A era da IA trouxe um dilema novo de infraestrutura: os modelos e assistentes rastreiam a web em escala: para treinar, para buscar respostas em tempo real e para alimentar agentes. O site recebe esse tráfego sem filtro, e o dono percebe pelo sintoma: servidor mais lento, pico de requests sem referer e banda consumida sem uma única conversão. O guia de agentes de IA mostrou o lado da visibilidade; este cobre o lado do servidor.
Quem são os robôs (e por que cada um visita)
- GPTBot: coleta dado de treinamento da OpenAI. Não traz citação direta.
- OAI-SearchBot: rastreia para a busca do ChatGPT: é o que pode citar seu site nas respostas (liberar = visibilidade).
- ChatGPT-User: recupera páginas disparadas pelo usuário em tempo real.
- ClaudeBot, PerplexityBot, Google-Extended, Bytespider: cada um com função própria (treinamento, busca, consumo por agentes).
A leitura que importa: são robôs diferentes com propósitos diferentes: a decisão de bloqueio é por robô, nunca em bloco. Bloquear tudo corta a visibilidade junto com o peso.
Como medir o impacto (antes de decidir)
- Logs do servidor: os requests por user-agent nos últimos 30 dias: quantos por robô, quais páginas, que frequência. O número costuma surpreender.
- Peso real: banda consumida e carga no servidor: o custo de infraestrutura do tráfego que não converte.
- Valor de contrapartida: o robô traz citação/visibilidade (OAI-SearchBot na busca do ChatGPT) ou só consome (GPTBot em site que não quer treinar modelos)?
1. Libere os que trazem visibilidade: OAI-SearchBot (citação no ChatGPT), os rastreadores de Perplexity/Gemini que alimentam respostas com link. 2. Decida por política os de treinamento (GPTBot, ClaudeBot, Google-Extended): a decisão é de negócio: proteger conteúdo proprietário ou alimentar o conhecimento futuro. 3. Limite os que pesam sem propósito: rate limit no servidor/WAF em vez de bloqueio total. 4. Nunca bloqueie por pânico o robô que traz citação: o custo de servidor é ínfimo perto da visibilidade perdida.
As defesas técnicas (na ordem de sutileza)
- robots.txt por robô: a camada educada: cada user-agent com a própria regra. Obedece quem quer obedecer: os mal-educados ignoram (e aí entram as camadas de baixo).
- Rate limiting no servidor/CDN: limita a velocidade por user-agent sem bloquear: o robô continua vindo, sem derrubar o site.
- Regras de WAF/CDN: Cloudflare e afins oferecem controle nativo de crawlers verificados (com verificação de IP real contra a lista oficial do robô: o que impede spoofing de user-agent).
- Bloqueio total: o último recurso para robôs que ignoram robots.txt e pesam de verdade: bloqueio por verificação de IP na borda.
O equilíbrio que a maioria acerta errado
Os dois extremos custam caro: liberar tudo: servidor pagando a fatura de treinar modelos de terceiros sem retorno; e bloquear tudo: invisibilidade nas respostas de IA exatamente quando a citação virou canal de descoberta (o pipeline de monitoramento e as ferramentas de visibilidade em LLMs medem esse retorno). O equilíbrio profissional: liberar os que trazem citação, decidir os de treinamento por política, limitar os abusivos: e revisar o caderno a cada novo robô que a indústria lançar.
A leitura final: o tráfego de IA é a nova constante da web: chegará ao seu servidor de qualquer forma. A resposta profissional é medição + decisão por robô + defesa em camadas: o servidor protegido e a visibilidade preservada. Para a fundação de rastreabilidade, o guia de SEO técnico; para a era dos agentes que consomem o site, o GPT-6 Astra.