O estudo mais completo do setor (crawls trimestrais, 1.744 sites, Q3 2026) mediu o retrato: 9,9% bloqueiam o GPTBot no robots.txt; 13,7% bloqueiam ao menos um rastreador de IA; 84,2% não têm política alguma: e só 1,8% permite explicitamente. O número que resume o problema não é o bloqueio: é a omissão. A maioria dos sites não decidiu nada sobre IA: e herda a política de quem configurou a infraestrutura.
Os 4 tipos de rastreador (o erro mais caro é tratá-los como um só)
- Rastreadores de treinamento em massa: GPTBot, CCBot, Bytespider, Meta-ExternalAgent: coletam conteúdo para treinar modelos futuros. Bloqueá-los não afeta respostas ao vivo.
- Índices de busca de IA: OAI-SearchBot, Claude-SearchBot, PerplexityBot: constroem o índice que o sistema consulta ao responder. Bloqueá-los é o bloqueio mais custoso: você sai das citações.
- Visitas ao vivo: ChatGPT-User, Claude-User, Perplexity-User: buscam uma página em tempo real para um usuário que acabou de perguntar sobre você. Tráfego de altíssima intenção.
- Interruptores robots.txt: Google-Extended, Applebot-Extended: nunca rastreiam sob esses nomes; são flags que o fornecedor honra separadamente (não aparecem nos logs).
- robots.txt: um
User-agent: *comDisallow: /bloqueia tudo, inclusive os buscadores. E as regras nomeadas de IA (GPTBot e cia) precisam ser verificadas uma a uma. - CDN/WAF/firewall: o Cloudflare passou a bloquear crawlers de IA por padrão em domínios novos; plugins de segurança (Wordfence, Sucuri) também. Invisível no robots.txt: só aparece testando requisições ao vivo.
- JavaScript: GPTBot, ClaudeBot e PerplexityBot geralmente não executam JS (o Googlebot executa): sites React/Vue client-side parecem vazios para a IA. Solução: renderização server-side/estática. Teste rápido:
curl -sL -A "GPTBot"e confira se o headline está no HTML. - Login walls e paywalls: o rastreador vê o que um visitante anônimo vê. Caminho do meio: publicar um subconjunto público ou resumo legível por máquina.
- Arquivos de descoberta ausentes: llms.txt, identity.json, ai.txt devem existir e retornar HTTP 200 com o Content-Type correto.
- Schema.org e conteúdo em imagem: JSON-LD complementa os arquivos; texto dentro de imagens ou canvas é invisível para o rastreador.
- Servidor: TTFB alto, SSL inválido, cadeias de redirecionamento e meta robots/X-Robots-Tag esquecidos: a fundação técnica que tudo depende (o guia técnico cobre).
As 7 barreiras silenciosas (o checklist completo)
Como verificar se a IA realmente rastreia você
Logs de acesso com filtro pelos user agents: e uma ressalva honesta: os logs subestimam, porque agentes de IA crescentemente usam user-agent de navegador comum. A verificação determinística (o que robots.txt declara × o que os logs mostram) é o par que revela a política real em operação.
Bloquear é legítimo em 4 cenários: 1. o conteúdo É o produto (paywall é o modelo). 2. existe acordo de licenciamento em negociação. 3. o custo de rastreamento é real (serverless com pay-per-request). 4. dever contratual. Nesses casos, bloqueie de forma seletiva: recusar os de treinamento em massa mantendo os de recuperação: em vez de Disallow: / generalizado. E o lembrete técnico: robots.txt é solicitação, não imposição: enforcement de verdade é firewall/WAF.
A ferramenta que fecha o ciclo
Cole o seu robots.txt no Verificador de Visibilidade IA e ele reporta o status de cada rastreador de IA (permitido, bloqueado, sem regra): mais o validador de llms.txt e o checklist de prontidão com score. Tudo no navegador, sem cadastro e sem API: o diagnóstico determinístico que transforma omissão em decisão.
A leitura final: a era da IA exige que a política de rastreamento seja uma decisão documentada: não o efeito colateral de um plugin. Os 4 tipos de rastreador, as 7 barreiras e o framework de decisão estão sobre a mesa: a escolha deliberada é o que separa a visibilidade gerida da invisibilidade acidental. Para o custo de servidor desse tráfego, o guia de robôs e performance; para a fundação, o guia técnico.