Serviços Blog Cases Glossário Soluções Ferramentas Contato Consultoria Gratuita

SEO Técnico

Seu site está bloqueando a IA? As 7 barreiras silenciosas que nenhum painel mostra

10/10/2026 9 min de leitura Por Equipe M&C

84,2% dos sites não têm política nenhuma sobre rastreadores de IA: e a maioria dos bloqueios não é decisão: é herança de um CMS, de um plugin de segurança ou de um CDN configurado por outra pessoa. Este guia desmonta os 4 tipos de rastreador (que a maioria confunde), as 7 barreiras silenciosas que robots.txt não revela e o framework de decisão: bloquear ou liberar, por robô, com consciência.

O estudo mais completo do setor (crawls trimestrais, 1.744 sites, Q3 2026) mediu o retrato: 9,9% bloqueiam o GPTBot no robots.txt; 13,7% bloqueiam ao menos um rastreador de IA; 84,2% não têm política alguma: e só 1,8% permite explicitamente. O número que resume o problema não é o bloqueio: é a omissão. A maioria dos sites não decidiu nada sobre IA: e herda a política de quem configurou a infraestrutura.

Os 4 tipos de rastreador (o erro mais caro é tratá-los como um só)

  1. Rastreadores de treinamento em massa: GPTBot, CCBot, Bytespider, Meta-ExternalAgent: coletam conteúdo para treinar modelos futuros. Bloqueá-los não afeta respostas ao vivo.
  2. Índices de busca de IA: OAI-SearchBot, Claude-SearchBot, PerplexityBot: constroem o índice que o sistema consulta ao responder. Bloqueá-los é o bloqueio mais custoso: você sai das citações.
  3. Visitas ao vivo: ChatGPT-User, Claude-User, Perplexity-User: buscam uma página em tempo real para um usuário que acabou de perguntar sobre você. Tráfego de altíssima intenção.
  4. Interruptores robots.txt: Google-Extended, Applebot-Extended: nunca rastreiam sob esses nomes; são flags que o fornecedor honra separadamente (não aparecem nos logs).
  5. As 7 barreiras silenciosas (o checklist completo)

    1. robots.txt: um User-agent: * com Disallow: / bloqueia tudo, inclusive os buscadores. E as regras nomeadas de IA (GPTBot e cia) precisam ser verificadas uma a uma.
    2. CDN/WAF/firewall: o Cloudflare passou a bloquear crawlers de IA por padrão em domínios novos; plugins de segurança (Wordfence, Sucuri) também. Invisível no robots.txt: só aparece testando requisições ao vivo.
    3. JavaScript: GPTBot, ClaudeBot e PerplexityBot geralmente não executam JS (o Googlebot executa): sites React/Vue client-side parecem vazios para a IA. Solução: renderização server-side/estática. Teste rápido: curl -sL -A "GPTBot" e confira se o headline está no HTML.
    4. Login walls e paywalls: o rastreador vê o que um visitante anônimo vê. Caminho do meio: publicar um subconjunto público ou resumo legível por máquina.
    5. Arquivos de descoberta ausentes: llms.txt, identity.json, ai.txt devem existir e retornar HTTP 200 com o Content-Type correto.
    6. Schema.org e conteúdo em imagem: JSON-LD complementa os arquivos; texto dentro de imagens ou canvas é invisível para o rastreador.
    7. Servidor: TTFB alto, SSL inválido, cadeias de redirecionamento e meta robots/X-Robots-Tag esquecidos: a fundação técnica que tudo depende (o guia técnico cobre).

    Como verificar se a IA realmente rastreia você

    Logs de acesso com filtro pelos user agents: e uma ressalva honesta: os logs subestimam, porque agentes de IA crescentemente usam user-agent de navegador comum. A verificação determinística (o que robots.txt declara × o que os logs mostram) é o par que revela a política real em operação.

    O framework de decisão (bloquear é razoável quando...)

    Bloquear é legítimo em 4 cenários: 1. o conteúdo É o produto (paywall é o modelo). 2. existe acordo de licenciamento em negociação. 3. o custo de rastreamento é real (serverless com pay-per-request). 4. dever contratual. Nesses casos, bloqueie de forma seletiva: recusar os de treinamento em massa mantendo os de recuperação: em vez de Disallow: / generalizado. E o lembrete técnico: robots.txt é solicitação, não imposição: enforcement de verdade é firewall/WAF.

    A ferramenta que fecha o ciclo

    Cole o seu robots.txt no Verificador de Visibilidade IA e ele reporta o status de cada rastreador de IA (permitido, bloqueado, sem regra): mais o validador de llms.txt e o checklist de prontidão com score. Tudo no navegador, sem cadastro e sem API: o diagnóstico determinístico que transforma omissão em decisão.

    A leitura final: a era da IA exige que a política de rastreamento seja uma decisão documentada: não o efeito colateral de um plugin. Os 4 tipos de rastreador, as 7 barreiras e o framework de decisão estão sobre a mesa: a escolha deliberada é o que separa a visibilidade gerida da invisibilidade acidental. Para o custo de servidor desse tráfego, o guia de robôs e performance; para a fundação, o guia técnico.

Perguntas frequentes

Dúvidas rápidas

Meu site está bloqueando os rastreadores de IA?
Verifique em 4 lugares: robots.txt (regras nomeadas de GPTBot, OAI-SearchBot, ClaudeBot e afins), CDN/WAF (o Cloudflare bloqueia IA por padrão em domínios novos), JavaScript (sites client-side parecem vazios para rastreadores que não executam JS) e paywalls. Um estudo com 1.744 sites mediu que 84,2% não têm política alguma: a maioria bloqueia por omissão, não por decisão.
Quais são os tipos de rastreador de IA?
Quatro funções distintas: rastreadores de treinamento em massa (GPTBot, CCBot: alimentam modelos futuros), índices de busca de IA (OAI-SearchBot, PerplexityBot: determinam citação ao vivo), visitas ao vivo (ChatGPT-User: recuperação em tempo real para um usuário) e interruptores de robots.txt (Google-Extended: flags que nunca rastreiam sob esses nomes).
Bloquear o GPTBot tira meu site do ChatGPT?
Não: o GPTBot coleta dado de treinamento; quem alimenta a busca do ChatGPT é o OAI-SearchBot. São robôs independentes: bloquear o de treinamento preserva a citação na busca, e vice-versa. Por isso a decisão é por robô: bloquear em bloco corta visibilidade junto com o custo.
Por que meu site React aparece vazio para as IAs?
GPTBot, ClaudeBot e PerplexityBot geralmente não executam JavaScript: um site React/Vue/Angular client-side renderiza vazio para eles. A solução é renderização server-side (SSR) ou estática (SSG). Teste rápido: curl com user-agent GPTBot e verifique se o headline aparece no HTML.
Quando é razoável bloquear rastreadores de IA?
Em quatro cenários: quando o conteúdo é o produto, quando há acordo de licenciamento em negociação, quando o custo de rastreamento é real (serverless pay-per-request) e por dever contratual. Nesses casos, bloqueio seletivo (recusar treinamento, manter recuperação) em vez de Disallow: / generalizado: e lembre: robots.txt é solicitação; enforcement é firewall.

Transforme bloqueio por omissão em escolha

Rode o Verificador de Visibilidade IA da M&C no navegador: e decida cada rastreador com consciência.

Continue lendo

Leia também

Fale conosco no WhatsApp