robots.txt para IA: liberar ou bloquear GPTBot e ClaudeBot
GEO

robots.txt para IA: liberar ou bloquear GPTBot e ClaudeBot

Marina AlvezPor Marina Alvez · Estrategista de GEO e Busca Generativa
Artigo criado em: 24/09/2026 às 01:24

Durante anos, o robots.txt tratava de dois assuntos: deixar o Google entrar e manter o robô longe das áreas administrativas. Hoje ele decide algo novo e bem mais delicado: se o seu conteúdo pode ou não ser lido pelos sistemas que respondem perguntas no lugar do buscador.

A decisão não é binária, e é aí que a maioria dos sites erra. Existe diferença entre um robô que coleta texto para treinar modelos e um robô que busca a página na hora em que alguém faz uma pergunta. Bloquear os dois com a mesma linha significa, na prática, escolher não aparecer nas respostas.

Quem é quem entre os robôs de IA

Os nomes mudam com o tempo, então o hábito saudável é conferir a documentação de cada empresa antes de escrever a regra. Este é o mapa atual dos agentes mais comuns em sites brasileiros:

AgenteEmpresaPara que serveEfeito de bloquear
GPTBotOpenAIColeta conteúdo para treinar modelosSeu texto não entra em treinamentos futuros
OAI-SearchBotOpenAIAlimenta a busca usada nas respostasReduz a chance de ser citado como fonte
ChatGPT-UserOpenAIAbre a página quando o usuário pedeO assistente não consegue ler seu link
ClaudeBotAnthropicColeta conteúdo para treinamentoSeu texto fica fora da base de treino
PerplexityBotPerplexityIndexa páginas para responder com fontesSai do índice que gera as citações
Google-ExtendedGoogleControla uso em produtos de IA generativaNão afeta a busca comum, afeta os recursos de IA

Guarde a última linha com atenção: o Google-Extended não tira você do índice de busca. Ele é um controle separado, voltado ao uso do conteúdo em recursos generativos. Já um bloqueio geral ao Googlebot tira você do buscador inteiro.

A regra prática para quem quer ser citado

Se a sua meta é aparecer nas respostas, a configuração é simples: libere quem lê para responder e decida com calma sobre quem lê para treinar. Um arquivo enxuto resolve:

User-agent: *
Allow: /
Disallow: /administracao/

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: PerplexityBot
Allow: /

Sitemap: https://seusite.com.br/sitemap.xml

Quem prefere manter o conteúdo fora de treinamentos, sem perder as citações, acrescenta apenas os agentes de coleta:

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

Esse é o meio-termo mais usado por veículos de conteúdo: aparecer nas respostas do presente, sem alimentar o treino do futuro. Não existe escolha certa universal aqui. Há um bom argumento para liberar tudo em sites que vivem de descoberta, e um argumento igualmente bom para restringir em sites que vivem de conteúdo próprio.

Bloquear treinamento tem custo: pense no seu modelo

A decisão sobre os robôs de coleta não é técnica, é de negócio, e muda conforme o que sustenta o seu site. Vale responder a uma pergunta antes de escrever qualquer regra: se o seu conteúdo alimentar um modelo, isso trabalha a favor ou contra você?

Para quem vive de ser encontrado, como prestadores de serviço, comércio local, profissionais liberais e blogs que geram oportunidade de contato, aparecer é o objetivo. Nesse caso, restringir a coleta tende a custar mais do que protege. A marca ser reconhecida e recomendada pelo assistente é exatamente o resultado desejado.

Para quem vende o próprio conteúdo, como cursos, relatórios de pesquisa, bancos de dados e veículos de assinatura, a conta inverte. Ali o texto é o produto, e alimentar o treino de um sistema que responderá a mesma pergunta de graça enfraquece o negócio. É o motivo pelo qual boa parte dos grandes veículos escolheu liberar quem cita e bloquear quem treina.

Há ainda o caminho do meio, que costuma ser o mais sensato para sites de conteúdo com serviço por trás: liberar tudo o que gera citação, bloquear a coleta para treinamento e manter o conteúdo premium atrás de cadastro, onde robô nenhum entra. Essa combinação protege o que tem valor comercial sem abrir mão da descoberta.

Duas ressalvas honestas: a discussão jurídica sobre uso de conteúdo em treinamento de modelos ainda está em aberto no Brasil e no mundo, e o bloqueio de hoje não alcança o que já foi coletado antes. Decida pelo que faz sentido daqui para a frente, e revise a escolha de tempos em tempos, porque tanto as regras quanto os agentes mudam.

Quatro erros que custam visibilidade

  • Bloquear por engano quem responde. Impedir o ChatGPT-User significa que, quando alguém cola seu link no assistente, ele não consegue abrir a página.
  • Achar que o robots.txt protege conteúdo. Ele é um pedido público de boa vontade. Quem não respeita a regra continua acessando, e o arquivo ainda revela quais pastas você quis esconder.
  • Confundir bloqueio com remoção. Bloquear o rastreamento não apaga o que já foi coletado antes, nem remove uma página do índice; para isso existe a marcação noindex, que exige que o robô possa ler a página.
  • Escrever regras contraditórias. Um Disallow genérico no grupo de todos os agentes continua valendo para quem não tem grupo próprio. Cada robô obedece ao bloco mais específico que encontra.

Onde o robots.txt se encaixa no conjunto

É comum confundir os papéis dos arquivos que ficam na raiz do site, e a confusão leva a decisões erradas. O robots.txt controla o acesso: diz quem pode entrar e onde. O sitemap.xml comunica a lista de endereços que você considera importantes, sem garantir nada. O llms.txt, proposta mais recente, resume o conteúdo em formato fácil de consumir por modelos de linguagem. E os dados estruturados explicam o significado de cada parte da página.

Os quatro trabalham juntos e nenhum substitui o outro. De nada adianta liberar todos os robôs de IA no robots.txt se a página não deixa claro qual trecho responde à pergunta. E de nada adianta um conteúdo impecável se o arquivo na raiz barra a entrada de quem poderia citá-lo.

O que fazer quando o robô ignora as regras

O robots.txt é um acordo de boa vontade, não uma tranca. Robôs sérios respeitam, mas existem coletores que ignoram completamente o arquivo, e outros que usam nomes de agente diferentes dos documentados. Se você identificar acesso indevido nos registros do servidor, o caminho deixa de ser o arquivo e passa a ser a infraestrutura: bloqueio por faixa de endereço, limitação de taxa de requisição ou exigência de autenticação para o conteúdo que precisa mesmo ficar restrito.

Antes de partir para o bloqueio, porém, confirme a identidade. Vários robôs podem ser verificados por resolução reversa do endereço que fez a requisição, e é comum alguém se passar por um agente conhecido. Bloquear na pressa costuma atingir o robô verdadeiro e derrubar sua visibilidade.

Quanto tempo leva para a mudança valer

Depois de publicar um robots.txt novo, os robôs relêem o arquivo em intervalos próprios, normalmente em até 24 horas para os mais ativos e alguns dias para os demais. Liberar o acesso não produz citação imediata: o conteúdo ainda precisa ser lido, considerado relevante e escolhido no momento em que alguém faz a pergunta certa. Trate a mudança como abertura de porta, e meça o efeito ao longo de semanas, não de horas.

Como conferir se está valendo

Depois de publicar, confirme com uma chamada simples, sem depender de painel nenhum:

curl -s https://seusite.com.br/robots.txt

curl -s -o /dev/null -w "%{http_code}\n" \
  -A "PerplexityBot" https://seusite.com.br/artigo.html

O arquivo precisa aparecer como texto puro, com status 200, e o teste com o agente do robô precisa devolver 200 também. Vale ainda conferir os registros de acesso do servidor depois de alguns dias: eles mostram quais robôs realmente passaram por lá, o que é mais confiável do que supor.

O robots.txt é só a porta

Liberar o acesso não faz ninguém ser citado, do mesmo jeito que abrir a loja não faz ninguém comprar. A citação depende de o conteúdo responder direto à pergunta, trazer dado verificável e estar estruturado de forma que a máquina consiga extrair o trecho certo. Quem quiser ver isso em detalhe encontra o caminho completo no guia de GEO, e o funcionamento do arquivo está documentado pelo próprio Google.

O que fazer a partir daqui

Abra o seu robots.txt hoje e faça três perguntas: os robôs que leem para responder estão liberados? Os que coletam para treinar estão de acordo com a sua decisão de negócio? E existe alguma regra antiga bloqueando pastas que hoje guardam conteúdo público, como imagens e arquivos de estilo? Essas três respostas resolvem a maior parte dos casos.

Perguntas frequentes

Bloquear o GPTBot tira meu site do ChatGPT?

Não necessariamente. O GPTBot é o agente de coleta para treinamento. Quem alimenta as respostas com busca é o OAI-SearchBot, e quem abre links a pedido do usuário é o ChatGPT-User. Bloquear só o primeiro preserva as citações.

O Google-Extended prejudica meu ranqueamento?

Não. Ele controla o uso do conteúdo em recursos de IA generativa e é separado do rastreamento para a busca. Bloqueá-lo não remove o site dos resultados comuns.

Preciso listar todos os robôs de IA existentes?

Não vale a pena. A lista muda com frequência. Defina a regra geral para todos os agentes e abra exceções apenas para os que importam à sua estratégia.

O robots.txt impede que copiem meu conteúdo?

Não. Ele é um pedido que robôs bem-comportados respeitam. Proteção de verdade exige autenticação, bloqueio no servidor ou limitação por taxa de acesso.

Como removo do índice uma página já coletada?

Use a marcação noindex na página e mantenha o rastreamento liberado, porque o robô precisa ler a página para enxergar a instrução. Bloquear no robots.txt impede a leitura e a página pode continuar listada.

Leia também

Compartilhe este artigo

Fontes e leituras recomendadas

Tags: GEOrobots.txt para IA
Marina Alvez
Marina AlvezEstrategista de GEO e Busca Generativa
Marina trabalha há mais de oito anos com otimização para mecanismos de busca e, desde 2023, dedica-se a GEO, ajudando marcas a serem citadas por ChatGPT, Gemini e Perplexity. Escreve sobre estratégia de conteúdo, dados estruturados e a nova lógica das respostas geradas por IA.