
robots.txt para IA: liberar ou bloquear GPTBot e ClaudeBot
Durante anos, o robots.txt tratava de dois assuntos: deixar o Google entrar e manter o robô longe das áreas administrativas. Hoje ele decide algo novo e bem mais delicado: se o seu conteúdo pode ou não ser lido pelos sistemas que respondem perguntas no lugar do buscador.
A decisão não é binária, e é aí que a maioria dos sites erra. Existe diferença entre um robô que coleta texto para treinar modelos e um robô que busca a página na hora em que alguém faz uma pergunta. Bloquear os dois com a mesma linha significa, na prática, escolher não aparecer nas respostas.
Quem é quem entre os robôs de IA
Os nomes mudam com o tempo, então o hábito saudável é conferir a documentação de cada empresa antes de escrever a regra. Este é o mapa atual dos agentes mais comuns em sites brasileiros:
| Agente | Empresa | Para que serve | Efeito de bloquear |
|---|---|---|---|
| GPTBot | OpenAI | Coleta conteúdo para treinar modelos | Seu texto não entra em treinamentos futuros |
| OAI-SearchBot | OpenAI | Alimenta a busca usada nas respostas | Reduz a chance de ser citado como fonte |
| ChatGPT-User | OpenAI | Abre a página quando o usuário pede | O assistente não consegue ler seu link |
| ClaudeBot | Anthropic | Coleta conteúdo para treinamento | Seu texto fica fora da base de treino |
| PerplexityBot | Perplexity | Indexa páginas para responder com fontes | Sai do índice que gera as citações |
| Google-Extended | Controla uso em produtos de IA generativa | Não afeta a busca comum, afeta os recursos de IA |
Guarde a última linha com atenção: o Google-Extended não tira você do índice de busca. Ele é um controle separado, voltado ao uso do conteúdo em recursos generativos. Já um bloqueio geral ao Googlebot tira você do buscador inteiro.
A regra prática para quem quer ser citado
Se a sua meta é aparecer nas respostas, a configuração é simples: libere quem lê para responder e decida com calma sobre quem lê para treinar. Um arquivo enxuto resolve:
User-agent: *
Allow: /
Disallow: /administracao/
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: PerplexityBot
Allow: /
Sitemap: https://seusite.com.br/sitemap.xml
Quem prefere manter o conteúdo fora de treinamentos, sem perder as citações, acrescenta apenas os agentes de coleta:
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
Esse é o meio-termo mais usado por veículos de conteúdo: aparecer nas respostas do presente, sem alimentar o treino do futuro. Não existe escolha certa universal aqui. Há um bom argumento para liberar tudo em sites que vivem de descoberta, e um argumento igualmente bom para restringir em sites que vivem de conteúdo próprio.
Bloquear treinamento tem custo: pense no seu modelo
A decisão sobre os robôs de coleta não é técnica, é de negócio, e muda conforme o que sustenta o seu site. Vale responder a uma pergunta antes de escrever qualquer regra: se o seu conteúdo alimentar um modelo, isso trabalha a favor ou contra você?
Para quem vive de ser encontrado, como prestadores de serviço, comércio local, profissionais liberais e blogs que geram oportunidade de contato, aparecer é o objetivo. Nesse caso, restringir a coleta tende a custar mais do que protege. A marca ser reconhecida e recomendada pelo assistente é exatamente o resultado desejado.
Para quem vende o próprio conteúdo, como cursos, relatórios de pesquisa, bancos de dados e veículos de assinatura, a conta inverte. Ali o texto é o produto, e alimentar o treino de um sistema que responderá a mesma pergunta de graça enfraquece o negócio. É o motivo pelo qual boa parte dos grandes veículos escolheu liberar quem cita e bloquear quem treina.
Há ainda o caminho do meio, que costuma ser o mais sensato para sites de conteúdo com serviço por trás: liberar tudo o que gera citação, bloquear a coleta para treinamento e manter o conteúdo premium atrás de cadastro, onde robô nenhum entra. Essa combinação protege o que tem valor comercial sem abrir mão da descoberta.
Duas ressalvas honestas: a discussão jurídica sobre uso de conteúdo em treinamento de modelos ainda está em aberto no Brasil e no mundo, e o bloqueio de hoje não alcança o que já foi coletado antes. Decida pelo que faz sentido daqui para a frente, e revise a escolha de tempos em tempos, porque tanto as regras quanto os agentes mudam.
Quatro erros que custam visibilidade
- Bloquear por engano quem responde. Impedir o ChatGPT-User significa que, quando alguém cola seu link no assistente, ele não consegue abrir a página.
- Achar que o robots.txt protege conteúdo. Ele é um pedido público de boa vontade. Quem não respeita a regra continua acessando, e o arquivo ainda revela quais pastas você quis esconder.
- Confundir bloqueio com remoção. Bloquear o rastreamento não apaga o que já foi coletado antes, nem remove uma página do índice; para isso existe a marcação noindex, que exige que o robô possa ler a página.
- Escrever regras contraditórias. Um Disallow genérico no grupo de todos os agentes continua valendo para quem não tem grupo próprio. Cada robô obedece ao bloco mais específico que encontra.
Onde o robots.txt se encaixa no conjunto
É comum confundir os papéis dos arquivos que ficam na raiz do site, e a confusão leva a decisões erradas. O robots.txt controla o acesso: diz quem pode entrar e onde. O sitemap.xml comunica a lista de endereços que você considera importantes, sem garantir nada. O llms.txt, proposta mais recente, resume o conteúdo em formato fácil de consumir por modelos de linguagem. E os dados estruturados explicam o significado de cada parte da página.
Os quatro trabalham juntos e nenhum substitui o outro. De nada adianta liberar todos os robôs de IA no robots.txt se a página não deixa claro qual trecho responde à pergunta. E de nada adianta um conteúdo impecável se o arquivo na raiz barra a entrada de quem poderia citá-lo.
O que fazer quando o robô ignora as regras
O robots.txt é um acordo de boa vontade, não uma tranca. Robôs sérios respeitam, mas existem coletores que ignoram completamente o arquivo, e outros que usam nomes de agente diferentes dos documentados. Se você identificar acesso indevido nos registros do servidor, o caminho deixa de ser o arquivo e passa a ser a infraestrutura: bloqueio por faixa de endereço, limitação de taxa de requisição ou exigência de autenticação para o conteúdo que precisa mesmo ficar restrito.
Antes de partir para o bloqueio, porém, confirme a identidade. Vários robôs podem ser verificados por resolução reversa do endereço que fez a requisição, e é comum alguém se passar por um agente conhecido. Bloquear na pressa costuma atingir o robô verdadeiro e derrubar sua visibilidade.
Quanto tempo leva para a mudança valer
Depois de publicar um robots.txt novo, os robôs relêem o arquivo em intervalos próprios, normalmente em até 24 horas para os mais ativos e alguns dias para os demais. Liberar o acesso não produz citação imediata: o conteúdo ainda precisa ser lido, considerado relevante e escolhido no momento em que alguém faz a pergunta certa. Trate a mudança como abertura de porta, e meça o efeito ao longo de semanas, não de horas.
Como conferir se está valendo
Depois de publicar, confirme com uma chamada simples, sem depender de painel nenhum:
curl -s https://seusite.com.br/robots.txt
curl -s -o /dev/null -w "%{http_code}\n" \
-A "PerplexityBot" https://seusite.com.br/artigo.html
O arquivo precisa aparecer como texto puro, com status 200, e o teste com o agente do robô precisa devolver 200 também. Vale ainda conferir os registros de acesso do servidor depois de alguns dias: eles mostram quais robôs realmente passaram por lá, o que é mais confiável do que supor.
O robots.txt é só a porta
Liberar o acesso não faz ninguém ser citado, do mesmo jeito que abrir a loja não faz ninguém comprar. A citação depende de o conteúdo responder direto à pergunta, trazer dado verificável e estar estruturado de forma que a máquina consiga extrair o trecho certo. Quem quiser ver isso em detalhe encontra o caminho completo no guia de GEO, e o funcionamento do arquivo está documentado pelo próprio Google.
O que fazer a partir daqui
Abra o seu robots.txt hoje e faça três perguntas: os robôs que leem para responder estão liberados? Os que coletam para treinar estão de acordo com a sua decisão de negócio? E existe alguma regra antiga bloqueando pastas que hoje guardam conteúdo público, como imagens e arquivos de estilo? Essas três respostas resolvem a maior parte dos casos.
Perguntas frequentes
Bloquear o GPTBot tira meu site do ChatGPT?
Não necessariamente. O GPTBot é o agente de coleta para treinamento. Quem alimenta as respostas com busca é o OAI-SearchBot, e quem abre links a pedido do usuário é o ChatGPT-User. Bloquear só o primeiro preserva as citações.
O Google-Extended prejudica meu ranqueamento?
Não. Ele controla o uso do conteúdo em recursos de IA generativa e é separado do rastreamento para a busca. Bloqueá-lo não remove o site dos resultados comuns.
Preciso listar todos os robôs de IA existentes?
Não vale a pena. A lista muda com frequência. Defina a regra geral para todos os agentes e abra exceções apenas para os que importam à sua estratégia.
O robots.txt impede que copiem meu conteúdo?
Não. Ele é um pedido que robôs bem-comportados respeitam. Proteção de verdade exige autenticação, bloqueio no servidor ou limitação por taxa de acesso.
Como removo do índice uma página já coletada?
Use a marcação noindex na página e mantenha o rastreamento liberado, porque o robô precisa ler a página para enxergar a instrução. Bloquear no robots.txt impede a leitura e a página pode continuar listada.
Leia também
Compartilhe este artigo
Fontes e leituras recomendadas

