Tecnologia · Presença Digital
Robots.txt para IA: como bloquear treino sem sumir das buscas do ChatGPT, Claude e Perplexity
Entenda quais crawlers controlam treino, busca e acessos por usuário na OpenAI, Anthropic e Perplexity, com regras de robots.txt, WAF e validação em logs.

Para bloquear uso em treinamento sem desaparecer das buscas de IA, não trate “bot de IA” como uma categoria única. Em agosto de 2026, OpenAI e Anthropic documentam agentes separados para treinamento, busca e acessos acionados pelo usuário. A Perplexity separa o bot de busca do agente acionado pelo usuário e afirma que nenhum dos dois é usado para coletar conteúdo para treinamento de modelos fundacionais.
Na prática, a configuração mais segura é decidir primeiro qual função você quer permitir e só depois escrever o robots.txt. Também é importante separar preferência de rastreamento de controle de acesso: o padrão do Robots Exclusion Protocol não é uma forma de autorização. Se a meta é impedir tecnicamente que alguém baixe uma URL, use autenticação, WAF, regras de CDN ou outro controle de acesso.
Matriz atual: treino, busca e acesso acionado pelo usuário
| Fornecedor | User-agent | Função documentada | robots.txt é o controle principal? | Se bloquear |
|---|---|---|---|---|
| OpenAI | GPTBot | Rastreamento de conteúdo que pode ser usado no treinamento de modelos generativos | Sim | Sinaliza que o conteúdo rastreado não deve ser usado no treinamento dos modelos fundacionais da OpenAI |
| OpenAI | OAI-SearchBot | Busca do ChatGPT | Sim | O site deixa de aparecer nas respostas de busca do ChatGPT, embora ainda possa surgir como link de navegação |
| OpenAI | ChatGPT-User | Ações iniciadas por usuários do ChatGPT e Custom GPTs | Não é confiável para bloquear | A OpenAI diz que, por serem ações iniciadas pelo usuário, as regras de robots.txt podem não se aplicar |
| Anthropic | ClaudeBot | Coleta que pode contribuir para treinamento de modelos | Sim | Sinaliza que materiais futuros do site devem ser excluídos dos conjuntos de treinamento |
| Anthropic | Claude-SearchBot | Indexação/navegação para melhorar resultados de busca no Claude | Sim | Pode reduzir a visibilidade e a precisão do site nas respostas de busca |
| Anthropic | Claude-User | Recuperação de páginas a pedido do usuário | Sim, segundo a documentação da Anthropic | Impede a recuperação do conteúdo nessas solicitações, o que pode reduzir a visibilidade em buscas dirigidas pelo usuário |
| Perplexity | PerplexityBot | Busca e exibição de sites nos resultados da Perplexity | Sim | Pode impedir que o site seja rastreado para aparecer nos resultados |
| Perplexity | Perplexity-User | Acesso a páginas em resposta a uma pergunta do usuário | Geralmente não | A própria Perplexity informa que esse agente geralmente ignora robots.txt |
Há duas diferenças que evitam muitos erros de configuração. A primeira: ChatGPT-User não determina presença na busca do ChatGPT; para isso, o agente relevante é OAI-SearchBot. A segunda: a página atual da Perplexity lista PerplexityBot e Perplexity-User e diz que nenhum deles é usado para coletar conteúdo para treinamento de modelos fundacionais. Portanto, não existe nessa documentação um “PerplexityBot de treino” equivalente ao GPTBot ou ao ClaudeBot.
Exemplo: bloquear treinamento e manter busca
Se o objetivo é bloquear treinamento onde há um agente específico para isso e continuar elegível para busca, um arquivo pode começar assim:
# OpenAI: bloquear treino, permitir busca
User-agent: GPTBot
Disallow: /
User-agent: OAI-SearchBot
Allow: /
# Anthropic: bloquear treino, permitir busca e acesso acionado pelo usuário
User-agent: ClaudeBot
Disallow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: Claude-User
Allow: /
# Perplexity: o bot listado é de busca, não de treinamento
User-agent: PerplexityBot
Allow: /
Esse exemplo não inclui ChatGPT-User nem Perplexity-User como mecanismo de bloqueio porque os próprios fornecedores alertam que robots.txt pode não se aplicar a essas visitas iniciadas por usuários. Para a Anthropic, a documentação atual diz que os bots respeitam as diretivas e descreve Claude-User como controlável por robots.txt.
Não copie o bloco sem comparar com as regras que já existem no seu site. Grupos duplicados para o mesmo user-agent podem ser combinados pelo parser, e regras mais específicas de caminho podem alterar o resultado. Em sites com múltiplos hosts, publique e revise o /robots.txt de cada subdomínio que tenha conteúdo relevante.
O que robots.txt não faz
O RFC 9309, que padroniza o Robots Exclusion Protocol, é explícito: as regras não são autorização de acesso. Um caminho listado no arquivo continua público; na verdade, o próprio robots.txt pode revelar a existência daquele caminho. Conteúdo confidencial ou privado precisa de um controle real, como autenticação HTTP, sessão, ACL, regra de CDN ou WAF.
Isso também explica por que “bloqueei no robots.txt” e “o servidor nunca mais verá uma requisição desse fornecedor” são afirmações diferentes. Um robô compatível pode respeitar a diretiva e parar de rastrear automaticamente, enquanto um acesso acionado pelo usuário pode seguir outra política. Além disso, um cliente malicioso pode simplesmente ignorar o protocolo.
Quando o WAF entra na configuração
O WAF resolve uma camada diferente. Ele decide se uma requisição chega ou não à aplicação; o robots.txt comunica a política de rastreamento a agentes que a respeitam. Se você pretende permitir busca, um WAF agressivo pode bloquear justamente o bot que você liberou no arquivo.
Por isso, use os endpoints oficiais de IP como fonte dinâmica, em vez de copiar faixas para uma regra permanente. A OpenAI publica listas separadas para OAI-SearchBot, GPTBot e ChatGPT-User. A Anthropic publica uma lista de IPs de seus crawlers. A Perplexity publica listas para PerplexityBot e Perplexity-User.
A Perplexity recomenda explicitamente combinar User-Agent + IP de origem nas regras de WAF, e manter as faixas atualizadas. Essa combinação também é útil como princípio operacional para não confiar apenas no texto do cabeçalho: o nome do user-agent pode ser falsificado por qualquer cliente. Já a Anthropic alerta que bloquear IPs de forma indiscriminada pode impedir o próprio crawler de ler o robots.txt; portanto, se você usa bloqueio de rede, mantenha o arquivo acessível e teste o comportamento no edge.
Como validar a configuração nos logs
- Confirme o arquivo servido de verdade. Acesse
https://seusite.com/robots.txte verifique o conteúdo entregue pelo CDN ou proxy, não apenas o arquivo no repositório. - Espere o cache do fornecedor. A OpenAI informa que mudanças relacionadas à busca podem levar cerca de 24 horas para refletir. A Perplexity diz que suas configurações podem levar até 24 horas. A Anthropic não informa nessa página um prazo equivalente.
- Filtre os logs pelos tokens dos agentes. Procure por
GPTBot,OAI-SearchBot,ChatGPT-User,ClaudeBot,Claude-SearchBot,Claude-User,PerplexityBotePerplexity-User. - Compare o IP de origem com a lista oficial atual. Faça a verificação no log do CDN/WAF, antes de qualquer proxy que substitua o endereço remoto. Não congele essas listas em documentação interna: os fornecedores podem atualizá-las.
- Separe bloqueio do WAF de obediência ao robots. Respostas
403, desafios de bot-management e rate limits são sinais de rede. Já um robô que respeitouDisallowpode simplesmente não requisitar a URL. - Teste uma URL permitida e uma restrita. Isso ajuda a detectar regras globais, exceções de caminho ou políticas do CDN que contradizem o arquivo.
Um filtro simples em logs pode começar assim:
grep -E 'GPTBot|OAI-SearchBot|ChatGPT-User|ClaudeBot|Claude-SearchBot|Claude-User|PerplexityBot|Perplexity-User' access.log
Em ambientes com Cloudflare, Fastly, Akamai ou outro proxy, prefira os logs da borda. O endereço visto pela aplicação pode ser o IP do proxy, o que inviabiliza conferir a origem do crawler.
Três armadilhas comuns
- Bloquear
OAI-SearchBotachando que bloqueou treinamento. O agente de treinamento da OpenAI éGPTBot;OAI-SearchBoté o agente de busca. - Usar apenas WAF para “opt out” de treinamento. No caso da Anthropic, a própria documentação orienta o opt-out por
robots.txte alerta que bloqueio de IP pode atrapalhar a leitura desse arquivo. - Interpretar “permitido” como garantia de citação. Permitir um bot apenas torna o conteúdo elegível ao acesso previsto por aquele fornecedor. Não garante rastreamento, indexação, ranking, resposta, menção nem citação em um assistente.
Política mínima recomendada
Para um site público que quer continuar encontrável por assistentes, mas não quer autorizar crawling de treinamento onde há um controle específico, a política mínima é: bloquear GPTBot e ClaudeBot; permitir OAI-SearchBot, Claude-SearchBot e PerplexityBot; decidir separadamente se acessos iniciados pelo usuário devem funcionar; e alinhar WAF/CDN com essa escolha.
Revise essa configuração periodicamente a partir da documentação dos fornecedores, não de listas copiadas em blogs. Nomes de agentes, versões dos user-agents, faixas de IP e comportamento de produtos são dados operacionais que mudam. A referência da OpenAI está em OpenAI Crawlers; a da Anthropic em Anthropic Bots; a da Perplexity em Perplexity Crawlers; e o limite de segurança do protocolo está no RFC 9309.
Transparência editorial
Fontes e referências
- official
- official
- officialAnthropic crawler IP rangesAnthropic
- officialPerplexity CrawlersPerplexity
- manualRFC 9309: Robots Exclusion ProtocolIETF / RFC Editor
Continue explorando