Robots.txt para IA: libere ou bloqueie por finalidade
Escolha o que cada tipo de robô pode fazer no seu site (treinar, buscar ou ler a pedido de uma pessoa) e copie o robots.txt pronto.
O que cada tipo de robô pode fazer
O conteúdo pode ser usado para treinar modelos de IA. Bloquear pede que o seu texto não entre no treino futuro.
Robôs: GPTBot, ClaudeBot, Google-Extended, Applebot-Extended, meta-externalagent, Amazonbot.
O site pode ser indexado para aparecer e ser linkado em respostas e buscas feitas com IA.
Robôs: OAI-SearchBot, Claude-SearchBot, Google-Extended, PerplexityBot, Applebot, meta-webindexer, Amzn-SearchBot, DuckAssistBot.
O robô abre a página só quando uma pessoa pede a um assistente. Vários fornecedores dizem que esses robôs podem ignorar o robots.txt.
Robôs: ChatGPT-User, Claude-User, Google-Agent, Google-GeminiNotebook, Google-Pinpoint, Perplexity-User, meta-externalfetcher, Amzn-User.
Cópia aberta da web mantida por uma fundação sem fins lucrativos. A página oficial não diz quem usa os dados.
Robôs: CCBot.
O robots.txt age por nome de robô, não por finalidade. Um robô com duas finalidades (Google-Extended: treino e respostas do Gemini; meta-externalagent: treino e produtos da Meta) é bloqueado inteiro se você bloquear qualquer uma delas.
Exceções por robô (0)
Uma exceção vence a escolha por finalidade.
Um por linha, começando por /. Ex.: /rascunhos/ ou /area-restrita/. Valem também para os robôs permitidos.
Suas escolhas ficam só neste navegador. Nada é enviado.
Como bloquear o treino de IA e manter a busca?
Para bloquear o treino e manter a busca, bloqueie GPTBot, ClaudeBot, Google-Extended, Applebot-Extended, meta-externalagent e Amazonbot, e deixe OAI-SearchBot, Claude-SearchBot e PerplexityBot. O robots.txt é um pedido, não uma barreira.
Treino, busca e acesso a pedido: o que muda para o seu site
Os fornecedores separam os robôs por finalidade. O gerador usa a mesma separação.
| Finalidade | O que o robô faz | Robôs no gerador |
|---|---|---|
| Treino de modelos | Coleta conteúdo que pode ser usado para treinar modelos de IA. Bloquear pede que o seu texto não entre em treinos futuros; não remove o que já foi coletado. | GPTBot, ClaudeBot, Google-Extended, Applebot-Extended, meta-externalagent, Amazonbot |
| Busca e respostas com fontes | Indexa páginas para mostrá-las, com link, em respostas e buscas feitas com IA. Bloquear tira o site desse índice. | OAI-SearchBot, Claude-SearchBot, Google-Extended, PerplexityBot, Applebot, meta-webindexer, Amzn-SearchBot, DuckAssistBot |
| Acesso a pedido do usuário | Abre uma página só quando uma pessoa pede a um assistente. Vários fornecedores dizem que o robots.txt pode não valer, porque quem pede é a pessoa. | ChatGPT-User, Claude-User, Google-Agent, Google-GeminiNotebook, Google-Pinpoint, Perplexity-User, meta-externalfetcher, Amzn-User |
| Coleta aberta da web | Mantém uma cópia aberta da web para quem quiser usar. A página oficial do CCBot não cita treino de IA. | CCBot |
A OpenAI escreve que cada ajuste do robots.txt é independente: dá para bloquear o GPTBot (treino) e liberar o OAI-SearchBot (busca do ChatGPT). A mesma lógica vale para a Anthropic, que separa ClaudeBot, Claude-SearchBot e Claude-User. No Google, o Google-Extended é um token só do robots.txt: ele não rastreia e, segundo a página do Google, não afeta a inclusão do site na Busca nem é sinal de ranqueamento.
O Googlebot é outra coisa. É o rastreador da Busca do Google, e as regras dele valem também para os recursos de IA da Busca. Por isso ele não aparece no gerador: bloqueá-lo tira o site do Google. Se for o caso, edite o arquivo à mão.
Como o gerador decide e escreve o arquivo
- Uma exceção que você escolheu para um robô vale mais que qualquer finalidade.
- Sem exceção, o robô segue as finalidades dele. Se tiver duas finalidades que o gerador controla e você bloquear qualquer uma, ele é bloqueado inteiro: o robots.txt age por nome de robô, não por finalidade. É o caso do
Google-Extended(treino e respostas do Gemini). - Todo robô escolhido ganha um grupo próprio, até os permitidos. Isso importa porque um grupo com o nome do robô substitui o grupo
*(RFC 9309, seção 2.2.1), e porque a Apple diz que o Applebot, sem grupo próprio, segue o do Googlebot. - Os caminhos que você fechar são repetidos em cada grupo permitido, para que o grupo próprio não os esqueça.
Os testes automáticos conferem isso: para cada uma das 16 combinações de permitir e bloquear por finalidade, o arquivo gerado é lido por um analisador das regras do RFC 9309 e o veredito de cada robô tem de bater com a escolha. O campo "Teste o arquivo gerado", ao lado do código, usa o mesmo analisador.
Exemplo resolvido: bloquear o treino e liberar a busca
- Treino bloqueado:
GPTBot,ClaudeBot,Google-Extended,Applebot-Extended,meta-externalagenteAmazonbotrecebemDisallow: /. - Busca, pedido do usuário e coleta aberta permitidos: os demais robôs recebem
Allow: /no grupo deles. - O Googlebot não aparece: continua com a regra geral do site, que permite.
Se a sua intenção for também fechar uma pasta, como /rascunhos/, escreva-a no campo de caminhos: ela entra em cada grupo permitido e no grupo *.
robots.txt
# Bloqueados por vocêUser-agent: GPTBotUser-agent: ClaudeBotUser-agent: Google-ExtendedUser-agent: Applebot-ExtendedUser-agent: meta-externalagentUser-agent: AmazonbotDisallow: /# PermitidosUser-agent: OAI-SearchBotUser-agent: ChatGPT-UserUser-agent: Claude-SearchBotUser-agent: Claude-UserUser-agent: Google-AgentUser-agent: Google-GeminiNotebookUser-agent: Google-PinpointUser-agent: PerplexityBotUser-agent: Perplexity-UserUser-agent: ApplebotUser-agent: meta-webindexerUser-agent: meta-externalfetcherUser-agent: CCBotUser-agent: Amzn-SearchBotUser-agent: Amzn-UserUser-agent: DuckAssistBotAllow: /O que o robots.txt não faz
- Não é uma barreira. É um pedido que os robôs que seguem o protocolo atendem. Nas páginas oficiais, a OpenAI diz que as regras “podem não valer” para o
ChatGPT-User, a Perplexity e o Google que seus buscadores acionados por pessoas “em geral ignoram” o arquivo, e a Meta que ometa-externalfetcher“pode ignorar”. - Não apaga o que já foi coletado. Bloquear pede que o robô não colete daqui para frente. As páginas que abrimos não descrevem o que acontece com o que já foi coletado: não confirmado.
- Não garante nem impede citação. Liberar um robô de busca permite que ele indexe o site; nenhum fornecedor diz como escolhe o que cita.
- Pode ter prazo. A OpenAI fala em cerca de 24 horas para o OAI-SearchBot se ajustar.
Conteúdo que não pode ser lido por ninguém precisa de senha ou de controle de acesso no servidor. Veja a tabela completa em Robôs de IA, com a página oficial de cada um.
Ver o checklist com fontesAs regras de precedência (RFC 9309)
O que o analisador desta página implementa.
| Situação | O que vale |
|---|---|
| Qual grupo vale para o robô | O que casa com o nome dele, sem diferenciar maiúsculas; vários grupos do mesmo robô se somam; sem grupo próprio, vale o *; sem nenhum, tudo é permitido. |
| Allow e Disallow em conflito | Vale a regra mais específica, a que casa com mais caracteres do caminho. No empate, vale o Allow. |
| Curingas | * casa zero ou mais caracteres e $ marca o fim do caminho. |
| /robots.txt | É sempre permitido. |
| Servidor sem o arquivo | Resposta 4xx: o robô pode acessar tudo. Resposta 5xx: o robô deve tratar como bloqueio total. |
| Registros fora do protocolo | Linhas como Crawl-delay não fazem parte do RFC 9309; os robôs podem ignorá-las. A Anthropic diz que aceita a extensão Crawl-delay; a Amazon, que não a suporta. |
Fontes desta página
Abertas em 11/10/2026.
- RFC 9309: Robots Exclusion Protocol (IETF)
Data na página: 09/2022 (publicada em setembro de 2022 (Internet Standards Track)) · aberta em
O que lemos: Correspondência de grupo sem diferenciar maiúsculas, grupos do mesmo robô somados, regra mais específica (mais octetos) vence, "allow" vence o empate, curingas * e $, /robots.txt sempre liberado, 4xx libera tudo e 5xx bloqueia tudo. - Overview of OpenAI crawlers (OpenAI)
A página não mostra data · aberta em
O que lemos: OAI-SearchBot, OAI-AdsBot, GPTBot e ChatGPT-User: para que serve cada um, as listas de IP e o prazo de cerca de 24 horas para uma mudança no robots.txt valer para a busca. A página aponta para o llms.txt da própria documentação da OpenAI; não diz que algum robô leia o llms.txt de outros sites. - Does Anthropic crawl data from the web, and how can site owners block the crawler? (Anthropic)
Data na página: 07/04/2026 (a página mostra "April 7, 2026" sob o título, sem dizer se é publicação ou atualização) · aberta em
O que lemos: ClaudeBot, Claude-User e Claude-SearchBot: o que cada um faz, a frase de que os robôs da Anthropic respeitam o robots.txt e o aviso de que bloquear por IP pode não funcionar. - Google common crawlers (Google)
Data na página: 14/07/2026 · aberta em
O que lemos: Tabela dos rastreadores comuns: Googlebot, Google-Extended (sem user agent próprio, não afeta a Busca) e Google-CloudVertexBot. "Sempre obedecem" ao robots.txt no rastreio automático. - Google user-triggered fetchers (Google)
Data na página: 19/08/2026 · aberta em
O que lemos: Lista Google-Agent, Google-GeminiNotebook e Google-Pinpoint, entre outros, e diz que, por serem pedidos de um usuário, em geral ignoram o robots.txt. - Perplexity crawlers (Perplexity)
A página não mostra data · aberta em
O que lemos: PerplexityBot (busca, "não é usado para treinar modelos de fundação") e Perplexity-User (a pedido do usuário, "em geral ignora" o robots.txt), com as listas de IP. A página aponta para o llms.txt da própria documentação da Perplexity; não diz que algum robô leia o llms.txt de outros sites. - About Applebot (Apple)
Data na página: 04/09/2026 (a página mostra "Published Date: September 04, 2026") · aberta em
O que lemos: Applebot respeita o robots.txt e, sem regra para ele mas com regra para Googlebot, segue a do Googlebot. Applebot-Extended não rastreia: só define como os dados do Applebot são usados no treino. - Meta Web Crawlers (Meta)
A página não mostra data · aberta em
O que lemos: meta-externalagent, meta-webindexer, meta-externalfetcher, meta-externalads e facebookexternalhit, com o texto de cada finalidade e a nota de que alguns "podem ignorar" o robots.txt. A página aponta para o llms.txt da documentação da Meta; não diz que algum robô leia o llms.txt de outros sites. - CCBot (Common Crawl)
A página não mostra data · aberta em
O que lemos: O que é o CCBot, a regra de robots.txt para bloqueá-lo, o user agent, a verificação por DNS reverso e a lista de IP em JSON. A página não menciona treino de IA. - Amazonbot (Amazon)
A página não mostra data · aberta em
O que lemos: Amazonbot ("pode ser usado para treinar modelos de IA da Amazon"), Amzn-SearchBot e Amzn-User (os dois "não rastreiam para treino"), uso do Protocolo de Exclusão de Robôs e das metatags noarchive e noindex. - DuckAssistBot (DuckDuckGo)
A página não mostra data · aberta em
O que lemos: Rastreia páginas em tempo real para respostas assistidas por IA com fontes; "os dados não são usados para treinar modelos"; o bloqueio é feito no robots.txt.
Perguntas frequentes
Como bloqueio o treino e deixo a busca de IA ler o meu site?
Bloqueie os robôs de treino (GPTBot, ClaudeBot, Google-Extended, Applebot-Extended, meta-externalagent, Amazonbot) e deixe os de busca (OAI-SearchBot, Claude-SearchBot, PerplexityBot). A OpenAI diz que cada configuração é independente. O gerador faz isso em um clique: é o padrão da página.
Bloquear o Google-Extended tira o meu site do Google?
Não. A página do Google diz que o Google-Extended não afeta a inclusão do site na Busca e não é sinal de ranqueamento. Ele controla se o conteúdo rastreado pode treinar futuras gerações do Gemini e fundamentar respostas no app Gemini e no Vertex AI. Já o Googlebot, se bloqueado, tira o site da Busca: por isso ele não entra no gerador.
O robots.txt é uma barreira que impede o robô de ler?
Não, é um pedido que os robôs que seguem o protocolo respeitam. Mais: OpenAI, Perplexity, Meta e Google dizem nas páginas oficiais que robôs acionados por uma pessoa (ChatGPT-User, Perplexity-User, meta-externalfetcher, Google-Agent) podem ignorar o robots.txt. Para conteúdo que não pode ser lido, use senha ou controle de acesso no servidor.
Por que o Applebot ganha sempre um grupo próprio?
A Apple diz que, se o robots.txt não menciona o Applebot mas menciona o Googlebot, o Applebot segue as instruções do Googlebot. Com um grupo escrito para ele, a regra fica explícita. O Applebot-Extended é outra coisa: não rastreia, só diz como os dados do Applebot podem ser usados no treino.
Quanto tempo leva para uma mudança valer?
A OpenAI informa que pode levar cerca de 24 horas para o OAI-SearchBot se ajustar a uma mudança no robots.txt. Nas páginas dos outros fornecedores que abrimos não há prazo: não confirmado.
O gerador está de acordo com o protocolo?
Os testes passam cada arquivo gerado por um analisador do RFC 9309, o texto do IETF que define o protocolo: o grupo do robô vence o grupo "*", a regra mais específica vence, e "allow" ganha o empate. Para as 16 combinações de permitir e bloquear por finalidade, o veredito de cada robô confere com a escolha.
Continue pelas outras ferramentas
Cada página resolve uma parte do trabalho com os robôs de IA.