Pular para o conteúdo

Robots.txt para IA: libere ou bloqueie por finalidade

Escolha o que cada tipo de robô pode fazer no seu site (treinar, buscar ou ler a pedido de uma pessoa) e copie o robots.txt pronto.

O que cada tipo de robô pode fazer

Treino de modelos

O conteúdo pode ser usado para treinar modelos de IA. Bloquear pede que o seu texto não entre no treino futuro.

Robôs: GPTBot, ClaudeBot, Google-Extended, Applebot-Extended, meta-externalagent, Amazonbot.

Busca e respostas com fontes

O site pode ser indexado para aparecer e ser linkado em respostas e buscas feitas com IA.

Robôs: OAI-SearchBot, Claude-SearchBot, Google-Extended, PerplexityBot, Applebot, meta-webindexer, Amzn-SearchBot, DuckAssistBot.

Acesso a pedido do usuário

O robô abre a página só quando uma pessoa pede a um assistente. Vários fornecedores dizem que esses robôs podem ignorar o robots.txt.

Robôs: ChatGPT-User, Claude-User, Google-Agent, Google-GeminiNotebook, Google-Pinpoint, Perplexity-User, meta-externalfetcher, Amzn-User.

Coleta aberta da web

Cópia aberta da web mantida por uma fundação sem fins lucrativos. A página oficial não diz quem usa os dados.

Robôs: CCBot.

O robots.txt age por nome de robô, não por finalidade. Um robô com duas finalidades (Google-Extended: treino e respostas do Gemini; meta-externalagent: treino e produtos da Meta) é bloqueado inteiro se você bloquear qualquer uma delas.

Exceções por robô (0)

Uma exceção vence a escolha por finalidade.

opcional

Um por linha, começando por /. Ex.: /rascunhos/ ou /area-restrita/. Valem também para os robôs permitidos.

opcional

Suas escolhas ficam só neste navegador. Nada é enviado.

Como bloquear o treino de IA e manter a busca?

Para bloquear o treino e manter a busca, bloqueie GPTBot, ClaudeBot, Google-Extended, Applebot-Extended, meta-externalagent e Amazonbot, e deixe OAI-SearchBot, Claude-SearchBot e PerplexityBot. O robots.txt é um pedido, não uma barreira.

Treino, busca e acesso a pedido: o que muda para o seu site

Os fornecedores separam os robôs por finalidade. O gerador usa a mesma separação.

Finalidades dos robôs de IA e os robôs de cada uma
FinalidadeO que o robô fazRobôs no gerador
Treino de modelosColeta conteúdo que pode ser usado para treinar modelos de IA. Bloquear pede que o seu texto não entre em treinos futuros; não remove o que já foi coletado.GPTBot, ClaudeBot, Google-Extended, Applebot-Extended, meta-externalagent, Amazonbot
Busca e respostas com fontesIndexa páginas para mostrá-las, com link, em respostas e buscas feitas com IA. Bloquear tira o site desse índice.OAI-SearchBot, Claude-SearchBot, Google-Extended, PerplexityBot, Applebot, meta-webindexer, Amzn-SearchBot, DuckAssistBot
Acesso a pedido do usuárioAbre uma página só quando uma pessoa pede a um assistente. Vários fornecedores dizem que o robots.txt pode não valer, porque quem pede é a pessoa.ChatGPT-User, Claude-User, Google-Agent, Google-GeminiNotebook, Google-Pinpoint, Perplexity-User, meta-externalfetcher, Amzn-User
Coleta aberta da webMantém uma cópia aberta da web para quem quiser usar. A página oficial do CCBot não cita treino de IA.CCBot

A OpenAI escreve que cada ajuste do robots.txt é independente: dá para bloquear o GPTBot (treino) e liberar o OAI-SearchBot (busca do ChatGPT). A mesma lógica vale para a Anthropic, que separa ClaudeBot, Claude-SearchBot e Claude-User. No Google, o Google-Extended é um token só do robots.txt: ele não rastreia e, segundo a página do Google, não afeta a inclusão do site na Busca nem é sinal de ranqueamento.

O Googlebot é outra coisa. É o rastreador da Busca do Google, e as regras dele valem também para os recursos de IA da Busca. Por isso ele não aparece no gerador: bloqueá-lo tira o site do Google. Se for o caso, edite o arquivo à mão.

Como o gerador decide e escreve o arquivo

  1. Uma exceção que você escolheu para um robô vale mais que qualquer finalidade.
  2. Sem exceção, o robô segue as finalidades dele. Se tiver duas finalidades que o gerador controla e você bloquear qualquer uma, ele é bloqueado inteiro: o robots.txt age por nome de robô, não por finalidade. É o caso do Google-Extended (treino e respostas do Gemini).
  3. Todo robô escolhido ganha um grupo próprio, até os permitidos. Isso importa porque um grupo com o nome do robô substitui o grupo * (RFC 9309, seção 2.2.1), e porque a Apple diz que o Applebot, sem grupo próprio, segue o do Googlebot.
  4. Os caminhos que você fechar são repetidos em cada grupo permitido, para que o grupo próprio não os esqueça.

Os testes automáticos conferem isso: para cada uma das 16 combinações de permitir e bloquear por finalidade, o arquivo gerado é lido por um analisador das regras do RFC 9309 e o veredito de cada robô tem de bater com a escolha. O campo "Teste o arquivo gerado", ao lado do código, usa o mesmo analisador.

Exemplo resolvido: bloquear o treino e liberar a busca

O que o padrão da página faz
  1. Treino bloqueado: GPTBot, ClaudeBot, Google-Extended, Applebot-Extended, meta-externalagent e Amazonbot recebem Disallow: /.
  2. Busca, pedido do usuário e coleta aberta permitidos: os demais robôs recebem Allow: / no grupo deles.
  3. O Googlebot não aparece: continua com a regra geral do site, que permite.

Se a sua intenção for também fechar uma pasta, como /rascunhos/, escreva-a no campo de caminhos: ela entra em cada grupo permitido e no grupo *.

robots.txt

# Bloqueados por vocêUser-agent: GPTBotUser-agent: ClaudeBotUser-agent: Google-ExtendedUser-agent: Applebot-ExtendedUser-agent: meta-externalagentUser-agent: AmazonbotDisallow: /# PermitidosUser-agent: OAI-SearchBotUser-agent: ChatGPT-UserUser-agent: Claude-SearchBotUser-agent: Claude-UserUser-agent: Google-AgentUser-agent: Google-GeminiNotebookUser-agent: Google-PinpointUser-agent: PerplexityBotUser-agent: Perplexity-UserUser-agent: ApplebotUser-agent: meta-webindexerUser-agent: meta-externalfetcherUser-agent: CCBotUser-agent: Amzn-SearchBotUser-agent: Amzn-UserUser-agent: DuckAssistBotAllow: /

O que o robots.txt não faz

  • Não é uma barreira. É um pedido que os robôs que seguem o protocolo atendem. Nas páginas oficiais, a OpenAI diz que as regras “podem não valer” para o ChatGPT-User, a Perplexity e o Google que seus buscadores acionados por pessoas “em geral ignoram” o arquivo, e a Meta que o meta-externalfetcher “pode ignorar”.
  • Não apaga o que já foi coletado. Bloquear pede que o robô não colete daqui para frente. As páginas que abrimos não descrevem o que acontece com o que já foi coletado: não confirmado.
  • Não garante nem impede citação. Liberar um robô de busca permite que ele indexe o site; nenhum fornecedor diz como escolhe o que cita.
  • Pode ter prazo. A OpenAI fala em cerca de 24 horas para o OAI-SearchBot se ajustar.

Conteúdo que não pode ser lido por ninguém precisa de senha ou de controle de acesso no servidor. Veja a tabela completa em Robôs de IA, com a página oficial de cada um.

Ver o checklist com fontes

As regras de precedência (RFC 9309)

O que o analisador desta página implementa.

Regras do RFC 9309 implementadas pelo analisador
SituaçãoO que vale
Qual grupo vale para o robôO que casa com o nome dele, sem diferenciar maiúsculas; vários grupos do mesmo robô se somam; sem grupo próprio, vale o *; sem nenhum, tudo é permitido.
Allow e Disallow em conflitoVale a regra mais específica, a que casa com mais caracteres do caminho. No empate, vale o Allow.
Curingas* casa zero ou mais caracteres e $ marca o fim do caminho.
/robots.txtÉ sempre permitido.
Servidor sem o arquivoResposta 4xx: o robô pode acessar tudo. Resposta 5xx: o robô deve tratar como bloqueio total.
Registros fora do protocoloLinhas como Crawl-delay não fazem parte do RFC 9309; os robôs podem ignorá-las. A Anthropic diz que aceita a extensão Crawl-delay; a Amazon, que não a suporta.

Fontes desta página

Abertas em 11/10/2026.

  • RFC 9309: Robots Exclusion Protocol (IETF)
    Data na página: 09/2022 (publicada em setembro de 2022 (Internet Standards Track)) · aberta em
    O que lemos: Correspondência de grupo sem diferenciar maiúsculas, grupos do mesmo robô somados, regra mais específica (mais octetos) vence, "allow" vence o empate, curingas * e $, /robots.txt sempre liberado, 4xx libera tudo e 5xx bloqueia tudo.
  • Overview of OpenAI crawlers (OpenAI)
    A página não mostra data · aberta em
    O que lemos: OAI-SearchBot, OAI-AdsBot, GPTBot e ChatGPT-User: para que serve cada um, as listas de IP e o prazo de cerca de 24 horas para uma mudança no robots.txt valer para a busca. A página aponta para o llms.txt da própria documentação da OpenAI; não diz que algum robô leia o llms.txt de outros sites.
  • Does Anthropic crawl data from the web, and how can site owners block the crawler? (Anthropic)
    Data na página: 07/04/2026 (a página mostra "April 7, 2026" sob o título, sem dizer se é publicação ou atualização) · aberta em
    O que lemos: ClaudeBot, Claude-User e Claude-SearchBot: o que cada um faz, a frase de que os robôs da Anthropic respeitam o robots.txt e o aviso de que bloquear por IP pode não funcionar.
  • Google common crawlers (Google)
    Data na página: 14/07/2026 · aberta em
    O que lemos: Tabela dos rastreadores comuns: Googlebot, Google-Extended (sem user agent próprio, não afeta a Busca) e Google-CloudVertexBot. "Sempre obedecem" ao robots.txt no rastreio automático.
  • Google user-triggered fetchers (Google)
    Data na página: 19/08/2026 · aberta em
    O que lemos: Lista Google-Agent, Google-GeminiNotebook e Google-Pinpoint, entre outros, e diz que, por serem pedidos de um usuário, em geral ignoram o robots.txt.
  • Perplexity crawlers (Perplexity)
    A página não mostra data · aberta em
    O que lemos: PerplexityBot (busca, "não é usado para treinar modelos de fundação") e Perplexity-User (a pedido do usuário, "em geral ignora" o robots.txt), com as listas de IP. A página aponta para o llms.txt da própria documentação da Perplexity; não diz que algum robô leia o llms.txt de outros sites.
  • About Applebot (Apple)
    Data na página: 04/09/2026 (a página mostra "Published Date: September 04, 2026") · aberta em
    O que lemos: Applebot respeita o robots.txt e, sem regra para ele mas com regra para Googlebot, segue a do Googlebot. Applebot-Extended não rastreia: só define como os dados do Applebot são usados no treino.
  • Meta Web Crawlers (Meta)
    A página não mostra data · aberta em
    O que lemos: meta-externalagent, meta-webindexer, meta-externalfetcher, meta-externalads e facebookexternalhit, com o texto de cada finalidade e a nota de que alguns "podem ignorar" o robots.txt. A página aponta para o llms.txt da documentação da Meta; não diz que algum robô leia o llms.txt de outros sites.
  • CCBot (Common Crawl)
    A página não mostra data · aberta em
    O que lemos: O que é o CCBot, a regra de robots.txt para bloqueá-lo, o user agent, a verificação por DNS reverso e a lista de IP em JSON. A página não menciona treino de IA.
  • Amazonbot (Amazon)
    A página não mostra data · aberta em
    O que lemos: Amazonbot ("pode ser usado para treinar modelos de IA da Amazon"), Amzn-SearchBot e Amzn-User (os dois "não rastreiam para treino"), uso do Protocolo de Exclusão de Robôs e das metatags noarchive e noindex.
  • DuckAssistBot (DuckDuckGo)
    A página não mostra data · aberta em
    O que lemos: Rastreia páginas em tempo real para respostas assistidas por IA com fontes; "os dados não são usados para treinar modelos"; o bloqueio é feito no robots.txt.

Perguntas frequentes

Como bloqueio o treino e deixo a busca de IA ler o meu site?

Bloqueie os robôs de treino (GPTBot, ClaudeBot, Google-Extended, Applebot-Extended, meta-externalagent, Amazonbot) e deixe os de busca (OAI-SearchBot, Claude-SearchBot, PerplexityBot). A OpenAI diz que cada configuração é independente. O gerador faz isso em um clique: é o padrão da página.

Bloquear o Google-Extended tira o meu site do Google?

Não. A página do Google diz que o Google-Extended não afeta a inclusão do site na Busca e não é sinal de ranqueamento. Ele controla se o conteúdo rastreado pode treinar futuras gerações do Gemini e fundamentar respostas no app Gemini e no Vertex AI. Já o Googlebot, se bloqueado, tira o site da Busca: por isso ele não entra no gerador.

O robots.txt é uma barreira que impede o robô de ler?

Não, é um pedido que os robôs que seguem o protocolo respeitam. Mais: OpenAI, Perplexity, Meta e Google dizem nas páginas oficiais que robôs acionados por uma pessoa (ChatGPT-User, Perplexity-User, meta-externalfetcher, Google-Agent) podem ignorar o robots.txt. Para conteúdo que não pode ser lido, use senha ou controle de acesso no servidor.

Por que o Applebot ganha sempre um grupo próprio?

A Apple diz que, se o robots.txt não menciona o Applebot mas menciona o Googlebot, o Applebot segue as instruções do Googlebot. Com um grupo escrito para ele, a regra fica explícita. O Applebot-Extended é outra coisa: não rastreia, só diz como os dados do Applebot podem ser usados no treino.

Quanto tempo leva para uma mudança valer?

A OpenAI informa que pode levar cerca de 24 horas para o OAI-SearchBot se ajustar a uma mudança no robots.txt. Nas páginas dos outros fornecedores que abrimos não há prazo: não confirmado.

O gerador está de acordo com o protocolo?

Os testes passam cada arquivo gerado por um analisador do RFC 9309, o texto do IETF que define o protocolo: o grupo do robô vence o grupo "*", a regra mais específica vence, e "allow" ganha o empate. Para as 16 combinações de permitir e bloquear por finalidade, o veredito de cada robô confere com a escolha.