Pular para o conteúdo

Robôs de IA: tabela com a fonte oficial de cada um

25 robôs de 9 fornecedores, com para que serve cada um, se o robots.txt o controla e a página oficial que sustenta a linha.

25 de 25 robôs

Robôs de IA documentados pelos próprios fornecedores
RobôDe quem e para que serveRespeita o robots.txt?Fonte oficial e data
GPTBot
rastreador
OpenAI · Treino de modelos
Coleta páginas cujo conteúdo pode ser usado para treinar os modelos de IA generativa da OpenAI.
O robots.txt controla
“Disallowing GPTBot indicates a site's content should not be used in training generative AI foundation models.”
OpenAI: robôs
sem data na página · aberta em 11/10/2026
IP oficial: lista
OAI-SearchBot
rastreador
OpenAI · Busca e respostas com fontes
Mostra sites nos resultados da busca do ChatGPT. Não é o robô de treino.
A OpenAI diz que a mudança no robots.txt pode levar cerca de 24 horas para valer.
O robots.txt controla
“OAI-SearchBot is used to surface websites in search results in ChatGPT's search features.”
OpenAI: robôs
sem data na página · aberta em 11/10/2026
IP oficial: lista
ChatGPT-User
rastreador
OpenAI · Acesso a pedido do usuário
Abre uma página quando uma pessoa pede ao ChatGPT ou a um GPT personalizado. Não rastreia a web sozinho.
Pode ignorar o robots.txt
“Because these actions are initiated by a user, robots.txt rules may not apply.”
OpenAI: robôs
sem data na página · aberta em 11/10/2026
IP oficial: lista
OAI-AdsBot
rastreador
OpenAI · Outra finalidade
Confere a segurança de páginas de destino enviadas como anúncio no ChatGPT. Só visita páginas enviadas como anúncio.
A página não diz
“OAI-AdsBot only visits pages submitted as ads.”
OpenAI: robôs
sem data na página · aberta em 11/10/2026
IP oficial: lista
ClaudeBot
rastreador
Anthropic · Treino de modelos
Coleta conteúdo da web que pode contribuir para o treino dos modelos da Anthropic.
A página também diz que a Anthropic aceita a extensão Crawl-delay e que bloquear por IP pode não funcionar.
O robots.txt controla
“Anthropic's bots "respect 'do not crawl' signals by honoring industry standard directives in robots.txt".”
Anthropic: rastreadores
página de 07/04/2026 · aberta em 11/10/2026
IP oficial: lista
Claude-SearchBot
rastreador
Anthropic · Busca e respostas com fontes
Percorre a web para melhorar a qualidade dos resultados de busca do Claude. Bloquear impede a indexação para a busca.
O robots.txt controla
“Disabling it "prevents our system from indexing your content for search optimization".”
Anthropic: rastreadores
página de 07/04/2026 · aberta em 11/10/2026
IP oficial: lista
Claude-User
rastreador
Anthropic · Acesso a pedido do usuário
Busca uma página quando uma pessoa faz uma pergunta ao Claude. Bloquear impede essa leitura a pedido.
O robots.txt controla
“Disabling it "prevents our system from retrieving your content in response to a user query".”
Anthropic: rastreadores
página de 07/04/2026 · aberta em 11/10/2026
IP oficial: lista
Googlebot
rastreador
Google · Busca e respostas com fontes
O rastreador da Busca do Google. Também é o que vale para os recursos de IA da Busca (Visão geral e Modo IA). Bloquear tira o site da Busca.
Fora do gerador por finalidade: bloquear o Googlebot remove o site do Google Busca.
O robots.txt controla
“Crawling preferences addressed to the Googlebot user agent affect Google Search (including Discover and all Google Search features).”
Google: rastreadores comuns
página de 14/07/2026 · aberta em 11/10/2026
Google-Extended
token de controle: não rastreia
Google · Treino de modelos + Busca e respostas com fontes
Não rastreia: é um controle do robots.txt que diz se o conteúdo que o Google já rastreou pode treinar futuras gerações do Gemini e fundamentar respostas no app Gemini e no Vertex AI.
Um controle só para treino e fundamentação: não dá para liberar um e bloquear o outro. Bloquear não tira o site da Busca.
O robots.txt controla
“Google-Extended does not impact a site's inclusion in Google Search nor is it used as a ranking signal in Google Search.”
Google: rastreadores comuns
página de 14/07/2026 · aberta em 11/10/2026
Google-CloudVertexBot
rastreador
Google · Outra finalidade
Rastreia a pedido de donos de sites para montar agentes do Vertex AI. Só age quando o dono do site pede.
O robots.txt controla
“Crawls requested by site owners to build Vertex AI Agents. (table row)”
Google: rastreadores comuns
página de 14/07/2026 · aberta em 11/10/2026
Google-Agent
rastreador
Google · Acesso a pedido do usuário
Agentes na infraestrutura do Google que navegam e agem na web a pedido de um usuário.
Pode ignorar o robots.txt
“Because the fetch was requested by a user, these fetchers generally ignore robots.txt rules.”
Google: buscadores acionados pelo usuário
página de 19/08/2026 · aberta em 11/10/2026
Google-GeminiNotebook
rastreador
Google · Acesso a pedido do usuário
Abre os endereços que uma pessoa adiciona como fonte de um projeto no Gemini Notebook.
Antes se chamava Google-NotebookLM, que a página diz ter suporte até agosto de 2026.
Pode ignorar o robots.txt
“Because the fetch was requested by a user, these fetchers generally ignore robots.txt rules.”
Google: buscadores acionados pelo usuário
página de 19/08/2026 · aberta em 11/10/2026
Google-Pinpoint
rastreador
Google · Acesso a pedido do usuário
Abre os endereços que uma pessoa indica como fonte de coleções de documentos no Google Pinpoint.
Pode ignorar o robots.txt
“Because the fetch was requested by a user, these fetchers generally ignore robots.txt rules.”
Google: buscadores acionados pelo usuário
página de 19/08/2026 · aberta em 11/10/2026
PerplexityBot
rastreador
Perplexity · Busca e respostas com fontes
Mostra e linka sites nos resultados de busca do Perplexity. A página diz que não é usado para treinar modelos de fundação.
A página recomenda liberar o robô no robots.txt, mas não descreve o que ocorre se você bloquear.
A página não diz
“We recommend allowing PerplexityBot in your site's robots.txt file.”
Perplexity: robôs
sem data na página · aberta em 11/10/2026
IP oficial: lista
Perplexity-User
rastreador
Perplexity · Acesso a pedido do usuário
Visita uma página para responder a uma pergunta de um usuário do Perplexity. A página diz que não é usado para treino.
Pode ignorar o robots.txt
“Since a user requested the fetch, this fetcher generally ignores robots.txt rules.”
Perplexity: robôs
sem data na página · aberta em 11/10/2026
IP oficial: lista
Applebot
rastreador
Apple · Busca e respostas com fontes
Alimenta recursos da Apple, como a busca (Siri e Spotlight). A Apple separa o uso para treino no Applebot-Extended.
Sem regra para o Applebot, mas com regra para o Googlebot, a Apple diz que segue a do Googlebot: por isso o gerador sempre escreve um grupo próprio para ele.
O robots.txt controla
“Applebot respects standard robots.txt directives in general search crawls that are targeted at Applebot.”
Apple: Applebot
página de 04/09/2026 · aberta em 11/10/2026
Applebot-Extended
token de controle: não rastreia
Apple · Treino de modelos
Não rastreia: é um controle do robots.txt que diz se o conteúdo rastreado pelo Applebot pode treinar os modelos de fundação de uso geral da Apple.
O robots.txt controla
“Applebot-Extended does not crawl webpages. Applebot-Extended is only used to determine how to use the data crawled by the Applebot user agent.”
Apple: Applebot
página de 04/09/2026 · aberta em 11/10/2026
meta-externalagent
rastreador
Meta · Treino de modelos + Outra finalidade
Rastreia a web para usos como treinar modelos de IA de fundação ou melhorar produtos indexando o conteúdo diretamente.
Duas finalidades no mesmo robô: bloquear o treino bloqueia também a indexação para produtos da Meta.
O robots.txt controla
“Crawls the web for use cases such as training foundation AI models or improving products by indexing content directly.”
Meta: rastreadores
sem data na página · aberta em 11/10/2026
meta-webindexer
rastreador
Meta · Busca e respostas com fontes
Percorre a web para melhorar a qualidade dos resultados de busca do Meta AI.
O robots.txt controla
“Allowing Meta-WebIndexer in your robots.txt file helps us cite and link to your content.”
Meta: rastreadores
sem data na página · aberta em 11/10/2026
meta-externalfetcher
rastreador
Meta · Acesso a pedido do usuário
Busca links individuais a pedido de um usuário e apoia funções de produtos, como a avaliação de IA com agentes.
Pode ignorar o robots.txt
“May bypass robots.txt because it performs fetches that were requested by the user.”
Meta: rastreadores
sem data na página · aberta em 11/10/2026
CCBot
rastreador
Common Crawl · Coleta aberta da web
Rastreador da Common Crawl, fundação sem fins lucrativos que publica uma cópia aberta da web. A página não cita treino de IA nem diz quem usa os dados.
A página avisa que há rastreadores que se passam por CCBot e ensina a conferir por DNS reverso.
O robots.txt controla
“To prevent Common Crawl from crawling your website, include the following in your robots.txt.”
Common Crawl: CCBot
sem data na página · aberta em 11/10/2026
IP oficial: lista
Amazonbot
rastreador
Amazon · Treino de modelos
Melhora produtos e serviços da Amazon e, segundo a página, pode ser usado para treinar modelos de IA da Amazon.
A página também diz que o Amazonbot respeita as metatags noarchive e noindex.
O robots.txt controla
“Amazonbot is used to improve our products and services. [...] may be used to train Amazon AI models.”
Amazon: Amazonbot
sem data na página · aberta em 11/10/2026
Amzn-SearchBot
rastreador
Amazon · Busca e respostas com fontes
Melhora as experiências de busca em produtos e serviços da Amazon. A página diz que não rastreia para treinar IA generativa.
O robots.txt controla
“Amzn-SearchBot is used to improve search experiences in Amazon products and services.”
Amazon: Amazonbot
sem data na página · aberta em 11/10/2026
Amzn-User
rastreador
Amazon · Acesso a pedido do usuário
Atende a ações de usuários, como respostas da Alexa que pedem informação atualizada. A página diz que não rastreia para treinar IA generativa.
A página fala do Protocolo de Exclusão de Robôs para os rastreadores em geral e não diz se o Amzn-User, que age a pedido, segue o mesmo caminho.
A página não diz
“Amzn-User supports user actions, such as responding to Alexa queries that require up-to-date information.”
Amazon: Amazonbot
sem data na página · aberta em 11/10/2026
DuckAssistBot
rastreador
DuckDuckGo · Busca e respostas com fontes
Rastreia páginas em tempo real para as respostas assistidas por IA do DuckDuckGo, que citam as fontes. A página diz que os dados não treinam modelos.
A página ensina a bloquear o robô editando o robots.txt, mas não descreve o comportamento com palavras próprias.
A página não diz
“This data is not used in any way to train AI models.”
DuckDuckGo: DuckAssistBot
sem data na página · aberta em 11/10/2026

Quais são os robôs de IA e para que serve cada um?

Os robôs de IA se dividem em treino (GPTBot, ClaudeBot), busca (OAI-SearchBot, Claude-SearchBot, PerplexityBot) e acesso a pedido de uma pessoa (ChatGPT-User, Claude-User). A OpenAI e a Perplexity dizem que os do terceiro grupo podem ignorar o robots.txt; a Anthropic diz que seus robôs o respeitam.

Como ler a tabela

Dados conferidos em 11/10/2026.

Cada linha tem o nome que vai na linha User-agent do robots.txt, o fornecedor, para que serve (com as palavras da página oficial, em português) e a página que sustenta a linha, com a data que a própria página mostra e o dia em que a abrimos. Páginas que não mostram data aparecem como “sem data na página”. O trecho em inglês é a frase da página que sustenta o que está dito sobre o robots.txt ou sobre a finalidade.

Os três estados da coluna “Respeita o robots.txt?”

  • O robots.txt controla: a página oficial documenta o efeito do robots.txt sobre o robô, por exemplo dizendo que bloquear impede a indexação ou o treino.
  • Pode ignorar o robots.txt: a página diz que o robô age a pedido de uma pessoa e que, por isso, as regras podem não valer. Vale para ChatGPT-User, Perplexity-User, meta-externalfetcher e os buscadores acionados pelo usuário do Google.
  • A página não diz: o fornecedor documenta o robô, mas não descreve o que ocorre com o robots.txt. Não preenchemos o vazio com suposição.

Rastreador e token de controle

O Google-Extended e o Applebot-Extended são tokens de controle: não visitam o site. Existem só no robots.txt, para dizer como os dados que o Googlebot e o Applebot já coletaram podem ser usados no treino.

Quem ficou de fora, e por quê

Robô sem página oficial aberta por nós não entra na tabela.

  • anthropic-ai: a página da Anthropic que abrimos não o menciona. não confirmado
  • MistralAI-User, Bytespider, Claude-Web, cohere-ai: não abrimos página oficial do fornecedor para eles hoje. não confirmado
  • bingbot (Microsoft): a página de ajuda do Bing não carregou conteúdo para leitura nesta conferência. não confirmado
  • OAI-AdsBot, Google-CloudVertexBot e o Googlebot estão na tabela, mas fora do gerador de robots.txt: os dois primeiros não são treino, busca de IA nem acesso a pedido, e bloquear o Googlebot tira o site da Busca do Google.

Outros sites e ferramentas listam dezenas de robôs a mais. Se o fornecedor não publicou a documentação, não temos como dizer para que o robô serve nem se ele respeita o robots.txt, e por isso ele não entra aqui.

Como conferir se uma visita é do robô de verdade

O nome no user agent pode ser copiado por qualquer programa. A Common Crawl avisa, na própria página, que existem rastreadores que se passam por CCBot, e a Anthropic, que bloquear por IP pode não funcionar. O caminho seguro é comparar o endereço IP da visita com a lista que o fornecedor publica. A coluna “Fonte oficial” traz o link da lista quando existe: OpenAI (GPTBot, OAI-SearchBot, ChatGPT-User, OAI-AdsBot), Anthropic, Perplexity (PerplexityBot e Perplexity-User) e Common Crawl. A Common Crawl também explica a verificação por DNS reverso.

Depois de saber quem é, decida o que permitir no gerador de robots.txt para IA. E para o que cada afirmação do mercado tem de fonte, veja o checklist.

Gerar o robots.txt por finalidade

Fontes desta página

Cada linha da tabela vem de uma destas páginas. Todas abertas em 11/10/2026.

  • Overview of OpenAI crawlers (OpenAI)
    A página não mostra data · aberta em
    O que lemos: OAI-SearchBot, OAI-AdsBot, GPTBot e ChatGPT-User: para que serve cada um, as listas de IP e o prazo de cerca de 24 horas para uma mudança no robots.txt valer para a busca. A página aponta para o llms.txt da própria documentação da OpenAI; não diz que algum robô leia o llms.txt de outros sites.
  • Does Anthropic crawl data from the web, and how can site owners block the crawler? (Anthropic)
    Data na página: 07/04/2026 (a página mostra "April 7, 2026" sob o título, sem dizer se é publicação ou atualização) · aberta em
    O que lemos: ClaudeBot, Claude-User e Claude-SearchBot: o que cada um faz, a frase de que os robôs da Anthropic respeitam o robots.txt e o aviso de que bloquear por IP pode não funcionar.
  • Google common crawlers (Google)
    Data na página: 14/07/2026 · aberta em
    O que lemos: Tabela dos rastreadores comuns: Googlebot, Google-Extended (sem user agent próprio, não afeta a Busca) e Google-CloudVertexBot. "Sempre obedecem" ao robots.txt no rastreio automático.
  • Overview of Google crawlers and fetchers (Google)
    Data na página: 12/06/2026 · aberta em
    O que lemos: As três categorias (rastreadores comuns, de caso especial e acionados pelo usuário) e o que cada uma faz com o robots.txt.
  • Google user-triggered fetchers (Google)
    Data na página: 19/08/2026 · aberta em
    O que lemos: Lista Google-Agent, Google-GeminiNotebook e Google-Pinpoint, entre outros, e diz que, por serem pedidos de um usuário, em geral ignoram o robots.txt.
  • Perplexity crawlers (Perplexity)
    A página não mostra data · aberta em
    O que lemos: PerplexityBot (busca, "não é usado para treinar modelos de fundação") e Perplexity-User (a pedido do usuário, "em geral ignora" o robots.txt), com as listas de IP. A página aponta para o llms.txt da própria documentação da Perplexity; não diz que algum robô leia o llms.txt de outros sites.
  • About Applebot (Apple)
    Data na página: 04/09/2026 (a página mostra "Published Date: September 04, 2026") · aberta em
    O que lemos: Applebot respeita o robots.txt e, sem regra para ele mas com regra para Googlebot, segue a do Googlebot. Applebot-Extended não rastreia: só define como os dados do Applebot são usados no treino.
  • Meta Web Crawlers (Meta)
    A página não mostra data · aberta em
    O que lemos: meta-externalagent, meta-webindexer, meta-externalfetcher, meta-externalads e facebookexternalhit, com o texto de cada finalidade e a nota de que alguns "podem ignorar" o robots.txt. A página aponta para o llms.txt da documentação da Meta; não diz que algum robô leia o llms.txt de outros sites.
  • CCBot (Common Crawl)
    A página não mostra data · aberta em
    O que lemos: O que é o CCBot, a regra de robots.txt para bloqueá-lo, o user agent, a verificação por DNS reverso e a lista de IP em JSON. A página não menciona treino de IA.
  • Amazonbot (Amazon)
    A página não mostra data · aberta em
    O que lemos: Amazonbot ("pode ser usado para treinar modelos de IA da Amazon"), Amzn-SearchBot e Amzn-User (os dois "não rastreiam para treino"), uso do Protocolo de Exclusão de Robôs e das metatags noarchive e noindex.
  • DuckAssistBot (DuckDuckGo)
    A página não mostra data · aberta em
    O que lemos: Rastreia páginas em tempo real para respostas assistidas por IA com fontes; "os dados não são usados para treinar modelos"; o bloqueio é feito no robots.txt.

Perguntas frequentes

Como sei se uma visita é mesmo do robô?

Pelo endereço IP, não pelo nome no user agent, que qualquer um pode copiar. OpenAI, Anthropic, Perplexity e Common Crawl publicam as listas de IP dos robôs (links na tabela). A Common Crawl avisa que há rastreadores que se passam por CCBot e ensina a conferir por DNS reverso.

O que quer dizer "pode ignorar o robots.txt"?

Que a página oficial do fornecedor diz que aquele robô age a pedido de uma pessoa e, por isso, pode não seguir o robots.txt. A OpenAI escreve que as regras "podem não valer" para o ChatGPT-User; a Perplexity e o Google escrevem que esses buscadores "em geral ignoram" o arquivo; a Meta, que o meta-externalfetcher "pode ignorar".

Por que o robô X não está na tabela?

Porque só entra robô que tem página oficial do próprio fornecedor aberta por nós. Ficaram de fora, por falta dessa página, o anthropic-ai, o MistralAI-User, o Bytespider e o rastreador da Microsoft (a página de ajuda do Bing não carregou para leitura). Se o fornecedor publicar a documentação, o robô entra.

O CCBot treina modelos de IA?

A página oficial da Common Crawl descreve uma fundação que democratiza o acesso a informação da web e não menciona treino de IA nem diz quem usa os dados. Por isso a tabela classifica o CCBot como "coleta aberta" e não como treino.

A tabela está atualizada?

Ela reflete as páginas oficiais abertas em 11/10/2026, com a data de cada página quando ela mostra uma. Fornecedores criam, renomeiam e aposentam robôs: o Google, por exemplo, já renomeou o Google-NotebookLM para Google-GeminiNotebook. Confira a página oficial antes de decidir.