Robôs de IA: tabela com a fonte oficial de cada um
25 robôs de 9 fornecedores, com para que serve cada um, se o robots.txt o controla e a página oficial que sustenta a linha.
25 de 25 robôs
| Robô | De quem e para que serve | Respeita o robots.txt? | Fonte oficial e data |
|---|---|---|---|
GPTBotrastreador | OpenAI · Treino de modelos Coleta páginas cujo conteúdo pode ser usado para treinar os modelos de IA generativa da OpenAI. | O robots.txt controla “Disallowing GPTBot indicates a site's content should not be used in training generative AI foundation models.” | OpenAI: robôs sem data na página · aberta em 11/10/2026 IP oficial: lista |
OAI-SearchBotrastreador | OpenAI · Busca e respostas com fontes Mostra sites nos resultados da busca do ChatGPT. Não é o robô de treino. A OpenAI diz que a mudança no robots.txt pode levar cerca de 24 horas para valer. | O robots.txt controla “OAI-SearchBot is used to surface websites in search results in ChatGPT's search features.” | OpenAI: robôs sem data na página · aberta em 11/10/2026 IP oficial: lista |
ChatGPT-Userrastreador | OpenAI · Acesso a pedido do usuário Abre uma página quando uma pessoa pede ao ChatGPT ou a um GPT personalizado. Não rastreia a web sozinho. | Pode ignorar o robots.txt “Because these actions are initiated by a user, robots.txt rules may not apply.” | OpenAI: robôs sem data na página · aberta em 11/10/2026 IP oficial: lista |
OAI-AdsBotrastreador | OpenAI · Outra finalidade Confere a segurança de páginas de destino enviadas como anúncio no ChatGPT. Só visita páginas enviadas como anúncio. | A página não diz “OAI-AdsBot only visits pages submitted as ads.” | OpenAI: robôs sem data na página · aberta em 11/10/2026 IP oficial: lista |
ClaudeBotrastreador | Anthropic · Treino de modelos Coleta conteúdo da web que pode contribuir para o treino dos modelos da Anthropic. A página também diz que a Anthropic aceita a extensão Crawl-delay e que bloquear por IP pode não funcionar. | O robots.txt controla “Anthropic's bots "respect 'do not crawl' signals by honoring industry standard directives in robots.txt".” | Anthropic: rastreadores página de 07/04/2026 · aberta em 11/10/2026 IP oficial: lista |
Claude-SearchBotrastreador | Anthropic · Busca e respostas com fontes Percorre a web para melhorar a qualidade dos resultados de busca do Claude. Bloquear impede a indexação para a busca. | O robots.txt controla “Disabling it "prevents our system from indexing your content for search optimization".” | Anthropic: rastreadores página de 07/04/2026 · aberta em 11/10/2026 IP oficial: lista |
Claude-Userrastreador | Anthropic · Acesso a pedido do usuário Busca uma página quando uma pessoa faz uma pergunta ao Claude. Bloquear impede essa leitura a pedido. | O robots.txt controla “Disabling it "prevents our system from retrieving your content in response to a user query".” | Anthropic: rastreadores página de 07/04/2026 · aberta em 11/10/2026 IP oficial: lista |
Googlebotrastreador | Google · Busca e respostas com fontes O rastreador da Busca do Google. Também é o que vale para os recursos de IA da Busca (Visão geral e Modo IA). Bloquear tira o site da Busca. Fora do gerador por finalidade: bloquear o Googlebot remove o site do Google Busca. | O robots.txt controla “Crawling preferences addressed to the Googlebot user agent affect Google Search (including Discover and all Google Search features).” | Google: rastreadores comuns página de 14/07/2026 · aberta em 11/10/2026 |
Google-Extendedtoken de controle: não rastreia | Google · Treino de modelos + Busca e respostas com fontes Não rastreia: é um controle do robots.txt que diz se o conteúdo que o Google já rastreou pode treinar futuras gerações do Gemini e fundamentar respostas no app Gemini e no Vertex AI. Um controle só para treino e fundamentação: não dá para liberar um e bloquear o outro. Bloquear não tira o site da Busca. | O robots.txt controla “Google-Extended does not impact a site's inclusion in Google Search nor is it used as a ranking signal in Google Search.” | Google: rastreadores comuns página de 14/07/2026 · aberta em 11/10/2026 |
Google-CloudVertexBotrastreador | Google · Outra finalidade Rastreia a pedido de donos de sites para montar agentes do Vertex AI. Só age quando o dono do site pede. | O robots.txt controla “Crawls requested by site owners to build Vertex AI Agents. (table row)” | Google: rastreadores comuns página de 14/07/2026 · aberta em 11/10/2026 |
Google-Agentrastreador | Google · Acesso a pedido do usuário Agentes na infraestrutura do Google que navegam e agem na web a pedido de um usuário. | Pode ignorar o robots.txt “Because the fetch was requested by a user, these fetchers generally ignore robots.txt rules.” | Google: buscadores acionados pelo usuário página de 19/08/2026 · aberta em 11/10/2026 |
Google-GeminiNotebookrastreador | Google · Acesso a pedido do usuário Abre os endereços que uma pessoa adiciona como fonte de um projeto no Gemini Notebook. Antes se chamava Google-NotebookLM, que a página diz ter suporte até agosto de 2026. | Pode ignorar o robots.txt “Because the fetch was requested by a user, these fetchers generally ignore robots.txt rules.” | Google: buscadores acionados pelo usuário página de 19/08/2026 · aberta em 11/10/2026 |
Google-Pinpointrastreador | Google · Acesso a pedido do usuário Abre os endereços que uma pessoa indica como fonte de coleções de documentos no Google Pinpoint. | Pode ignorar o robots.txt “Because the fetch was requested by a user, these fetchers generally ignore robots.txt rules.” | Google: buscadores acionados pelo usuário página de 19/08/2026 · aberta em 11/10/2026 |
PerplexityBotrastreador | Perplexity · Busca e respostas com fontes Mostra e linka sites nos resultados de busca do Perplexity. A página diz que não é usado para treinar modelos de fundação. A página recomenda liberar o robô no robots.txt, mas não descreve o que ocorre se você bloquear. | A página não diz “We recommend allowing PerplexityBot in your site's robots.txt file.” | Perplexity: robôs sem data na página · aberta em 11/10/2026 IP oficial: lista |
Perplexity-Userrastreador | Perplexity · Acesso a pedido do usuário Visita uma página para responder a uma pergunta de um usuário do Perplexity. A página diz que não é usado para treino. | Pode ignorar o robots.txt “Since a user requested the fetch, this fetcher generally ignores robots.txt rules.” | Perplexity: robôs sem data na página · aberta em 11/10/2026 IP oficial: lista |
Applebotrastreador | Apple · Busca e respostas com fontes Alimenta recursos da Apple, como a busca (Siri e Spotlight). A Apple separa o uso para treino no Applebot-Extended. Sem regra para o Applebot, mas com regra para o Googlebot, a Apple diz que segue a do Googlebot: por isso o gerador sempre escreve um grupo próprio para ele. | O robots.txt controla “Applebot respects standard robots.txt directives in general search crawls that are targeted at Applebot.” | Apple: Applebot página de 04/09/2026 · aberta em 11/10/2026 |
Applebot-Extendedtoken de controle: não rastreia | Apple · Treino de modelos Não rastreia: é um controle do robots.txt que diz se o conteúdo rastreado pelo Applebot pode treinar os modelos de fundação de uso geral da Apple. | O robots.txt controla “Applebot-Extended does not crawl webpages. Applebot-Extended is only used to determine how to use the data crawled by the Applebot user agent.” | Apple: Applebot página de 04/09/2026 · aberta em 11/10/2026 |
meta-externalagentrastreador | Meta · Treino de modelos + Outra finalidade Rastreia a web para usos como treinar modelos de IA de fundação ou melhorar produtos indexando o conteúdo diretamente. Duas finalidades no mesmo robô: bloquear o treino bloqueia também a indexação para produtos da Meta. | O robots.txt controla “Crawls the web for use cases such as training foundation AI models or improving products by indexing content directly.” | Meta: rastreadores sem data na página · aberta em 11/10/2026 |
meta-webindexerrastreador | Meta · Busca e respostas com fontes Percorre a web para melhorar a qualidade dos resultados de busca do Meta AI. | O robots.txt controla “Allowing Meta-WebIndexer in your robots.txt file helps us cite and link to your content.” | Meta: rastreadores sem data na página · aberta em 11/10/2026 |
meta-externalfetcherrastreador | Meta · Acesso a pedido do usuário Busca links individuais a pedido de um usuário e apoia funções de produtos, como a avaliação de IA com agentes. | Pode ignorar o robots.txt “May bypass robots.txt because it performs fetches that were requested by the user.” | Meta: rastreadores sem data na página · aberta em 11/10/2026 |
CCBotrastreador | Common Crawl · Coleta aberta da web Rastreador da Common Crawl, fundação sem fins lucrativos que publica uma cópia aberta da web. A página não cita treino de IA nem diz quem usa os dados. A página avisa que há rastreadores que se passam por CCBot e ensina a conferir por DNS reverso. | O robots.txt controla “To prevent Common Crawl from crawling your website, include the following in your robots.txt.” | Common Crawl: CCBot sem data na página · aberta em 11/10/2026 IP oficial: lista |
Amazonbotrastreador | Amazon · Treino de modelos Melhora produtos e serviços da Amazon e, segundo a página, pode ser usado para treinar modelos de IA da Amazon. A página também diz que o Amazonbot respeita as metatags noarchive e noindex. | O robots.txt controla “Amazonbot is used to improve our products and services. [...] may be used to train Amazon AI models.” | Amazon: Amazonbot sem data na página · aberta em 11/10/2026 |
Amzn-SearchBotrastreador | Amazon · Busca e respostas com fontes Melhora as experiências de busca em produtos e serviços da Amazon. A página diz que não rastreia para treinar IA generativa. | O robots.txt controla “Amzn-SearchBot is used to improve search experiences in Amazon products and services.” | Amazon: Amazonbot sem data na página · aberta em 11/10/2026 |
Amzn-Userrastreador | Amazon · Acesso a pedido do usuário Atende a ações de usuários, como respostas da Alexa que pedem informação atualizada. A página diz que não rastreia para treinar IA generativa. A página fala do Protocolo de Exclusão de Robôs para os rastreadores em geral e não diz se o Amzn-User, que age a pedido, segue o mesmo caminho. | A página não diz “Amzn-User supports user actions, such as responding to Alexa queries that require up-to-date information.” | Amazon: Amazonbot sem data na página · aberta em 11/10/2026 |
DuckAssistBotrastreador | DuckDuckGo · Busca e respostas com fontes Rastreia páginas em tempo real para as respostas assistidas por IA do DuckDuckGo, que citam as fontes. A página diz que os dados não treinam modelos. A página ensina a bloquear o robô editando o robots.txt, mas não descreve o comportamento com palavras próprias. | A página não diz “This data is not used in any way to train AI models.” | DuckDuckGo: DuckAssistBot sem data na página · aberta em 11/10/2026 |
Quais são os robôs de IA e para que serve cada um?
Os robôs de IA se dividem em treino (GPTBot, ClaudeBot), busca (OAI-SearchBot, Claude-SearchBot, PerplexityBot) e acesso a pedido de uma pessoa (ChatGPT-User, Claude-User). A OpenAI e a Perplexity dizem que os do terceiro grupo podem ignorar o robots.txt; a Anthropic diz que seus robôs o respeitam.
Como ler a tabela
Dados conferidos em 11/10/2026.
Cada linha tem o nome que vai na linha User-agent do robots.txt, o fornecedor, para que serve (com as palavras da página oficial, em português) e a página que sustenta a linha, com a data que a própria página mostra e o dia em que a abrimos. Páginas que não mostram data aparecem como “sem data na página”. O trecho em inglês é a frase da página que sustenta o que está dito sobre o robots.txt ou sobre a finalidade.
Os três estados da coluna “Respeita o robots.txt?”
- O robots.txt controla: a página oficial documenta o efeito do robots.txt sobre o robô, por exemplo dizendo que bloquear impede a indexação ou o treino.
- Pode ignorar o robots.txt: a página diz que o robô age a pedido de uma pessoa e que, por isso, as regras podem não valer. Vale para ChatGPT-User, Perplexity-User, meta-externalfetcher e os buscadores acionados pelo usuário do Google.
- A página não diz: o fornecedor documenta o robô, mas não descreve o que ocorre com o robots.txt. Não preenchemos o vazio com suposição.
Rastreador e token de controle
O Google-Extended e o Applebot-Extended são tokens de controle: não visitam o site. Existem só no robots.txt, para dizer como os dados que o Googlebot e o Applebot já coletaram podem ser usados no treino.
Quem ficou de fora, e por quê
Robô sem página oficial aberta por nós não entra na tabela.
anthropic-ai: a página da Anthropic que abrimos não o menciona. não confirmadoMistralAI-User,Bytespider,Claude-Web,cohere-ai: não abrimos página oficial do fornecedor para eles hoje. não confirmadobingbot(Microsoft): a página de ajuda do Bing não carregou conteúdo para leitura nesta conferência. não confirmadoOAI-AdsBot,Google-CloudVertexBote oGooglebotestão na tabela, mas fora do gerador de robots.txt: os dois primeiros não são treino, busca de IA nem acesso a pedido, e bloquear o Googlebot tira o site da Busca do Google.
Outros sites e ferramentas listam dezenas de robôs a mais. Se o fornecedor não publicou a documentação, não temos como dizer para que o robô serve nem se ele respeita o robots.txt, e por isso ele não entra aqui.
Como conferir se uma visita é do robô de verdade
O nome no user agent pode ser copiado por qualquer programa. A Common Crawl avisa, na própria página, que existem rastreadores que se passam por CCBot, e a Anthropic, que bloquear por IP pode não funcionar. O caminho seguro é comparar o endereço IP da visita com a lista que o fornecedor publica. A coluna “Fonte oficial” traz o link da lista quando existe: OpenAI (GPTBot, OAI-SearchBot, ChatGPT-User, OAI-AdsBot), Anthropic, Perplexity (PerplexityBot e Perplexity-User) e Common Crawl. A Common Crawl também explica a verificação por DNS reverso.
Depois de saber quem é, decida o que permitir no gerador de robots.txt para IA. E para o que cada afirmação do mercado tem de fonte, veja o checklist.
Gerar o robots.txt por finalidadeFontes desta página
Cada linha da tabela vem de uma destas páginas. Todas abertas em 11/10/2026.
- Overview of OpenAI crawlers (OpenAI)
A página não mostra data · aberta em
O que lemos: OAI-SearchBot, OAI-AdsBot, GPTBot e ChatGPT-User: para que serve cada um, as listas de IP e o prazo de cerca de 24 horas para uma mudança no robots.txt valer para a busca. A página aponta para o llms.txt da própria documentação da OpenAI; não diz que algum robô leia o llms.txt de outros sites. - Does Anthropic crawl data from the web, and how can site owners block the crawler? (Anthropic)
Data na página: 07/04/2026 (a página mostra "April 7, 2026" sob o título, sem dizer se é publicação ou atualização) · aberta em
O que lemos: ClaudeBot, Claude-User e Claude-SearchBot: o que cada um faz, a frase de que os robôs da Anthropic respeitam o robots.txt e o aviso de que bloquear por IP pode não funcionar. - Google common crawlers (Google)
Data na página: 14/07/2026 · aberta em
O que lemos: Tabela dos rastreadores comuns: Googlebot, Google-Extended (sem user agent próprio, não afeta a Busca) e Google-CloudVertexBot. "Sempre obedecem" ao robots.txt no rastreio automático. - Overview of Google crawlers and fetchers (Google)
Data na página: 12/06/2026 · aberta em
O que lemos: As três categorias (rastreadores comuns, de caso especial e acionados pelo usuário) e o que cada uma faz com o robots.txt. - Google user-triggered fetchers (Google)
Data na página: 19/08/2026 · aberta em
O que lemos: Lista Google-Agent, Google-GeminiNotebook e Google-Pinpoint, entre outros, e diz que, por serem pedidos de um usuário, em geral ignoram o robots.txt. - Perplexity crawlers (Perplexity)
A página não mostra data · aberta em
O que lemos: PerplexityBot (busca, "não é usado para treinar modelos de fundação") e Perplexity-User (a pedido do usuário, "em geral ignora" o robots.txt), com as listas de IP. A página aponta para o llms.txt da própria documentação da Perplexity; não diz que algum robô leia o llms.txt de outros sites. - About Applebot (Apple)
Data na página: 04/09/2026 (a página mostra "Published Date: September 04, 2026") · aberta em
O que lemos: Applebot respeita o robots.txt e, sem regra para ele mas com regra para Googlebot, segue a do Googlebot. Applebot-Extended não rastreia: só define como os dados do Applebot são usados no treino. - Meta Web Crawlers (Meta)
A página não mostra data · aberta em
O que lemos: meta-externalagent, meta-webindexer, meta-externalfetcher, meta-externalads e facebookexternalhit, com o texto de cada finalidade e a nota de que alguns "podem ignorar" o robots.txt. A página aponta para o llms.txt da documentação da Meta; não diz que algum robô leia o llms.txt de outros sites. - CCBot (Common Crawl)
A página não mostra data · aberta em
O que lemos: O que é o CCBot, a regra de robots.txt para bloqueá-lo, o user agent, a verificação por DNS reverso e a lista de IP em JSON. A página não menciona treino de IA. - Amazonbot (Amazon)
A página não mostra data · aberta em
O que lemos: Amazonbot ("pode ser usado para treinar modelos de IA da Amazon"), Amzn-SearchBot e Amzn-User (os dois "não rastreiam para treino"), uso do Protocolo de Exclusão de Robôs e das metatags noarchive e noindex. - DuckAssistBot (DuckDuckGo)
A página não mostra data · aberta em
O que lemos: Rastreia páginas em tempo real para respostas assistidas por IA com fontes; "os dados não são usados para treinar modelos"; o bloqueio é feito no robots.txt.
Perguntas frequentes
Como sei se uma visita é mesmo do robô?
Pelo endereço IP, não pelo nome no user agent, que qualquer um pode copiar. OpenAI, Anthropic, Perplexity e Common Crawl publicam as listas de IP dos robôs (links na tabela). A Common Crawl avisa que há rastreadores que se passam por CCBot e ensina a conferir por DNS reverso.
O que quer dizer "pode ignorar o robots.txt"?
Que a página oficial do fornecedor diz que aquele robô age a pedido de uma pessoa e, por isso, pode não seguir o robots.txt. A OpenAI escreve que as regras "podem não valer" para o ChatGPT-User; a Perplexity e o Google escrevem que esses buscadores "em geral ignoram" o arquivo; a Meta, que o meta-externalfetcher "pode ignorar".
Por que o robô X não está na tabela?
Porque só entra robô que tem página oficial do próprio fornecedor aberta por nós. Ficaram de fora, por falta dessa página, o anthropic-ai, o MistralAI-User, o Bytespider e o rastreador da Microsoft (a página de ajuda do Bing não carregou para leitura). Se o fornecedor publicar a documentação, o robô entra.
O CCBot treina modelos de IA?
A página oficial da Common Crawl descreve uma fundação que democratiza o acesso a informação da web e não menciona treino de IA nem diz quem usa os dados. Por isso a tabela classifica o CCBot como "coleta aberta" e não como treino.
A tabela está atualizada?
Ela reflete as páginas oficiais abertas em 11/10/2026, com a data de cada página quando ela mostra uma. Fornecedores criam, renomeiam e aposentam robôs: o Google, por exemplo, já renomeou o Google-NotebookLM para Google-GeminiNotebook. Confira a página oficial antes de decidir.
Continue pelas outras ferramentas
Cada página resolve uma parte do trabalho com os robôs de IA.