Pular para o conteúdo

Checklist para a IA ler o seu site, só com fonte

18 itens, cada um com a página oficial e a data. Nenhuma promessa de aparecer em resposta de IA.

0 de 18 itens com fonte marcados

Suas marcações ficam só neste navegador. Cada item cita a página oficial e a data em que a abrimos.

Deixe os robôs entrarem

  • OpenAI, Anthropic, Perplexity e Meta documentam um robô de busca cada um. Se o robots.txt bloqueia esse robô, o site fica de fora do índice que ele alimenta. Bloquear o robô de treino não precisa bloquear o de busca: são nomes diferentes.

    Claude-SearchBot: “prevents our system from indexing your content for search optimization”. Perplexity: “we recommend allowing PerplexityBot”.

    Fontes: OpenAI: robôs (sem data na página); Anthropic: rastreadores (página de 07/04/2026); Perplexity: robôs (sem data na página); Meta: rastreadores (sem data na página) · abertas em

  • Para a Visão geral e o Modo IA da Busca do Google não há robô à parte: o Google diz que as regras do Googlebot são o controle. Bloquear o Googlebot tira o site da Busca inteira.

    Googlebot’s robots.txt directives are the control for managing how Google crawls a site for Search.

    Fontes: Google: recursos de IA e o seu site (página de 10/12/2025); Google: rastreadores comuns (página de 14/07/2026) · abertas em

  • Uma regra de firewall ou de CDN que bloqueia robôs vale mesmo com o robots.txt liberando. O Google pede que o rastreio seja permitido no robots.txt e pela CDN ou hospedagem; a Anthropic avisa que bloquear por IP pode não funcionar.

    Fontes: Google: recursos de IA e o seu site (página de 10/12/2025); Anthropic: rastreadores (página de 07/04/2026) · abertas em

  • A OpenAI diz que cada configuração é independente. O Google-Extended, que controla treino e respostas do Gemini, não afeta a inclusão do site na Busca do Google. Use o gerador de robots.txt para escolher por finalidade.

    Fontes: OpenAI: robôs (sem data na página); Google: rastreadores comuns (página de 14/07/2026) · abertas em

  • A Apple diz que, sem regra para o Applebot mas com regra para o Googlebot, ele segue a do Googlebot. Um grupo com o nome dele evita surpresa.

    Fontes: Apple: Applebot (página de 04/09/2026) · abertas em

  • A OpenAI informa que uma mudança no robots.txt pode levar cerca de 24 horas para valer no OAI-SearchBot. Nas páginas dos outros fornecedores que abrimos não vimos prazo: não confirmado.

    it can take ~24 hours from a site’s robots.txt update for our systems to adjust.

    Fontes: OpenAI: robôs (sem data na página) · abertas em

Deixe o conteúdo fácil de ler

  • O Google recomenda que o conteúdo importante esteja em texto, não só em imagem ou vídeo, para os recursos de IA da Busca.

    Fontes: Google: recursos de IA e o seu site (página de 10/12/2025) · abertas em

  • Links internos fazem parte das práticas que o Google lista para a Busca, inclusive nos recursos de IA.

    Fontes: Google: recursos de IA e o seu site (página de 10/12/2025) · abertas em

  • O Google lista “boa experiência na página” entre as práticas de SEO que valem também para os recursos de IA da Busca.

    Fontes: Google: recursos de IA e o seu site (página de 10/12/2025) · abertas em

  • O Google diz que dados estruturados não são exigidos para a IA generativa da Busca e que não existe marcação schema.org especial. Se você usa, o conteúdo marcado deve ser o mesmo que aparece na página.

    Structured data isn’t required for generative AI search, and there’s no special schema.org markup you need to add.

    Fontes: Google: recursos de IA e o seu site (página de 10/12/2025); Google: otimização para IA (página de 10/07/2026) · abertas em

  • O guia do Google abre com “crie conteúdo valioso e não genérico para o seu público”. Não há truque de formatação que o substitua, e o Google diz que não é preciso quebrar o conteúdo em pedaços pequenos para a IA.

    There’s no requirement to break your content into tiny pieces for AI to better understand it.

    Fontes: Google: otimização para IA (página de 10/07/2026) · abertas em

  • O Google lista a verificação do site no Search Console entre as práticas para a Busca, e a manutenção das informações de Merchant Center e Perfil da Empresa quando elas se aplicam ao seu negócio.

    Fontes: Google: recursos de IA e o seu site (página de 10/12/2025) · abertas em

Controle o que aparece

  • O Google indica nosnippet, data-nosnippet, max-snippet e noindex para limitar o que aparece da página. Para treino e fundamentação em outros sistemas do Google, o controle é o Google-Extended.

    Fontes: Google: recursos de IA e o seu site (página de 10/12/2025) · abertas em

  • A página do Amazonbot diz que ele respeita as metatags noarchive e noindex no nível da página, o que serve quando o problema é uma página, não o site todo.

    Fontes: Amazon: Amazonbot (sem data na página) · abertas em

  • ChatGPT-User, Perplexity-User, meta-externalfetcher e os buscadores acionados pelo usuário do Google dizem, nas páginas oficiais, que o robots.txt pode não valer, porque quem pede é uma pessoa. Conteúdo que não pode ser lido precisa de controle de acesso, não de robots.txt.

    ChatGPT-User: “Because these actions are initiated by a user, robots.txt rules may not apply.”

    Fontes: OpenAI: robôs (sem data na página); Perplexity: robôs (sem data na página); Meta: rastreadores (sem data na página); Google: buscadores acionados pelo usuário (página de 19/08/2026) · abertas em

Confira quem visita

  • OpenAI, Anthropic, Perplexity e Common Crawl publicam as faixas de IP dos robôs. A Common Crawl avisa que há quem se faça passar por CCBot. O nome no user agent, sozinho, não prova nada. Os endereços estão na tabela de robôs.

    Fontes: OpenAI: robôs (sem data na página); Anthropic: rastreadores (página de 07/04/2026); Perplexity: robôs (sem data na página); Common Crawl: CCBot (sem data na página) · abertas em

Sobre o llms.txt

  • O Google diz que a Busca não usa llms.txt e que criá-lo não ajuda nem prejudica o site na Busca. O Chrome audita o arquivo no Lighthouse como convenção emergente e o chama de opcional. Nenhum fornecedor de IA que abrimos diz que seu assistente lê o arquivo: não confirmado.

    Doing so will neither harm nor help your site’s visibility or rankings in Google Search.

    Fontes: Google: otimização para IA (página de 10/07/2026); Chrome: auditoria llms.txt do Lighthouse (página de 05/05/2026); llmstxt.org (página de 10/08/2026) · abertas em

  • A proposta pede links no formato [nome](url) e sugere uma versão em Markdown das páginas com informação útil. É uma proposta aberta a comentários, não um padrão. Use o validador antes de publicar.

    Fontes: llmstxt.org (página de 10/08/2026); llmstxt.org (mudanças da v1 para a v2) (sem data na página) · abertas em

Prática comum, sem fonte oficial

Costumes de mercado que não encontramos na documentação de nenhum fornecedor de IA. Não contam no progresso.

  • Diga logo no começo da página inicial o que o site faz prática comum, sem fonte oficial

    Costume de quem escreve para busca e para pessoas: um resumo claro no topo. Nenhum fornecedor de IA documenta que isso aumente a chance de citação.

  • Use o mesmo nome e os mesmos dados do negócio em todo lugar prática comum, sem fonte oficial

    Costume de mercado para evitar confusão entre fontes. Sem página oficial de fornecedor de IA que o recomende.

  • Olhe os logs do servidor de vez em quando prática comum, sem fonte oficial

    Prática comum para saber quais robôs visitam o site e com que frequência. Os fornecedores publicam os nomes e os IP, mas não pedem esse monitoramento.

O que fazer para a IA conseguir ler o meu site?

O que as páginas oficiais sustentam é permitir o acesso dos robôs certos e deixar o conteúdo legível: texto, links internos, robots.txt sem bloqueio por engano. Nenhum fornecedor documenta como escolhe o que citar.

Por que este checklist é curto

Menos itens, todos com página oficial.

Pesquise “como aparecer no ChatGPT” e você encontra listas longas, com truques de formatação e promessas de posição. Nenhuma delas tem lastro nos fornecedores: OpenAI, Anthropic, Google, Perplexity e os outros documentam seus robôs (nome, finalidade, regras de acesso), mas não documentam como escolhem o que citar. O que dá para afirmar com fonte é o que está aqui: permitir o acesso, não bloquear por engano e manter o conteúdo legível.

O Google tem um guia dedicado e diz que não há requisitos adicionais nem otimizações especiais para aparecer na Visão geral e no Modo IA, e que as práticas de sempre da Busca valem. É isso que a maior parte dos itens acima repete, com o endereço da página.

Exemplo: o que o checklist diz sobre o llms.txt

O item “Trate o llms.txt como opcional” junta três fontes: o Google diz que a Busca ignora o arquivo e que criá-lo não ajuda nem prejudica; o Chrome o audita como convenção emergente e opcional; e a proposta o chama de proposta aberta a comentários. Nenhuma das três diz que um assistente de IA o lê. Resultado: o item não manda criar nem deixar de criar o arquivo, e marca a leitura como “não confirmado”.

O que ficou de fora por falta de fonte aparece na seção “prática comum, sem fonte oficial” da ferramenta, com 3 itens que não contam no progresso. Para gerar o arquivo e conferir o formato, use o gerador de llms.txt e o validador.

O que você não vai ver aqui

  • “Aparecer na primeira resposta do ChatGPT” ou qualquer promessa de posição: não há fonte oficial.
  • Contagem de palavras, densidade de termos ou “palavras que a IA prefere”: nenhum fornecedor publicou isso.
  • Marcação especial para IA: o Google diz que não existe schema.org especial para a IA generativa da Busca.
  • Quebrar o texto em pedaços pequenos para a IA: o Google diz que não há essa exigência.

Se você encontrar uma página oficial que sustente algum desses pontos, ele entra no checklist com o link e a data.

Ver a tabela dos robôs

Fontes desta página

Abertas em 11/10/2026.

  • Guia de otimização para recursos de IA generativa na Busca (Google)
    Data na página: 10/07/2026 · aberta em
    O que lemos: Diz que a Busca do Google não usa llms.txt nem outros arquivos de texto para IA, que criá-los "não ajuda nem prejudica" e que não é preciso marcação especial.
  • AI features and your website (Google)
    Data na página: 10/12/2025 · aberta em
    O que lemos: Para aparecer nos recursos de IA da Busca valem as práticas de SEO: permitir o rastreio, links internos, boa experiência na página, conteúdo importante em texto e dados estruturados iguais ao texto visível.
  • Google common crawlers (Google)
    Data na página: 14/07/2026 · aberta em
    O que lemos: Tabela dos rastreadores comuns: Googlebot, Google-Extended (sem user agent próprio, não afeta a Busca) e Google-CloudVertexBot. "Sempre obedecem" ao robots.txt no rastreio automático.
  • Google user-triggered fetchers (Google)
    Data na página: 19/08/2026 · aberta em
    O que lemos: Lista Google-Agent, Google-GeminiNotebook e Google-Pinpoint, entre outros, e diz que, por serem pedidos de um usuário, em geral ignoram o robots.txt.
  • Lighthouse: llms.txt (Agentic Browsing) (Google Chrome)
    Data na página: 05/05/2026 · aberta em
    O que lemos: Chama o llms.txt de convenção emergente, recomenda o arquivo na raiz e diz que, sem ele (404), a auditoria fica "não aplicável" porque o arquivo é opcional. Não diz que um assistente de IA o lê.
  • The /llms.txt file, v2 (Jeremy Howard) (llmstxt.org)
    Data na página: 10/08/2026 (publicada em 03/09/2024; a página declara modificação em 10/08/2026) · aberta em
    O que lemos: O formato: H1 obrigatório, citação com o resumo, trechos sem títulos, listas de arquivos sob H2 com [nome](url) e notas depois de dois pontos, seção "Optional". Chama o texto de proposta aberta a comentários e diz que o arquivo vale a partir do caminho onde está.
  • Changes: what changed from v1 to v2 (llmstxt.org)
    A página não mostra data · aberta em
    O que lemos: Na v2, o arquivo cobre as páginas abaixo do seu caminho e o mais específico vale; a seção Optional deixou de ter efeito mecânico e ficou como convenção.
  • Overview of OpenAI crawlers (OpenAI)
    A página não mostra data · aberta em
    O que lemos: OAI-SearchBot, OAI-AdsBot, GPTBot e ChatGPT-User: para que serve cada um, as listas de IP e o prazo de cerca de 24 horas para uma mudança no robots.txt valer para a busca. A página aponta para o llms.txt da própria documentação da OpenAI; não diz que algum robô leia o llms.txt de outros sites.
  • Does Anthropic crawl data from the web, and how can site owners block the crawler? (Anthropic)
    Data na página: 07/04/2026 (a página mostra "April 7, 2026" sob o título, sem dizer se é publicação ou atualização) · aberta em
    O que lemos: ClaudeBot, Claude-User e Claude-SearchBot: o que cada um faz, a frase de que os robôs da Anthropic respeitam o robots.txt e o aviso de que bloquear por IP pode não funcionar.
  • Perplexity crawlers (Perplexity)
    A página não mostra data · aberta em
    O que lemos: PerplexityBot (busca, "não é usado para treinar modelos de fundação") e Perplexity-User (a pedido do usuário, "em geral ignora" o robots.txt), com as listas de IP. A página aponta para o llms.txt da própria documentação da Perplexity; não diz que algum robô leia o llms.txt de outros sites.
  • About Applebot (Apple)
    Data na página: 04/09/2026 (a página mostra "Published Date: September 04, 2026") · aberta em
    O que lemos: Applebot respeita o robots.txt e, sem regra para ele mas com regra para Googlebot, segue a do Googlebot. Applebot-Extended não rastreia: só define como os dados do Applebot são usados no treino.
  • Meta Web Crawlers (Meta)
    A página não mostra data · aberta em
    O que lemos: meta-externalagent, meta-webindexer, meta-externalfetcher, meta-externalads e facebookexternalhit, com o texto de cada finalidade e a nota de que alguns "podem ignorar" o robots.txt. A página aponta para o llms.txt da documentação da Meta; não diz que algum robô leia o llms.txt de outros sites.
  • Amazonbot (Amazon)
    A página não mostra data · aberta em
    O que lemos: Amazonbot ("pode ser usado para treinar modelos de IA da Amazon"), Amzn-SearchBot e Amzn-User (os dois "não rastreiam para treino"), uso do Protocolo de Exclusão de Robôs e das metatags noarchive e noindex.
  • CCBot (Common Crawl)
    A página não mostra data · aberta em
    O que lemos: O que é o CCBot, a regra de robots.txt para bloqueá-lo, o user agent, a verificação por DNS reverso e a lista de IP em JSON. A página não menciona treino de IA.

Perguntas frequentes

Fazer tudo do checklist garante que a IA vai citar o meu site?

Não. Nenhum fornecedor que abrimos documenta como escolhe o que citar. O checklist junta o que as páginas oficiais dizem sobre permitir o acesso e deixar o conteúdo legível, e nada além disso. O Google chega a dizer que não há otimização especial para aparecer na Visão geral e no Modo IA.

Por que não há itens como "use as palavras que a IA gosta"?

Porque nenhum fornecedor publicou isso. Sem fonte oficial, a ideia fica fora da lista ou aparece marcada como "prática comum, sem fonte oficial", numa seção à parte que não conta no progresso.

O que significa "prática comum, sem fonte oficial"?

É um costume de quem trabalha com busca e conteúdo, que não encontramos escrito na documentação de nenhum fornecedor de IA. Pode ser útil para as pessoas que visitam o site, mas não temos como dizer que muda algo para um robô.

As caixas que eu marco são enviadas para algum lugar?

Não. Elas ficam no armazenamento local do navegador, na chave visibilidadenaia:checklist:v1. O botão "Desmarcar tudo" apaga. Trocar de aparelho ou limpar os dados do navegador também apaga.