Pesquisa original

Índice de Prontidão para IA:quem configurou o acesso dos robôs?

O Índice de Prontidão para IA é um levantamento periódico de dois arquivos públicos — robots.txt e llms.txt — nos domínios brasileiros de SEO e GEO. Na rodada 1 (18 de agosto de 2026), 16 dos 18 domínios legíveis servem llms.txt, mas apenas 6 declaram explicitamente qualquer rastreador de IA no robots.txt.

Rodada 1 · coleta em 18 de agosto de 2026 · 19 domínios verificados · método reprodutível, evidência bruta arquivada

16/18

servem llms.txt

o arquivo que nenhum provedor de IA lê hoje

6/18

nomeiam algum bot de IA no robots.txt

o arquivo que governa o acesso de fato

7/16

llms.txt gerados por plugin

assinatura de Yoast SEO ou Rank Math no corpo

3/18

usam Content-Signal

a diretiva da Cloudflare para uso por IA

O achado central

O mercado adotou o arquivo errado?

O padrão que emerge dos dados é uma inversão curiosa. O llms.txt — uma proposta da comunidade que nenhum grande provedor de IA declara consumir (John Mueller, do Google, afirmou em junho de 2025 que "nenhum sistema de IA usa llms.txt atualmente") — está em 16 dos 18 domínios legíveis. Em 7 desses 16, o arquivo carrega a assinatura de um plugin (Yoast SEO ou Rank Math): foi ligado numa caixa de configuração, não curado.

Já o robots.txt — o arquivo que os rastreadores de IA de fato leem antes de acessar qualquer página, conforme a RFC 9309 e a documentação da própria OpenAI — recebeu decisão explícita em só 6 dos 18 domínios. Os outros 12 nunca nomearam um único bot de IA: nem para liberar, nem para restringir. E a diretiva Content-Signal, proposta pela Cloudflare em setembro de 2025 para separar busca, resposta de IA e treinamento, aparece em apenas 3.

Nenhum domínio da amostra bloqueia GPTBot, ClaudeBot ou PerplexityBot — o acesso está aberto em todos. A diferença entre os 6 que nomeiam e os 12 que não nomeiam não é acesso: é intenção. Um mercado que vende otimização para IA configurou, na própria casa, o arquivo simbólico com mais frequência do que o arquivo operacional.

Resultados completos

Domínio por domínio, na data da coleta.

"Tokens nomeados" conta quantos dos 12 tokens de user-agent de IA verificados (GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, anthropic-ai, PerplexityBot, Perplexity-User, Google-Extended, CCBot, Bytespider, Applebot-Extended, meta-externalagent) têm um grupo User-agent: explícito no robots.txt do domínio. A inclusão no índice não é endosso nem crítica — é o conjunto de domínios que os próprios rankings brasileiros de SEO/GEO citam.

DomínioTokens de IA nomeadosBloqueia bot de IAContent-Signalllms.txtOrigem do llms.txt
alexandrecaramaschi.com12/12simpresentesem assinatura de plugin
qualitysmi.com.br11/12meta-externalagentsimpresentesem assinatura de plugin
www.aiseobrasil.com (nós)*6/12nãopresentecurado manualmente
meuredator.com.br5/12nãopresentesem assinatura de plugin
criamente.com4/12nãopresenteYoast SEO v25.9
studiovisual.com.br2/12nãopresenteRank Math SEO
www.conversion.com.br0/12simpresentesem assinatura de plugin
webestrategica.com.br0/12nãopresenteYoast SEO v28.0
www.liveseo.com.br0/12nãopresenteRank Math SEO
blog.gv8.com.br0/12nãopresenteYoast SEO v28.2
www.seomartin.com0/12nãopresentesem assinatura de plugin
upsendbrasil.com.br0/12nãopresenteRank Math SEO
webi.com.br0/12nãopresentesem assinatura de plugin
ojob.com.br0/12nãopresenteYoast SEO v27.4
promptado.com0/12nãopresentesem assinatura de plugin
blog.grupodemetrios.com.br0/12nãopresentesem assinatura de plugin
www.agenciamestre.com0/12nãoausente
saoclemente.com.br0/12nãosoft-404
www.hedgehogdigital.com.brinacessível a partir do nosso ambiente de coleta na data da rodada — não computado em nenhuma estatística

* Conflito de interesse declarado: a AI SEO Brasil publica o índice e está no frame, medida pelo mesmo critério. Na data da coleta, nosso robots.txt nomeava 6 dos 12 tokens e não tinha Content-Signal. Em 21 de agosto de 2026 (após a coleta, antes desta publicação) atualizamos o arquivo para os 12 tokens + Content-Signal — a mudança conta apenas na rodada 2, como qualquer outro domínio. "Soft-404" = o servidor responde 200 com uma página HTML no lugar do arquivo. O robots.txt declara intenção, não comportamento: o índice não observa se os bots respeitam as diretivas nem bloqueios por firewall. Amostra pequena e não aleatória: os percentuais descrevem este conjunto de 18 domínios legíveis, não o mercado inteiro.

E no seu site?

Três verificações que levam dez minutos.

  1. Abra seu /robots.txt e procure por GPTBot, PerplexityBot e ClaudeBot. Se nenhum aparece, seu site nunca tomou uma decisão sobre rastreadores de IA — o guia robots.txt para GPTBot e outros bots de IA mostra como declarar cada um.
  2. Confira seu /llms.txt — e o que está dentro dele. Um arquivo gerado por plugin lista o que o plugin escolheu, não o que você quer que as IAs leiam. O passo a passo está em como criar um llms.txt.
  3. Decida sobre treinamento: com Content-Signal dá para permitir citação em respostas de IA e ainda assim sinalizar preferência contra uso em treino — são decisões separadas.

Esses três arquivos são a camada de acesso da nossa auditoria GEO em 7 etapas — a parte que destrava todo o resto do trabalho de SEO para IA.

Perguntas frequentes

Método, limites e próximas rodadas.

O que o Índice de Prontidão para IA mede?

O índice verifica dois arquivos públicos — robots.txt e llms.txt — em 19 domínios brasileiros de SEO/GEO. No robots.txt, registra quais dos 12 principais tokens de rastreadores de IA (GPTBot, ClaudeBot, PerplexityBot, Google-Extended etc.) têm um grupo User-agent explícito e qual acesso recebem, além da presença da diretiva Content-Signal. No llms.txt, registra presença, soft-404 e assinatura de plugin gerador. Ele não avalia qualidade de serviço de nenhuma agência: mede configuração declarada, com evidência bruta arquivada.

Não nomear um bot de IA no robots.txt significa estar bloqueado?

Não. Um site sem menção explícita a GPTBot ou PerplexityBot normalmente os recebe pelas regras do grupo genérico (User-agent: *), que na amostra permite o acesso em todos os casos. O que a ausência revela é outra coisa: o site não tomou nenhuma decisão deliberada sobre rastreadores de IA — nem para liberar, nem para restringir, nem para sinalizar preferências de uso do conteúdo.

O llms.txt funciona para aparecer em respostas de IA?

Hoje não há evidência disso. O llms.txt é uma proposta da comunidade (llmstxt.org, de Jeremy Howard), e nenhum grande provedor de IA declara consumi-lo — John Mueller, do Google, afirmou em junho de 2025 que "nenhum sistema de IA usa llms.txt atualmente". Nós mantemos o nosso porque o custo é zero e o formato pode ser adotado no futuro, mas tratamos como aposta, não como fator. O acesso real dos rastreadores é governado pelo robots.txt.

O que é a diretiva Content-Signal no robots.txt?

Content-Signal é um vocabulário proposto pela Cloudflare em setembro de 2025 (contentsignals.org) que se adiciona ao robots.txt para declarar preferências de uso do conteúdo em três frentes separadas: busca tradicional (search), respostas de IA (ai-input) e treinamento de modelos (ai-train). É uma sinalização de preferência, não um bloqueio técnico — mas é hoje o canal mais granular para separar "pode me citar" de "pode treinar com meu conteúdo". Na rodada 1, só 3 dos 18 domínios legíveis a utilizavam.

Como os dados foram coletados e posso reproduzir o levantamento?

A coleta é um script Node.js que faz requisições HTTP públicas a /robots.txt e /llms.txt de cada domínio, interpreta os grupos de user-agent conforme a RFC 9309 e arquiva o corpo bruto de cada arquivo com hash SHA-256. O frame de domínios foi fechado antes da coleta (domínios que aparecem como agência ranqueada ou publisher nos rankings brasileiros de "melhores agências de SEO/GEO 2026", mais o nosso). Falha de conexão vira "inacessível", nunca "não tem o arquivo". Qualquer pessoa pode refazer as mesmas requisições e conferir os resultados.

Minha agência está na lista e os dados mudaram. Como atualizar?

O índice é uma fotografia datada (rodada 1: 18 de agosto de 2026) e será recoletado trimestralmente — mudanças feitas depois da coleta aparecem na rodada seguinte, como aliás aconteceu com o nosso próprio robots.txt. Se algum dado da sua propriedade estiver factualmente errado na data da coleta, escreva para contato@aiseobrasil.com com o registro e corrigiremos com nota.

Seu site está pronto para os rastreadores de IA?

O diagnóstico gratuito verifica os mesmos arquivos deste índice no seu domínio — e mostra como sua marca aparece hoje nas respostas do ChatGPT, Gemini e Perplexity.