llms.txt, robots.txt e crawlers de IA: a infraestrutura técnica do GEO
GPTBot, ClaudeBot e PerplexityBot precisam conseguir ler seu site pra sua marca existir nas respostas. O checklist técnico de infraestrutura GEO, explicado sem jargão.
Antes de qualquer estratégia de conteúdo, existe uma pergunta binária: os robôs das IAs conseguem ler o seu site? Se a resposta for não, todo o resto é irrelevante. A boa notícia é que essa camada técnica é pequena, objetiva e resolve num dia de trabalho.
Conheça os crawlers que importam
- GPTBot (OpenAI): alimenta o treinamento dos modelos GPT. Bloquear ele é pedir pra não existir no ChatGPT de amanhã.
- ClaudeBot (Anthropic): mesmo papel pros modelos Claude.
- PerplexityBot: indexa pra busca em tempo real do Perplexity. Efeito mais rápido de observar.
- Google-Extended (Google): controla o uso do seu conteúdo no treinamento do Gemini, separado do Googlebot clássico.
robots.txt: a decisão estratégica disfarçada de arquivo técnico
Muitos sites bloquearam crawlers de IA em 2023 e 2024 por medo, e hoje pagam o preço em invisibilidade. Pra quem quer ser citado, a política é o contrário: liberar explicitamente os crawlers de IA no robots.txt e apontar o sitemap. Cada user-agent liberado é uma porta aberta pra sua marca entrar no repertório do modelo.
llms.txt: o cartão de visita pra IA
O llms.txt é um padrão emergente: um arquivo em texto simples na raiz do site que resume, em markdown, o que o site é e quais páginas importam. Pense nele como um sitemap legível por modelo de linguagem, com contexto em vez de só URLs. Custa minutos pra publicar e remove ambiguidade sobre quem você é. O formato: um título, um parágrafo descrevendo o negócio e listas de links comentados pras páginas chave.
O checklist completo
- robots.txt liberando GPTBot, ClaudeBot, PerplexityBot e Google-Extended, com link pro sitemap.
- sitemap.xml atualizado, cobrindo as páginas de marketing e o blog.
- llms.txt na raiz descrevendo o negócio e as páginas principais.
- Conteúdo em HTML renderizado no servidor: crawler de IA não executa JavaScript como um navegador. O que só aparece via JS client-side é invisível.
- Schema.org nas páginas chave (Organization, FAQPage, BlogPosting).
- Tempo de resposta saudável: crawlers desistem de site lento.
Se você quer conferir como o seu site está nessa camada (e nas outras), a análise do Cita aí verifica a presença da sua marca nos 4 LLMs e aponta, em português claro, o que falta na infraestrutura e no conteúdo, com os prompts de correção prontos. Trinta segundos, sem cartão, em citaai.app.