Skip to content
tutorials

O que é llms.txt? A especificação, os céticos e se vale a pena

llms.txt é a proposta de Jeremy Howard de setembro de 2024: um arquivo markdown em /llms.txt que fornece aos modelos de linguagem um mapa curado do seu site. John Mueller, do Google, diz que nenhum serviço de IA importante o utiliza — os logs do servidor mostram que os crawlers nem sequer o solicitam — comparando-o à meta tag de palavras-chave. A especificação precisa, o panorama honesto da adoção, o argumento contrário bem fundamentado e o veredito calibrado: gaste dez minutos publicando um como cortesia, depois gaste a hora real nas alavancas mensuráveis.

Marcus Lee

Resumo / Pontos-chave

  • llms.txt é uma proposta, não um padrão: nome H1, resumo em blockquote, seções de link H2 e uma seção 'Optional' que contextos menores podem ignorar.
  • Nenhum grande serviço de IA anunciou o uso dele, e Mueller observa que os crawlers nem sequer solicitam o arquivo — as expectativas para classificações devem ser próximas de zero.
  • Publique um mesmo assim: dez minutos, risco zero, consumidores de nicho reais em ferramentas de desenvolvedor, e o exercício de curadoria é um trabalho de posicionamento que vale a pena fazer.
  • A hora de visibilidade de IA mensurável vai para o acesso de crawler, texto renderizado no servidor, dados estruturados e cobertura de terceiros — não para arquivos autodeclarados.

Poucos arquivos têm uma lacuna tão grande entre a frequência com que são vendidos e a frequência com que são lidos. Uma indústria artesanal de geradores agora comercializa o llms.txt como uma alavanca de classificação de AI-SEO; enquanto isso, a autoridade mais citada em busca diz que os crawlers nem sequer solicitam o arquivo. Ambas as coisas valem a pena entender com precisão, porque a decisão certa — gastar dez minutos, esperar pouco — só faz sentido depois de ver ambas.

A especificação, com precisão

De llmstxt.org: um arquivo markdown UTF-8 servido no caminho raiz /llms.txt, estruturado exatamente nesta ordem —

  • Um H1 com o nome do projeto ou site. O único elemento obrigatório.
  • Um blockquote com um resumo de uma linha.
  • Opcionalmente, markdown curto de forma livre com o contexto que um modelo deve saber antes de seguir os links.
  • Zero ou mais seções delimitadas por H2 — cada uma sendo uma lista markdown de links [nome](https://url), opcionalmente seguidos por : e uma nota curta.
  • Uma seção opcional literalmente intitulada "Optional" — a única parte do arquivo que contextos de IA menores têm permissão para ignorar; material secundário vai lá.

A ideia é a economia de tokens: em vez de um sistema de IA rastrear e truncar seu site aleatoriamente, você entrega a ele dez links bem escolhidos com uma linha de contexto cada. Alguns projetos também publicam um complemento expandido (comumente llms-full.txt) incorporando o conteúdo completo da página, embora essa variante seja uma convenção de implementação em vez de parte da especificação propriamente dita.

Quem realmente o lê em 2026

Inventário honesto: o próprio ecossistema da proposta o adotou — FastHTML, nbdev e os projetos Answer.AI o publicam, diretórios da comunidade indexam sites que o possuem, e plataformas de documentação adicionaram suporte com um clique, então o arquivo é comum em docs de ferramentas de desenvolvedor. Vários agentes de codificação e ferramentas de resposta o buscarão quando apontados para um site. O que não aconteceu, de acordo com a observação dos logs de servidor de Mueller, é o rastreamento rotineiro pelos principais serviços de IA — OpenAI, Anthropic e Google não anunciaram nada, e as análises de log continuam mostrando que os grandes crawlers não solicitam o arquivo. Se o seu motivo para publicar é "o ChatGPT finalmente nos entenderá", as evidências não sustentam isso.

Gostando do artigo? Receba um assim na sua caixa de entrada toda manhã.

um e-mail por dia · cancele em dois cliques · sem rastreadores de terceiros

O argumento contrário, bem fundamentado

A comparação da tag meta keywords feita por Mueller é a versão mais contundente da objeção: llms.txt é conteúdo autodeclarado — "isto é o que o proprietário de um site afirma que seu site é" — e sinais autodeclarados morrem porque são facilmente manipulados. "Nesse ponto, por que não verificar o site diretamente?" Um crawler que consegue ler suas páginas reais não precisa do seu comunicado de imprensa sobre elas. Essa lógica matou a tag keywords, e nada no llms.txt é estruturalmente imune a isso.

O argumento para dedicar pelo menos dez minutos

  • O custo é genuinamente trivial. Um arquivo estático, sem etapa de build, sem risco. Apostas assimétricas com desvantagem próxima de zero não exigem alta convicção.
  • Existem alguns consumidores hoje. Ferramentas de desenvolvedor, agentes que entendem documentação e mecanismos de resposta que aceitam uma dica de site realmente o leem — um nicho, mas real, e mais valioso para produtos cujos compradores são desenvolvedores.
  • A curadoria é o valor real. Escolher as dez páginas que melhor explicam seu produto — e escrever uma linha honesta sobre cada uma — é um trabalho de posicionamento que você deveria fazer independentemente de um robô buscar o resultado.
  • Valor de opção. Se um grande mecanismo anunciar suporte, os sites com arquivos limpos estarão prontos; todos os outros entrarão na correria.

Como escrever um que valha a pena ler

Faça curadoria, não despeje conteúdo: um sitemap regurgitado em markdown derrota toda a premissa. Dez a vinte links, cada um com uma nota que diz o que um leitor aprende ali — não um texto de marketing, mas contexto voltado para modelos. Coloque changelogs, páginas legais e arquivos em Optional. Mantenha-o atualizado da mesma forma que mantém seu sitemap, e sirva-o como markdown UTF-8 simples na raiz. Nosso gerador gratuito de llms.txt compõe um arquivo com a especificação exata no navegador — nada é armazenado, sem necessidade de cadastro — com a mesma ressalva honesta que este post carrega.

Onde a hora real é gasta

Se você tem uma hora para visibilidade em IA, llms.txt são os últimos dez minutos, não os primeiros cinquenta. As alavancas mensuráveis, em ordem: se crawlers de IA têm permissão de entrada (robots.txt), se suas páginas servem texto legível sem executar JavaScript, se você publica títulos, descrições e dados estruturados, e como é seu perfil de autoridade — a verificação gratuita de dez segundos cobre todos os quatro. Além do básico, o que move as recomendações de IA é o que outras páginas confiáveis dizem sobre você — a camada de cobertura e citações que mapeamos no guia de ferramentas de visibilidade de IA, e, em uma nota de transparência, a camada na qual nosso próprio Stork Wire atua. Arquivos autodeclarados são uma cortesia. Evidências de terceiros são o sinal de classificação — tanto para mecanismos de busca quanto para mecanismos de resposta.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only