
llms.txt: o que é, para que serve e como criar o seu
O llms.txt é um arquivo de texto simples, colocado na raiz do site, que apresenta o conteúdo em formato fácil de ler por modelos de linguagem. A ideia nasceu em 2024, na proposta de Jeremy Howard, e parte de uma constatação prática: uma página HTML moderna é cheia de menu, banner, script e rodapé, e o modelo gasta boa parte da janela de contexto separando o texto útil do resto.
A proposta é a mesma do robots.txt em espírito, mas com objetivo oposto. Em vez de dizer aonde o robô não pode ir, o llms.txt diz onde está o melhor do seu conteúdo, em uma lista limpa e comentada.
Como é o formato
É Markdown puro, com uma hierarquia enxuta: um título com o nome do site, um parágrafo de resumo em itálico, seções com listas de links e uma frase curta explicando cada item. Nada de tabela, imagem ou código complicado.
# StartGoogle
> Blog sobre GEO, AEO e SEO na era
> da busca generativa.
## Guias
- [Guia de GEO](/guias/guia-de-geo.html):
como ser citado por IAs.
- [Guia de SEO](/guias/guia-de-seo.html):
fundamentos de busca.
## Artigos recentes
- [robots.txt para IA](/posts/robots.html):
quais robôs liberar.
## Contato
- [Fale conosco](/pages/contato.html)
Alguns sites publicam também uma versão estendida, o llms-full.txt, com o texto completo dos artigos em vez de só os links. Faz sentido em documentação técnica, onde o conteúdo é curto e objetivo. Em blog, costuma virar um arquivo gigante que ninguém consome.
O que o llms.txt não faz
Como a proposta virou assunto rápido, apareceu junto uma safra de promessas que o arquivo não sustenta. Vale deixar claro o que ele não entrega, para você investir o tempo onde há retorno.
Ele não obriga ninguém a citar você. A escolha da fonte depende de relevância, confiança e de o conteúdo responder bem à pergunta feita. Um sumário bem escrito não compensa um texto raso. Ele também não é um sinal de ranqueamento: não existe declaração de nenhum buscador nesse sentido, e tratar o arquivo como fator de posicionamento é interpretar demais.
Ele não controla acesso, papel que continua sendo do robots.txt, e não define versão canônica de nada, papel da tag canonical. Também não substitui os dados estruturados: o llms.txt fala sobre o site como um todo, enquanto o schema explica o significado de cada elemento dentro de uma página específica, e é esse detalhe que permite a extração precisa de um trecho.
Como saber se alguém está lendo
Essa é a pergunta mais útil e a menos respondida nos textos sobre o tema. A única medição confiável está nos registros de acesso do seu servidor: procure requisições ao caminho do arquivo e veja qual agente as fez. Se o arquivo nunca é buscado, você tem sua resposta para aquele período, sem depender de opinião.
Vale acompanhar também o caminho inverso: quando um assistente cita seu site, ele costuma acessar a página original no momento da resposta. Comparar esses acessos com as citações que você observa nas ferramentas dá uma noção prática de quem realmente consome seu conteúdo, que é uma informação melhor do que qualquer promessa sobre o arquivo.
Onde ele se encaixa entre os arquivos que você já tem
| Arquivo | Para quem fala | O que diz | Quem obedece hoje |
|---|---|---|---|
| robots.txt | Rastreadores | Onde pode e onde não pode entrar | Praticamente todos os robôs sérios |
| sitemap.xml | Buscadores | Lista completa de endereços e datas | Google, Bing e agregadores |
| llms.txt | Modelos de linguagem | Onde está o melhor conteúdo, resumido | Adoção ainda incerta e voluntária |
| Dados estruturados | Máquinas em geral | O significado de cada elemento da página | Buscadores e assistentes, de forma ampla |
A leitura correta da tabela é esta: o llms.txt não substitui nada. Ele é uma camada extra, barata, para um cenário que ainda está se formando. Se você precisa escolher onde investir tempo primeiro, dados estruturados e conteúdo bem organizado entregam retorno comprovado hoje; o llms.txt é aposta de baixo custo para amanhã.
O que colocar (e o que deixar de fora)
- Coloque o que responde perguntas. Guias, tutoriais, páginas de referência e artigos que explicam conceitos.
- Explique cada link em uma linha. A frase curta depois dos dois pontos é o que ajuda o modelo a escolher o link certo.
- Use endereços absolutos ou caminhos consistentes. Link quebrado no arquivo é pior que arquivo nenhum.
- Deixe de fora páginas de sistema. Login, carrinho, área administrativa e filtros não interessam.
- Não repita o sitemap inteiro. O valor está na curadoria, não no volume.
Como gerar sem trabalho manual
Se o seu site é publicado por um gerador estático ou por um painel próprio, o llms.txt deve nascer do mesmo lugar que cria o sitemap. Assim ele nunca envelhece. A lógica é curta em qualquer linguagem: percorra os conteúdos publicados, agrupe por seção, escreva título, endereço e resumo.
$linhas = ["# " . $nomeDoSite, "",
"> " . $descricao, "", "## Artigos", ""];
foreach ($publicados as $p) {
$linhas[] = "- [" . $p["titulo"] . "]("
. $p["url"] . "): " . $p["resumo"];
}
file_put_contents("llms.txt",
implode("\n", $linhas));
Em WordPress, o mesmo resultado sai de um plugin de sitemap com saída customizada ou de uma rotina agendada. O importante é a regeneração automática: arquivo desatualizado, com links que já não existem, passa a impressão contrária da que você queria.
Como conferir se está no ar
Depois de publicar, teste o endereço direto e confirme que ele chega como texto puro, e não como página HTML de erro:
curl -s -I https://seusite.com.br/llms.txt
curl -s https://seusite.com.br/llms.txt | head -20
O cabeçalho deve trazer status 200 e tipo text/plain ou text/markdown. Se o seu servidor devolver a home para qualquer endereço desconhecido, você tem um problema maior que o llms.txt e vale corrigir antes.
Erros que tiram o valor do arquivo
- Listar tudo. Um llms.txt com 300 links é um sitemap disfarçado. O ganho está na escolha do que importa.
- Descrições vagas. "Artigo sobre SEO" não ajuda ninguém a decidir. A frase precisa dizer qual pergunta aquele conteúdo responde.
- Gerar uma vez e esquecer. Links mortos e conteúdo removido passam a impressão oposta da que você queria.
- Servir como HTML. Alguns servidores entregam página de erro estilizada em vez de texto puro; confira o tipo da resposta.
- Escrever em tom de propaganda. O arquivo é um sumário técnico, não uma página de vendas.
Como fazer em cada tipo de site
Em site estático, o arquivo sai do mesmo processo que gera o sitemap: uma função percorre os conteúdos e escreve o texto. É o cenário mais simples e o mais confiável, porque a publicação e a atualização acontecem juntas.
Em WordPress, dá para resolver com uma rotina agendada que grava o arquivo na raiz, ou com um endpoint que responde em texto puro no endereço certo. Evite plugins que apenas criam a página no editor: o conteúdo acaba servido como HTML e perde a função.
Em plataformas fechadas, como construtores visuais, nem sempre é possível gravar arquivos na raiz. Nesses casos, a alternativa honesta é concentrar esforço no que a plataforma permite: dados estruturados, títulos claros e uma página de índice bem organizada, que cumpre parte do papel.
Vale a pena mesmo?
Minha resposta prática: vale, desde que seja automático e você não crie expectativa falsa. Leva minutos para integrar ao processo de publicação, ocupa alguns kilobytes e não compete com nada. O que não vale é trocar o trabalho de estrutura de conteúdo, dados estruturados e autoridade pelo arquivo de moda do momento. Quem quiser ver essa ordem de prioridades por inteiro encontra o caminho no guia de GEO.
O que fazer a partir daqui
Gere uma primeira versão com os seus dez melhores conteúdos, publique na raiz, confira o status e coloque a geração dentro da rotina que já publica seu site. Revise a cada trimestre para tirar links mortos. É o tipo de tarefa que se faz uma vez e rende sem manutenção.
Perguntas frequentes
O Google usa o llms.txt?
Não há confirmação oficial de que o Google use o arquivo como sinal. Ele é uma proposta da comunidade, adotada por parte dos sites de documentação e ainda sem uso declarado pelas grandes plataformas.
llms.txt substitui o robots.txt ou o sitemap?
Não. São arquivos com funções diferentes: o robots.txt controla acesso, o sitemap lista endereços para buscadores e o llms.txt resume o conteúdo para modelos de linguagem.
Preciso do llms-full.txt também?
Só se o seu conteúdo for curto e técnico, como documentação. Em blog, o arquivo completo fica grande demais e raramente compensa.
Onde o arquivo deve ficar?
Na raiz do domínio, acessível em /llms.txt, servido como texto puro com status 200.
Publicar o arquivo pode prejudicar meu SEO?
Não. Ele não interfere no rastreamento nem na indexação das páginas. O único risco é manter links quebrados nele, o que passa impressão de descuido.
Leia também
Compartilhe este artigo
Fontes e leituras recomendadas

