La BoétieInsights
llms.txt generation and platform setup

Un générateur llms.txt gratuit ne produit pas le même fichier qu'un autre

By La BoétieUpdated August 2, 202614 min read
Deux fichiers llms.txt affichés côte à côte dans un éditeur de texte

Ouvrez deux onglets, entrez la même adresse de site dans deux outils différents, téléchargez les deux sorties, affichez-les côte à côte. Les fichiers divergent dès la troisième ligne. Un générateur llms.txt gratuit qui lit votre sitemap sort une liste longue, avec des descriptions recopiées depuis vos balises meta. Un autre, alimenté à la main, sort douze lignes choisies. Aucune page de vente ne dit cela : un générateur llms.txt gratuit se juge sur son fichier, jamais sur sa promesse. Cet article donne la grille de six critères, notée sur dix-huit points, que vous appliquez vous-même à n'importe quel outil, et les deux situations où la meilleure décision reste d'écrire le fichier à la main.

À retenir :

  • La spécification publiée en septembre 2024 par Jeremy Howard, cofondateur d'Answer.AI, ne rend obligatoire qu'un seul élément : « An H1 with the name of the project or site. This is the only required section ».
  • Mintlify plafonne ses fichiers générés automatiquement à 100 000 caractères, soit environ 25 000 jetons, et tronque au-delà en listant le nombre de pages omises.
  • L'extension WordPress Website LLMs.txt dépasse 40 000 installations actives en version 8.5.6 et exclut les contenus marqués noindex par Yoast SEO, Rank Math, SEOPress ou All in One SEO.
  • WebRankInfo chiffre entre 30 et 60 minutes par site et par mois la maintenance sérieuse du fichier.
  • John Mueller, Search Advocate chez Google, déclare qu'aucun service d'IA n'a annoncé lire ce fichier, ce qui fait de sa qualité éditoriale, pas de son existence, le seul enjeu réel.

Juger la sortie d'un générateur llms.txt gratuit, pas sa page de vente

Toutes les pages de vente promettent la même chose : un fichier prêt en trente secondes. Justa annonce « environ 30 secondes pour 100 pages » et travaille à partir du sitemap, avec la mention « Nous analysons votre sitemap pour récupérer le contenu textuel de toutes les pages accessibles ». Hack The SEO annonce « en 30 secondes, sans inscription », mais demande à l'utilisateur de saisir lui-même ses pages clés, cinq à quinze lignes au format « Titre | URL | note facultative ». Deux promesses identiques, deux logiques opposées. Le premier fichier reflète l'architecture technique du site ; le second reflète les priorités commerciales de celui qui l'a rempli.

Un générateur llms.txt gratuit documente rarement sa logique de sélection, et c'est précisément ce que la comparaison révèle. La manipulation tient en cinq étapes et coûte un quart d'heure.

  1. Choisissez un site que vous connaissez ligne par ligne. Le vôtre de préférence : vous verrez immédiatement quelle page manque.
  2. Lancez le premier outil et enregistrez la sortie sous un nom explicite, par exemple llms-outil-a.txt.
  3. Lancez le second sur la même adresse, sans rien modifier, et enregistrez llms-outil-b.txt.
  4. Ouvrez les deux fichiers côte à côte dans un éditeur de texte brut, jamais dans le navigateur, qui masque la structure Markdown.
  5. Notez chaque sortie sur la grille de six critères décrite plus bas, sur dix-huit points.

Ce que vous cherchez n'est pas l'esthétique du fichier, c'est l'écart entre ce que l'outil a retenu et ce que vous auriez retenu. Avant de lancer la comparaison, relisez ce que contient un fichier qui mérite sa place : sans référentiel, une comparaison n'a pas d'échelle.

La grille de notation : six critères, dix-huit points

Chaque critère se note de 0 à 3 points sur le fichier produit, jamais sur la documentation de l'outil. Un générateur llms.txt gratuit qui atteint 12 points sur 18 fait gagner du temps ; en dessous de 8, la reprise manuelle coûte plus cher que la rédaction directe.

CritèreCe que vous vérifiez dans le fichier produitPoints
1. Profondeur et sélectionL'outil explique-t-il ce qu'il retient et ce qu'il écarte ?0 à 3
2. Qualité des descriptionsPhrase rédigée pour le lecteur ou balise meta recopiée ?0 à 3
3. Poids en jetonsLe fichier reste-t-il sous quelques dizaines de milliers de caractères ?0 à 3
4. ConformitéTitre, résumé en bloc de citation, sections et bloc Optional présents ?0 à 3
5. RégénérationVos ajouts manuels survivent-ils au passage suivant ?0 à 3
6. Vérification des URLChaque lien renvoie-t-il un code HTTP 200 avant publication ?0 à 3

Critère 1, la profondeur d'exploration : ce que l'outil retient et ce qu'il écarte

La découverte désigne la façon dont l'outil constitue son inventaire d'URL : lecture du sitemap.xml, exploration des liens page par page, ou saisie manuelle. Justa se limite au sitemap, ce qui exclut mécaniquement toute page absente du fichier XML. L'extension WordPress Website LLMs.txt part des réglages du CMS et retire les contenus marqués noindex ou nofollow par Yoast SEO, Rank Math, SEOPress et All in One SEO. Hack The SEO ne découvre rien du tout : la sélection vient entièrement de vous.

Aucune de ces trois logiques n'est fautive : la faute commence quand un générateur llms.txt gratuit ne dit pas laquelle il applique. Attribuez 3 points quand l'outil publie sa règle de sélection et vous laisse la corriger, 1 point quand il liste sans expliquer, 0 quand la sortie place vos mentions légales et vos archives de catégories au même niveau que votre offre.

Critère 2, les descriptions : phrase rédigée ou balise meta recopiée

L'écart se voit en trois lignes, et c'est le critère le plus discriminant de la grille. Mintlify documente sa règle sans détour : « Each page's description comes from the description field in its frontmatter. Descriptions truncate at 300 characters and the first line break. » La description n'est donc pas écrite, elle est héritée, puis coupée à 300 caractères. Justa, de son côté, nettoie le contenu existant et le convertit en Markdown, sans produire de phrase de synthèse.

Le test de lecture est immédiat. Une description héritée commence par une formule de vitrine : « Découvrez notre gamme complète de solutions ». Une description rédigée nomme une entité, un chiffre ou une contrainte : « Tarification pour équipes de 5 à 50 personnes, facturation annuelle uniquement ». Le modèle qui lit le fichier ne dispose que de cette ligne pour décider s'il ouvre la page. La différence entre fichier exploré contre fichier documenté se joue entièrement là. Attribuez 3 points pour une phrase rédigée par page, 0 pour une reprise automatique de la balise meta.

Critère 3, le poids en jetons : pourquoi un fichier long coûte au modèle qui le lit

La spécification justifie son existence par une contrainte matérielle : les fenêtres de contexte « are too small to handle most websites in their entirety ». Un fichier qui gonfle reproduit donc exactement le problème qu'il prétend résoudre. Mintlify pose la limite haute de façon explicite : « Automatically generated llms.txt files cannot exceed 100,000 characters », au-delà de quoi la plateforme tronque et signale le nombre de pages omises.

Faites le calcul sur votre propre sortie. À l'approximation courante de quatre caractères par jeton en anglais, ces 100 000 caractères représentent environ 25 000 jetons consommés avant même que le modèle n'ouvre une seule de vos pages. Un fichier de 8 000 caractères, soit près de 2 000 jetons, laisse au contraire la place à trois ou quatre pages complètes. Un générateur llms.txt gratuit qui déverse 400 URL produit un document que le modèle tronquera lui-même, sans vous dire où. Notez 3 points sous 10 000 caractères, 1 point entre 10 000 et 50 000, 0 au-delà.

Structure d'un fichier llms.txt : titre, résumé et sections de liens

Critère 4, la conformité : titre, résumé, sections et bloc Optional

La spécification tient en quatre éléments et se vérifie en trente secondes. Elle impose « An H1 with the name of the project or site. This is the only required section », puis recommande « a blockquote with a short summary of the project » et « zero or more markdown sections delimited by H2 headers, containing 'file lists' of URLs ». Le bloc Optional porte une sémantique particulière que beaucoup d'outils ignorent : « If it's included, the URLs provided there can be skipped if a shorter context is needed. » Le texte de référence reste consultable sur le site de la spécification llms.txt.

Un générateur llms.txt gratuit qui produit une liste de liens sans titre ni résumé fabrique un plan de site déguisé, pas un fichier llms.txt. Notez 3 points quand les quatre éléments sont présents et que le bloc Optional isole réellement le secondaire, 1 point quand le titre et le résumé manquent, 0 quand la sortie n'est pas du Markdown valide.

Critère 5, la régénération : vos ajouts manuels survivent-ils au passage suivant

C'est le critère que personne ne teste avant de payer, et celui qui décide de la durée de vie du fichier. Le scénario est simple : vous corrigez trois descriptions à la main, vous publiez, puis le mois suivant l'outil régénère. Deux comportements existent. Les générateurs qui reconstruisent le fichier depuis zéro écrasent vos corrections sans avertissement. Ceux qui travaillent par fusion conservent les blocs que vous avez édités.

L'organisation du fichier vous protège dans les deux cas. Isolez vos ajouts dans une section H2 dédiée, distincte de celles que l'outil alimente, et versionnez le fichier dans votre dépôt. Sur WordPress, où l'extension Website LLMs.txt régénère à chaque publication, l'intégration WordPress mérite d'être paramétrée avant le premier passage. Un générateur llms.txt gratuit sans mode fusion vous condamne à refaire le même travail à chaque cycle. Notez 3 points pour une fusion documentée, 0 pour un écrasement silencieux.

Critère 6, la vérification des URL : chaque lien testé avant publication

Un fichier qui pointe vers des pages en erreur 404 dégrade la confiance du modèle qui le lit, exactement comme un sitemap périmé dégrade celle d'un moteur classique. La vérification est pourtant triviale à automatiser : une requête HEAD par URL, un code HTTP 200 attendu, un rapport d'écarts. Presque aucun générateur llms.txt gratuit ne le fait, parce que cela transforme une opération instantanée en traitement de plusieurs secondes.

Carolyn Shelby, SEO & AI Strategist chez Yoast, résume l'enjeu dans Search Engine Land le 9 juillet 2025 : « the content has to exist and deliver when the model gets there ». Le fichier n'est qu'une promesse d'accès ; une URL morte la casse. Notez 3 points quand l'outil teste chaque lien et vous remet le rapport, 0 quand un générateur llms.txt gratuit se contente de recopier le sitemap.

Les deux cas où l'écriture manuelle l'emporte sur l'automatisation

Premier cas : le site de moins de trente pages. Rédiger douze lignes prend vingt minutes et produit un fichier meilleur que n'importe quelle sortie automatique, parce que la sélection et les descriptions sont exactement les vôtres. C'est le format que Hack The SEO institutionnalise en recommandant cinq à quinze pages saisies à la main. Le seuil de rentabilité de l'automatisation ne commence qu'au moment où l'inventaire dépasse ce qu'un humain relit en une séance.

Second cas : le site dont l'architecture ne reflète pas l'offre. Quand les pages qui vendent sont enfouies sous trois niveaux de blog, aucun sitemap ne les fera remonter. WebRankInfo, qui estime la maintenance sérieuse à 30 à 60 minutes par site et par mois, va plus loin et écrit « Je ne vous conseille pas de créer un fichier llms.txt sur votre site » tant que ce travail éditorial n'est pas fait : un fichier automatique posé sur une architecture bancale amplifie le désordre. Dans les deux cas, mieux vaut suivre la méthode pour créer le fichier étape par étape que relancer un générateur llms.txt gratuit en espérant un résultat différent.

Comment La Boétie traite le problème dans son générateur

Découverte et inventaire. L'outil part de robots.txt et de sitemap.xml pour construire un inventaire complet des URL, classées par type, la substance commerciale en premier. La règle de sélection est publiée, donc auditable.

Rédaction des descriptions. Chaque page est lue pour en extraire l'objectif, l'audience, les entités, les offres, les canonicals, les titres et les données structurées existantes. La description est écrite à partir de cette lecture, pas héritée d'une balise meta.

Vérification et audit. Chaque URL est testée en direct avant d'être inscrite dans le fichier, livré en .md et en .txt, accompagné d'un audit SEO et GEO couvrant indexabilité, canonicals, titres, données structurées, maillage interne, signaux de langue et accessibilité aux robots. La contrepartie est assumée : 25 $ ou 20 € par exécution, sans abonnement ni compte, là où un générateur llms.txt gratuit ne coûte rien mais vous laisse la vérification à faire. Le générateur llms.txt de La Boétie s'utilise en une passe.

FAQ : choisir un générateur llms.txt gratuit

Un générateur llms.txt gratuit suffit-il pour un site e-commerce ?

Rarement en l'état. Un catalogue de plusieurs milliers de références produit une sortie automatique qui dépasse les 100 000 caractères retenus comme plafond par Mintlify, donc tronquée. La bonne pratique consiste à laisser l'outil générer la structure, puis à réduire manuellement aux catégories et aux pages de marque, en renvoyant le détail produit vers un fichier llms-full.txt distinct ou vers le flux produit existant.

Faut-il publier llms.txt et llms-full.txt ?

Les deux fichiers répondent à des besoins différents. Mintlify héberge automatiquement un llms.txt qui liste les pages, et un llms-full.txt qui regroupe l'intégralité de la documentation en un seul document. Le premier sert de sommaire, le second de corpus. Un site vitrine n'a besoin que du premier ; une documentation technique tire un bénéfice réel du second.

Que se passe-t-il si une URL du fichier renvoie une erreur 404 ?

Le modèle qui suit le lien n'obtient rien et perd confiance dans le reste du fichier. Aucune sanction algorithmique n'est documentée, puisque John Mueller rappelle qu'aucun service d'IA n'a déclaré utiliser ce fichier, mais l'effet pratique est immédiat : la page que vous vouliez faire citer n'est pas lue. Testez chaque lien avant publication et après toute migration.

À quelle fréquence faut-il régénérer le fichier ?

À chaque changement structurel : nouvelle offre, nouvelle gamme, refonte de l'arborescence, changement de prix. WebRankInfo estime le coût d'une maintenance sérieuse entre 30 et 60 minutes par site et par mois. En rythme de croisière, une relecture trimestrielle suffit pour un site vitrine stable, contre une vérification mensuelle pour un site éditorial qui publie chaque semaine.

Conclusion

La manipulation décrite ici ne demande ni budget ni compétence technique : deux outils, une seule adresse, deux fichiers ouverts côte à côte. Elle règle en un quart d'heure une question que les pages de vente laissent ouverte, parce qu'elle déplace le jugement de la promesse vers la sortie. Les six critères, notés sur dix-huit points, se réappliquent à n'importe quel outil, gratuit ou payant, et restent valables quand la spécification évoluera. Retenez le seuil : sous 8 points sur 18, la reprise manuelle coûte moins cher que la correction, et aucun générateur llms.txt gratuit ne remplacera la décision éditoriale de choisir quelles pages méritent d'être lues. Un générateur llms.txt gratuit fait gagner du temps sur l'inventaire, jamais sur ce choix.

À lire également :

Sources :

Questions

Un générateur llms.txt gratuit suffit-il pour un site e-commerce ?

Rarement en l'état. Un catalogue de plusieurs milliers de références produit une sortie automatique qui dépasse les 100 000 caractères retenus comme plafond par Mintlify, donc tronquée. La bonne pratique consiste à laisser l'outil générer la structure, puis à réduire manuellement aux catégories et aux pages de marque, en renvoyant le détail produit vers un fichier llms-full.txt distinct ou vers le flux produit existant.

Faut-il publier llms.txt et llms-full.txt ?

Les deux fichiers répondent à des besoins différents. Mintlify héberge automatiquement un llms.txt qui liste les pages, et un llms-full.txt qui regroupe l'intégralité de la documentation en un seul document. Le premier sert de sommaire, le second de corpus. Un site vitrine n'a besoin que du premier ; une documentation technique tire un bénéfice réel du second.

Que se passe-t-il si une URL du fichier renvoie une erreur 404 ?

Le modèle qui suit le lien n'obtient rien et perd confiance dans le reste du fichier. Aucune sanction algorithmique n'est documentée, puisque John Mueller rappelle qu'aucun service d'IA n'a déclaré utiliser ce fichier, mais l'effet pratique est immédiat : la page que vous vouliez faire citer n'est pas lue. Testez chaque lien avant publication et après toute migration.

À quelle fréquence faut-il régénérer le fichier ?

À chaque changement structurel : nouvelle offre, nouvelle gamme, refonte de l'arborescence, changement de prix. WebRankInfo estime le coût d'une maintenance sérieuse entre 30 et 60 minutes par site et par mois. En rythme de croisière, une relecture trimestrielle suffit pour un site vitrine stable, contre une vérification mensuelle pour un site éditorial qui publie chaque semaine.