La BoétieInsights
llms.txt generation and platform setup

llms.txt à la racine : vérifier que le fichier est bien en ligne

By La BoétieUpdated August 7, 20268 min read
Contrôle des en-têtes HTTP d'un fichier llms.txt servi à la racine d'un domaine

Le llms.txt est un fichier Markdown placé à la racine d'un domaine, qui résume l'objet d'un site et liste ses pages clés à l'intention des modèles de langage. Une ressource déposée au bon endroit s'ouvre sans erreur dans un navigateur alors que le serveur la renvoie dans un format qu'aucun robot ne traite.

Vérifier que le fichier est bien en ligne demande quatre contrôles, chacun avec une valeur attendue : le code de réponse, le type de contenu, l'encodage, puis le signal de l'audit Chrome Lighthouse. L'ensemble prend moins de cinq minutes avec curl.

À retenir :

  • /llms.txt répond 200 en direct, sans redirection 301 ou 308 : un robot qui suit une redirection vers une page HTML repart avec du balisage.
  • L'en-tête Content-Type attendu est text/plain; charset=utf-8 ou text/markdown. Servi en text/html, le document est traité comme une page ordinaire.
  • L'audit llms.txt de Chrome Lighthouse, arrivé avec la version 13.3 en mai 2026, échoue sur erreur serveur et passe en Not Applicable sur un 404.
  • 97 % des fichiers llms.txt n'ont reçu aucune requête en mai 2026, selon Originality.ai.

Pourquoi vérifier que le fichier est bien en ligne demande quatre contrôles

Une ressource présente et une ressource correctement servie sont deux états du même chemin /llms.txt, le second se mesurant sur deux en-têtes HTTP, un encodage et un rapport d'audit. Originality.ai a recensé 4 088 fichiers llms.txt en juin 2025 et 36 120 en mai 2026, soit une multiplication par 8,8 en douze mois, et les journaux serveur analysés par Ahrefs sur 137 000 domaines attribuent 1,1 % seulement des requêtes vers ces fichiers à des robots de récupération IA. Vérifier que le fichier est bien en ligne conditionne ce peu de trafic agent. Si l'installation reste à faire, créer un fichier llms.txt étape par étape précède ces contrôles.

Contrôle 1, le code de réponse et le piège de la redirection

Le premier contrôle porte sur le code de réponse HTTP, le nombre à trois chiffres renvoyé avant tout contenu. La commande curl -I https://votredomaine.com/llms.txt affiche les en-têtes sans télécharger le corps. La valeur attendue est 200, sans étape intermédiaire.

Le piège se trouve dans la redirection. Une redirection 301 (déplacement permanent) ou 308 posée sur /llms.txt renvoie le client vers une autre adresse, typiquement la page d'accueil, parce qu'une règle générique de réécriture attrape les URL inconnues. Le navigateur suit la chaîne et affiche une page lisible, alors qu'un robot repart avec du HTML. Ajoutez l'option -L pour dérouler la chaîne et lire l'adresse finale : si elle diffère de /llms.txt, la règle de réécriture, dans le .htaccess d'Apache ou dans la configuration Nginx, doit exclure ce chemin. Vérifier que le fichier est bien en ligne commence par cette lecture d'en-têtes.

Contrôle 2, le type de contenu renvoyé par le serveur

Le deuxième contrôle lit l'en-tête Content-Type de la même réponse, filtrée sur grep -i content-type. Les deux valeurs acceptables sont text/plain; charset=utf-8 et text/markdown. La spécification llmstxt.org n'impose aucun type MIME.

Un serveur qui répond text/html sur ce chemin signale une réécriture : la requête a été routée vers le moteur de rendu du CMS au lieu de la ressource statique. Vérifier que le fichier est bien en ligne passe par la lecture de cet en-tête. Sur WordPress, l'intégration WordPress du fichier llms.txt détaille les deux montages possibles.

Conversion d'un fichier texte vers un encodage UTF-8 intact

Contrôle 3, l'encodage UTF-8 et les caractères accentués

Le troisième contrôle prend une seconde : ouvrez la ressource et cherchez un accent. Des accents affichés sous forme de paires de caractères latins parasites signalent un enregistrement en ISO-8859-1, autrement dit en Latin-1, relu ensuite comme de l'UTF-8. Le cas est documenté sur le forum de support de WordPress.org, où la sortie llms.txt d'une extension corrompait les caractères accentués et rendait la section descriptive illisible pour les robots qui la consultent.

La correction se fait à l'enregistrement, par une conversion en UTF-8. Le BOM (Byte Order Mark), signature de trois octets en tête de fichier, reste autorisé : Yoast le préfixe sur le llms.txt produit par son extension.

Contrôle 4, lire le signal de l'audit Chrome Lighthouse

Le quatrième contrôle passe par Chrome Lighthouse, l'outil d'audit intégré aux DevTools de Chrome. Sa catégorie agentic browsing, arrivée avec Lighthouse 13.3 en mai 2026, ajoute quatre vérifications : arbre d'accessibilité, stabilité du contenu après rendu, implémentation WebMCP et règles llms.txt.

La documentation Chrome for Developers indique que l'audit signale la page quand « a server error occurs when attempting to retrieve the llms.txt file », et qu'une réponse 404 le place en Not Applicable « as providing the file is optional at the moment ». Un résultat sans échec ne prouve donc rien à lui seul : un site dépourvu de ressource obtient le même affichage qu'un site correctement configuré. Quand la ressource répond, l'audit examine la présence d'un titre H1, une longueur suffisante et des liens, détails développés dans l'audit Chrome Lighthouse agentic browsing.

Les quatre contrôles et leurs valeurs attendues

Les quatre contrôles à passer pour vérifier que le fichier est bien en ligne tiennent dans un tableau.

ContrôleOutilValeur attendueSymptôme d'échec
Code de réponsecurl -I sur /llms.txt200, sans redirection301 ou 308 vers une page HTML
Type de contenuLe même appel, filtrétext/plain; charset=utf-8 ou text/markdowntext/html renvoyé par le CMS
EncodageOuverture dans un éditeurAccents intacts en UTF-8Caractères parasites
Audit ChromeLighthouse 13.3Audit sans erreur serveurÉchec serveur, ou Not Applicable sur 404

Ces quatre lignes se rejouent après chaque migration ou mise à jour du CMS.

FAQ : vérifier que le fichier est bien en ligne

Comment vérifier que le fichier est bien en ligne sans ligne de commande ?

Ouvrez https://votredomaine.com/llms.txt dans un navigateur et affichez le code source. Une ressource correctement servie apparaît en texte brut, sans balisage autour. WebRankInfo décrit cette méthode comme le contrôle de base et rappelle qu'aucun validateur officiel n'existe à ce jour. Le rapport Lighthouse complète ce contrôle du côté serveur.

Une redirection 301 sur /llms.txt pose-t-elle un problème ?

Oui. Le chemin doit répondre 200 en direct, sans 301 ni 308 intermédiaire, contrainte sur laquelle les guides d'implémentation français convergent. Un robot qui suit la chaîne atterrit sur une page HTML générée par le CMS et repart avec du balisage au lieu du résumé Markdown attendu.

Faut-il empêcher l'indexation du fichier llms.txt ?

WebRankInfo recommande un en-tête X-Robots-Tag: noindex dans le .htaccess, pour llms.txt, llms-full.txt et toute URL se terminant par .md. La directive tient la ressource hors des pages de résultats sans empêcher les crawlers IA d'y accéder, puisqu'ils lisent le chemin indépendamment de son statut d'indexation.

Un audit Chrome sans échec garantit-il que tout fonctionne ?

Non. La documentation Chrome for Developers précise qu'une réponse 404 place l'audit en Not Applicable, la publication de la ressource restant facultative. Un site sans llms.txt obtient donc le même résultat qu'un site correctement configuré. Seule une erreur serveur déclenche un échec.

Comment La Boétie prend en charge la couche agent de votre site

Génération. Le Générateur llms.txt produit une ressource conforme à la spécification à partir de l'arborescence réelle du site, en une passe, facturée 20 € ou 25 $, sans compte à créer.

Installation. Une équipe de cinq à six ingénieurs livre le montage adapté à la pile en place : ressource statique, route Next.js ou extension WordPress.

Contrôle. Les quatre vérifications décrites ici sont rejouées après livraison. Le client garde la propriété de tout ce qui est produit.

Lancez le générateur llms.txt de La Boétie et repartez avec une ressource prête à déposer.

Conclusion

Quatre contrôles séparent une publication d'une installation exploitable : un code 200 sans redirection, un Content-Type en texte brut ou en Markdown, un encodage UTF-8 intact, un audit Lighthouse lu pour ce qu'il dit réellement. SE Ranking mesure 10,13 % d'adoption sur environ 300 000 domaines indexés en mai 2026, dont 97 % sans aucune requête ce mois-là selon Originality.ai. Vérifier que le fichier est bien en ligne est l'étape qui clôt l'installation et conditionne la lecture de votre ressource par les agents.

À lire également :

Sources :

Questions

Comment vérifier que le fichier est bien en ligne sans ligne de commande ?

Ouvrez https://votredomaine.com/llms.txt dans un navigateur et affichez le code source. Une ressource correctement servie apparaît en texte brut, sans balisage autour. WebRankInfo décrit cette méthode comme le contrôle de base et rappelle qu'aucun validateur officiel n'existe à ce jour. Le rapport Lighthouse complète ce contrôle du côté serveur.

Une redirection 301 sur /llms.txt pose-t-elle un problème ?

Oui. Le chemin doit répondre 200 en direct, sans 301 ni 308 intermédiaire, contrainte sur laquelle les guides d'implémentation français convergent. Un robot qui suit la chaîne atterrit sur une page HTML générée par le CMS et repart avec du balisage au lieu du résumé Markdown attendu.

Faut-il empêcher l'indexation du fichier llms.txt ?

WebRankInfo recommande un en-tête X-Robots-Tag: noindex dans le .htaccess, pour llms.txt, llms-full.txt et toute URL se terminant par .md. La directive tient la ressource hors des pages de résultats sans empêcher les crawlers IA d'y accéder, puisqu'ils lisent le chemin indépendamment de son statut d'indexation.

Un audit Chrome sans échec garantit-il que tout fonctionne ?

Non. La documentation Chrome for Developers précise qu'une réponse 404 place l'audit en Not Applicable, la publication de la ressource restant facultative. Un site sans llms.txt obtient donc le même résultat qu'un site correctement configuré. Seule une erreur serveur déclenche un échec.