Les robots Web d'IA se sont scindés en trois. La plupart des fichiers robots.txt n'en nomment qu'un.
Le fichier renvoie toujours un 200. Il a cessé d'être vrai en 2024.
Le 20 août 2026, j'ai procédé à une réconciliation complète de sagentix.ca/robots.txt avec ce que les fournisseurs d'IA documentent actuellement — les onze, page par page. Ce qui en est ressorti n'était pas un problème de fichier. C'était un changement structurel dans le fonctionnement des fournisseurs, et le fichier a été l'instrument qui l'a rendu visible.
Le fichier nommait 20 agents d'IA, tous en Allow — 21 blocs User-Agent en comptant le caractère générique. GPTBot, ClaudeBot, PerplexityBot, Googlebot : un fichier délibéré, bien construit, et meilleur que ce que porte la plupart des sites. C'était aussi un fichier de 2024, et il nommait anthropic-ai et Claude-Web — deux chaînes qui ne figurent dans aucune documentation actuelle d'Anthropic — sans nommer ni Claude-User ni Claude-SearchBot, qui n'existaient pas au moment de sa rédaction.
Rien n'était bloqué. Aucun système de surveillance ne s'est déclenché, le fichier renvoyait un 200 et s'analysait correctement. C'est là tout le constat : un fichier correct et un fichier à jour sont deux choses différentes, et aucun instrument de votre côté ne peut les distinguer.
L'idée maîtresse : les fournisseurs ont scindé un robot Web en trois — un qui entraîne, un qui va chercher la page quand un utilisateur pose une question, un qui indexe pour la recherche. Un fichier rédigé avant cette scission nomme l'agent d'entraînement et rate les deux qui déterminent si un assistant peut vous atteindre et vous citer. Rien ne casse, donc rien ne vous prévient.
Ce qui a réellement changé
Les fournisseurs ont scindé un robot Web en trois, et pour une raison qui devient évidente une fois qu'on la voit : les trois fonctions ont des conséquences véritablement différentes pour un propriétaire de site, alors ils ont donné à chacune sa propre commande.
La documentation d'Anthropic énonce le motif le plus clairement. Elle décrit « the three robots that Anthropic uses » et les sépare par fonction (Anthropic, 2026) :
- ClaudeBot recueille du contenu Web susceptible de contribuer à l'entraînement des modèles.
- Claude-User s'exécute quand une personne pose une question à Claude. La description que fait Anthropic de l'effet d'une désactivation est la phrase importante : cela « prevents our system from retrieving your content in response to a user query, which may reduce your site's visibility for user-directed web search » (Anthropic, 2026).
- Claude-SearchBot indexe le contenu pour la qualité des résultats de recherche.
Amazon documente la même scission en trois — Amazonbot, Amzn-SearchBot, Amzn-User — et précise explicitement qu'il s'agit de commandes distinctes : « Each user agent setting is independent of the others » (Amazon, 2026). Amzn-User « supports user actions, such as responding to Alexa queries that require up-to-date information » (Amazon, 2026).
Meta documente quatre robots Web plutôt que trois, et le quatrième correspond au cas agentique. Meta-WebIndexer « navigates the web to improve Meta AI search result quality for users »; Meta-ExternalFetcher « fetches individual links at a user's request and supports product functions such as evaluating and improving agentic AI capabilities » (Meta, 2026).
OpenAI exploite GPTBot pour l'entraînement, OAI-SearchBot pour la recherche et ChatGPT-User pour les récupérations amorcées par l'utilisateur, plus OAI-AdsBot pour les pages de destination publicitaires (OpenAI, 2026) — mais sa réponse sur la deuxième fonction n'est pas celle d'Anthropic, et l'écart est ce que la page a de plus utile. OpenAI énonce que « ChatGPT-User is not used for crawling the web in an automatic fashion. Because these actions are initiated by a user, robots.txt rules may not apply » (OpenAI, 2026). Pour le volet recherche, l'entreprise oriente les propriétaires ailleurs et recommande OAI-SearchBot comme agent à utiliser dans robots.txt pour gérer les exclusions de la recherche et l'exploration automatique (OpenAI, 2026). Anthropic présente Claude-User comme un agent que votre fichier régit bel et bien, et prévient que le désactiver réduit votre visibilité. Les mêmes trois fonctions; deux fournisseurs, deux réponses différentes à la question de savoir si votre fichier régit la deuxième.
Perplexity exploite PerplexityBot et Perplexity-User (Perplexity, 2026). DuckDuckGo a ajouté DuckAssistBot à côté de DuckDuckBot (DuckDuckGo, 2026). Apple exploite Applebot et Applebot-Extended (Apple, 2026).
Trois fonctions. Entraîner, aller chercher pour un utilisateur, indexer pour la recherche. Une fois la forme connue, on peut lire la page de n'importe quel fournisseur en trente secondes et dire laquelle des trois on a nommée.
La mauvaise lecture
La plupart des gens qui remarqueront ceci en tireront la même conclusion que moi au départ : ajouter les noms manquants à la liste d'autorisation. C'est la mauvaise lecture, et elle compte parce qu'elle vous oriente vers le mauvais fichier.
Si votre robots.txt est un fichier permissif — User-agent: * avec Allow: / et quelques chemins privés interdits — alors les agents que vous n'avez pas nommés n'ont jamais été bloqués. Le caractère générique leur accordait déjà exactement ce que les blocs nommés accordaient. Le mien était de ceux-là. Le préjudice pratique était nul. Ce que j'avais, c'était une défaillance d'entretien déguisée en défaillance technique.
Le fichier qui vous coûte réellement quelque chose est celui qui contient un Disallow.
Prenons un site qui a décidé, raisonnablement, de tenir son contenu à l'écart de l'entraînement des modèles tout en restant visible dans la recherche par IA. En 2024, cela tenait en une ligne par fournisseur : interdire ClaudeBot, interdire GPTBot, laisser le reste tranquille. Aujourd'hui, ce même fichier bloque l'entraînement et autorise les deux agents de récupération — ce que son auteur voulait, par chance.
Inversons maintenant. Un site qui voulait stopper tout le trafic d'IA a écrit Disallow: / pour ClaudeBot et GPTBot et a considéré l'affaire réglée. Ce fichier bloque désormais l'entraînement et autorise Claude-User, Claude-SearchBot, ChatGPT-User et OAI-SearchBot — la scission en trois a déplacé deux des trois fonctions hors de la règle que son auteur avait écrite. L'intention et l'instruction se sont dissociées, silencieusement, et le fichier a toujours l'air délibéré.
Les deux sites ont un fichier qui se lit comme réfléchi. Un seul dit encore ce que son auteur voulait dire. Ni l'un ni l'autre propriétaire n'a moyen de le savoir de l'extérieur, parce qu'un robots.txt ne signale jamais ce qu'il n'a pas réussi à apparier.
Google explique pourquoi l'inspection des journaux ne suffit pas
Le contournement évident consiste à sauter la documentation et à lire ses journaux d'accès : quels que soient les agents d'utilisateur qui s'y présentent, nommer ceux-là. Cette méthode échoue sur Google, et Google n'est pas une petite exception.
La documentation de Google énonce clairement que « Google-Extended doesn't have a separate HTTP request user agent string » (Google, 2026). C'est un jeton de commande pour robots.txt et rien d'autre — l'exploration se fait sous les agents d'utilisateur Google existants, et le jeton régit l'utilisation du contenu pour l'ancrage de Gemini et de Vertex AI. Il n'apparaîtra jamais dans un fichier journal, parce que rien ne l'envoie jamais.
La méthode d'inspection des journaux renvoie donc une liste à laquelle manque le seul jeton qui commande l'utilisation de votre contenu par les produits d'IA de Google. Une méthode qui a l'air empirique, qui donne une réponse assurée et qui ne peut pas voir ce que vous vérifiiez est pire qu'aucune méthode — elle met la question à la retraite.
Le même piège se trouve un cran plus bas, et il est tendu précisément pour les lecteurs attentifs. Google-Extended ne figure pas du tout sur la page d'aperçu des robots Web de Google — il est documenté sur la page des robots à cas particuliers. Ne lisez que l'aperçu, comme le ferait toute personne raisonnable, et les indices disent qu'il a été retiré : une récupération réussie, une réponse assurée, et rien nulle part pour signaler l'écart. C'est exactement pourquoi la vérification doit porter sur un ensemble de pages nommées plutôt que sur une recherche.
Ce que j'ai trouvé en les vérifiant tous
La question intéressante était de savoir si Anthropic faisait exception. Non — la même forme est apparue chez quatre des onze fournisseurs, et dans chaque cas le nom reporté était le robot d'entraînement :
| Fournisseur | Documenté au 2026-08-24 | Ce que mon fichier nommait |
|---|---|---|
| Amazon | Amazonbot, Amzn-SearchBot, Amzn-User |
Amazonbot |
| Meta | Meta-ExternalAgent, Meta-ExternalFetcher, Meta-WebIndexer, facebookexternalhit |
Meta-ExternalAgent, plus FacebookBot |
| DuckDuckGo | DuckDuckBot, DuckAssistBot |
DuckDuckBot |
Googlebot, Google-Extended, GoogleOther, Google-CloudVertexBot, Google-Agent, Google-NotebookLM |
Googlebot, Google-Extended |
Dans chacun des quatre cas, le nom reporté était le robot d'entraînement et les absents étaient les deux qui déterminent si un assistant peut atteindre et citer le site. Ce ne sont pas quatre coïncidences. C'est une seule restructuration sectorielle, arrivée discrètement et à des moments différents sur onze pages de documentation distinctes.
FacebookBot mérite sa propre phrase. Il ne figure nulle part dans la documentation actuelle de Meta sur ses robots Web, qui en énumère quatre et ne l'inclut pas. Il fait exactement ce que font anthropic-ai et Claude-Web dans un fichier de 2024 : occuper une ligne, n'apparier rien, et donner au fichier l'air d'être à jour.
Un nom de la liste n'a aucune documentation de fournisseur. ByteDance ne publie aucune page sur ses robots Web que j'aie pu atteindre — developer.bytedance.com renvoie un 404 et bytespider.bytedance.com ne se résout pas — de sorte que Bytespider n'est attesté que par des projets communautaires. Il reste, avec l'exception inscrite dans le fichier à côté — un nom non documenté qu'on a décidé de garder n'est pas la même chose qu'un nom que personne n'a examiné.
Pourquoi cela se dégrade sans que rien ne vous prévienne
Tous les modes de défaillance ici partagent une propriété : l'artefact continue de fonctionner pendant qu'il cesse d'être vrai.
Un robot Web bloqué produit des symptômes. Une chaîne d'agent d'utilisateur périmée n'en produit aucun. Elle n'apparie aucune requête, ne figure dans aucun journal, ne déclenche aucune alerte, et laisse un fichier qui se lit comme soigneusement entretenu. Le seul instrument qui la détecte consiste à relire la documentation du fournisseur et à comparer — et c'est une tâche que personne ne planifie, parce qu'aucun événement ne la déclenche.
La documentation des fournisseurs bouge aussi. Des onze pages que j'ai vérifiées, trois avaient déménagé : la documentation de Google vers un nouveau chemin, celle de Perplexity vers une autre section, celle d'Anthropic de support.anthropic.com vers support.claude.com. Les trois se résolvent toujours par des redirections, de sorte qu'une vérification de liens réussit et qu'un signet fonctionne toujours. Les noms d'agents n'avaient pas changé dans ces trois cas — mais un processus qui traite « le lien fonctionne encore » comme « le contenu est à jour » n'en aurait rien su dans un sens comme dans l'autre.
Deux des onze pages ne s'affichent pas sans JavaScript. La page de Bing sur ses robots Web renvoie une coquille JavaScript dont le texte extractible fait environ quatre-vingt-dix caractères; celle de Meta renvoie un HTTP 400 à un agent d'utilisateur de navigateur, de façon reproductible. Cherchez une chaîne d'agent d'utilisateur dans l'un ou l'autre résultat et vous obtenez zéro correspondance, ce qui se lit exactement comme ce fournisseur ne documente aucun robot Web. La distinction n'est pas mince. Une récupération ratée et un sujet vide produisent une sortie identique, et une seule des deux constitue un constat.
Comment Sagentix traite la question
La vérification s'exécute comme un registre et un calendrier plutôt que comme une intention. Chaque chaîne d'agent, sa fonction, la page du fournisseur qui la documente, et un jeton témoin qui prouve qu'une récupération a réellement fonctionné — parce qu'une récupération ratée ne doit jamais se lire comme une absence. Une tâche hebdomadaire relit les onze pages et signale les écarts : agents qui ne sont plus documentés, nouveaux noms de forme agentique sur la page, documentation qui a déménagé, et tout écart entre ce que documentent les fournisseurs et ce que dit le fichier du site. Elle reste silencieuse lors d'une semaine sans changement et notifie en cas de changement.
C'est la même discipline probante qui s'applique à chaque livrable client — 1 412 artefacts de PI organisés derrière une grille de contrôle qualité à 22 points, un mandat de 6 à 8 semaines, de 4 000 à 50 000 $ CA, avec une garantie de remboursement à la phase 1 (sous réserve des modalités). L'audit numérique de la phase 09 traite la configuration de récupération par IA comme une observation datée assortie d'un intervalle de revérification, et non comme une correction ponctuelle, précisément pour la raison qui justifie ce billet Sagentix Phase 09 Digital Audit, 2026.
La leçon générale est celle qu'il faut retenir, et elle ne porte pas sur robots.txt. L'expertise produit un artefact correct le jour où il est rédigé. Rien dans l'expertise ne maintient cet artefact correct pendant que ce qu'il décrit se déplace sous lui. Seule une relecture planifiée le fait — et c'est pourquoi le livrable intéressant ici n'a jamais été le fichier corrigé. C'est la tâche hebdomadaire qui rattrapera le prochain changement, et celui d'après.
Trois choses à faire de ceci
Lisez votre propre fichier en fonction des trois fonctions, et non des noms de fournisseurs. Ouvrez votredomaine.com/robots.txt sur votre téléphone. Pour chaque fournisseur que vous avez nommé, demandez-vous laquelle des trois fonctions — entraîner, aller chercher pour un utilisateur, indexer pour la recherche — vous avez traitée. Si vous avez nommé une seule chaîne, vous avez probablement traité une seule fonction. Vingt minutes, sans outil, sans abonnement. Si vous avez la moindre ligne Disallow, faites-le aujourd'hui plutôt que ce trimestre — c'est le fichier où l'intention et l'instruction se dissocient.
Inscrivez une relecture au calendrier, chaque trimestre. Les noms changent au rythme des fournisseurs, pas au vôtre, et rien de cette dégradation n'est observable de votre côté. Un rappel récurrent de relire les onze pages vaut mieux que n'importe quel soin pris une seule fois. Récupérez la page de chaque fournisseur avec un véritable agent d'utilisateur de navigateur, et confirmez que chaque récupération a renvoyé du contenu réel avant de conclure à quoi que ce soit de manquant.
Ou faites-le auditer dans le cadre d'un diagnostic plus large, ce que fait l'audit numérique de la phase 09 — avec la réserve permanente que l'audit ne vaut que ce que vaut son intervalle de revérification. Si vous ne retenez qu'une idée de ce billet et ne me parlez jamais, retenez la première; c'est là que se trouve presque toute la valeur.
Une dernière note de portée : Sagentix conseille en stratégie de mise en marché. Je ne fournis pas de services de certification, d'audit ou de nature juridique, et rien ici n'est une voie d'accès à la vente de tels services.
References
- Amazon. (2026). Amazonbot. Amazon Developer. https://developer.amazon.com/amazonbot
- Anthropic. (2026, April 7). Does Anthropic crawl data from the web, and how can site owners block the crawler? Anthropic Help Center. https://support.claude.com/en/articles/8896518-does-anthropic-crawl-data-from-the-web-and-how-can-site-owners-block-the-crawler
- Apple. (2026). About Applebot. Apple Support. https://support.apple.com/en-us/119829
- DuckDuckGo. (2026). DuckDuckBot. DuckDuckGo Help Pages. https://duckduckgo.com/duckduckgo-help-pages/results/duckduckbot/
- Google. (2026). Google crawlers and fetchers: Special-case crawlers. Google Search Central. https://developers.google.com/crawling/docs/crawlers-fetchers/google-common-crawlers
- Meta. (2026). Web crawlers. Meta for Developers. https://developers.facebook.com/docs/sharing/webmasters/web-crawlers
- OpenAI. (2026). OpenAI bots. OpenAI Developers. https://developers.openai.com/api/docs/bots
- Perplexity. (2026). Perplexity crawlers. Perplexity Docs. https://docs.perplexity.ai/docs/resources/perplexity-crawlers
Abonnez-vous et recevez le cahier
Le cahier TAM / SAM / SOM ascendant — gratuit avec votre abonnement
Un cahier pratique de 11 pages avec des feuilles à remplir — recherche SCIAN, test SAM à trois filtres, SOM optimiste/base/pessimiste et les vérifications de contrôle préalable. Publié nulle part ailleurs. Recevez ensuite une analyse à valeur probante un mardi sur deux. Pas de pourriel, désabonnement en tout temps. Voir les anciens numéros.

Stéphane Raby
Fondateur et conseiller principal — Sagentix Advisors
CMC | CISSP | ing. | MBA exécutif Telfer (uOttawa) — classé nº 1 au monde par CEO Magazine, 2023. Plus de 25 ans en stratégie technologique, cybersécurité et conseil en management.
Vous voulez appliquer ces preuves à votre marché?
La phase 1 (Renseignement de marché) débute à 4 000 $ – 5 000 $ CA, avec garantie de remboursement.