Les robots Web d'IA se sont scindés en trois. La plupart des fichiers robots.txt n'en nomment qu'un.
Le fichier renvoie toujours un 200. Il a cessé d'être vrai en 2024.
Le 24 août 2026, j'ai procédé à une réconciliation complète de sagentix.ca/robots.txt avec ce que les fournisseurs d'IA documentent actuellement — les douze fournisseurs que le fichier nomme, page par page : OpenAI, Anthropic, Perplexity, Google, Bing, DuckDuckGo, Common Crawl, Apple, ByteDance, Meta, Amazon et Yandex. Ce qui en est ressorti n'était pas un problème de fichier. C'était un changement structurel dans le fonctionnement des fournisseurs, et le fichier a été l'instrument qui l'a rendu visible.
Le fichier nommait 20 agents d'IA, tous en Allow — 21 blocs User-Agent en comptant le caractère générique. GPTBot, ClaudeBot, PerplexityBot, Googlebot : un fichier délibéré, bien construit, et meilleur que ce que porte la plupart des sites. C'était aussi un fichier de 2024, et il nommait anthropic-ai et Claude-Web — deux chaînes qui ne figurent dans aucune documentation actuelle d'Anthropic — sans nommer ni Claude-User ni Claude-SearchBot, qui n'existaient pas au moment de sa rédaction.
Rien n'était bloqué. Aucun système de surveillance ne s'est déclenché, le fichier renvoyait un 200 et s'analysait correctement. C'est là tout le constat : un fichier correct et un fichier à jour sont deux choses différentes, et aucun instrument de votre côté ne peut les distinguer.
L'idée maîtresse : les fournisseurs ont scindé un robot Web en trois — un qui entraîne, un qui va chercher la page quand un utilisateur pose une question, un qui indexe pour la recherche. Un fichier rédigé avant cette scission nomme l'agent d'entraînement et rate les deux qui déterminent si un assistant peut vous atteindre et vous citer. Rien ne casse, donc rien ne vous prévient.
Ce qui a réellement changé
Les fournisseurs ont scindé un robot Web en trois, et pour une raison qui devient évidente une fois qu'on la voit : les trois fonctions ont des conséquences véritablement différentes pour un propriétaire de site, alors ils ont donné à chacune sa propre commande.
La documentation d'Anthropic énonce le motif le plus clairement. Elle décrit « the three robots that Anthropic uses » et les sépare par fonction (Anthropic, 2026) :
- ClaudeBot recueille du contenu Web susceptible de contribuer à l'entraînement des modèles.
- Claude-User s'exécute quand une personne pose une question à Claude. La description que fait Anthropic de l'effet d'une désactivation est la phrase importante : cela « prevents our system from retrieving your content in response to a user query, which may reduce your site's visibility for user-directed web search » (Anthropic, 2026).
- Claude-SearchBot indexe le contenu pour la qualité des résultats de recherche.
Amazon documente la même scission en trois — Amazonbot, Amzn-SearchBot, Amzn-User — et précise explicitement qu'il s'agit de commandes distinctes : « Each user agent setting is independent of the others » (Amazon, 2026). Amzn-User « supports user actions, such as responding to Alexa queries that require up-to-date information » (Amazon, 2026).
Meta documente cinq robots Web plutôt que trois, et les deux supplémentaires correspondent au cas agentique et à la publicité. Meta-WebIndexer « navigates the web to improve Meta AI search result quality for users »; Meta-ExternalFetcher « fetches individual links at a user's request and supports product functions such as evaluating and improving agentic AI capabilities » (Meta, 2026).
OpenAI exploite GPTBot pour l'entraînement, OAI-SearchBot pour la recherche et ChatGPT-User pour les récupérations amorcées par l'utilisateur, plus OAI-AdsBot pour les pages de destination publicitaires (OpenAI, 2026) — mais sa réponse sur la deuxième fonction n'est pas celle d'Anthropic, et l'écart est ce que la page a de plus utile. OpenAI énonce que « ChatGPT-User is not used for crawling the web in an automatic fashion. Because these actions are initiated by a user, robots.txt rules may not apply » (OpenAI, 2026). Pour le volet recherche, l'entreprise oriente les propriétaires ailleurs et recommande OAI-SearchBot comme agent à utiliser dans robots.txt pour gérer les exclusions de la recherche et l'exploration automatique (OpenAI, 2026). Anthropic présente Claude-User comme un agent que votre fichier régit bel et bien, et prévient que le désactiver réduit votre visibilité. Les mêmes trois fonctions; deux fournisseurs, deux réponses différentes à la question de savoir si votre fichier régit la deuxième.
Perplexity exploite PerplexityBot et Perplexity-User (Perplexity, 2026). DuckDuckGo documente DuckAssistBot à côté de DuckDuckBot (DuckDuckGo, 2026a, 2026b). Apple exploite Applebot et Applebot-Extended (Apple, 2026).
Trois fonctions. Entraîner, aller chercher pour un utilisateur, indexer pour la recherche. Une fois la forme connue, on peut lire la page de n'importe quel fournisseur en trente secondes et dire laquelle des trois on a nommée.
Trois semaines plus tard, les trois fonctions sont devenues trois commutateurs
Le 15 septembre 2026, Cloudflare a livré des commandes bâties sur la même scission en trois — et a nommé le cas que le conseil de ce billet n'atteint pas.
La taxonomie est arrivée par une autre voie. Cloudflare « classifies bots by behavior » et offre trois de ces comportements comme commandes : Search, « crawling to build a search index »; Training, « crawling to train or fine-tune a model »; et Agent, « user-directed agents visiting a page on behalf of a human, such as chat fetch bots and browser-use agents » (Becker, 2026). Entraîner, aller chercher pour un utilisateur, indexer pour la recherche — un étage plus bas dans la pile, déduit du trafic plutôt que de la documentation. Quand les fournisseurs et le réseau placé devant eux rangent les mêmes requêtes dans les mêmes trois cases, les cases sont probablement réelles.
Le même billet chiffre l'écart entre ce que l'on veut des trois fonctions. Moins de 1 % des sites Cloudflare bloquent les robots de recherche, tandis que 17 % « choose to enable some mechanism to block training » (Becker, 2026). Presque personne ne cherche à disparaître. On cherche à séparer deux choses qu'un seul fichier n'arrive souvent pas à séparer.
D'où la complication, et elle borne ce que la méthode de ce billet peut faire pour vous. Certains des plus gros robots exercent deux fonctions sous un seul nom : « A mixed-use crawler is a single crawler doing both Search and Training » (Becker, 2026). Applebot, Bingbot et Googlebot sont les cas nommés. Pour ces trois-là, aucune paire de lignes User-agent ne sépare l'entraînement de la recherche, parce qu'il n'y a pas de second nom à qui s'adresser — refusez l'un et vous refusez l'autre. Lire son fichier à l'aune des trois fonctions atteint les fournisseurs qui ont scindé leurs robots (Amazon, Anthropic, Meta, Mistral, OpenAI) et s'arrête aux trois qui ne l'ont pas fait.
Cloudflare énonce la limite plus crûment que je ne l'ai fait : « A robots.txt directive alone cannot solve this problem. Anyone can publish one, but it cannot identify who is crawling, determine why they are crawling, or stop a crawler that ignores it » (Becker, 2026). Un fichier est une requête adressée à un nom. Il ne peut pas vérifier le nom, et pour un robot à usage mixte le nom ne porte pas la distinction que vous voulez établir.
La deuxième fonction demeure la moins réglée, et quatre parties donnent maintenant quatre réponses. OpenAI dit que les règles de robots.txt peuvent ne pas s'appliquer à une récupération amorcée par l'utilisateur (OpenAI, 2026). Anthropic présente Claude-User comme un agent que votre fichier régit bel et bien, et prévient que le désactiver vous coûte en visibilité (Anthropic, 2026). Meta est la plus directe : parce que Meta-ExternalFetcher agit à la demande d'un utilisateur, « this crawler may bypass robots.txt rules » (Meta, 2026). La réponse de Cloudflare est que la question n'a pas encore d'instrument — « the Internet does not yet have a well-established directive for expressing Disallow preferences to agents » — alors elle ne livre aucun réglage Disallow pour les agents et renvoie à la norme émergente ai-prefs (Becker, 2026). La fonction qui s'exécute quand un acheteur interroge un assistant à votre sujet est celle dont la mécanique est la moins arrêtée et la portée commerciale la plus grande.
La mauvaise lecture
La plupart des gens qui remarqueront ceci en tireront la même conclusion que moi au départ : ajouter les noms manquants à la liste d'autorisation. C'est la mauvaise lecture, et elle compte parce qu'elle vous oriente vers le mauvais fichier.
Si votre robots.txt est un fichier permissif — User-agent: * avec Allow: / et quelques chemins privés interdits — alors les agents que vous n'avez pas nommés n'ont jamais été bloqués. Le caractère générique leur accordait déjà exactement ce que les blocs nommés accordaient. Le mien était de ceux-là. Le préjudice pratique était nul. Ce que j'avais, c'était une défaillance d'entretien déguisée en défaillance technique.
Le fichier qui vous coûte réellement quelque chose est celui qui contient un Disallow.
Prenons un site qui a décidé, raisonnablement, de tenir son contenu à l'écart de l'entraînement des modèles tout en restant visible dans la recherche par IA. En 2024, cela tenait en une ligne par fournisseur : interdire ClaudeBot, interdire GPTBot, laisser le reste tranquille. Aujourd'hui, ce même fichier bloque l'entraînement et autorise les deux agents de récupération — ce que son auteur voulait, par chance.
Inversons maintenant. Un site qui voulait stopper tout le trafic d'IA a écrit Disallow: / pour ClaudeBot et GPTBot et a considéré l'affaire réglée. Ce fichier bloque désormais l'entraînement et autorise Claude-User, Claude-SearchBot, ChatGPT-User et OAI-SearchBot — la scission en trois a déplacé deux des trois fonctions hors de la règle que son auteur avait écrite. L'intention et l'instruction se sont dissociées, silencieusement, et le fichier a toujours l'air délibéré.
Les deux sites ont un fichier qui se lit comme réfléchi. Un seul dit encore ce que son auteur voulait dire. Ni l'un ni l'autre propriétaire n'a moyen de le savoir de l'extérieur, parce qu'un robots.txt ne signale jamais ce qu'il n'a pas réussi à apparier.
Google explique pourquoi l'inspection des journaux ne suffit pas
Le contournement évident consiste à sauter la documentation et à lire ses journaux d'accès : quels que soient les agents d'utilisateur qui s'y présentent, nommer ceux-là. Cette méthode échoue sur Google, et Google n'est pas une petite exception.
La documentation de Google énonce clairement que « Google-Extended doesn't have a separate HTTP request user agent string » (Google, 2026a). C'est un jeton de commande pour robots.txt et rien d'autre — l'exploration se fait sous les agents d'utilisateur Google existants, et le jeton régit l'utilisation du contenu pour l'ancrage de Gemini et de Vertex AI. Il n'apparaîtra jamais dans un fichier journal, parce que rien ne l'envoie jamais.
La méthode d'inspection des journaux renvoie donc une liste à laquelle manque le seul jeton qui commande l'utilisation de votre contenu par les produits d'IA de Google. Une méthode qui a l'air empirique, qui donne une réponse assurée et qui ne peut pas voir ce que vous vérifiiez est pire qu'aucune méthode — elle met la question à la retraite.
Le même piège se trouve un cran plus bas, et il m'a attrapé. Google-Extended ne figure pas du tout sur la page d'aperçu des robots Web de Google — il est documenté sur la page des robots Web courants. La première version de ce billet indiquait la page des robots à cas particuliers, que j'avais déduite sans jamais l'ouvrir; cette page n'en fait aucune mention. Ne lisez que l'aperçu, comme le ferait toute personne raisonnable, et les indices disent que le jeton a été retiré : une récupération réussie, une réponse assurée, et rien nulle part pour signaler l'écart. J'ai commis cette erreur même dans le paragraphe qui met en garde contre elle, ce qui est la meilleure preuve que je puisse offrir que la vérification doit porter sur un ensemble de pages nommées plutôt que sur une recherche.
Ce que j'ai trouvé en les vérifiant tous
La question intéressante était de savoir si Anthropic faisait exception. Non : cinq fournisseurs documentent une véritable scission en trois — Anthropic, OpenAI, Amazon, Meta et Mistral. Une question distincte et plus étroite était de savoir où mon propre fichier avait pris du retard, et c'était quatre fournisseurs. Les deux comptes ne mesurent pas la même chose, et la première version de ce billet les présentait comme un seul. Mistral est le plus net des cinq, parce que sa page dit ce que chaque jeton n'est pas : MistralAI-Training n'est « not used for search indexing or to answer live user queries », MistralAI-User n'est « not used for crawling the web in any automatic fashion, nor to crawl content for generative AI training », et MistralAI-Index sert « indexing purposes only » et n'est « not used for generative AI training of any kind » (Mistral AI, 2026). Voici où mon propre fichier avait pris du retard :
| Fournisseur | Documenté au 2026-08-24 | Ce que mon fichier nommait |
|---|---|---|
| Amazon | Amazonbot, Amzn-SearchBot, Amzn-User |
Amazonbot |
| Meta | Meta-ExternalAgent, Meta-ExternalFetcher, Meta-WebIndexer, facebookexternalhit |
Meta-ExternalAgent, plus FacebookBot |
| DuckDuckGo | DuckDuckBot, DuckAssistBot |
DuckDuckBot |
Googlebot, Google-Extended, GoogleOther, Google-CloudVertexBot (page des robots courants); Google-Agent, Google-GeminiNotebook (page des récupérateurs déclenchés par l'utilisateur; Google, 2026b) — une sélection, et non l'ensemble de Google |
Googlebot, Google-Extended |
Le motif n'est pas uniforme, et le dire compte davantage que la version bien rangée. Chez Amazon, le nom reporté était le robot d'entraînement et deux agents de récupération étaient absents. Google est le cas inverse : Google-Extended, le contrôle d'entraînement, était nommé, et les récupérateurs déclenchés par l'utilisateur ne l'étaient pas. DuckDuckGo ne documente aucun robot d'entraînement — DuckDuckBot est un robot de recherche, et au sujet de DuckAssistBot l'entreprise écrit « This data is not used in any way to train AI models » (DuckDuckGo, 2026b). Ce que les quatre ont en commun, c'est un écart entre ce que le fournisseur documente et ce que le fichier nommait; ce qui remplit l'écart diffère d'un fournisseur à l'autre.
FacebookBot mérite sa propre phrase. Il ne figure nulle part dans la documentation actuelle de Meta sur ses robots Web, qui en énumère cinq et ne l'inclut pas. Il fait exactement ce que font anthropic-ai et Claude-Web dans un fichier de 2024 : occuper une ligne, n'apparier rien, et donner au fichier l'air d'être à jour.
Un nom de la liste, je l'ai eu faux, et la façon dont je l'ai eu faux est tout le propos de ce billet. J'ai écrit que ByteDance ne publiait aucune page sur ses robots Web que j'aie pu atteindre : developer.bytedance.com renvoie un 404 et bytespider.bytedance.com ne se résout pas, ce qui est exact dans les deux cas. La conclusion, elle, ne suit pas. ByteDance documente Bytespider sur sa plateforme pour webmestres Toutiao, à zhanzhang.toutiao.com/docs/intro/26899, qui renvoie un 200 depuis l'Amérique du Nord — et y décrit un robot de recherche : explorer la page, la traiter, servir la recherche. Le mot 训练, entraînement, n'y figure nulle part. Le secteur qualifie Bytespider de robot d'entraînement pour l'IA; la seule documentation de ByteDance ne le fait pas (ByteDance, 2026). J'avais restreint ma recherche à une seule famille de noms d'hôtes et lu une absence comme un constat, soit exactement la défaillance contre laquelle la section précédente met en garde.
Pourquoi cela se dégrade sans que rien ne vous prévienne
Tous les modes de défaillance ici partagent une propriété : l'artefact continue de fonctionner pendant qu'il cesse d'être vrai.
Un robot Web bloqué produit des symptômes. Une chaîne d'agent d'utilisateur périmée n'en produit aucun. Elle n'apparie aucune requête, ne figure dans aucun journal, ne déclenche aucune alerte, et laisse un fichier qui se lit comme soigneusement entretenu. Le seul instrument qui la détecte consiste à relire la documentation du fournisseur et à comparer — et c'est une tâche que personne ne planifie, parce qu'aucun événement ne la déclenche.
La documentation des fournisseurs bouge aussi. Des douze pages, trois avaient déménagé : la documentation de Google vers un nouveau chemin, celle de Perplexity vers une autre section, celle d'Anthropic de support.anthropic.com vers support.claude.com. Les trois se résolvent toujours par des redirections, de sorte qu'une vérification de liens réussit et qu'un signet fonctionne toujours. Les noms d'agents n'avaient pas changé dans ces trois cas — mais un processus qui traite « le lien fonctionne encore » comme « le contenu est à jour » n'en aurait rien su dans un sens comme dans l'autre.
Deux des pages déjouent une récupération naïve, par des mécanismes différents. La page de Bing sur ses robots Web renvoie une coquille JavaScript dont le texte extractible tient en une ligne — le titre de la page — alors que la réponse brute fait 125 Ko et contient bingbot quarante fois dans une charge utile de script (Microsoft, 2026). Celle de Meta renvoie un HTTP 400 à un agent d'utilisateur de navigateur, de façon reproductible, et la cause n'est pas l'affichage : envoyez un agent d'utilisateur Googlebot et la même adresse renvoie 324 Ko de HTML rendu côté serveur, avec les cinq noms de robots. Cherchez une chaîne d'agent d'utilisateur dans le texte extrait de l'un ou l'autre résultat et vous obtenez zéro correspondance, ce qui se lit exactement comme ce fournisseur ne documente aucun robot Web. La distinction n'est pas mince. Une récupération ratée et un sujet vide produisent une sortie identique, et une seule des deux constitue un constat.
La défaillance plus récente : le fichier change sans que vous y touchiez
Tout ce qui précède décrit un fichier resté immobile pendant que le Web bougeait. La même livraison de Cloudflare introduit le cas inverse, et il a sa place dans la vérification : un robots.txt qui change sans que son propriétaire le modifie.
Managed robots.txt ne conseille pas. Il écrit. Là où un site possède déjà un fichier, « Cloudflare will prepend our managed robots.txt before your existing robots.txt, combining both into a single response »; là où il n'en a pas, « Cloudflare creates a new file with managed Disallow rules for known AI crawlers and serves it for you » (Cloudflare, 2026). La nouvelle commande Training fonctionne de la même façon : Disallow AI Training « is named for the Disallow: directive it publishes in your robots.txt », et Bot Preference Sync « publishes the applicable no-training preference in robots.txt » (Becker, 2026).
Le fichier qu'un robot lit à votre domaine, c'est donc votre fichier plus ce que le réseau placé devant lui a ajouté en tête. Lire la copie de votre dépôt ne vous dit plus ce que vous publiez. Cela change la méthode d'une ligne — récupérez le fichier servi en HTTPS, comme le fait un robot, et lisez celui-là.
Le mécanisme est lui-même en cours de remplacement. « Managed Robots.txt will be deprecated in favor of Bot Preference Sync. Customers who enabled Managed Robots.txt will migrate to the new system » (Becker, 2026). Cette migration suit le calendrier de Cloudflare, pas celui du propriétaire du site.
Un réglage a changé de sens au passage, ce qui est la thèse de ce billet habillée en tableau de bord plutôt qu'en fichier texte. Block et « Block on pages with ads » « previously did not apply to mixed-use crawlers because blocking them could also affect search discoverability »; ils « apply to all training crawlers, including mixed-use crawlers » désormais (Becker, 2026). Aucun comportement en production n'a basculé — un réglage Training à Block migre vers Disallow AI Training, ce qui en préserve l'effet pratique (Becker, 2026). Mais le mot n'est plus le mot qu'il était. Un guide d'exploitation qui dit mettre Training à Block pointe maintenant ailleurs que le 14 septembre, et Cloudflare dit exactement où : « It will stop Applebot, Bingbot, and Googlebot from reaching your site — search included » (Becker, 2026).
Le cas le plus net figure dans la même annonce. Chez Microsoft, la prise en charge du refus d'entraînement au niveau de robots.txt est encore en construction, visée pour le début de 2027, de sorte que « until that support launches, selecting Disallow AI Training will not automatically convey a no-training preference to Bing through robots.txt » (Becker, 2026). Une commande nommée d'après un résultat, correctement configurée, qui signale un succès — et qui ne produit pas encore ce résultat chez l'un des trois robots pour lesquels elle existe. Cloudflare publie la réserve dans le billet de lancement, ce qui est la bonne façon de livrer. Cela reste un nom qui décrit une destination plutôt qu'un état.
Comment Sagentix traite la question
La vérification s'exécute comme un registre et un calendrier plutôt que comme une intention. Chaque chaîne d'agent, sa fonction, la page du fournisseur qui la documente, et un jeton témoin qui prouve qu'une récupération a réellement fonctionné — parce qu'une récupération ratée ne doit jamais se lire comme une absence. Une tâche hebdomadaire relit les treize pages de fournisseurs et signale les écarts : agents qui ne sont plus documentés, nouveaux noms de forme agentique sur la page, documentation qui a déménagé, et tout écart entre ce que documentent les fournisseurs et ce que dit le fichier du site. Elle reste silencieuse lors d'une semaine sans changement et notifie en cas de changement.
Elle justifie sa place les semaines comme celle-ci. Relancée le 16 septembre 2026 sur le fichier même que ce billet a corrigé, elle a signalé une dérive. La page des récupérateurs déclenchés par l'utilisateur de Google inscrit désormais Google-NotebookLM comme « Former agent (supported until August 2026) » et documente Google-GeminiNotebook à sa place (Google, 2026b). Le registre portait encore le nom retiré : il a donc lu l'agent courant comme inconnu et réclamé le nom mort — l'instrument chargé de repérer les chaînes d'agent périmées s'était lui-même périmé, vingt-trois jours après la parution de ce billet. La même exécution a montré Mistral nommé dans le fichier du site et dans cet article, mais absent du registre : personne ne surveillait le fournisseur décrit ici comme le plus net des cinq. La même exécution a constaté que la page de Meta sur ses robots Web avait déménagé de /docs/ vers /documentation/, et l'ancien chemin redirige toujours — aucune vérification de liens ne l'aurait donc jamais signalé. Les trois sont corrigés depuis le 16 septembre 2026. C'est l'argument en faveur de la cadence, et la cadence le défend mieux que n'importe quelle affirmation de ma part.
C'est la même discipline probante qui s'applique à chaque livrable client — 1 425 artefacts de PI organisés derrière une grille de contrôle qualité à 18 vérifications, un mandat de 6 à 8 semaines, de 4 500 à 45 000 $ CA, avec une garantie de remboursement à la phase 1 (sous réserve des modalités). L'audit numérique de la phase 09 traite la configuration de récupération par IA comme une observation datée assortie d'un intervalle de revérification, et non comme une correction ponctuelle, précisément pour la raison qui justifie ce billet Sagentix Phase 09 Digital Audit, 2026.
La leçon générale est celle qu'il faut retenir, et elle ne porte pas sur robots.txt. L'expertise produit un artefact correct le jour où il est rédigé. Rien dans l'expertise ne maintient cet artefact correct pendant que ce qu'il décrit se déplace sous lui. Seule une relecture planifiée le fait — et c'est pourquoi le livrable intéressant ici n'a jamais été le fichier corrigé. C'est la tâche hebdomadaire qui rattrapera le prochain changement, et celui d'après.
Trois choses à faire de ceci
Lisez votre propre fichier en fonction des trois fonctions, et non des noms de fournisseurs. Ouvrez votredomaine.com/robots.txt sur votre téléphone — le fichier servi, et non la copie de votre dépôt, parce que le réseau placé devant vous y ajoute peut-être des lignes en tête. Pour chaque fournisseur que vous avez nommé, demandez-vous laquelle des trois fonctions — entraîner, aller chercher pour un utilisateur, indexer pour la recherche — vous avez traitée. Si vous avez nommé une seule chaîne, vous avez probablement traité une seule fonction. Pour Applebot, Bingbot et Googlebot, posez une autre question : ce sont des robots à usage mixte, donc la séparation que vous cherchez est un réglage à la périphérie du réseau plutôt qu'une ligne dans le fichier (Becker, 2026). Vingt minutes, sans outil, sans abonnement. Si vous avez la moindre ligne Disallow, faites-le aujourd'hui plutôt que ce trimestre — c'est le fichier où l'intention et l'instruction se dissocient.
Inscrivez une relecture au calendrier, chaque trimestre. Les noms changent au rythme des fournisseurs, pas au vôtre, et rien de cette dégradation n'est observable de votre côté. Un rappel récurrent de relire les pages des fournisseurs, nommées une à une plutôt que comptées, vaut mieux que n'importe quel soin pris une seule fois. Récupérez la page de chaque fournisseur avec un véritable agent d'utilisateur de navigateur, et confirmez que chaque récupération a renvoyé du contenu réel avant de conclure à quoi que ce soit de manquant.
Ou faites-le auditer dans le cadre d'un diagnostic plus large, ce que fait l'audit numérique de la phase 09 — avec la réserve permanente que l'audit ne vaut que ce que vaut son intervalle de revérification. Si vous ne retenez qu'une idée de ce billet et ne me parlez jamais, retenez la première; c'est là que se trouve presque toute la valeur.
Une dernière note de portée : Sagentix conseille en stratégie de mise en marché. Je ne fournis pas de services de certification, d'audit ou de nature juridique, et rien ici n'est une voie d'accès à la vente de tels services.
References
- Amazon. (2026). Amazonbot. Amazon Developer. https://developer.amazon.com/amazonbot
- Anthropic. (2026, April 7). Does Anthropic crawl data from the web, and how can site owners block the crawler? Anthropic Help Center. https://support.claude.com/en/articles/8896518-does-anthropic-crawl-data-from-the-web-and-how-can-site-owners-block-the-crawler
- Apple. (2026). About Applebot. Apple Support. https://support.apple.com/en-us/119829
- Becker, B. (2026, September 15). Have it both ways: stay discoverable in search while disallowing AI training. Cloudflare Blog. https://blog.cloudflare.com/accountable-mixed-use-ai-crawlers/
- ByteDance. (2026). 关于Bytespider [About Bytespider]. Toutiao Webmaster Platform. https://zhanzhang.toutiao.com/docs/intro/26899
- Cloudflare. (2026). Managed robots.txt. Cloudflare Docs. https://developers.cloudflare.com/bots/additional-configurations/managed-robots-txt/
- DuckDuckGo. (2026a). DuckDuckBot. DuckDuckGo Help Pages. https://duckduckgo.com/duckduckgo-help-pages/results/duckduckbot/
- DuckDuckGo. (2026b). DuckAssistBot. DuckDuckGo Help Pages. https://duckduckgo.com/duckduckgo-help-pages/results/duckassistbot/
- Google. (2026a). Google crawlers and fetchers: Google's common crawlers. Google Search Central. https://developers.google.com/crawling/docs/crawlers-fetchers/google-common-crawlers
- Google. (2026b). Google crawlers and fetchers: User-triggered fetchers. Google Search Central. https://developers.google.com/crawling/docs/crawlers-fetchers/google-user-triggered-fetchers
- Meta. (2026). Web crawlers. Meta for Developers. https://developers.facebook.com/docs/sharing/webmasters/web-crawlers (returns HTTP 400 to a browser user-agent; serves the full page to a Googlebot user-agent)
- Microsoft. (2026). Which crawlers does Bing use? Bing Webmaster Tools Help. https://www.bing.com/webmasters/help/which-crawlers-does-bing-use-8c184ec0
- Mistral AI. (2026). Robots. Mistral AI Documentation. https://docs.mistral.ai/robots
- OpenAI. (2026). OpenAI bots. OpenAI Developers. https://developers.openai.com/api/docs/bots
- Perplexity. (2026). Perplexity crawlers. Perplexity Docs. https://docs.perplexity.ai/docs/resources/perplexity-crawlers
Abonnez-vous et recevez le cahier
Le cahier TAM / SAM / SOM ascendant — gratuit avec votre abonnement
Un cahier pratique de 11 pages avec des feuilles à remplir — recherche SCIAN, test SAM à trois filtres, SOM optimiste/base/pessimiste et les vérifications de contrôle préalable. Publié nulle part ailleurs. Recevez ensuite une analyse à valeur probante un mardi sur deux. Pas de pourriel, désabonnement en tout temps. Voir les anciens numéros.

Stéphane Raby
Fondateur et conseiller principal — Sagentix Advisors
CMC | CISSP | ing. | MBA exécutif Telfer (uOttawa) — classé nº 1 au monde par CEO Magazine, 2023. Plus de 25 ans en stratégie technologique, cybersécurité et conseil en management.
Vous voulez appliquer ces preuves à votre marché?
La phase 1 (Renseignement de marché) débute à 4 500 $ CA, avec garantie de remboursement.