Vous êtes une entreprise ?
Ordiama, c'est aussi une agence IA à Strasbourg : on crée votre site, on vous rend visible dans l'IA et on automatise vos tâches.
Vous avez entendu parler de GPTBot, de Google-Extended, de ClaudeBot. Peut-etre qu’un prestataire vous a conseille de « tout bloquer pour proteger votre contenu ». Peut-etre au contraire qu’on vous a dit de « tout ouvrir pour etre visible dans ChatGPT ». Les deux camps ont tort, parce qu’ils traitent une question a deux etages comme si elle n’en avait qu’un.
Le vrai dilemme du dirigeant est le suivant. Autoriser ces robots, c’est laisser votre contenu nourrir l’entrainement des IA, mais aussi le rendre citable dans leurs reponses, donc visible. Les bloquer, c’est proteger la valeur que vous produisez, mais au risque de disparaitre des reponses que des millions de gens consultent chaque jour. Ce guide vous donne les noms exacts, les commandes verifiees pour autoriser ou bloquer chaque robot, et un cadre de decision selon que vous etes un media, un e-commerce ou une entreprise de service.
Reponse directe. Il n’y a pas de reponse unique, mais il y a une cle : les robots d’entrainement sont separes des robots de citation. Vous pouvez bloquer les robots qui aspirent votre contenu pour entrainer les modeles (GPTBot, ClaudeBot, CCBot, et Google-Extended pour Gemini) tout en laissant passer ceux qui vous citent dans les reponses (OAI-SearchBot pour ChatGPT, Claude-SearchBot, PerplexityBot, et Googlebot pour les AI Overviews). Le blocage se fait dans un fichier
robots.txta la racine de votre site. Attention : ce fichier est un signal volontaire, respecte par les robots serieux, ignore par les scrapers, et contourne par les recuperations declenchees par un utilisateur (ChatGPT-User, Perplexity-User).
Un robot d’IA n’a pas un seul usage. C’est la source de presque toutes les erreurs sur ce sujet. Un meme editeur, comme OpenAI ou Anthropic, fait tourner plusieurs robots distincts, chacun avec un nom different et un role different. Les melanger, c’est prendre le risque de bloquer votre visibilite en croyant proteger votre contenu, ou l’inverse.
Il y a trois grands usages a distinguer.
La consequence est directe. La question n’est pas « je bloque ou j’ouvre », mais « je bloque quoi, et je laisse passer quoi ». Cette distinction rejoint ce que nous expliquons dans notre guide du GEO, l’optimisation pour etre cite par les moteurs generatifs : etre visible dans les reponses des IA est devenu un canal a part entiere.
Voici les cinq acteurs cites dans votre question, plus les robots de citation associes que la plupart des guides oublient. Les noms sont les identifiants exacts a utiliser dans robots.txt, verifies sur les documentations officielles en juillet 2026.
| Robot (user-agent) | Editeur | A quoi il sert | Respecte robots.txt ? |
|---|---|---|---|
GPTBot |
OpenAI | Entrainement des modeles (GPT) | Oui |
OAI-SearchBot |
OpenAI | Indexation pour les citations dans ChatGPT Search | Oui |
ChatGPT-User |
OpenAI | Va lire une page quand un utilisateur le demande | Recuperation a la demande de l’utilisateur |
Google-Extended |
Autorise ou non l’usage de votre contenu pour entrainer Gemini | Oui (jeton de controle, pas un robot distinct) | |
ClaudeBot |
Anthropic | Entrainement des modeles (Claude) | Oui |
Claude-SearchBot |
Anthropic | Indexation pour la qualite des reponses de recherche de Claude | Oui |
Claude-User |
Anthropic | Va lire une page quand un utilisateur de Claude le demande | Oui |
PerplexityBot |
Perplexity | Indexation pour surfacer et citer votre site dans Perplexity | Oui |
Perplexity-User |
Perplexity | Va lire une page quand un utilisateur le demande | Ignore generalement robots.txt |
CCBot |
Common Crawl | Archive publique du web, largement reutilisee pour entrainer des IA tierces | Oui |
Sources : OpenAI, « Overview of OpenAI Crawlers », consulte en juillet 2026 ; Google, « Google-Extended », consulte en juillet 2026 ; Anthropic, « Does Anthropic crawl data from the web », consulte en juillet 2026 ; Perplexity, « PerplexityBot », consulte en juillet 2026 ; Common Crawl, « CCBot », consulte en juillet 2026.
C’est le point le plus mal compris. Google-Extended n’est pas un robot separe qui parcourt votre site. C’est un simple interrupteur dans robots.txt. Il decide d’une chose : est-ce que le contenu que Google a deja recolte peut servir a entrainer les modeles Gemini et a alimenter certaines applications Gemini.
A retenir. Bloquer
Google-Extendedn’a aucun effet sur votre presence dans Google Search, ni sur votre eligibilite aux AI Overviews. Ces derniers utilisentGooglebot, le robot classique du moteur. Vous pouvez donc refuser que votre contenu entraine Gemini tout en restant present dans le moteur et dans ses resumes IA. Google le confirme dans sa documentation.Source : Google, « Google-Extended, Google crawlers », consulte en juillet 2026.
Tout se joue dans un fichier texte nomme robots.txt, place a la racine de votre site. Son adresse est donc https://votresite.fr/robots.txt. Chaque bloc commence par le nom du robot (User-agent), suivi de ce qu’il a le droit de parcourir (Allow) ou non (Disallow). Un Disallow: / bloque tout le site, un Allow: / ouvre tout.
Voici les recettes concretes selon votre intention. La casse des noms de robots n’a pas d’importance, mais respectez l’orthographe exacte.
C’est la configuration la plus equilibree pour la plupart des sites : votre contenu ne sert pas gratuitement a entrainer les modeles, mais vous restez citable dans les reponses IA.
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
Ici, les quatre premiers blocs refusent l’entrainement. Les trois derniers laissent explicitement passer les robots de citation. Googlebot n’est pas mentionne, donc il continue son travail normal, AI Overviews compris.
Vous voulez un maximum de visibilite et l’entrainement ne vous derange pas. Le plus simple est de ne rien mettre de specifique : par defaut, un robot qui respecte robots.txt et n’y trouve aucune interdiction considere qu’il a le droit de parcourir. Si vous voulez etre explicite :
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: CCBot
Allow: /
Vous refusez a la fois l’entrainement et la citation. C’est un choix radical qui vous efface des reponses IA. A reserver aux cas ou votre contenu est votre produit (voir le cadre plus bas).
User-agent: GPTBot
Disallow: /
User-agent: OAI-SearchBot
Disallow: /
User-agent: ChatGPT-User
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Claude-SearchBot
Disallow: /
User-agent: Claude-User
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
Notez qu’un bloc pour tous les robots inconnus (User-agent: *) ne suffit pas : les grands robots d’IA cherchent d’abord leur nom exact et suivent ce bloc en priorite. Il faut donc les nommer un par un.
Apres modification, comptez jusqu’a 24 heures pour que certains editeurs prennent en compte le changement, selon les documentations d’OpenAI et de Perplexity. Si vous ne savez pas ou trouver ce fichier, la plupart des CMS et des extensions SEO permettent de l’editer sans toucher au serveur.
Soyons clairs sur les limites, car un dirigeant qui croit avoir « ferme la porte » alors qu’elle reste entrebaillee prend une mauvaise decision.
robots.txt n’empeche techniquement personne d’acceder a une page publique : il demande poliment de ne pas le faire. Pour un blocage reel, il faut agir au niveau du serveur ou d’un pare-feu, en filtrant les plages d’adresses IP que les editeurs publient.Perplexity-User ignore generalement robots.txt, car c’est un humain qui a demande la page. OpenAI decrit ChatGPT-User comme une action initiee par l’utilisateur, dans une logique differente du parcours automatique. Autrement dit, si quelqu’un colle l’adresse de votre page dans l’IA, elle pourra souvent la lire malgre votre robots.txt.CCBot. Seule la verification par adresse IP permet de distinguer le vrai du faux.Ce sujet touche aussi a la protection de vos donnees plus largement. Si la question de ce que deviennent vos informations quand elles rencontrent une IA vous preoccupe, nous la traitons en detail dans notre guide RGPD et IA : ou vont vraiment vos donnees.
Il n’y a pas de bon reglage universel. La bonne question est : votre contenu vaut-il plus en etant vu, ou en etant rare ? Voici une grille par profil.
Votre contenu est votre actif. Le laisser entrainer gratuitement des modeles qui, ensuite, repondent a votre place sans clic, c’est le dilemme central des editeurs. Mais disparaitre des reponses IA vous coupe d’un canal de visibilite qui grandit vite.
Reglage conseille : cas 1. Bloquez l’entrainement (GPTBot, ClaudeBot, CCBot, Google-Extended), gardez les robots de citation. Vous refusez de nourrir gratuitement les modeles, mais vous restez cite, avec un lien, quand une IA repond. C’est la position que de grands editeurs ont adoptee. Pour maximiser ces citations, structurez vos pages en faits atomiques, ces donnees autonomes que les IA extraient facilement.
Vos fiches produit ont un but simple : vendre. Etre cite par une IA qui recommande un produit ou compare des offres, avec un lien vers votre boutique, est une opportunite pure. Le risque d’entrainement est faible, car une fiche produit n’est pas un contenu editorial rare a proteger.
Reglage conseille : ouvrir largement, en priorite les robots de citation et de recherche. Vous voulez apparaitre quand un acheteur demande a l’IA « quel est le meilleur X pour Y ». En revanche, ne confondez pas ouverture et laisser-faire cote qualite : produire des centaines de fiches sans valeur reste risque pour votre referencement, comme nous l’expliquons dans notre guide sur 500 fiches produit avec l’IA sans tuer son SEO.
Votre objectif est d’etre trouve par des prospects. De plus en plus de gens demandent a une IA quel prestataire choisir. Vous avez donc tout interet a etre citable. Le contenu de votre site vitrine n’a presque aucune valeur d’entrainement a proteger.
Reglage conseille : ouvrir, surtout les robots de citation. Ne bloquez rien par reflexe de prudence : ici, se bloquer, c’est se rendre invisible sans rien gagner. La vraie priorite est ailleurs, dans la clarte et la coherence de vos informations, un sujet que nous developpons dans Schema.org et GEO : les balisages que les IA exploitent.
Un site dont le contenu est vendu (base documentaire payante, recherche exclusive, creations originales), ou qui contient des donnees a ne pas diffuser, releve d’une autre logique. La, le cas 3 (tout bloquer) se justifie, complete par un vrai filtrage serveur, puisque robots.txt ne suffit pas.
La bonne reponse n’est ni « tout bloquer » ni « tout ouvrir ». Elle tient en une distinction : separez l’entrainement de la citation, et decidez usage par usage.
Pour la grande majorite des TPE et PME, dont l’objectif est d’etre trouvees et choisies, la logique penche vers l’ouverture, au moins pour les robots de citation. Se bloquer par prudence revient souvent a se rendre invisible sans rien proteger de vraiment precieux. Pour les editeurs et les producteurs de contenu de valeur, la position equilibree consiste a bloquer l’entrainement gratuit tout en restant citable. Pour les rares sites dont le contenu est le produit lui-meme, le blocage complet a du sens, a condition de le doubler d’une protection reelle au niveau du serveur.
Un dernier point de methode : c’est une decision reversible. Vous pouvez tester une configuration, observer, et ajuster. Ce qui compte, c’est de la prendre en connaissance de cause, pas au hasard d’un conseil trop simple. Si vous voulez etre accompagne pour construire votre visibilite a l’ere de l’IA, cote SEO comme cote GEO, c’est le metier de notre agence de referencement IA.
Non, pas directement. GPTBot sert a entrainer les modeles d’OpenAI. Le robot qui vous rend citable dans ChatGPT Search est OAI-SearchBot. Vous pouvez bloquer le premier et laisser passer le second. En revanche, si vous bloquez aussi OAI-SearchBot, vous vous coupez des reponses de ChatGPT qui citent des sources.
Non. Google confirme que Google-Extended ne concerne que l’usage de votre contenu pour entrainer Gemini. Votre presence dans Google Search et dans les AI Overviews depend de Googlebot, qui n’est pas affecte. Vous pouvez donc refuser l’entrainement Gemini sans perdre en visibilite dans le moteur.
Il est a la racine de votre site, accessible a l’adresse votresite.fr/robots.txt. Sur WordPress, une extension SEO comme Rank Math ou Yoast permet de l’editer depuis l’administration, sans toucher au serveur. Sur d’autres plateformes, cherchez l’option robots.txt dans les reglages, ou demandez a votre hebergeur.
Non. C’est un signal respecte par les robots serieux, mais ignore par les scrapers malveillants et souvent contourne par les recuperations declenchees par un utilisateur (comme Perplexity-User). Pour un blocage reel, il faut filtrer les plages d’adresses IP des robots au niveau du serveur ou d’un pare-feu.
Vous nommez chaque robot separement dans robots.txt, donc vous pouvez, mais la logique est la meme partout : distinguer les robots d’entrainement des robots de citation. Une fois cette distinction faite, votre choix (bloquer l’entrainement, garder la citation) s’applique de la meme facon a OpenAI, Anthropic, Perplexity et Google.
Ordiama, c'est aussi une agence IA à Strasbourg : on crée votre site, on vous rend visible dans l'IA et on automatise vos tâches.