Aller au contenu
Klacos
Protection

Bloquer les robots d’IA : décider usage par usage, après les avoir vérifiés

La question n’est pas de savoir s’il faut bloquer les robots d’IA, mais quel usage de vos contenus vous acceptez : l’entraînement d’un modèle, la recherche d’un assistant, la lecture demandée par un utilisateur, l’action d’un agent. Chaque usage a ses robots, et votre robots.txt peut les traiter un par un.

Par l’équipe Klacos Publié le Mis à jour le

Bloquer tous les robots d’IA d’un coup vous retire aussi des réponses où un assistant aurait pu vous citer. Mieux vaut décider usage par usage. Les éditeurs séparent désormais leurs robots selon ce qu’ils font de vos pages : GPTBot récolte pour entraîner les modèles d’OpenAI, OAI-SearchBot indexe pour la recherche de ChatGPT, ChatGPT-User lit une page parce qu’un utilisateur vient de la demander. Votre robots.txt peut refuser l’un et accepter les autres.

Ce fichier exprime un souhait, il ne bloque rien, et n’importe quel script peut écrire « GPTBot » dans ses requêtes. Avant de trancher, il faut donc vérifier qui passe vraiment, et mesurer ce que chacun prend. C’est le rôle d’une protection anti-bot de site web : vérifier un client avant de croire ce qu’il dit de lui.

Quatre usages, et la question que chacun vous pose

« Robot d’IA » recouvre des métiers très différents. Ce qu’ils vous coûtent et ce qu’ils vous rapportent n’a rien de commun, et chacun appelle sa propre réponse.

Usage Ce que fait le robot La question à vous poser
Entraînement Il récolte des pages pour entraîner les futurs modèles. Acceptez-vous que vos contenus nourrissent un modèle, sans lien vers vous ?
Recherche Il indexe vos pages pour que l’assistant puisse les citer dans ses réponses. Voulez-vous apparaître dans les réponses des assistants ?
Requête d’un utilisateur Il lit une page à la demande d’une personne, au moment où elle pose sa question. Laissez-vous un lecteur passer par un assistant pour vous lire ?
Agent Il agit pour quelqu’un : il parcourt, compare, remplit un formulaire. Ce robot doit-il pouvoir faire sur vos pages ce qu’y ferait un client ?
Inconnu Il ne dit pas qui il est, ou rien ne permet de vérifier ce qu’il annonce. Que faire d’un visiteur dont vous ne savez rien ?

Les deux premières lignes se règlent bien dans un robots.txt, parce que les robots d’exploration des grands éditeurs le lisent. Les trois dernières, beaucoup moins : un utilisateur ou un agent passe souvent outre, et un inconnu ne se reconnaît dans aucune règle.

Les principaux robots d’IA, et ce qu’un refus change

Chaque éditeur documente ses robots : OpenAI, Anthropic, Google, Apple, Perplexity, Meta et Common Crawl. Le tableau reprend ce que disaient ces pages le 8 octobre 2026.

Robot (éditeur) Usage Si votre robots.txt le refuse
GPTBot (OpenAI) Entraînement Vous indiquez que vos contenus ne doivent pas servir à entraîner les modèles d’OpenAI.
ClaudeBot (Anthropic) Entraînement Vos contenus à venir sont exclus des données d’entraînement d’Anthropic.
Google-Extended (Google) Entraînement et réponses de Gemini Ce que Google explore chez vous ne sert plus à entraîner les futurs Gemini ni à étayer leurs réponses. Aucun effet sur Google Search.
Applebot-Extended (Apple) Entraînement Vos pages ne servent plus à entraîner les modèles d’Apple, et restent dans ses résultats de recherche.
Meta-ExternalAgent (Meta) Entraînement et indexation Vous refusez l’exploration que Meta destine à l’entraînement de ses modèles et à l’indexation pour ses produits.
CCBot (Common Crawl) Archive ouverte du web Common Crawl n’ajoute plus vos pages à son archive, que chacun peut télécharger et réutiliser.
OAI-SearchBot (OpenAI) Recherche Votre site n’apparaît plus dans les réponses de recherche de ChatGPT, sauf comme simple lien de navigation.
Claude-SearchBot (Anthropic) Recherche Vos pages ne sont plus indexées pour la recherche de Claude.
PerplexityBot (Perplexity) Recherche Vos pages ne sont plus proposées ni liées dans les résultats de Perplexity. L’éditeur précise que ce robot ne sert pas à entraîner de modèles.
ChatGPT-User (OpenAI) Requête d’un utilisateur, actions OpenAI prévient que les règles du robots.txt peuvent ne pas s’appliquer à ces visites.
Claude-User (Anthropic) Requête d’un utilisateur Claude ne peut plus lire votre page pour répondre à la question d’un utilisateur.
Perplexity-User (Perplexity) Requête d’un utilisateur Perplexity écrit que ce robot ignore en général le robots.txt, puisqu’un utilisateur a demandé la page.
Meta-ExternalFetcher (Meta) Requête d’un utilisateur, agents Meta prévient qu’il peut passer outre le robots.txt.

Trois enseignements ressortent de ces pages.

Refuser l’entraînement ne vous retire pas de la recherche. OpenAI écrit que ses réglages sont indépendants : on peut laisser passer OAI-SearchBot et refuser GPTBot. Google précise que Google-Extended ne joue ni sur la présence dans Google Search ni sur le classement, et Apple dit la même chose d’Applebot-Extended.

Certains noms ne sont pas des robots. Google-Extended et Applebot-Extended sont des mots que lit le robots.txt : l’exploration se fait avec Googlebot et Applebot, et vous ne verrez jamais ces deux noms dans vos journaux.

Les robots qui lisent pour un utilisateur échappent au fichier. OpenAI, Perplexity et Meta l’écrivent chacun à leur manière. Derrière ces visites, il y a une personne qui a demandé votre page à un assistant : les refuser, c’est refuser ce lecteur-là, et le robots.txt ne suffit pas à le faire.

Le robots.txt demande, il n’impose pas

La norme qui le décrit, la RFC 9309 publiée en septembre 2022, le pose dès son introduction : ce sont des règles que les robots « sont priés de respecter », et elles « ne sont pas une forme d’autorisation d’accès ».

Un changement ne s’applique pas tout de suite. La norme permet à un robot de garder sa copie du fichier jusqu’à 24 heures, Meta prévient de ce même délai, et OpenAI indique qu’il faut compter environ 24 heures pour que sa recherche tienne compte d’une mise à jour.

Surtout, une règle ne vise qu’un nom. Un aspirateur de contenu qui se présente comme Chrome n’est concerné par aucune ligne de votre fichier. Le blocage par User-Agent dans nginx ou Apache a la même faiblesse : il arrête les robots qui disent leur nom, y compris ceux qui ignorent le robots.txt, mais il ne distingue pas le vrai GPTBot d’un script qui en emprunte le nom.

Le fichier reste le bon endroit pour dire votre choix aux robots qui le lisent, et ceux des grands éditeurs le lisent quand ils explorent seuls. Anthropic accepte même Crawl-delay, une extension hors norme qui espace ses visites. Anthropic prévient aussi que bloquer ses adresses IP peut ne pas garantir durablement votre refus, parce que ses robots ne peuvent alors plus lire votre robots.txt.

Les services placés devant les sites ont pris acte de ces limites. Depuis le 1er juillet 2025, Cloudflare bloque par défaut les robots d’IA sur les domaines qui s’inscrivent chez lui, sauf si leur propriétaire choisit de les laisser passer. Le même éditeur a publié des observations sur des robots non déclarés attribués à Perplexity, qui contournaient des interdictions sous une autre identité : un refus écrit ne pèse plus rien quand le robot change de nom. Si vous envisagez de quitter ce service, le guide sur l’alternative européenne à Cloudflare fait le tour des questions à poser.

Vérifier un robot avant de croire son nom

Un client qui se présente comme GPTBot espère profiter de la porte que vous avez ouverte à OpenAI. Avant de lui accorder ce que vous accordez à OpenAI, vérifiez d’où il vient. Deux méthodes tiennent, et une troisième se prépare.

La première est le DNS inverse avec confirmation. Google décrit la méthode pour ses robots : on demande le nom associé à l’adresse IP, on vérifie qu’il appartient à googlebot.com, google.com ou googleusercontent.com, puis on résout ce nom pour s’assurer qu’il redonne la même adresse. Apple procède de même avec applebot.apple.com, Common Crawl avec crawl.commoncrawl.org. Le nom doit appartenir au domaine, et pas seulement finir par les mêmes lettres : evilgooglebot.com se termine par « googlebot.com » et n’a rien à voir avec Google.

La deuxième est la liste d’adresses publiée par l’éditeur. OpenAI en publie une par robot, Anthropic une pour l’ensemble de ses robots, Perplexity une par robot, Google plusieurs fichiers selon le type de robot. Ces listes bougent, chacune à son rythme. Voici leur date de génération, relevée le 8 octobre 2026 :

Liste Générée le
ChatGPT-User (OpenAI) 7 octobre 2026
Robots d’Anthropic 7 octobre 2026
GPTBot (OpenAI) 22 septembre 2026
CCBot (Common Crawl) 11 août 2026
OAI-SearchBot (OpenAI) 2 janvier 2026
PerplexityBot (Perplexity) 7 février 2025

Deux de ces listes avaient changé la veille. Une liste recopiée une fois dans la configuration d’un pare-feu vieillit sans prévenir : il faut la relire régulièrement à la source.

La troisième méthode est la signature des requêtes par le robot lui-même, que le groupe de travail Web Bot Auth de l’IETF est en train de normaliser. Le 8 octobre 2026, son texte principal en est à une première version de travail, datée du 1er septembre 2026 : rien n’est encore une norme.

Reste le cas où l’éditeur ne publie rien, ni nom de domaine ni liste. Aucune vérification n’est alors possible, et l’échec d’une vérification impossible ne prouve rien. Ce robot n’est pas un imposteur pour autant : traitez-le en inconnu.

Les faux robots d’IA, et ceux qui taisent leur nom

Un client qui s’annonce GPTBot depuis une adresse absente de la liste d’OpenAI n’est pas GPTBot. Il emprunte un nom connu et doit être traité en usurpateur : il ne profite pas de l’accès que vous avez accordé à OpenAI, et ses requêtes ne s’ajoutent pas à ce que vous attribuez à OpenAI.

Plus difficile à repérer : le robot qui ne se déclare pas du tout et se présente comme un navigateur. Aucune ligne de robots.txt ne le vise, aucune liste d’adresses ne le trahit. Un agent qui pilote un navigateur ordinaire peut lui aussi passer sans nom. Il faut alors regarder la visite elle-même : d’où elle vient, à quel rythme elle enchaîne les pages, quel chemin elle suit sur le site. Aucun de ces indices ne suffit seul. Un lecteur peut très bien passer par un VPN hébergé dans un centre de données, et un lecteur pressé peut ouvrir dix onglets d’un coup.

Mesurer leur impact avant de décider

Bloquer a un coût, laisser faire aussi, et aucun des deux ne se voit sans chiffres. Une fois les robots vérifiés, quatre mesures suffisent pour décider :

  • le nombre de requêtes de chaque robot, rapporté à votre trafic total ;
  • les pages qu’il demande : des pages servies depuis un cache ne coûtent presque rien, alors qu’une recherche interne ou des filtres de catalogue parcourus combinaison par combinaison sollicitent votre base de données à chaque passage ;
  • sa fréquence : un robot qui repasse sur tout votre catalogue chaque semaine ne pèse pas comme un robot qui vient une fois par mois ;
  • ce qu’il vous renvoie : les visites venues de ChatGPT, de Perplexity ou de Copilot dans les sources de vos statistiques.

Un robot de recherche qui passe peu et vous envoie des lecteurs ne se traite pas comme un robot qui reparcourt vos archives sans rien renvoyer.

Deux pièges faussent la mesure. OpenAI prévient que si vous laissez passer GPTBot et OAI-SearchBot, une seule exploration peut servir aux deux usages : l’un des deux peut sembler absent de vos journaux. Et un robot qui exécute votre script de mesure se compte comme un visiteur, ce qui gonfle l’audience sur laquelle vous jugez son coût. Le guide sur les robots comptés comme visiteurs dans vos statistiques explique comment les repérer.

Entre laisser passer et bloquer, il reste ralentir : un plafond de requêtes, ou Crawl-delay pour les robots qui le lisent.

Quelle stratégie pour un éditeur

Une fois les robots vérifiés et mesurés, le choix se fait par usage, pas d’un seul bloc. Trois positions reviennent.

Votre objectif Robots à refuser dans le robots.txt Ce qu’il faut savoir
Être cité par les assistants sans nourrir leurs modèles GPTBot, ClaudeBot, Google-Extended, Applebot-Extended, Meta-ExternalAgent Les robots de recherche et ceux qui lisent pour un utilisateur restent ouverts : vous restez dans les réponses. Ajoutez CCBot si vous ne voulez pas non plus figurer dans une archive ouverte que chacun peut réutiliser.
Ne rien céder aux assistants Tous les robots d’IA déclarés, recherche comprise ChatGPT-User, Perplexity-User et Meta-ExternalFetcher peuvent passer outre : seul un contrôle à l’entrée du site fait respecter ce refus.
Être lu et cité partout Aucun Surveillez les volumes, robot par robot, et ralentissez celui qui pèse trop.

Les moteurs de recherche restent en dehors de ce choix. Refuser Google-Extended ne touche pas Googlebot, alors que bloquer Googlebot pour se protéger de l’IA vous retirerait de Google Search. Un accès payant ou sous licence, lui, se négocie avec l’éditeur du robot : aucune ligne de robots.txt ne le met en place.

Pour un média, ce choix s’ajoute à d’autres questions (aspirateurs de contenus, audience réelle, sections réservées), réunies sur la page consacrée à la protection des contenus d’un média.

Le choix fait pour ce site

Le robots.txt de ce site laisse entrer tout le monde, et le redit nommément à GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, Claude-User, PerplexityBot, Google-Extended, Applebot-Extended et CCBot. Nous voulons que les assistants trouvent ces pages et les citent, entraînement compris. Ce fichier ne vérifie rien pour autant : il annonce notre choix aux robots qui le lisent.

Des robots vérifiés avant d’être crus, puis rangés par catégorie

Klacos se place devant votre site : chaque requête passe par lui avant votre serveur, y compris celles des robots qui n’exécutent jamais de JavaScript. Quand un client se présente comme un robot connu, Klacos vérifie qu’il vient bien de chez son éditeur avant de le croire, comme pour tous les robots vérifiés. Le nom seul ne suffit jamais, et vous n’avez aucune liste d’adresses à recopier ni à tenir à jour.

Parmi les robots d’IA, ceux d’OpenAI (GPTBot, OAI-SearchBot, ChatGPT-User) sont vérifiés sur les adresses que l’éditeur publie. Les autres, ClaudeBot ou PerplexityBot par exemple, sont reconnus au nom qu’ils déclarent : ce nom peut les faire ranger parmi les robots d’IA, jamais leur ouvrir une porte. Un client qui emprunte le nom d’un robot sans venir de chez son éditeur est traité en usurpateur. Un robot dont l’éditeur ne publie rien reste un inconnu, jugé sur sa visite dans son ensemble comme n’importe quel visiteur.

Un robot vérifié est rangé dans sa catégorie (moteur de recherche, robot d’IA, supervision) et sort de votre audience. L’espace Trafic de la console montre ce que chaque catégorie a demandé, en requêtes et en visiteurs : la mesure décrite plus haut, sans fouiller vos journaux.

Pour la catégorie des robots d’IA, vous choisissez, site par site, de laisser passer, d’observer, de ralentir ou de bloquer. Le réglage proposé est l’observation : ils passent, et vous voyez leur part de votre trafic avant de décider. Le réglage vaut pour toute la catégorie : pour un choix robot par robot, comme dans le tableau plus haut, votre robots.txt reste l’outil, et Klacos fait respecter le choix de la catégorie à ceux qui ne le lisent pas. Tant que vous observez, la console montre ce que votre réglage aurait fait, sans rien appliquer ; vous passez ensuite au blocage un palier à la fois, avec un retour arrière en un geste. Tout cela se règle depuis le contrôle des robots d’IA.

Voyez ce qui visite votre site avant d’en décider

Klacos ouvre ses premiers accès début 2027. Laissez votre adresse, ou parlons de votre cas.