Des bots tels que le GPTBot d’OpenAI, l’Applebot, CCBot, Google-Extended, et Bytespider analysent, stockent ou extraient les données de votre site web afin de fournir des données pour entraîner des LLMs plus avancés.
Chez Originality.ai, nous nous soucions du développement responsable (qui inclut l’extraction éthique) et de l’utilisation (AI Detector) des outils d’écriture d’IA générative comme ChatGPT.
Cet article examinera en profondeur l’objectif des bots d’IA, ce qu’ils font, comment les bloquer et la bataille intéressante pour l’avenir de l’IA qui se joue autour d’un fichier rarement connu appelé robots.txt.
Les bots d’IA se présentent sous plusieurs formes, notamment les assistants IA, les collecteurs de données d’IA, et les robots d’exploration de recherche IA, tous destinés à alimenter les principaux outils d’IA et moteurs de recherche IA. Chacun de ces bots d’IA extrait des données du web. De nombreux webmasters jugent ces pratiques inacceptables et souhaitent protéger leurs données ou les informations de leur site web contre l’extraction.
À mesure qu’une plus grande partie d’Internet bloque les bots d’IA, le nombre de mots disponibles pour les entreprises d’IA comme OpenAI, Anthropic pour développer leur dernier LLM (comme GPT-4o, Claude 3.5) diminuera, ce qui entraînera un ralentissement de l’amélioration future des outils d’IA.
La méthode la plus courante consiste à ajouter le texte suivant à votre fichier Robots.txt :
User-agent: name-of-bot
Disallow: /
Exemple :
User-agent: GPTBot
Disallow: /
Consultez la fin de cet article pour une explication plus approfondie des options permettant de bloquer les bots d’IA et un exemple de fichier Robots.txt.
OpenAI, en particulier, s’est montré actif dans ses efforts pour conclure des partenariats de données afin de continuer à alimenter ses efforts d’entraînement de LLM.
Robots.txt est un protocole Internet qui fournit aux robots d’exploration des moteurs de recherche des informations sur les URL auxquelles le robot peut accéder sur votre site web. Il est principalement utilisé pour éviter de surcharger le domaine avec des requêtes produites par les robots d’exploration.
Il est important de savoir que Robots.txt est une demande que les bots devraient suivre, mais qui ne « doit » pas nécessairement être suivie.
En ce qui concerne le filtrage et la gestion du trafic des robots d’exploration vers votre site web, l’objectif de robots.txt varie selon le type de fichier :
L’objectif principal de robots.txt est de restreindre l’accès des robots d’exploration à des pages spécifiques de votre site web. Supposons que vous craigniez que le serveur de votre site web soit submergé par un trop grand nombre de requêtes Google. Dans ce cas, vous pouvez empêcher les robots d’exploration des moteurs de recherche d’accéder à des pages spécifiques de votre site web afin de réduire l’utilisation.
Vous pouvez utiliser le fichier robots.txt pour gérer le trafic d’exploration vers les images, les vidéos et les fichiers audio. Cela empêcherait certains médias spécifiques d’apparaître dans la SERP (Search Engine Results Page) sur Google ou d’autres moteurs de recherche.
Si vous pensez qu’il existe un taux d’utilisation particulier causé par des fichiers de style, des images ou des scripts peu importants, vous pouvez utiliser le fichier robots.txt pour restreindre l’accès de certains robots d’exploration IA, collecteurs, assistants ou autres bots.
Passons en revue les différents types de bots d’IA et de robots d’exploration déployés par les entreprises sur le web :
Les assistants IA tels que le ChatGPT-User appartenant à OpenAI et le Meta-ExternalFetcher déployé par Meta jouent un rôle essentiel dans la réponse aux demandes des utilisateurs. Les réponses peuvent être au format texte ou vocal et utilisent les données web collectées pour construire la réponse la plus utile possible au prompt de l’utilisateur.
L’extraction web par IA est une procédure menée par des bots collecteurs de données d’IA pour récolter autant de données utiles que possible pour l’entraînement de LLM. Des entreprises telles que Apple, ByteDance, Common Crawl, OpenAI et Anthropic utilisent des collecteurs de données d’IA pour constituer un vaste jeu de données du web sur lequel entraîner des LLMs.
De nombreuses entreprises déploient des robots d’exploration de recherche IA pour recueillir des informations sur des pages de sites web spécifiques, les titres, les mots-clés, les images et les liens intégrés référencés. Bien que les robots d’exploration IA aient le potentiel d’envoyer du trafic vers un site web, certains propriétaires de sites choisissent malgré tout de les bloquer.
ChatGPT-User est un robot d’exploration assistant de recherche envoyé par ChatGPT d’Open AI à la suite de prompts utilisateur. La plupart de ses réponses incluent généralement un résumé du contenu du site web ainsi qu’un lien de référence.
Le type du robot d’exploration ChatGPT-User est assistant IA, car il est utilisé pour effectuer intelligemment des tâches au nom de l’utilisateur de ChatGPT.
L’assistant de recherche ChatGPT-User devrait effectuer des visites ponctuelles en fonction de la demande de l’utilisateur, plutôt que de parcourir automatiquement le web comme d’autres robots d’exploration.
Pour bloquer ce robot d’exploration, vous devez inclure l’instruction suivante dans le fichier robots.txt de votre site web :
User-agent: ChatGPT-User
Disallow: /
Le robot d’exploration Meta-ExternalFetcher est envoyé par tous les produits de Meta AI pour répondre aux prompts utilisateur directs lorsqu’un lien individuel est requis.
L’assistant IA Meta-ExternalFetcher est sollicité pour effectuer intelligemment des tâches au nom de l’utilisateur de Meta AI.
Semblable au robot d’exploration ChatGPT-user, Meta-ExternalFetcher effectue généralement des visites ponctuelles basées sur la demande de l’utilisateur, plutôt que d’explorer automatiquement le web.
Vous devez inclure la commande suivante dans le fichier robots.txt de votre site web pour empêcher l’accès de Meta-ExternalFetcher :
User-agent: Meta-ExternalFetcher
Disallow: /
Le robot d’exploration web Amazonbot est utilisé par Amazon pour indexer et enregistrer les résultats de recherche, ce qui permet à l’assistant IA Alexa de répondre aux questions plus précisément. La plupart des réponses d’Alexa contiennent généralement une référence au site web.
Amazonbot est un robot d’exploration de recherche IA utilisé pour indexer le contenu web destiné aux résultats de recherche d’Alexa alimentés par l’IA.
La particularité des robots d’exploration de recherche est qu’ils ne suivent pas un schéma de visite fixe pour les sites web. La fréquence des visites est définie par de nombreux facteurs et se produit généralement à la demande, en réponse à une requête utilisateur, y compris pour Amazonbot.
Vous pouvez limiter l’accès d’Amazonbot à votre site web en saisissant les lignes de commande suivantes dans le fichier robots.txt de votre site web :
User-agent: Amazonbot
Disallow: /
Le robot d’exploration de recherche Applebot est utilisé pour enregistrer les résultats de recherche, permettant à l’assistant IA Siri de répondre plus efficacement aux questions des utilisateurs. La plupart des réponses de Siri contiennent une référence aux sites web explorés par Applebot.
Applebot est un robot d’exploration de recherche IA qui indexe le contenu web pour construire des résultats de recherche alimentés par l’IA.
Le comportement d’Applebot varie selon plusieurs facteurs, tels que la demande de recherche, les sites web explorés et les requêtes des utilisateurs. Par défaut, les robots d’exploration de recherche ne s’appuient pas sur des visites fixes pour fournir des résultats.
Bien qu’il ne soit pas conseillé de bloquer les robots d’exploration de recherche, vous pouvez utiliser la commande suivante dans le fichier robots.txt du site web pour empêcher l’accès d’Applebot :
User-agent: Applebot
Disallow: /
Le robot d’exploration OAI-SearchBot est utilisé pour construire un index de sites web pouvant être utilisé comme résultat du produit SearchGPT d’OpenAI.
OAI-SearchBot est un robot d’exploration de recherche IA utilisé pour indexer le contenu web afin de fournir des résultats de recherche alimentés par l’IA plus précis pour le service SearchGPT d’OpenAI.
Le comportement d’OAI-SearchBot peut être défini par la fréquence des recherches web et des requêtes utilisateur. Comme tout autre robot d’exploration de recherche, OAI-SearchBot ne s’appuie pas sur des visites fixes de sites web pour fournir des résultats.
Incluez la commande suivante dans le fichier robots.txt de votre site web pour empêcher activement l’accès d’OAI-SearchBot :
User-agent: OAI-SearchBot
Disallow: /
Perplexity utilise le robot d’exploration web PerplexityBot pour indexer les résultats de recherche afin de fournir une réponse plus efficace à son assistant IA. Les réponses fournies par l’assistant affichent normalement des références intégrées vers diverses sources web.
PerplexityBot est un robot d’exploration de recherche IA conçu pour indexer les résultats destinés aux résultats de recherche alimentés par l’IA de l’assistant IA Perplexity.
Comme la plupart des robots d’exploration de recherche, PerplexityBot ne dépend pas d’un calendrier de visites fixe pour les sources web qu’il promeut. La fréquence des visites peut varier en fonction de plusieurs facteurs, tels que les requêtes des utilisateurs.
Vous pouvez restreindre l’accès de PerplexityBot à votre site web en incluant la règle de jeton d’agent suivante dans robots.txt :
User-agent: PerplexityBot
Disallow: /
YouBot est un robot d’exploration de recherche déployé par You.ai pour indexer les résultats de recherche afin de fournir des réponses utilisateur plus précises via l’assistant IA You. Le bot renvoie généralement aux sites web référencés au moyen de sources intégrées.
Le robot d’exploration de recherche YouBot indexe le contenu web afin de générer des résultats de recherche alimentés par l’IA plus précis.
Le robot d’exploration YouBot n’a pas de calendrier de visites établi et la fréquence des visites se produit souvent à la demande ou en réponse à une requête utilisateur.
Vous devez coller la commande suivante dans le fichier robots.txt de votre site web pour empêcher l’accès du robot d’exploration YouBot :
User-agent: YouBot
Disallow: /
Le collecteur de données d’IA Applebot-Extended est utilisé pour entraîner la gamme de modèles LLM d’APple qui alimentent les fonctionnalités d’IA générative de l’entreprise. Ce collecteur Applebot a une large application dans tous les aspects d’Apple intelligence, des Services et des Developer Tools.
Applebot-Extended est un collecteur de données d’IA utilisé pour télécharger du contenu web et entraîner l’IA ou les LLM (Large Language Models)
Bien que l’on ne sache pas exactement comment les collecteurs de données d’IA choisissent les sites web à explorer, on sait que les sources ayant une densité d’information plus élevée attirent ce collecteur Applebot. Il serait logique qu’un LLM privilégie les sites web qui publient et mettent régulièrement à jour les informations web présentes sur la page.
Incluez la commande suivante dans le fichier robots.txt de votre site web pour bloquer Applebot-Extended :
User-agent: Applebot-Extended
Disallow: /
Exploité par ByteDance, Bytespider est un collecteur de données d’IA pour le propriétaire chinois de TikTok. Il est utilisé pour télécharger des données d’entraînement de LLM et fournir des données pertinentes.
Bytespider est un collecteur de données d’IA utilisé pour entraîner des Large Language Models en téléchargeant du contenu depuis le web.
Le collecteur de données d’IA Bytespider privilégie les sources web régulièrement mises à jour et riches en faits afin de les utiliser comme apport pour les LLMs.
Incluez la règle de jeton d’agent utilisateur suivante dans le fichier robots.txt de votre site web :
User-agent: Bytespider
Disallow: /
CCBot appartient à Common Crawl afin de construire un référentiel open source à partir de données d’exploration web disponibles pour que chacun puisse y accéder et les utiliser.
CCBot est un collecteur de données d’IA destiné à télécharger du contenu web et à mener l’entraînement de modèles d’IA.
CCBot explore des sources web riches en informations afin de réaliser un entraînement de LLM plus efficace.
Incluez la règle suivante dans robots.txt pour restreindre l’accès de CCBot :
User-agent: CCBot
Disallow: /
Le collecteur de données d’IA ClaudeBot est exploité par Anthropic pour fournir des données d’entraînement à des Large Language Models comme Claude.
ClaudeBot est un collecteur de données d’IA destiné au téléchargement de contenu web et à l’entraînement de modèles d’IA.
ClaudeBot choisit les sites web à explorer en fonction de la densité d’information et de la régularité des mises à jour des informations.
L’accès de ClaudeBot peut être révoqué en incluant la règle suivante dans robots.txt :
User-agent: ClaudeBot
Disallow: /
Diffbot est conçu pour structurer, comprendre, agréger et même vendre des données de sites web correctement structurées pour l’entraînement de modèles d’IA et la surveillance en temps réel.
Diffbot est un collecteur de données d’IA conçu pour entraîner des modèles d’IA et télécharger/structurer des informations web.
La fréquence des visites de Diffbot est définie par la qualité des informations de la source et la régularité des mises à jour.
L’exploration de Diffbot peut être empêchée en appliquant la règle suivante dans robots.txt :
User-agent: Diffbot
Disallow: /
FacebookBot est déployé par Meta pour améliorer l’efficacité de la technologie de reconnaissance vocale par IA et pour entraîner des modèles d’IA.
FacebookBot est un robot d’exploration collecteur de données d’IA, utilisé pour enregistrer du contenu web et l’entraînement de LLM.
FacebookBot n’a pas de calendrier de visites fixe, mais il reconnaît peut-être les sources contenant des informations plus riches et bien mises à jour et s’appuie sur elles.
L’accès de FacebookBot peut être révoqué avec la règle suivante :
User-agent: FacebookBot
Disallow: /
Le robot d’exploration Google-Extended est utilisé pour fournir des informations d’entraînement aux produits d’IA appartenant à Google, tels que l’assistant Gemini et les API génératives Vertex AI.
Le robot d’exploration Google-Extended est un collecteur de données d’IA destiné à télécharger des informations depuis le web et à mener l’entraînement de l’IA.
Le calendrier de visites du bot Google-Extended est également flexible, mais il est beaucoup plus ciblé que celui d’autres robots d’exploration en raison de la riche base de données de Google composée de sources web d’informations fiables.
Le robot d’exploration Google-Extended peut être mis sur liste noire avec la règle suivante :
User-agent: Google-Extended
Disallow: /
GPTBot est développé par OpenAI pour explorer des sources web et télécharger des données d’entraînement pour les Large Language Models de l’entreprise et des produits comme ChatGPT.
GPTBot est un collecteur de données d’IA conçu pour télécharger et fournir un large éventail de données depuis le web.
Comme d’autres collecteurs de données d’IA, GPTBot privilégie les sources et sites web riches en informations afin de fournir davantage d’informations pertinentes pour les procédures d’entraînement de l’IA.
Vous pouvez bloquer le collecteur de données d’IA GPTBot avec la règle robots.txt suivante :
User-agent: GPTBot
Disallow: /
Meta-ExternalAgent est une technologie de robot d’exploration développée par Meta pour améliorer les technologies d’IA de l’entreprise en téléchargeant et en indexant directement le contenu web.
Le Meta-ExternalAgent utilise une technologie d’extraction de données IA pour télécharger et indexer du contenu web, destinée à l’entraînement de l’IA.
À l’instar d’autres robots d’exploration développés par l’entreprise, le Meta-ExternalAgent utilise une stratégie d’exploration flexible pour identifier les sources web riches en informations.
Ce robot d’exploration développé par Meta peut être restreint au moyen de la règle robots.txt suivante :
User-agent: Meta-ExternalAgent
Disallow: /
Le robot d’exploration omgili appartient à Webz.io et est conçu pour maintenir une bibliothèque constituée de données d’exploration web, qui est ensuite vendue à d’autres entreprises à des fins d’entraînement de l’IA.
Le robot d’exploration omgili est un extracteur de données IA qui télécharge des informations d’entraînement de l’IA depuis le web.
Comme les informations explorées sont ensuite vendues par Webz.io, le robot d’exploration omgili suit les sites web crédibles et autorisés contenant des informations pertinentes.
Utilisez la règle suivante pour empêcher l’accès du robot d’exploration omgili à votre site web :
User-agent: omgili
Disallow: /
L’agent Anthropic-AI non confirmé tend à être utilisé pour télécharger des données d’entraînement pertinentes et les fournir aux produits alimentés par l’IA appartenant à l’entreprise, comme Claude.
Le type exact de l’agent Anthropic-AI est encore inconnu en raison de l’absence de divulgation par l’entreprise.
En raison de l’absence d’informations pertinentes sur l’agent Anthropic-AI, le robot d’exploration peut être utilisé à plusieurs fins, mais cela reste difficile à déterminer.
L’agent Anthropic-AI peut être bloqué avec la règle suivante :
User-agent: anthropic-ai
Disallow: /
Claude-Web est un autre agent IA exploité par Anthropic, sans documentation officielle sur ses objectifs d’utilisation. Claude-Web devrait fournir des données d’entraînement LLM pertinentes pour Anthropic.
Claude-Web sera soit un extracteur de données IA, soit un robot d’exploration de recherche standard pour le grand modèle de langage Claude 3.5 d’Anthropic.
Anthropic retient les informations sur les fonctionnalités de Claude-Web, mais le comportement du robot d’exploration correspondra au type de l’agent une fois qu’il sera entièrement divulgué.
La règle suivante est utilisée pour suspendre l’accès d’exploration de l’agent Claude-Web à votre site web :
User-agent: Claude-Web
Disallow: /
Cohere-AI est un agent non documenté développé par Cohere pour fournir à ses outils d’IA générative des informations d’étude pertinentes. Il récupère des informations sur le web lorsque les utilisateurs le demandent via Cohere AI.
Comme aucune documentation n’est disponible pour cet agent Cohere AI, le type du robot d’exploration reste inconnu de nombreux propriétaires de sites web.
On soupçonne que l’agent Cohere-AI sera polyvalent grâce à différents schémas comportementaux afin de fournir aux utilisateurs de Cohere des informations pertinentes et des liens de sources intégrés.
Vous pouvez suspendre l’accès de l’agent Cohere-AI au moyen de la règle suivante :
User-agent: cohere-ai
Disallow: /
La fonction principale d’Ai2Bot est d’explorer « certains domaines » et d’acquérir du contenu web pour l’entraînement de modèles de langage.
Comme indiqué par Ai2, l’Ai2Bot est un robot d’exploration de recherche IA, car il analyse le contenu, les images et les vidéos du site web exploré.
L’Ai2Bot n’explore que des sites web spécifiques, comme indiqué par l’entreprise, mais il peut élargir de jour en jour son éventail de domaines enregistrés.
Incluez la règle suivante dans le robots.txt de votre site web pour suspendre l’Ai2Bot :
User-agent: Ai2Bot
Disallow: /
L’entreprise Ai2 possède le bot Ai2Bot-Dolma et respecte les règles robots.txt. Le contenu acquis est utilisé pour entraîner divers modèles de langage appartenant à l’entreprise.
Bien que le bot n’ait pas de type spécifique attribué, nous pensons qu’il a le comportement d’un robot d’exploration de recherche IA standard.
L’Ai2Bot-Dolma n’explore que « certains domaines » afin de trouver le contenu web requis pour l’entraînement de modèles de langage.
Utilisez la ligne robots.txt suivante pour restreindre l’accès d’Ai2Bot-Dolma :
User-agent: Ai2Bot-Dolma
Disallow: /
Bien que l’on sache peu de choses sur ce robot d’exploration, il respecte le robots.txt et est utilisé pour acquérir des données destinées à des expériences d’apprentissage automatique.
Le type du bot est encore inconnu, mais nous pensons qu’il s’agit soit d’un robot d’exploration générique, soit d’un extracteur de données IA, d’après son comportement sur le web.
On ne sait pas clairement qui est l’opérateur de ce bot, mais les données sont utilisées pour l’entraînement de grands modèles de langage, l’apprentissage automatique et la création de jeux de données.
Voici comment suspendre l’accès de FriendlyCrawler à votre site web :
User-agent: FriendlyCrawler
Disallow: /
Le robot d’exploration GoogleOther est un bot appartenant à Google, mais il reste difficile de savoir s’il est lié à l’IA ou artificiellement intelligent. Actuellement, seul un faible pourcentage des sites web les plus performants ont bloqué le bot GoogleOther.
Le bot GoogleOther est un robot d’exploration de moteur de recherche qui indexe le contenu web afin d’obtenir des résultats de moteur de recherche plus précis ou la SERP Google.
Comme tout autre robot d’exploration de moteur de recherche, le bot GoogleOther ne suit pas de calendrier de visite particulier, et la fréquence de visite varie selon l’activité du site web et la qualité du contenu.
Ajoutez la règle suivante au fichier robots.txt de votre site web :
User-agent: GoogleOther
Disallow: /
GoogleOther-Image est la version de GoogleOther proposée pour explorer, analyser et indexer les images sur le web
Comme GoogleOther, le bot GoogleOther-Image est un robot d’exploration générique utilisé par diverses équipes produit pour rendre le contenu des sites web accessible au public.
Ce robot d’exploration ne respecte pas un calendrier de visite fixe, mais analyse les sources d’images les plus fiables du web et indexe des informations particulières.
Vous pouvez bloquer ce robot d’exploration Google avec la commande suivante :
User-agent: GoogleOther-Image
Disallow: /
Comme pour le robot d’exploration GoogleOther standard et le bot d’enregistrement d’images, GoogleOther-Video explore et analyse le contenu vidéo sur le web.
Ce bot est un robot d’exploration générique au service de diverses équipes produit et entreprises afin d’obtenir une meilleure portée avec les vidéos téléversées sur leur site web.
Comme les autres versions de GoogleOther, ce robot d’exploration dispose également d’un calendrier de visite flexible, défini par l’activité et la qualité du contenu vidéo du site web.
Ce bot Google peut être bloqué avec la ligne robots.txt suivante :
User-agent: GoogleOther-Video
Disallow: /
L’ICC-Crawler est un agent qui n’est toujours pas catégorisé par son créateur. On ignore encore si ce robot d’exploration est artificiellement intelligent ou a un lien avec l’IA.
Comme pour sa source, le type du bot ICC-Crawler est également inconnu.
Le comportement du bot varie selon le type du robot d’exploration, notamment selon qu’il s’agit d’un extracteur de données, d’un robot d’exploration de moteur de recherche ou d’un archiveur.
L’ICC-Crawler peut être bloqué avec la commande suivante :
User-agent: ICC-Crawler
Disallow: /
Le bot Imagesift appartient à Hive, mais on ignore actuellement si le robot d’exploration est lié à l’IA ou artificiellement intelligent.
L’ImagesiftBot est un collecteur de renseignements qui recherche des informations utiles sur le web et enregistre ou indexe les résultats dans une base de données.
Le comportement des robots d’exploration collecteurs de renseignements dépend des objectifs de leurs clients. Par exemple, un client peut vouloir populariser sa marque, ce qui amène le bot à explorer les réseaux sociaux plus fréquemment que d’autres sites web sans rapport.
Ce robot d’exploration peut être bloqué de la manière suivante :
User-agent: ImagesiftBot
Disallow: /
Le PetalBot appartenant à Huawei est actuellement suspendu sur 2 % des sites web indexés populaires. On ignore encore si ce robot d’exploration est artificiellement intelligent ou lié d’une quelconque manière à l’IA.
PetalBot est un robot d’exploration de moteur de recherche qui indexe le contenu web et acquiert des données à partir des résultats des moteurs de recherche.
Le comportement de PetalBot est défini par la qualité du contenu et l’activité des sites web et domaines enregistrés. Les robots d’exploration de moteurs de recherche ont tendance à explorer les sites web dont la qualité du contenu est plus élevée et l’activité fréquente.
L’accès de PetalBot peut être suspendu de la manière suivante :
User-agent: PetalBot
Disallow: /
Scrapy appartient à Zyte et est actuellement bloqué sur plus de 3 % des domaines enregistrés sur le web.
Scrapy est un extracteur IA, un type de robot d’exploration connu pour ne pas respecter le robots.txt d’un site web. Il finira par analyser les informations requises, même si cela signifie accéder à un site web qui comporte une règle robots.txt d’interdiction pour Scrapy.
Prédire le calendrier de visite d’un extracteur IA est presque impossible. Ces robots d’exploration sont déployés à des fins différentes, et il est difficile de dire quels sites web ils exploreraient et à quelle fréquence.
Bien que robots.txt ne fasse pas grand-chose contre les extracteurs IA, voici comment bloquer Scrapy :
User-agent: Scrapy
Disallow: /
Timpibot appartient à Timpi et est actuellement bloqué sur 3 % des sites web indexés populaires. Le seul objectif de Timpibot est d’acquérir des données web pour l’entraînement de modèles d’IA.
Contrairement à un extracteur standard, Timpibot est un extracteur de données IA qui s’appuie uniquement sur l’intelligence artificielle pour explorer et indexer du contenu web.
Comme pour les extracteurs standard, le calendrier de visite des extracteurs de données IA est également incertain. Ces robots d’exploration ont tendance à choisir des sites web présentant une densité d’informations et une valeur de contenu plus élevées, selon les informations requises pour l’entraînement du modèle d’IA.
L’accès de Timpibot peut être suspendu avec la règle robots.txt suivante :
User-agent: Timpibot
Disallow: /
Le VelenPublicCrawler est exploité par Hunter et a été bloqué par 0 % des sites web les mieux indexés sur le web.
Le robot d’exploration est un collecteur de renseignements standard, destiné à recueillir des informations utiles à partir des résultats web.
Les collecteurs de renseignements tendent à répondre aux objectifs de leurs clients et, dans la plupart des cas, ont des tâches spécifiques quant aux informations à collecter.
VelenPublicWebCrawler peut être bloqué avec la commande suivante :
User-agent: VelenPublicWebCrawler
Disallow: /
Webzio-Extended est un autre robot d’exploration appartenant à Webz.io, utilisé pour maintenir le dépôt des données d’exploration acquises. Les informations sont ensuite vendues à d’autres entreprises et sont généralement utilisées pour l’entraînement de modèles d’IA.
Webzio-Extended est un extracteur de données IA qui télécharge du contenu web dans le but d’entraîner des modèles d’IA.
Les extracteurs de données IA tels que Webzio-Extended ne s’en tiennent pas à un calendrier fixe de visite des sites web. Les sources de données plus riches ont tendance à attirer davantage les extracteurs et à les amener à explorer plus souvent.
L’accès de Webzio-Extended à votre site web peut être suspendu avec la commande suivante :
User-agent: Webzio-Extended
Disallow: /
Le robot d’exploration facebookexternalhit est un bot déployé par Meta, bloqué sur plus de 6 % des sites web populaires enregistrés. On ignore encore si le bot est artificiellement intelligent ou lié à l’IA.
Facebookexternalhit est un récupérateur, qui explore les résultats web pour le compte d’une application.
Les récupérateurs sont généralement déployés pour visiter des sites web à la demande. Ils sont utilisés pour présenter les métadonnées d’un lien particulier, un titre ou une image miniature par exemple, à l’utilisateur demandeur.
Ce robot d’exploration Meta peut être bloqué avec la règle robots.txt suivante :
User-agent: facebookexternalhit
Disallow: /
On sait qu’img2dataset est le seul robot d’exploration web de l’entreprise, destiné à télécharger un grand nombre d’images et à les convertir en jeux de données pour entraîner de grands modèles de langage.
Le type d’img2dataset est encore inconnu, mais nous pensons qu’il s’agit d’un robot d’exploration de moteur de recherche IA, d’après son comportement et son calendrier de visite.
Img2dataset tend à explorer les sites web disposant d’une base de données d’images plus riche et d’une variété de thèmes.
Ce robot d’exploration peut être suspendu avec la règle suivante :
User-agent: img2dataset
Disallow: /
Il existe plusieurs possibilités uniques pour restreindre le trafic de bots indésirable vers votre site web :
La méthode la plus courante consiste à ajouter le texte suivant à votre fichier Robots.txt :
User-agent: name-of-bot
Disallow: /
Exemple :
User-agent: GPTBot
Disallow: /
La création d’un fichier robots.txt facilement accessible implique plusieurs étapes simples :
Au cours de cette étape, vous devez accéder au répertoire racine du site web. C’est là que le fichier doit être stocké afin de restreindre efficacement l’accès des robots d’exploration à votre site web. Gardez à l’esprit que votre site web ne peut avoir qu’un seul fichier robots.txt.
Vous pouvez utiliser n’importe quel éditeur pour créer le fichier, comme le Bloc-notes de Windows, TextEdit et vi. Assurez-vous que le fichier est enregistré avec l’encodage UTF-8 et procédez à l’application des règles. Les robots d’exploration de Google répondent à l’ensemble de règles suivant : "user-agent," "disallow," "allow" et "sitemap." Chaque règle a son propre objectif en matière de gestion des robots d’exploration.
L’étape suivante consiste à rendre le fichier robots.txt nouvellement créé accessible au public en ouvrant une fenêtre de navigation privée dans votre navigateur et en vous rendant à l’emplacement du fichier. Vous pouvez vérifier si le robots.txt est accessible publiquement en saisissant le domaine du site, par exemple "https://(site name)", et en ajoutant "/robots.txt" à la fin.
Comme nous l’avons établi précédemment, inclure une règle de restriction pour un bot particulier dans le robots.txt de votre site web ne désindexera pas la page ni ne la supprimera de la SERP. Lorsqu’il tentera d’accéder à votre page, le bot recevra automatiquement un message d’erreur et sera redirigé ailleurs, sans accéder au contenu de la page.
La page restera découvrable pour tous les utilisateurs et bots IA, mais les bots portant l’étiquette indiquée dans le fichier robots.txt n’y auront pas accès.
Ce fichier d’exemple bloque :
Bloquer les extracteurs de données, mais pas le robot d’exploration ni l’assistant de recherche, vise à empêcher les données d’un site web d’être utilisées pour l’entraînement tout en permettant à la recherche/aux assistants IA d’envoyer du trafic vers le site web.
Il existe plusieurs possibilités lorsqu’il s’agit de suspendre l’accès des bots IA avec l’aide d’un pare-feu. Passons en revue chacune de ces possibilités uniques :
Si vous connaissez bien les adresses utilisées par les bots pour accéder à votre domaine, vous pouvez mettre les IP sur liste noire via le pare-feu de votre site web. C’est une pratique couramment connue pour réduire le trafic involontaire vers votre site web et préserver les ressources. Cependant, les bots peuvent faire tourner plusieurs IP.
La méthode peut-être la plus largement privilégiée pour suspendre à 100 % le trafic de bots vers votre site web consiste à mettre en œuvre un logiciel CAPTCHA qui exige une validation humaine. Chaque nouveau visiteur sera invité à réaliser un défi simple, comme assembler des pièces de puzzle ou identifier des objets sur un ensemble d’images, afin d’obtenir l’accès. Les pare-feu peuvent être modifiés pour déclencher des CAPTCHA.
Les services CDN tels que Cloudflare ou Amazon CloudFront peuvent être intégrés au pare-feu de votre site web afin de réduire le trafic des bots IA. Comme pour les défis CAPTCHA, seules les adresses IP valides appartenant à de vrais utilisateurs seront autorisées à accéder à votre site web.
Comme une grande variété de webmasters s’appuient sur robots.txt pour suspendre le trafic de bots indésirable vers leur site web, chaque règle du fichier vise un bot spécifique. Après que les entreprises ont commencé à constater la baisse du trafic de leurs bots, beaucoup ont décidé d’attribuer un nouveau nom à leurs bots qui ne figurait pas dans le fichier robots.txt de nombreux sites web.
Un exemple récent est la manière dont Anthropic a fusionné ses extracteurs de données IA nommés « ANTHROPIC-AI » et « CLAUDE-WEB » en un nouveau bot nommé « CLAUDEBOT ». Il a sûrement fallu un certain temps aux sites web pour s’en apercevoir et, entre-temps, le nouveau bot a eu un accès sans précédent à tous les sites web sur Internet.
Avec l’utilisation croissante et généralisée des informations publiques par les entreprises d’IA pour entraîner de grands modèles de langage, l’inefficacité des protocoles web devient évidente. En réponse au scraping massif de données réalisé par des entreprises d’IA spécialisées dans les données web telles que C4, Dolma, et Refined Web, l’accès des robots d’exploration a connu une baisse de plus de 28 %-45 %.

Au total, 45 % de C4 est désormais restreint, nombre de ces restrictions étant diverses et faisant évoluer les lois des infrastructures d’IA à usage général via robots.txt. La demande de consentement aux données devient de plus en plus complexe, non seulement pour l’IA commerciale, mais aussi pour tous les types de recherche universitaire et d’utilisation non commerciale de l’IA.
La collision entre les entreprises d’IA qui tentent de scraper autant de données que possible pour entraîner des LLMs et les éditeurs qui cherchent à défendre leurs données/leur bande passante contre les abus a donné lieu à une lutte intéressante qui se joue dans un fichier peu connu présent sur tous les sites web, appelé robots.txt.
Ce guide vise à suivre l’évolution de ce conflit grâce à notre tableau de bord en direct, en montrant lesquels des top 1000 sites web bloquent les bots IA, comment les bloquer et lesquels vous devriez bloquer.
S’il manque des bots que vous aimeriez voir inclus, veuillez nous contacter.