Bloquez les robots d’IA qui explorent les sites Web à l’aide de Robots.txt

Consultez le tableau de bord en direct montrant les sites Web qui empêchent les bots d’IA tels que GPTBot, CCBot, Google-extended et ByteSpider d’explorer et d’extraire le contenu de leur site Web. Découvrez quels robots d’exploration / extracteurs d’IA font quoi et comment les bloquer à l’aide de Robots.txt.

Des bots tels que le GPTBot d’OpenAI, l’Applebot, CCBot, Google-Extended, et Bytespider analysent, stockent ou extraient les données de votre site web afin de fournir des données pour entraîner des LLMs plus avancés. 

Chez Originality.ai, nous nous soucions du développement responsable (qui inclut l’extraction éthique) et de l’utilisation (AI Detector) des outils d’écriture d’IA générative comme ChatGPT.  

Cet article examinera en profondeur l’objectif des bots d’IA, ce qu’ils font, comment les bloquer et la bataille intéressante pour l’avenir de l’IA qui se joue autour d’un fichier rarement connu appelé robots.txt. 

Que sont les bots d’IA ?

Les bots d’IA se présentent sous plusieurs formes, notamment les assistants IA, les collecteurs de données d’IA, et les robots d’exploration de recherche IA, tous destinés à alimenter les principaux outils d’IA et moteurs de recherche IA. Chacun de ces bots d’IA extrait des données du web. De nombreux webmasters jugent ces pratiques inacceptables et souhaitent protéger leurs données ou les informations de leur site web contre l’extraction. 

Pourquoi est-ce important si les sites web bloquent les bots d’IA ?

À mesure qu’une plus grande partie d’Internet bloque les bots d’IA, le nombre de mots disponibles pour les entreprises d’IA comme  OpenAI, Anthropic pour développer leur dernier LLM (comme GPT-4o, Claude 3.5) diminuera, ce qui entraînera un ralentissement de l’amélioration future des outils d’IA.

Comment bloquer les bots d’IA (version simple) :

La méthode la plus courante consiste à ajouter le texte suivant à votre fichier Robots.txt :

User-agent: name-of-bot

Disallow: /

Exemple :

User-agent: GPTBot

Disallow: /

Consultez la fin de cet article pour une explication plus approfondie des options permettant de bloquer les bots d’IA et un exemple de fichier Robots.txt. 

OpenAI, en particulier, s’est montré actif dans ses efforts pour conclure des partenariats de données afin de continuer à alimenter ses efforts d’entraînement de LLM. 

Qu’est-ce que robots.txt et que fait-il ?

Robots.txt est un protocole Internet qui fournit aux robots d’exploration des moteurs de recherche des informations sur les URL auxquelles le robot peut accéder sur votre site web. Il est principalement utilisé pour éviter de surcharger le domaine avec des requêtes produites par les robots d’exploration. 

Il est important de savoir que Robots.txt est une demande que les bots devraient suivre, mais qui ne « doit » pas nécessairement être suivie. 

En ce qui concerne le filtrage et la gestion du trafic des robots d’exploration vers votre site web, l’objectif de robots.txt varie selon le type de fichier :

Filtrage des pages web

L’objectif principal de robots.txt est de restreindre l’accès des robots d’exploration à des pages spécifiques de votre site web. Supposons que vous craigniez que le serveur de votre site web soit submergé par un trop grand nombre de requêtes Google. Dans ce cas, vous pouvez empêcher les robots d’exploration des moteurs de recherche d’accéder à des pages spécifiques de votre site web afin de réduire l’utilisation.

Filtrage des fichiers multimédias

Vous pouvez utiliser le fichier robots.txt pour gérer le trafic d’exploration vers les images, les vidéos et les fichiers audio. Cela empêcherait certains médias spécifiques d’apparaître dans la SERP (Search Engine Results Page) sur Google ou d’autres moteurs de recherche.

Fichier de ressources 

Si vous pensez qu’il existe un taux d’utilisation particulier causé par des fichiers de style, des images ou des scripts peu importants, vous pouvez utiliser le fichier robots.txt pour restreindre l’accès de certains robots d’exploration IA, collecteurs, assistants ou autres bots.

Types de bots d’IA

Passons en revue les différents types de bots d’IA et de robots d’exploration déployés par les entreprises sur le web :

Assistants IA

Les assistants IA tels que le ChatGPT-User appartenant à OpenAI et le Meta-ExternalFetcher déployé par Meta jouent un rôle essentiel dans la réponse aux demandes des utilisateurs. Les réponses peuvent être au format texte ou vocal et utilisent les données web collectées pour construire la réponse la plus utile possible au prompt de l’utilisateur.

Collecteurs de données d’IA

L’extraction web par IA est une procédure menée par des bots collecteurs de données d’IA pour récolter autant de données utiles que possible pour l’entraînement de LLM. Des entreprises telles que Apple, ByteDance, Common Crawl, OpenAI et Anthropic utilisent des collecteurs de données d’IA pour constituer un vaste jeu de données du web sur lequel entraîner des LLMs.

Robots d’exploration de recherche IA

De nombreuses entreprises déploient des robots d’exploration de recherche IA pour recueillir des informations sur des pages de sites web spécifiques, les titres, les mots-clés, les images et les liens intégrés référencés. Bien que les robots d’exploration IA aient le potentiel d’envoyer du trafic vers un site web, certains propriétaires de sites choisissent malgré tout de les bloquer.

Description des bots d’IA populaires

Analyse approfondie des bots d’IA populaires

ChatGPT-User - Assistant de recherche IA 

Vue d’ensemble

ChatGPT-User est un robot d’exploration assistant de recherche envoyé par ChatGPT d’Open AI à la suite de prompts utilisateur. La plupart de ses réponses incluent généralement un résumé du contenu du site web ainsi qu’un lien de référence.

Type

Le type du robot d’exploration ChatGPT-User est assistant IA, car il est utilisé pour effectuer intelligemment des tâches au nom de l’utilisateur de ChatGPT.

Comportement du robot d’exploration

L’assistant de recherche ChatGPT-User devrait effectuer des visites ponctuelles en fonction de la demande de l’utilisateur, plutôt que de parcourir automatiquement le web comme d’autres robots d’exploration.

Comment bloquer l’assistant de recherche ChatGPT-User ?

Pour bloquer ce robot d’exploration, vous devez inclure l’instruction suivante dans le fichier robots.txt de votre site web :

User-agent: ChatGPT-User
Disallow: /

Meta-ExternalFetcher - Assistant de recherche IA 

Vue d’ensemble

Le robot d’exploration Meta-ExternalFetcher est envoyé par tous les produits de Meta AI pour répondre aux prompts utilisateur directs lorsqu’un lien individuel est requis.

Type

L’assistant IA Meta-ExternalFetcher est sollicité pour effectuer intelligemment des tâches au nom de l’utilisateur de Meta AI.

Comportement du robot d’exploration

Semblable au robot d’exploration ChatGPT-user, Meta-ExternalFetcher effectue généralement des visites ponctuelles basées sur la demande de l’utilisateur, plutôt que d’explorer automatiquement le web.

Comment bloquer l’assistant IA Meta-ExternalFetcher ?

Vous devez inclure la commande suivante dans le fichier robots.txt de votre site web pour empêcher l’accès de Meta-ExternalFetcher :

User-agent: Meta-ExternalFetcher
Disallow: /

Amazonbot - Robot d’exploration de recherche IA 

Vue d’ensemble

Le robot d’exploration web Amazonbot est utilisé par Amazon pour indexer et enregistrer les résultats de recherche, ce qui permet à l’assistant IA Alexa de répondre aux questions plus précisément. La plupart des réponses d’Alexa contiennent généralement une référence au site web.

Type

Amazonbot est un robot d’exploration de recherche IA utilisé pour indexer le contenu web destiné aux résultats de recherche d’Alexa alimentés par l’IA.

Comportement du robot d’exploration

La particularité des robots d’exploration de recherche est qu’ils ne suivent pas un schéma de visite fixe pour les sites web. La fréquence des visites est définie par de nombreux facteurs et se produit généralement à la demande, en réponse à une requête utilisateur, y compris pour Amazonbot.

Comment bloquer le robot d’exploration de recherche Amazonbot ?

Vous pouvez limiter l’accès d’Amazonbot à votre site web en saisissant les lignes de commande suivantes dans le fichier robots.txt de votre site web :

User-agent: Amazonbot
Disallow: /

Applebot - Robot d’exploration de recherche IA 

Vue d’ensemble

Le robot d’exploration de recherche Applebot est utilisé pour enregistrer les résultats de recherche, permettant à l’assistant IA Siri de répondre plus efficacement aux questions des utilisateurs. La plupart des réponses de Siri contiennent une référence aux sites web explorés par Applebot.

Type

Applebot est un robot d’exploration de recherche IA qui indexe le contenu web pour construire des résultats de recherche alimentés par l’IA.

Comportement du robot d’exploration

Le comportement d’Applebot varie selon plusieurs facteurs, tels que la demande de recherche, les sites web explorés et les requêtes des utilisateurs. Par défaut, les robots d’exploration de recherche ne s’appuient pas sur des visites fixes pour fournir des résultats.

Comment bloquer le robot d’exploration de recherche Applebot

Bien qu’il ne soit pas conseillé de bloquer les robots d’exploration de recherche, vous pouvez utiliser la commande suivante dans le fichier robots.txt du site web pour empêcher l’accès d’Applebot :

User-agent: Applebot
Disallow: /

OAI-SearchBot - Robot d’exploration de recherche IA

Vue d’ensemble

Le robot d’exploration OAI-SearchBot est utilisé pour construire un index de sites web pouvant être utilisé comme résultat du produit SearchGPT d’OpenAI.

Type

OAI-SearchBot est un robot d’exploration de recherche IA utilisé pour indexer le contenu web afin de fournir des résultats de recherche alimentés par l’IA plus précis pour le service SearchGPT d’OpenAI.

Comportement du robot d’exploration

Le comportement d’OAI-SearchBot peut être défini par la fréquence des recherches web et des requêtes utilisateur. Comme tout autre robot d’exploration de recherche, OAI-SearchBot ne s’appuie pas sur des visites fixes de sites web pour fournir des résultats.

Comment bloquer le robot d’exploration OAI-SearchBot ?

Incluez la commande suivante dans le fichier robots.txt de votre site web pour empêcher activement l’accès d’OAI-SearchBot :

User-agent: OAI-SearchBot
Disallow: /

PerplexityBot - Robot d’exploration de recherche IA

Vue d’ensemble

Perplexity utilise le robot d’exploration web PerplexityBot pour indexer les résultats de recherche afin de fournir une réponse plus efficace à son assistant IA.  Les réponses fournies par l’assistant affichent normalement des références intégrées vers diverses sources web.

Type

PerplexityBot est un robot d’exploration de recherche IA conçu pour indexer les résultats destinés aux résultats de recherche alimentés par l’IA de l’assistant IA Perplexity.

Comportement du robot d’exploration

Comme la plupart des robots d’exploration de recherche, PerplexityBot ne dépend pas d’un calendrier de visites fixe pour les sources web qu’il promeut. La fréquence des visites peut varier en fonction de plusieurs facteurs, tels que les requêtes des utilisateurs.

Comment bloquer le robot d’exploration de recherche PerplexityBot ?

Vous pouvez restreindre l’accès de PerplexityBot à votre site web en incluant la règle de jeton d’agent suivante dans robots.txt :

User-agent: PerplexityBot
Disallow: /

YouBot - Robot d’exploration de recherche IA

Vue d’ensemble

YouBot est un robot d’exploration de recherche déployé par You.ai pour indexer les résultats de recherche afin de fournir des réponses utilisateur plus précises via l’assistant IA You. Le bot renvoie généralement aux sites web référencés au moyen de sources intégrées.

Type

Le robot d’exploration de recherche YouBot indexe le contenu web afin de générer des résultats de recherche alimentés par l’IA plus précis.

Comportement du robot d’exploration

Le robot d’exploration YouBot n’a pas de calendrier de visites établi et la fréquence des visites se produit souvent à la demande ou en réponse à une requête utilisateur.

Comment bloquer le robot d’exploration de recherche YouBot ?

Vous devez coller la commande suivante dans le fichier robots.txt de votre site web pour empêcher l’accès du robot d’exploration YouBot :

User-agent: YouBot
Disallow: /

Applebot-Extended collecteur de données d’IA

Vue d’ensemble

Le collecteur de données d’IA Applebot-Extended est utilisé pour entraîner la gamme de modèles LLM d’APple qui alimentent les fonctionnalités d’IA générative de l’entreprise. Ce collecteur Applebot a une large application dans tous les aspects d’Apple intelligence, des Services et des Developer Tools.

Type

Applebot-Extended est un collecteur de données d’IA utilisé pour télécharger du contenu web et entraîner l’IA ou les LLM (Large Language Models)

Comportement du robot d’exploration

Bien que l’on ne sache pas exactement comment les collecteurs de données d’IA choisissent les sites web à explorer, on sait que les sources ayant une densité d’information plus élevée attirent ce collecteur Applebot. Il serait logique qu’un LLM privilégie les sites web qui publient et mettent régulièrement à jour les informations web présentes sur la page.

Comment bloquer le collecteur de données d’IA Applebot-Extended ?

Incluez la commande suivante dans le fichier robots.txt de votre site web pour bloquer Applebot-Extended :

User-agent: Applebot-Extended
Disallow: /

Bytespider collecteur de données d’IA

Vue d’ensemble

Exploité par ByteDance, Bytespider est un collecteur de données d’IA pour le propriétaire chinois de TikTok. Il est utilisé pour télécharger des données d’entraînement de LLM et fournir des données pertinentes.

Type

Bytespider est un collecteur de données d’IA utilisé pour entraîner des Large Language Models en téléchargeant du contenu depuis le web.

Comportement du robot d’exploration

Le collecteur de données d’IA Bytespider privilégie les sources web régulièrement mises à jour et riches en faits afin de les utiliser comme apport pour les LLMs.

Comment bloquer le collecteur de données d’IA Bytespider ?

Incluez la règle de jeton d’agent utilisateur suivante dans le fichier robots.txt de votre site web :

User-agent: Bytespider
Disallow: /

CCBot collecteur de données d’IA

Vue d’ensemble

CCBot appartient à Common Crawl afin de construire un référentiel open source à partir de données d’exploration web disponibles pour que chacun puisse y accéder et les utiliser.

Type

CCBot est un collecteur de données d’IA destiné à télécharger du contenu web et à mener l’entraînement de modèles d’IA.

Comportement du robot d’exploration

CCBot explore des sources web riches en informations afin de réaliser un entraînement de LLM plus efficace.

Comment bloquer le collecteur de données d’IA CCBot ?

Incluez la règle suivante dans robots.txt pour restreindre l’accès de CCBot :

User-agent: CCBot
Disallow: /

ClaudeBot - Collecteur de données d’IA

Vue d’ensemble

Le collecteur de données d’IA ClaudeBot est exploité par Anthropic pour fournir des données d’entraînement à des Large Language Models comme Claude.

Type

ClaudeBot est un collecteur de données d’IA destiné au téléchargement de contenu web et à l’entraînement de modèles d’IA.

Comportement du robot d’exploration

ClaudeBot choisit les sites web à explorer en fonction de la densité d’information et de la régularité des mises à jour des informations.

Comment bloquer le collecteur de données d’IA ClaudeBot ?

L’accès de ClaudeBot peut être révoqué en incluant la règle suivante dans robots.txt :

User-agent: ClaudeBot
Disallow: /

Diffbot - Collecteur de données d’IA

Vue d’ensemble

Diffbot est conçu pour structurer, comprendre, agréger et même vendre des données de sites web correctement structurées pour l’entraînement de modèles d’IA et la surveillance en temps réel.

Type

Diffbot est un collecteur de données d’IA conçu pour entraîner des modèles d’IA et télécharger/structurer des informations web.

Comportement du robot d’exploration

La fréquence des visites de Diffbot est définie par la qualité des informations de la source et la régularité des mises à jour.

Comment bloquer le collecteur de données d’IA Diffbot ?

L’exploration de Diffbot peut être empêchée en appliquant la règle suivante dans robots.txt :

User-agent: Diffbot
Disallow: /

FacebookBot - Collecteur de données d’IA

Vue d’ensemble

FacebookBot est déployé par Meta pour améliorer l’efficacité de la technologie de reconnaissance vocale par IA et pour entraîner des modèles d’IA.

Type

FacebookBot est un robot d’exploration collecteur de données d’IA, utilisé pour enregistrer du contenu web et l’entraînement de LLM.

Comportement du robot d’exploration

FacebookBot n’a pas de calendrier de visites fixe, mais il reconnaît peut-être les sources contenant des informations plus riches et bien mises à jour et s’appuie sur elles.

Comment bloquer le collecteur de données d’IA FacebookBot ?

L’accès de FacebookBot peut être révoqué avec la règle suivante :

User-agent: FacebookBot
Disallow: /

Google-Extended - Collecteur de données d’IA

Vue d’ensemble

Le robot d’exploration Google-Extended est utilisé pour fournir des informations d’entraînement aux produits d’IA appartenant à Google, tels que l’assistant Gemini et les API génératives Vertex AI.

Type

Le robot d’exploration Google-Extended est un collecteur de données d’IA destiné à télécharger des informations depuis le web et à mener l’entraînement de l’IA.

Comportement du robot d’exploration

Le calendrier de visites du bot Google-Extended est également flexible, mais il est beaucoup plus ciblé que celui d’autres robots d’exploration en raison de la riche base de données de Google composée de sources web d’informations fiables.

Comment bloquer le collecteur de données d’IA Google-Extended ?

Le robot d’exploration Google-Extended peut être mis sur liste noire avec la règle suivante :

User-agent: Google-Extended
Disallow: /

GPTBot - Collecteur de données d’IA

Vue d’ensemble

GPTBot est développé par OpenAI pour explorer des sources web et télécharger des données d’entraînement pour les Large Language Models de l’entreprise et des produits comme ChatGPT.

Type

GPTBot est un collecteur de données d’IA conçu pour télécharger et fournir un large éventail de données depuis le web.

Comportement du robot d’exploration

Comme d’autres collecteurs de données d’IA, GPTBot privilégie les sources et sites web riches en informations afin de fournir davantage d’informations pertinentes pour les procédures d’entraînement de l’IA.

Comment bloquer le collecteur de données d’IA GPTBot ?

Vous pouvez bloquer le collecteur de données d’IA GPTBot avec la règle robots.txt suivante :

User-agent: GPTBot
Disallow: /

Meta-ExternalAgent - Extracteur de données IA

Aperçu

Meta-ExternalAgent est une technologie de robot d’exploration développée par Meta pour améliorer les technologies d’IA de l’entreprise en téléchargeant et en indexant directement le contenu web.

Type

Le Meta-ExternalAgent utilise une technologie d’extraction de données IA pour télécharger et indexer du contenu web, destinée à l’entraînement de l’IA.

Comportement du robot d’exploration

À l’instar d’autres robots d’exploration développés par l’entreprise, le Meta-ExternalAgent utilise une stratégie d’exploration flexible pour identifier les sources web riches en informations.

Comment bloquer l’extracteur de données IA Meta-ExternalAgent ?

Ce robot d’exploration développé par Meta peut être restreint au moyen de la règle robots.txt suivante :

User-agent: Meta-ExternalAgent
Disallow: /

omgili - Extracteur de données IA

Aperçu

Le robot d’exploration omgili appartient à Webz.io et est conçu pour maintenir une bibliothèque constituée de données d’exploration web, qui est ensuite vendue à d’autres entreprises à des fins d’entraînement de l’IA.

Type

Le robot d’exploration omgili est un extracteur de données IA qui télécharge des informations d’entraînement de l’IA depuis le web.

Comportement du robot d’exploration

Comme les informations explorées sont ensuite vendues par Webz.io, le robot d’exploration omgili suit les sites web crédibles et autorisés contenant des informations pertinentes.

Comment bloquer l’extracteur de données IA omgili ?

Utilisez la règle suivante pour empêcher l’accès du robot d’exploration omgili à votre site web :

User-agent: omgili
Disallow: /

Anthropic-AI - Agent IA non documenté 

Aperçu

L’agent Anthropic-AI non confirmé tend à être utilisé pour télécharger des données d’entraînement pertinentes et les fournir aux produits alimentés par l’IA appartenant à l’entreprise, comme Claude.

Type

Le type exact de l’agent Anthropic-AI est encore inconnu en raison de l’absence de divulgation par l’entreprise.

Comportement du robot d’exploration

En raison de l’absence d’informations pertinentes sur l’agent Anthropic-AI, le robot d’exploration peut être utilisé à plusieurs fins, mais cela reste difficile à déterminer.

Comment bloquer l’agent Anthropic-AI ?

L’agent Anthropic-AI peut être bloqué avec la règle suivante :

User-agent: anthropic-ai
Disallow: /

Claude-Web - Agent IA non documenté

Aperçu

Claude-Web est un autre agent IA exploité par Anthropic, sans documentation officielle sur ses objectifs d’utilisation. Claude-Web devrait fournir des données d’entraînement LLM pertinentes pour Anthropic.

Type

Claude-Web sera soit un extracteur de données IA, soit un robot d’exploration de recherche standard pour le grand modèle de langage Claude 3.5 d’Anthropic.

Comportement du robot d’exploration

Anthropic retient les informations sur les fonctionnalités de Claude-Web, mais le comportement du robot d’exploration correspondra au type de l’agent une fois qu’il sera entièrement divulgué.

Comment bloquer l’agent Claude-Web ?

La règle suivante est utilisée pour suspendre l’accès d’exploration de l’agent Claude-Web à votre site web :

User-agent: Claude-Web
Disallow: /

Agent Cohere-AI - Non documenté

Aperçu

Cohere-AI est un agent non documenté développé par Cohere pour fournir à ses outils d’IA générative des informations d’étude pertinentes. Il récupère des informations sur le web lorsque les utilisateurs le demandent via Cohere AI.

Type

Comme aucune documentation n’est disponible pour cet agent Cohere AI, le type du robot d’exploration reste inconnu de nombreux propriétaires de sites web.

Comportement du robot d’exploration

On soupçonne que l’agent Cohere-AI sera polyvalent grâce à différents schémas comportementaux afin de fournir aux utilisateurs de Cohere des informations pertinentes et des liens de sources intégrés.

Comment bloquer l’agent Cohere-AI ?

Vous pouvez suspendre l’accès de l’agent Cohere-AI au moyen de la règle suivante :

User-agent: cohere-ai
Disallow: /

Ai2Bot - Robot d’exploration de recherche IA

Aperçu

La fonction principale d’Ai2Bot est d’explorer « certains domaines » et d’acquérir du contenu web pour l’entraînement de modèles de langage.

Type

Comme indiqué par Ai2, l’Ai2Bot est un robot d’exploration de recherche IA, car il analyse le contenu, les images et les vidéos du site web exploré.

Comportement du robot d’exploration

L’Ai2Bot n’explore que des sites web spécifiques, comme indiqué par l’entreprise, mais il peut élargir de jour en jour son éventail de domaines enregistrés.

Comment bloquer le robot d’exploration de recherche IA Ai2Bot ?

Incluez la règle suivante dans le robots.txt de votre site web pour suspendre l’Ai2Bot :

User-agent: Ai2Bot

Disallow: /

Ai2Bot-Dolma - Robot d’exploration de recherche IA

Aperçu

L’entreprise Ai2 possède le bot Ai2Bot-Dolma et respecte les règles robots.txt. Le contenu acquis est utilisé pour entraîner divers modèles de langage appartenant à l’entreprise.

Type

Bien que le bot n’ait pas de type spécifique attribué, nous pensons qu’il a le comportement d’un robot d’exploration de recherche IA standard.

Comportement du robot d’exploration

L’Ai2Bot-Dolma n’explore que « certains domaines » afin de trouver le contenu web requis pour l’entraînement de modèles de langage.

Comment bloquer le robot d’exploration de recherche IA Ai2Bot-Dolma ?

Utilisez la ligne robots.txt suivante pour restreindre l’accès d’Ai2Bot-Dolma :

User-agent: Ai2Bot-Dolma

Disallow: /

FriendlyCrawler - Inconnu

Aperçu

Bien que l’on sache peu de choses sur ce robot d’exploration, il respecte le robots.txt et est utilisé pour acquérir des données destinées à des expériences d’apprentissage automatique.

Type

Le type du bot est encore inconnu, mais nous pensons qu’il s’agit soit d’un robot d’exploration générique, soit d’un extracteur de données IA, d’après son comportement sur le web.

Comportement du robot d’exploration

On ne sait pas clairement qui est l’opérateur de ce bot, mais les données sont utilisées pour l’entraînement de grands modèles de langage, l’apprentissage automatique et la création de jeux de données.

Comment bloquer FriendlyCrawler ?

Voici comment suspendre l’accès de FriendlyCrawler à votre site web :

User-agent: FriendlyCrawler

Disallow: /

GoogleOther - Robot d’exploration de moteur de recherche

Aperçu

Le robot d’exploration GoogleOther est un bot appartenant à Google, mais il reste difficile de savoir s’il est lié à l’IA ou artificiellement intelligent. Actuellement, seul un faible pourcentage des sites web les plus performants ont bloqué le bot GoogleOther.

Type

Le bot GoogleOther est un robot d’exploration de moteur de recherche qui indexe le contenu web afin d’obtenir des résultats de moteur de recherche plus précis ou la SERP Google.

Comportement du robot d’exploration

Comme tout autre robot d’exploration de moteur de recherche, le bot GoogleOther ne suit pas de calendrier de visite particulier, et la fréquence de visite varie selon l’activité du site web et la qualité du contenu.

Comment bloquer le robot d’exploration de moteur de recherche GoogleOther ?

Ajoutez la règle suivante au fichier robots.txt de votre site web :

User-agent: GoogleOther

Disallow: /

GoogleOther-Image - Robot d’exploration générique

Aperçu

GoogleOther-Image est la version de GoogleOther proposée pour explorer, analyser et indexer les images sur le web

Type

Comme GoogleOther, le bot GoogleOther-Image est un robot d’exploration générique utilisé par diverses équipes produit pour rendre le contenu des sites web accessible au public. 

Comportement du robot d’exploration

Ce robot d’exploration ne respecte pas un calendrier de visite fixe, mais analyse les sources d’images les plus fiables du web et indexe des informations particulières.

Comment bloquer le robot d’exploration générique GoogleOther-Image ?

Vous pouvez bloquer ce robot d’exploration Google avec la commande suivante :

User-agent: GoogleOther-Image

Disallow: /

GoogleOther-Video - Robot d’exploration générique

Aperçu

Comme pour le robot d’exploration GoogleOther standard et le bot d’enregistrement d’images, GoogleOther-Video explore et analyse le contenu vidéo sur le web.

Type

Ce bot est un robot d’exploration générique au service de diverses équipes produit et entreprises afin d’obtenir une meilleure portée avec les vidéos téléversées sur leur site web.

Comportement du robot d’exploration

Comme les autres versions de GoogleOther, ce robot d’exploration dispose également d’un calendrier de visite flexible, défini par l’activité et la qualité du contenu vidéo du site web.

Comment bloquer le robot d’exploration générique GoogleOther-Video ?

Ce bot Google peut être bloqué avec la ligne robots.txt suivante :

User-agent: GoogleOther-Video

Disallow: /

ICC-Crawler - Inconnu

Aperçu

L’ICC-Crawler est un agent qui n’est toujours pas catégorisé par son créateur. On ignore encore si ce robot d’exploration est artificiellement intelligent ou a un lien avec l’IA.

Type

Comme pour sa source, le type du bot ICC-Crawler est également inconnu.

Comportement du robot d’exploration

Le comportement du bot varie selon le type du robot d’exploration, notamment selon qu’il s’agit d’un extracteur de données, d’un robot d’exploration de moteur de recherche ou d’un archiveur.

Comment bloquer ICC-Crawler ?

L’ICC-Crawler peut être bloqué avec la commande suivante :

User-agent: ICC-Crawler

Disallow: /

ImagesiftBot - Collecteur de renseignements

Aperçu

Le bot Imagesift appartient à Hive, mais on ignore actuellement si le robot d’exploration est lié à l’IA ou artificiellement intelligent. 

Type

L’ImagesiftBot est un collecteur de renseignements qui recherche des informations utiles sur le web et enregistre ou indexe les résultats dans une base de données.

Comportement du robot d’exploration

Le comportement des robots d’exploration collecteurs de renseignements dépend des objectifs de leurs clients. Par exemple, un client peut vouloir populariser sa marque, ce qui amène le bot à explorer les réseaux sociaux plus fréquemment que d’autres sites web sans rapport.

Comment bloquer le collecteur de renseignements ImagesiftBot ?

Ce robot d’exploration peut être bloqué de la manière suivante :

User-agent: ImagesiftBot

Disallow: /

PetalBot - Robot d’exploration de moteur de recherche

Aperçu

Le PetalBot appartenant à Huawei est actuellement suspendu sur 2 % des sites web indexés populaires. On ignore encore si ce robot d’exploration est artificiellement intelligent ou lié d’une quelconque manière à l’IA.

Type

PetalBot est un robot d’exploration de moteur de recherche qui indexe le contenu web et acquiert des données à partir des résultats des moteurs de recherche.

Comportement du robot d’exploration

Le comportement de PetalBot est défini par la qualité du contenu et l’activité des sites web et domaines enregistrés. Les robots d’exploration de moteurs de recherche ont tendance à explorer les sites web dont la qualité du contenu est plus élevée et l’activité fréquente.

Comment bloquer le robot d’exploration de moteur de recherche PetalBot ?

L’accès de PetalBot peut être suspendu de la manière suivante :

User-agent: PetalBot

Disallow: /

Scrapy - Extracteur IA

Aperçu

Scrapy appartient à Zyte et est actuellement bloqué sur plus de 3 % des domaines enregistrés sur le web.

Type

Scrapy est un extracteur IA, un type de robot d’exploration connu pour ne pas respecter le robots.txt d’un site web. Il finira par analyser les informations requises, même si cela signifie accéder à un site web qui comporte une règle robots.txt d’interdiction pour Scrapy.

Comportement du robot d’exploration

Prédire le calendrier de visite d’un extracteur IA est presque impossible. Ces robots d’exploration sont déployés à des fins différentes, et il est difficile de dire quels sites web ils exploreraient et à quelle fréquence.

Comment bloquer l’extracteur IA Scrapy ?

Bien que robots.txt ne fasse pas grand-chose contre les extracteurs IA, voici comment bloquer Scrapy :

User-agent: Scrapy

Disallow: /

Timpibot - Extracteur de données IA

Aperçu

Timpibot appartient à Timpi et est actuellement bloqué sur 3 % des sites web indexés populaires. Le seul objectif de Timpibot est d’acquérir des données web pour l’entraînement de modèles d’IA.

Type

Contrairement à un extracteur standard, Timpibot est un extracteur de données IA qui s’appuie uniquement sur l’intelligence artificielle pour explorer et indexer du contenu web. 

Comportement du robot d’exploration

Comme pour les extracteurs standard, le calendrier de visite des extracteurs de données IA est également incertain. Ces robots d’exploration ont tendance à choisir des sites web présentant une densité d’informations et une valeur de contenu plus élevées, selon les informations requises pour l’entraînement du modèle d’IA.

Comment bloquer l’extracteur de données IA Timpibot ?

L’accès de Timpibot peut être suspendu avec la règle robots.txt suivante :

User-agent: Timpibot

Disallow: /

VelenPublicWebCrawler - Collecteur de renseignements

Aperçu

Le VelenPublicCrawler est exploité par Hunter et a été bloqué par 0 % des sites web les mieux indexés sur le web.

Type

Le robot d’exploration est un collecteur de renseignements standard, destiné à recueillir des informations utiles à partir des résultats web.

Comportement du robot d’exploration

Les collecteurs de renseignements tendent à répondre aux objectifs de leurs clients et, dans la plupart des cas, ont des tâches spécifiques quant aux informations à collecter.

Comment bloquer le collecteur de renseignements VelenPublicWebCrawler ?

VelenPublicWebCrawler peut être bloqué avec la commande suivante :

User-agent: VelenPublicWebCrawler

Disallow: /

Webzio-Extended - Extracteur de données IA

Aperçu

Webzio-Extended est un autre robot d’exploration appartenant à Webz.io, utilisé pour maintenir le dépôt des données d’exploration acquises. Les informations sont ensuite vendues à d’autres entreprises et sont généralement utilisées pour l’entraînement de modèles d’IA.

Type

Webzio-Extended est un extracteur de données IA qui télécharge du contenu web dans le but d’entraîner des modèles d’IA.

Comportement du robot d’exploration

Les extracteurs de données IA tels que Webzio-Extended ne s’en tiennent pas à un calendrier fixe de visite des sites web. Les sources de données plus riches ont tendance à attirer davantage les extracteurs et à les amener à explorer plus souvent.

Comment bloquer l’extracteur de données IA Webzio-Extended ?

L’accès de Webzio-Extended à votre site web peut être suspendu avec la commande suivante :

User-agent: Webzio-Extended

Disallow: /

Facebookexternalhit - Récupérateur

Aperçu

Le robot d’exploration facebookexternalhit est un bot déployé par Meta, bloqué sur plus de 6 % des sites web populaires enregistrés. On ignore encore si le bot est artificiellement intelligent ou lié à l’IA.

Type

Facebookexternalhit est un récupérateur, qui explore les résultats web pour le compte d’une application. 

Comportement du robot d’exploration

Les récupérateurs sont généralement déployés pour visiter des sites web à la demande. Ils sont utilisés pour présenter les métadonnées d’un lien particulier, un titre ou une image miniature par exemple, à l’utilisateur demandeur.

Comment bloquer le récupérateur Facebookexternalhit ?

Ce robot d’exploration Meta peut être bloqué avec la règle robots.txt suivante :

User-agent: facebookexternalhit 

Disallow: /

Img2dataset - Inconnu

Aperçu

On sait qu’img2dataset est le seul robot d’exploration web de l’entreprise, destiné à télécharger un grand nombre d’images et à les convertir en jeux de données pour entraîner de grands modèles de langage.

Type

Le type d’img2dataset est encore inconnu, mais nous pensons qu’il s’agit d’un robot d’exploration de moteur de recherche IA, d’après son comportement et son calendrier de visite.

Comportement du robot d’exploration

Img2dataset tend à explorer les sites web disposant d’une base de données d’images plus riche et d’une variété de thèmes.

Comment bloquer le robot d’exploration img2dataset ?

Ce robot d’exploration peut être suspendu avec la règle suivante :

User-agent: img2dataset

Disallow: /

Comment bloquer les bots IA (version avancée) :

Il existe plusieurs possibilités uniques pour restreindre le trafic de bots indésirable vers votre site web :

La méthode la plus courante consiste à ajouter le texte suivant à votre fichier Robots.txt :

User-agent: name-of-bot
Disallow: /

Exemple :

User-agent: GPTBot
Disallow: /

Utiliser Robots.txt

La création d’un fichier robots.txt facilement accessible implique plusieurs étapes simples :

1. Créez un fichier nommé "robots.txt"

Au cours de cette étape, vous devez accéder au répertoire racine du site web. C’est là que le fichier doit être stocké afin de restreindre efficacement l’accès des robots d’exploration à votre site web. Gardez à l’esprit que votre site web ne peut avoir qu’un seul fichier robots.txt.

2. Rédigez les règles robots.txt

Vous pouvez utiliser n’importe quel éditeur pour créer le fichier, comme le Bloc-notes de Windows, TextEdit et vi. Assurez-vous que le fichier est enregistré avec l’encodage UTF-8 et procédez à l’application des règles.  Les robots d’exploration de Google répondent à l’ensemble de règles suivant : "user-agent," "disallow," "allow" et "sitemap." Chaque règle a son propre objectif en matière de gestion des robots d’exploration.

3. Téléversez le fichier robots.txt

L’étape suivante consiste à rendre le fichier robots.txt nouvellement créé accessible au public en ouvrant une fenêtre de navigation privée dans votre navigateur et en vous rendant à l’emplacement du fichier. Vous pouvez vérifier si le robots.txt est accessible publiquement en saisissant le domaine du site, par exemple "https://(site name)", et en ajoutant "/robots.txt" à la fin.

Exemple de Robots.txt bloquant les bots extracteurs de données IA

Comme nous l’avons établi précédemment, inclure une règle de restriction pour un bot particulier dans le robots.txt de votre site web ne désindexera pas la page ni ne la supprimera de la SERP. Lorsqu’il tentera d’accéder à votre page, le bot recevra automatiquement un message d’erreur et sera redirigé ailleurs, sans accéder au contenu de la page.

La page restera découvrable pour tous les utilisateurs et bots IA, mais les bots portant l’étiquette indiquée dans le fichier robots.txt n’y auront pas accès.

Ce fichier d’exemple bloque :

  • NON - Assistant de recherche IA
  • NON - Robot d’exploration de recherche IA
  • TOUS - Extracteur de données IA

Bloquer les extracteurs de données, mais pas le robot d’exploration ni l’assistant de recherche, vise à empêcher les données d’un site web d’être utilisées pour l’entraînement tout en permettant à la recherche/aux assistants IA d’envoyer du trafic vers le site web.

Pare-feu

Il existe plusieurs possibilités lorsqu’il s’agit de suspendre l’accès des bots IA avec l’aide d’un pare-feu. Passons en revue chacune de ces possibilités uniques :

  • Configurer le blocage d’IP

Si vous connaissez bien les adresses utilisées par les bots pour accéder à votre domaine, vous pouvez mettre les IP sur liste noire via le pare-feu de votre site web. C’est une pratique couramment connue pour réduire le trafic involontaire vers votre site web et préserver les ressources. Cependant, les bots peuvent faire tourner plusieurs IP.

  • Utiliser un logiciel CAPTCHA

La méthode peut-être la plus largement privilégiée pour suspendre à 100 % le trafic de bots vers votre site web consiste à mettre en œuvre un logiciel CAPTCHA qui exige une validation humaine. Chaque nouveau visiteur sera invité à réaliser un défi simple, comme assembler des pièces de puzzle ou identifier des objets sur un ensemble d’images, afin d’obtenir l’accès. Les pare-feu peuvent être modifiés pour déclencher des CAPTCHA.

Utiliser un CDN (Content Delivery Network)

Les services CDN tels que Cloudflare ou Amazon CloudFront peuvent être intégrés au pare-feu de votre site web afin de réduire le trafic des bots IA. Comme pour les défis CAPTCHA, seules les adresses IP valides appartenant à de vrais utilisateurs seront autorisées à accéder à votre site web.

Les défis émergents liés aux changements de noms de bots

Comme une grande variété de webmasters s’appuient sur robots.txt pour suspendre le trafic de bots indésirable vers leur site web, chaque règle du fichier vise un bot spécifique. Après que les entreprises ont commencé à constater la baisse du trafic de leurs bots, beaucoup ont décidé d’attribuer un nouveau nom à leurs bots qui ne figurait pas dans le fichier robots.txt de nombreux sites web.

Un exemple récent est la manière dont Anthropic a fusionné ses extracteurs de données IA nommés « ANTHROPIC-AI » et « CLAUDE-WEB » en un nouveau bot nommé « CLAUDEBOT ». Il a sûrement fallu un certain temps aux sites web pour s’en apercevoir et, entre-temps, le nouveau bot a eu un accès sans précédent à tous les sites web sur Internet.

Déclin des communs de données IA et conséquences

Avec l’utilisation croissante et généralisée des informations publiques par les entreprises d’IA pour entraîner de grands modèles de langage, l’inefficacité des protocoles web devient évidente. En réponse au scraping massif de données réalisé par des entreprises d’IA spécialisées dans les données web telles que C4, Dolma, et Refined Web, l’accès des robots d’exploration a connu une baisse de plus de 28 %-45 %.

Decline of AI Data Commons and Consequences
https://www.dataprovenance.org/Consent_in_Crisis.pdf

Au total, 45 % de C4 est désormais restreint, nombre de ces restrictions étant diverses et faisant évoluer les lois des infrastructures d’IA à usage général via robots.txt. La demande de consentement aux données devient de plus en plus complexe, non seulement pour l’IA commerciale, mais aussi pour tous les types de recherche universitaire et d’utilisation non commerciale de l’IA.

Conclusion

La collision entre les entreprises d’IA qui tentent de scraper autant de données que possible pour entraîner des LLMs et les éditeurs qui cherchent à défendre leurs données/leur bande passante contre les abus a donné lieu à une lutte intéressante qui se joue dans un fichier peu connu présent sur tous les sites web, appelé robots.txt. 

Ce guide vise à suivre l’évolution de ce conflit grâce à notre tableau de bord en direct, en montrant lesquels des top 1000 sites web bloquent les bots IA, comment les bloquer et lesquels vous devriez bloquer. 

S’il manque des bots que vous aimeriez voir inclus, veuillez nous contacter.

Détecteur de contenu IA & Vérificateur de plagiat pour les spécialistes du marketing et les rédacteurs

Utilisez nos outils de pointe pour vous assurer de pouvoir publier en toute intégrité !