Bloquea los bots de IA para que no rastreen sitios web usando Robots.txt

Vea el panel en vivo que muestra los sitios web que bloquean a bots de IA como GPTBot, CCBot, Google-extended y ByteSpider para que no rastreen ni extraigan el contenido de su sitio web. Aprenda qué hacen los rastreadores / extractores de IA y cómo bloquearlos usando Robots.txt.

Bots como GPTBot de OpenAI, el Applebot, CCBot, Google-Extended, y Bytespider analizan, almacenan o extraen datos de tu sitio web para proporcionar datos con los que entrenar LLMs más avanzados. 

En Originality.ai, nos importa el desarrollo responsable (que incluye la extracción ética de datos) y el uso (AI Detector) de herramientas de escritura de IA generativa como ChatGPT.  

Este artículo hará un análisis profundo del propósito de los bots de IA, qué hacen, cómo bloquearlos y la interesante batalla por el futuro de la IA que se desarrolla en un archivo poco conocido llamado robots.txt. 

¿Qué son los bots de IA?

Los bots de IA vienen en múltiples formas, incluidos asistentes de IA, extractores de datos de IA, y rastreadores de búsqueda de IA, todos para impulsar herramientas de IA líderes y motores de búsqueda de IA. Cada uno de estos bots de IA extrae datos de la web. Numerosos webmasters consideran estas prácticas inaceptables y quieren mantener sus datos o la información de su sitio web a salvo de ser extraídos. 

¿Por qué importa si los sitios web bloquean los bots de IA?

A medida que más partes de internet bloquean los bots de IA, el número de palabras disponibles para empresas de IA como  OpenAI, Anthropic para desarrollar su LLM más reciente (como GPT-4o, Claude 3.5) disminuirá, lo que resultará en una mejora futura más lenta de las herramientas de IA.

Cómo bloquear bots de IA (versión sencilla):

La forma más común es añadir el siguiente texto a tu archivo Robots.txt:

User-agent: name-of-bot

Disallow: /

Ejemplo:

User-agent: GPTBot

Disallow: /

Consulta la parte inferior de este artículo para obtener una explicación más detallada de las opciones para bloquear bots de IA y un archivo Robots.txt de muestra. 

OpenAI en particular ha sido activa intentando asegurar asociaciones de datos para seguir impulsando sus esfuerzos de entrenamiento de LLM. 

¿Qué es robots.txt y qué hace?

Robots.txt es un protocolo de internet que proporciona a los rastreadores de motores de búsqueda información sobre qué URLs puede acceder el rastreador en tu sitio web. Se usa principalmente para evitar sobrecargar el dominio con solicitudes producidas por rastreadores. 

Es importante saber que Robots.txt es una solicitud que los bots deberían seguir, pero no “tiene” que seguirse. 

En términos de filtrar y gestionar el tráfico de rastreadores hacia tu sitio web, el propósito de robots.txt tiene una aplicación diferente según el tipo de archivo:

Filtrado de páginas web

El propósito principal de robots.txt es restringir el acceso de rastreadores a páginas específicas de tu sitio web. Supongamos que te preocupa que el servidor de tu sitio web esté sobrecargado por demasiadas solicitudes de Google. En ese caso, puedes impedir que los rastreadores de motores de búsqueda accedan a páginas específicas de tu sitio web para reducir la utilización.

Filtrado de archivos multimedia

Puedes usar el archivo robots.txt para gestionar el tráfico de rastreo hacia imágenes, videos y archivos de audio. Esto impediría que medios específicos aparezcan en la SERP (página de resultados del motor de búsqueda) en Google u otros motores de búsqueda.

Archivo de recursos 

Si crees que hay una tasa de utilización particular causada por archivos de estilo, imágenes o scripts sin importancia, puedes usar el archivo robots.txt para restringir el acceso de rastreadores, extractores, asistentes u otros bots de IA particulares.

Tipos de bots de IA

Repasemos los diferentes tipos de bots y rastreadores de IA implementados por empresas en la web:

Asistentes de IA

Los asistentes de IA como el ChatGPT-User propiedad de OpenAI y el Meta-ExternalFetcher implementado por Meta desempeñan un papel vital al responder a las consultas de los usuarios. Las respuestas pueden estar en formato de texto o voz y usan los datos web recopilados para construir la respuesta más útil posible al prompt del usuario.

Extractores de datos de IA

La extracción web con IA es un procedimiento llevado a cabo por bots extractores de datos de IA para recopilar tantos datos útiles como sea posible para el entrenamiento de LLM. Empresas como Apple, ByteDance, Common Crawl, OpenAI y Anthropic usan extractores de datos de IA para crear un gran conjunto de datos de la web con el que entrenar LLMs.

Rastreadores de búsqueda de IA

Muchas empresas implementan rastreadores de búsqueda de IA para recopilar información sobre páginas específicas de sitios web, títulos, palabras clave, imágenes y enlaces en línea referenciados. Aunque los rastreadores de IA tienen el potencial de enviar tráfico a un sitio web, algunos propietarios de sitios web siguen optando por bloquearlos.

Descripción de bots de IA populares

Análisis profundo de bots de IA populares

ChatGPT-User - Asistente de búsqueda de IA 

Descripción general

ChatGPT-User es un rastreador asistente de búsqueda enviado por ChatGPT de Open AI como resultado de prompts de usuarios. La mayoría de sus respuestas normalmente incluirían un resumen del contenido del sitio web, así como un enlace de referencia.

Tipo

El tipo del rastreador ChatGPT-User es asistente de IA, ya que se usa para realizar tareas de forma inteligente en nombre del usuario de ChatGPT.

Comportamiento del rastreador

Se espera que el asistente de búsqueda ChatGPT-User realice visitas puntuales dada la solicitud del usuario, en lugar de navegar por la web automáticamente como otros rastreadores.

¿Cómo bloquear el asistente de búsqueda ChatGPT-User?

Para bloquear este rastreador, debes incluir la siguiente declaración en el robots.txt de tu sitio web:

User-agent: ChatGPT-User
Disallow: /

Meta-ExternalFetcher - Asistente de búsqueda de IA 

Descripción general

El rastreador Meta-ExternalFetcher es enviado por todos los productos de Meta AI para dirigir prompts de usuarios siempre que se requiera un enlace individual.

Tipo

El asistente de IA Meta-ExternalFetcher se recupera para realizar tareas de forma inteligente en nombre del usuario de Meta AI.

Comportamiento del rastreador

De manera similar al rastreador ChatGPT-user, Meta-ExternalFetcher generalmente realiza visitas puntuales según la solicitud del usuario, en lugar de rastrear automáticamente la web.

¿Cómo bloquear el asistente de IA Meta-ExternalFetcher?

Debes incluir el siguiente comando en el robots.txt de tu sitio web para impedir el acceso de Meta-ExternalFetcher:

User-agent: Meta-ExternalFetcher
Disallow: /

Amazonbot - Rastreador de búsqueda de IA 

Descripción general

El rastreador web Amazonbot es utilizado por Amazon para indexar y registrar resultados de búsqueda, lo que permite que el asistente de IA Alexa responda preguntas con mayor precisión. La mayoría de las respuestas de Alexa generalmente contienen una referencia al sitio web.

Tipo

Amazonbot es un rastreador de búsqueda de IA que se usa para indexar contenido web para los resultados de búsqueda impulsados por IA de Alexa.

Comportamiento del rastreador

Lo específico de los rastreadores de búsqueda es que no se adhieren a un esquema fijo de visitas para sitios web. La frecuencia de visitas se define por muchos factores y normalmente ocurre bajo demanda ante una consulta de usuario, incluso por parte de Amazonbot.

¿Cómo bloquear el rastreador de búsqueda Amazonbot?

Puedes limitar el acceso de Amazonbot a tu sitio web escribiendo las siguientes líneas de comando en el robots.txt de tu sitio web:

User-agent: Amazonbot
Disallow: /

Applebot - Rastreador de búsqueda de IA 

Descripción general

El rastreador de búsqueda Applebot se usa para registrar resultados de búsqueda, lo que permite que el asistente de IA Siri responda las preguntas de los usuarios de manera más eficaz. La mayoría de las respuestas de Siri contienen una referencia a los sitios web rastreados por Applebot.

Tipo

Applebot es un rastreador de búsqueda de IA que indexa contenido web para construir resultados de búsqueda impulsados por IA.

Comportamiento del rastreador

El comportamiento de Applebot varía según múltiples factores, como la demanda de búsqueda, los sitios web rastreados y las consultas de los usuarios. Por defecto, los rastreadores de búsqueda no dependen de visitas fijas para proporcionar resultados.

Cómo bloquear el rastreador de búsqueda Applebot

Aunque no se aconseja bloquear rastreadores de búsqueda, puedes usar el siguiente comando en el robots.txt del sitio web para impedir el acceso de Applebot:

User-agent: Applebot
Disallow: /

OAI-SearchBot - Rastreador de búsqueda de IA

Descripción general

El rastreador OAI-SearchBot se utiliza para construir un índice de sitios web que puede usarse como resultado del producto SearchGPT de OpenAI.

Tipo

OAI-SearchBot es un rastreador de búsqueda de IA utilizado para indexar contenido web con el fin de proporcionar resultados de búsqueda impulsados por IA más precisos para el servicio SearchGPT de OpenAI.

Comportamiento del rastreador

El comportamiento de OAI-SearchBot puede definirse por la frecuencia de las búsquedas web y las consultas de los usuarios. Como cualquier otro rastreador de búsqueda, OAI-SearchBot no depende de visitas fijas a sitios web para proporcionar resultados.

¿Cómo bloquear el rastreador OAI-SearchBot?

Incluye el siguiente comando en el archivo robots.txt de tu sitio web para impedir activamente el acceso de OAI-SearchBot:

User-agent: OAI-SearchBot
Disallow: /

PerplexityBot - rastreador de búsqueda de IA

Descripción general

Perplexity utiliza el rastreador web PerplexityBot para indexar resultados de búsqueda y ofrecer una respuesta más eficaz para su asistente de IA.  Las respuestas proporcionadas por el asistente normalmente muestran referencias en línea a una variedad de fuentes web.

Tipo

PerplexityBot es un rastreador de búsqueda de IA diseñado para indexar resultados para resultados de búsqueda impulsados por IA por el asistente de IA de Perplexity.

Comportamiento del rastreador

Como la mayoría de los rastreadores de búsqueda, PerplexityBot no depende de un calendario de visitas fijo para las fuentes web que promueve. La frecuencia de las visitas puede variar según múltiples factores, como las consultas de los usuarios.

¿Cómo bloquear el rastreador de búsqueda PerplexityBot?

Puedes restringir el acceso de PerplexityBot a tu sitio web incluyendo la siguiente regla de token de agente en el robots.txt:

User-agent: PerplexityBot
Disallow: /

YouBot - rastreador de búsqueda de IA

Descripción general

YouBot es un rastreador de búsqueda implementado por You.ai para indexar resultados de búsqueda y ofrecer respuestas de usuario más precisas por parte del asistente de IA de You. El bot generalmente remite mediante fuentes en línea a los sitios web referenciados.

Tipo

El rastreador de búsqueda YouBot indexa contenido web para generar resultados de búsqueda impulsados por IA más precisos.

Comportamiento del rastreador

El rastreador YouBot no tiene un calendario de visitas establecido y la frecuencia de las visitas suele ocurrir bajo demanda o en respuesta a una consulta de usuario.

¿Cómo bloquear el rastreador de búsqueda YouBot?

Debes pegar el siguiente comando en el archivo robots.txt de tu sitio web para impedir el acceso del rastreador YouBot:

User-agent: YouBot
Disallow: /

Extractor de datos de IA Applebot-Extended

Descripción general

El extractor de datos de IA Applebot-Extended se utiliza para entrenar la línea de modelos LLM de APple que impulsan las funciones de IA generativa de la empresa. Este extractor Applebot tiene una amplia aplicación en todos los aspectos de la inteligencia de Apple, servicios y herramientas para desarrolladores.

Tipo

Applebot-Extended es un extractor de datos de IA utilizado para descargar contenido web y para entrenar IA o LLM (modelos de lenguaje de gran tamaño)

Comportamiento del rastreador

Aunque sigue sin estar claro cómo eligen exactamente los extractores de datos de IA qué sitio web rastrear, se sabe que las fuentes con una mayor densidad de información atraen a este extractor Applebot. Tendría sentido que un LLM favoreciera los sitios web que cargan y actualizan regularmente la información web de la página.

¿Cómo bloquear el extractor de datos de IA Applebot-Extended?

Incluye el siguiente comando en el archivo robots.txt de tu sitio web para bloquear Applebot-Extended:

User-agent: Applebot-Extended
Disallow: /

Extractor de datos de IA Bytespider

Descripción general

Operado por ByteDance, Bytespider es un extractor de datos de IA para el propietario chino de TikTok. Se utiliza para descargar datos de entrenamiento de LLM y proporcionar datos relacionados.

Tipo

Bytespider es un extractor de datos de IA utilizado para entrenar modelos de lenguaje de gran tamaño descargando contenido de la web.

Comportamiento del rastreador

El extractor de datos de IA Bytespider favorece las fuentes web con información actualizada regularmente y rica en datos para usarla como suministro para LLMs.

¿Cómo bloquear el extractor de datos de IA Bytespider?

Incluye la siguiente regla de token de agente de uso en el robots.txt de tu sitio web:

User-agent: Bytespider
Disallow: /

Extractor de datos de IA CCBot

Descripción general

CCBot es propiedad de Common Crawl para crear un repositorio de código abierto mediante datos de rastreo web disponibles para que cualquiera pueda acceder y usarlos.

Tipo

CCBot es un extractor de datos de IA destinado a descargar contenido web y realizar entrenamiento de modelos de IA.

Comportamiento del rastreador

CCBot rastrea fuentes web ricas en información para realizar un entrenamiento de LLM más eficaz.

¿Cómo bloquear el extractor de datos de IA CCBot?

Incluye la siguiente regla en robots.txt para restringir el acceso de CCBot:

User-agent: CCBot
Disallow: /

ClaudeBot - extractor de datos de IA

Descripción general

El extractor de datos de IA ClaudeBot es operado por Anthropic para suministrar datos de entrenamiento a modelos de lenguaje de gran tamaño como Claude.

Tipo

ClaudeBot es un extractor de datos de IA destinado a descargar contenido web y entrenar modelos de IA.

Comportamiento del rastreador

ClaudeBot elige qué sitios web rastrear según la densidad de información y la regularidad de las actualizaciones de información.

¿Cómo bloquear el extractor de datos de IA ClaudeBot?

El acceso de ClaudeBot puede revocarse incluyendo la siguiente regla en el robots.txt:

User-agent: ClaudeBot
Disallow: /

Diffbot - extractor de datos de IA

Descripción general

Diffbot está diseñado para estructurar, comprender, agregar e incluso vender datos de sitios web debidamente estructurados para el entrenamiento de modelos de IA y el monitoreo en tiempo real.

Tipo

Diffbot es un extractor de datos de IA diseñado para entrenar modelos de IA y descargar/estructurar información web.

Comportamiento del rastreador

La frecuencia de las visitas de Diffbot está definida por la calidad de la información de la fuente y la regularidad de las actualizaciones.

¿Cómo bloquear el extractor de datos de IA Diffbot?

El rastreo de Diffbot puede impedirse aplicando la siguiente regla en el robots.txt:

User-agent: Diffbot
Disallow: /

FacebookBot - extractor de datos de IA

Descripción general

FacebookBot es implementado por Meta para mejorar la eficiencia de la tecnología de reconocimiento de voz de IA y para entrenar modelos de IA.

Tipo

FacebookBot es un rastreador extractor de datos de IA, utilizado para registrar contenido web y entrenamiento de LLM.

Comportamiento del rastreador

FacebookBot no tiene un calendario de visitas fijo, pero quizás reconoce y se basa en fuentes con información más rica y bien actualizada.

¿Cómo bloquear el extractor de datos de IA FacebookBot?

El acceso de FacebookBot puede revocarse con la siguiente regla:

User-agent: FacebookBot
Disallow: /

Google-Extended - extractor de datos de IA

Descripción general

El rastreador Google-Extended se utiliza para suministrar información de entrenamiento para productos de IA propiedad de Google, como el asistente Gemini y las APIs generativas Vertex AI.

Tipo

El rastreador Google-Extended es un extractor de datos de IA destinado a descargar información de la web y realizar entrenamiento de IA.

Comportamiento del rastreador

El calendario de visitas del bot Google-Extended también es flexible, pero está mucho más dirigido que otros rastreadores debido a la rica base de datos de Google de fuentes web de información fiable.

¿Cómo bloquear el extractor de datos de IA Google-Extended?

El rastreador Google-Extended puede ponerse en lista negra con la siguiente regla:

User-agent: Google-Extended
Disallow: /

GPTBot - extractor de datos de IA

Descripción general

GPTBot es desarrollado por OpenAI para rastrear fuentes web y descargar datos de entrenamiento para los modelos de lenguaje de gran tamaño de la empresa y productos como ChatGPT.

Tipo

GPTBot es un extractor de datos de IA diseñado para descargar y suministrar una amplia gama de datos de la web.

Comportamiento del rastreador

Como otros extractores de datos de IA, GPTBot favorece las fuentes y sitios web ricos en información para suministrar información más relacionada para los procedimientos de entrenamiento de IA.

¿Cómo bloquear el extractor de datos de IA GPTBot?

Puedes bloquear el extractor de datos de IA GPTBot con la siguiente regla de robots.txt:

User-agent: GPTBot
Disallow: /

Meta-ExternalAgent - Raspador de datos de IA

Descripción general

Meta-ExternalAgent es una tecnología de rastreo desarrollada por Meta para mejorar las tecnologías de IA de la empresa mediante la descarga e indexación directa de contenido web.

Tipo

Meta-ExternalAgent utiliza una tecnología de raspador de datos de IA para descargar e indexar contenido web, destinada al entrenamiento de IA.

Comportamiento del rastreador

Al igual que otros rastreadores desarrollados por la empresa, Meta-ExternalAgent utiliza una estrategia de rastreo flexible para identificar fuentes web ricas en información.

¿Cómo bloquear el raspador de datos de IA Meta-ExternalAgent?

Este rastreador desarrollado por Meta puede restringirse mediante la siguiente regla robots.txt:

User-agent: Meta-ExternalAgent
Disallow: /

omgili - Raspador de datos de IA

Descripción general

El rastreador omgili es propiedad de Webz.io y está diseñado para mantener una biblioteca creada de datos de rastreo web que luego se vende a otras empresas con fines de entrenamiento de IA.

Tipo

El rastreador omgili es un raspador de datos de IA que descarga información de entrenamiento de IA de la web.

Comportamiento del rastreador

Dado que la información rastreada luego es vendida por Webz.io, el rastreador omgili realiza un seguimiento de sitios web creíbles y autorizados con información relacionada.

¿Cómo bloquear el raspador de datos de IA omgili?

Utilice la siguiente regla para impedir el acceso del rastreador omgili a su sitio web:

User-agent: omgili
Disallow: /

Anthropic-AI - Agente de IA no documentado 

Descripción general

El agente Anthropic-AI no confirmado tiende a utilizarse para descargar datos de entrenamiento relacionados y suministrarlos a productos impulsados por IA propiedad de la empresa, como Claude.

Tipo

El tipo exacto del agente Anthropic-AI aún se desconoce debido a la ausencia de divulgación por parte de la empresa.

Comportamiento del rastreador

Debido a la ausencia de información relacionada sobre el agente Anthropic-AI, el rastreador puede utilizarse para múltiples fines, pero aún es difícil saberlo.

¿Cómo bloquear el agente Anthropic-AI?

El agente Anthropic-AI puede bloquearse con la siguiente regla:

User-agent: anthropic-ai
Disallow: /

Claude-Web - Agente de IA no documentado

Descripción general

Claude-Web es otro agente de IA operado por Anthropic, sin documentación oficial sobre sus fines de uso. Se espera que Claude-Web proporcione datos relacionados de entrenamiento de LLM para Anthropic.

Tipo

Claude-Web será un raspador de datos de IA o un rastreador de búsqueda estándar para el modelo de lenguaje grande Claude 3.5 de Anthropic.

Comportamiento del rastreador

Anthropic está reteniendo información sobre las funcionalidades de Claude-Web, pero el comportamiento del rastreador corresponderá al tipo de agente una vez que se divulgue por completo.

¿Cómo bloquear el agente Claude-Web?

La siguiente regla se utiliza para suspender el acceso de rastreo del agente Claude-Web a su sitio web:

User-agent: Claude-Web
Disallow: /

Cohere-AI Agent - No documentado

Descripción general

Cohere-AI es un agente no documentado desarrollado por Cohere para suministrar a sus herramientas de IA generativa información de estudio relacionada. Recupera información de la web cuando los usuarios se lo solicitan a través de Cohere AI.

Tipo

Como no hay documentación disponible para este agente Cohere AI, el tipo de rastreador aún es desconocido para muchos de los propietarios de sitios web.

Comportamiento del rastreador

Se sospecha que el agente Cohere-AI tendrá múltiples propósitos mediante diferentes patrones de comportamiento para suministrar a los usuarios de Cohere información relacionada y enlaces de fuentes en línea.

¿Cómo bloquear el agente Cohere-AI?

Puede suspender el acceso del Cohere-AI Agent mediante la siguiente regla:

User-agent: cohere-ai
Disallow: /

Ai2Bot - Rastreador de búsqueda de IA

Descripción general

La función principal de Ai2Bot es rastrear “ciertos dominios” y adquirir contenido web para entrenar modelos de lenguaje.

Tipo

Según lo informado por Ai2, Ai2Bot es un rastreador de búsqueda de IA, ya que analiza contenido, imágenes y videos en el sitio web rastreado.

Comportamiento del rastreador

Ai2Bot solo rastrea sitios web específicos, según lo informado por la empresa, pero puede ampliar su rango de dominios registrados día a día.

¿Cómo bloquear el rastreador de búsqueda de IA Ai2Bot?

Incluya la siguiente regla en el robots.txt de su sitio web para suspender Ai2Bot:

User-agent: Ai2Bot

Disallow: /

Ai2Bot-Dolma - Rastreador de búsqueda de IA

Descripción general

La empresa Ai2 posee el bot Ai2Bot-Dolma y respeta las reglas de robots.txt. El contenido adquirido se utiliza para entrenar una variedad de modelos de lenguaje propiedad de la empresa.

Tipo

Aunque el bot no tiene un tipo específico asignado, creemos que tiene el comportamiento de un rastreador de búsqueda de IA estándar.

Comportamiento del rastreador

Ai2Bot-Dolma solo rastrea “ciertos dominios” para encontrar el contenido web requerido para entrenar modelos de lenguaje.

¿Cómo bloquear el rastreador de búsqueda de IA Ai2Bot-Dolma?

Utilice la siguiente línea de robots.txt para restringir el acceso de Ai2Bot-Dolma:

User-agent: Ai2Bot-Dolma

Disallow: /

FriendlyCrawler - Desconocido

Descripción general

Aunque no se sabe mucho sobre este rastreador, respeta el robots.txt y se utiliza para adquirir datos para experimentos de aprendizaje automático.

Tipo

El tipo del bot aún es desconocido, pero creemos que es un rastreador genérico o un raspador de datos de IA según su comportamiento web.

Comportamiento del rastreador

No está claro quién es el operador de este bot, pero los datos se utilizan para entrenar modelos de lenguaje grandes, aprendizaje automático y creación de conjuntos de datos.

¿Cómo bloquear FriendlyCrawler?

Así es como puede suspender el acceso de FriendlyCrawler a su sitio web:

User-agent: FriendlyCrawler

Disallow: /

GoogleOther - Rastreador de motores de búsqueda

Descripción general

El rastreador GoogleOther es un bot propiedad de Google, pero aún no está claro si está relacionado con la IA o si es artificialmente inteligente en absoluto. Actualmente, solo un pequeño porcentaje de los sitios web con mejor rendimiento han bloqueado el bot GoogleOther.

Tipo

El bot GoogleOther es un rastreador de motores de búsqueda que indexa contenido web para obtener resultados de motores de búsqueda más precisos o la SERP de Google.

Comportamiento del rastreador

Como cualquier otro rastreador de motores de búsqueda, el bot GoogleOther no se adhiere a un calendario de visitas particular y la frecuencia de visitas varía según la actividad del sitio web y la calidad del contenido.

¿Cómo bloquear el rastreador de motores de búsqueda GoogleOther?

Añada la siguiente regla al archivo robots.txt de su sitio web:

User-agent: GoogleOther

Disallow: /

GoogleOther-Image - Rastreador genérico

Descripción general

GoogleOther-Image es la versión de GoogleOther propuesta para rastrear, analizar e indexar imágenes en la web

Tipo

Al igual que GoogleOther, el bot GoogleOther-Image es un rastreador genérico utilizado por varios equipos de producto para hacer que el contenido del sitio web sea accesible públicamente. 

Comportamiento del rastreador

Este rastreador no se ciñe a un calendario de visitas fijo, sino que analiza las fuentes de imágenes más confiables de la web e indexa información particular.

¿Cómo bloquear el rastreador genérico GoogleOther-Image?

Puede bloquear este rastreador de Google con el siguiente comando:

User-agent: GoogleOther-Image

Disallow: /

GoogleOther-Video - Rastreador genérico

Descripción general

Al igual que con el rastreador GoogleOther estándar y el bot que registra imágenes, GoogleOther-Video rastrea y analiza contenido de video en la web.

Tipo

Este bot es un rastreador genérico que presta servicio a una variedad de equipos de producto y ayuda a las empresas a obtener un mayor alcance con los videos subidos a su sitio web.

Comportamiento del rastreador

Al igual que las otras versiones de GoogleOther, este rastreador también tiene un calendario de visitas flexible definido por la actividad y la calidad del contenido de video del sitio web.

¿Cómo bloquear el rastreador genérico GoogleOther-Video?

Este bot de Google puede bloquearse con la siguiente línea de robots.txt:

User-agent: GoogleOther-Video

Disallow: /

ICC-Crawler - Desconocido

Descripción general

ICC-Crawler es un agente que aún no ha sido categorizado por el creador. Aún se desconoce si este rastreador es artificialmente inteligente o tiene algo que ver con la IA.

Tipo

Al igual que con su fuente, el tipo del bot ICC-Crawler también es desconocido.

Comportamiento del rastreador

El comportamiento del bot varía según el tipo de rastreador, particularmente si es un raspador de datos, un rastreador de motores de búsqueda o un archivador.

¿Cómo bloquear ICC-Crawler?

ICC-Crawler puede bloquearse con el siguiente comando:

User-agent: ICC-Crawler

Disallow: /

ImagesiftBot - Recopilador de inteligencia

Descripción general

El bot Imagesift es propiedad de Hive, pero actualmente se desconoce si el rastreador está relacionado con la IA o es inteligente artificialmente. 

Tipo

ImagesiftBot es un recopilador de inteligencia que busca información útil en la web y registra o indexa los resultados en una base de datos.

Comportamiento del rastreador

El comportamiento de los rastreadores recopiladores de inteligencia depende de los objetivos de sus clientes. Por ejemplo, un cliente podría estar interesado en popularizar su marca, lo que hace que el bot rastree las redes sociales con más frecuencia que otros sitios web no relacionados.

¿Cómo bloquear el recopilador de inteligencia ImagesiftBot?

Este rastreador se puede bloquear de la siguiente manera:

User-agent: ImagesiftBot

Disallow: /

PetalBot - Rastreador de motor de búsqueda

Descripción general

PetalBot, propiedad de Huawei, está actualmente suspendido en el 2% de los sitios web indexados populares. Todavía se desconoce si este rastreador es inteligente artificialmente o está relacionado con la IA de alguna manera.

Tipo

PetalBot es un rastreador de motor de búsqueda que indexa contenido web y adquiere datos de los resultados de los motores de búsqueda.

Comportamiento del rastreador

El comportamiento de PetalBot se define por la calidad del contenido y la actividad de los sitios web y dominios registrados. Los rastreadores de motores de búsqueda tienden a rastrear sitios web con una mayor calidad de contenido y actividad frecuente.

¿Cómo bloquear el rastreador de motor de búsqueda PetalBot?

El acceso de PetalBot se puede suspender de la siguiente manera:

User-agent: PetalBot

Disallow: /

Scrapy - Extractor de IA

Descripción general

Scrapy es propiedad de Zyte y actualmente está bloqueado en más del 3% de los dominios registrados en la web.

Tipo

Scrapy es un extractor de IA, cuyos rastreadores son conocidos por no respetar el robots.txt de un sitio web. Finalmente analizará la información requerida, incluso si eso significa acceder a un sitio web que tiene una regla disallow de robots.txt para Scrapy.

Comportamiento del rastreador

Predecir el horario de visitas de un extractor de IA es casi imposible. Estos rastreadores se envían con diferentes propósitos y es difícil saber qué sitios web rastrearía y con qué frecuencia.

¿Cómo bloquear el extractor de IA Scrapy?

Aunque robots.txt no hace mucho contra los extractores de IA, así es como se bloquea Scrapy:

User-agent: Scrapy

Disallow: /

Timpibot - Extractor de datos de IA

Descripción general

Timpibot es propiedad de Timpi y actualmente está bloqueado en el 3% de los sitios web indexados populares. El único propósito de Timpibot es adquirir datos web para el entrenamiento de modelos de IA.

Tipo

A diferencia de un extractor estándar, Timpibot es un extractor de datos de IA que depende únicamente de la inteligencia artificial para rastrear e indexar contenido web. 

Comportamiento del rastreador

Al igual que con los extractores estándar, el horario de visitas de los extractores de datos de IA tampoco está claro. Estos rastreadores tienden a elegir sitios web con una mayor densidad de información y valor de contenido, dependiendo de la información requerida para el entrenamiento del modelo de IA.

¿Cómo bloquear el extractor de datos de IA Timpibot?

El acceso de Timpibot se puede suspender con la siguiente regla de robots.txt:

User-agent: Timpibot

Disallow: /

VelenPublicWebCrawler - Recopilador de inteligencia

Descripción general

VelenPublicCrawler es operado por Hunter y ha sido bloqueado por el 0% de los sitios web mejor indexados en la web.

Tipo

El rastreador es un recopilador de inteligencia estándar, diseñado para recopilar información útil de los resultados web.

Comportamiento del rastreador

Los recopiladores de inteligencia tienden a cumplir los objetivos de sus clientes y, en la mayoría de los casos, tienen tareas específicas sobre qué información recopilar.

¿Cómo bloquear el recopilador de inteligencia VelenPublicWebCrawler?

VelenPublicWebCrawler se puede bloquear con el siguiente comando:

User-agent: VelenPublicWebCrawler

Disallow: /

Webzio-Extended - Extractor de datos de IA

Descripción general

Webzio-Extended es otro rastreador propiedad de Webz.io, utilizado para mantener el repositorio de los datos de rastreo adquiridos. Luego, la información se vende a otras empresas y normalmente se utiliza para el entrenamiento de modelos de IA.

Tipo

Webzio-Extended es un extractor de datos de IA que descarga contenido web con el propósito de entrenar modelos de IA.

Comportamiento del rastreador

Los extractores de datos de IA como Webzio-Extended no se adhieren a una visita fija de sitios web. Las fuentes de datos más ricas tienden a atraer más a los extractores y hacen que rastreen con mayor frecuencia.

¿Cómo bloquear el extractor de datos de IA Webzio-Extended?

El acceso de Webzio-Extended a tu sitio web se puede suspender con el siguiente comando:

User-agent: Webzio-Extended

Disallow: /

Facebookexternalhit - Recuperador

Descripción general

El rastreador facebookexternalhit es un bot enviado por Meta bloqueado en más del 6% de los sitios web populares registrados. Aún no está claro si el bot es inteligente artificialmente o está relacionado con la IA.

Tipo

Facebookexternalhit es un recuperador que rastrea resultados web en nombre de una aplicación. 

Comportamiento del rastreador

Los recuperadores normalmente se envían para visitar sitios web bajo demanda. Se utilizan para presentar los metadatos de un enlace en particular, un título o una imagen en miniatura, por ejemplo, al usuario solicitante.

¿Cómo bloquear el recuperador Facebookexternalhit?

Este rastreador de Meta se puede bloquear con la siguiente regla de robots.txt:

User-agent: facebookexternalhit 

Disallow: /

Img2dataset - Desconocido

Descripción general

Se sabe que img2dataset es el único rastreador web de la empresa, diseñado para descargar una gran cantidad de imágenes y convertirlas en conjuntos de datos para entrenar modelos de lenguaje grandes.

Tipo

El tipo de img2dataset aún se desconoce, pero creemos que es un rastreador de motor de búsqueda de IA, según su comportamiento y horario de visitas.

Comportamiento del rastreador

Img2dataset tiende a rastrear sitios web con una base de datos de imágenes más rica y con una variedad de temas.

¿Cómo bloquear el rastreador img2dataset?

Este rastreador se puede suspender con la siguiente regla:

User-agent: img2dataset

Disallow: /

Cómo bloquear bots de IA (versión avanzada):

Existen múltiples posibilidades únicas para restringir el tráfico de bots no deseado a tu sitio web:

La forma más común es añadir el siguiente texto a tu archivo Robots.txt:

User-agent: name-of-bot
Disallow: /

Ejemplo:

User-agent: GPTBot
Disallow: /

Usa Robots.txt

Crear un archivo robots.txt fácilmente accesible implica varios pasos sencillos:

1. Crea un archivo llamado "robots.txt"

Durante este paso, debes acceder al directorio raíz del sitio web. Aquí es donde se debe almacenar el archivo para restringir eficazmente el acceso de los rastreadores a tu sitio web. Ten en cuenta que tu sitio web puede tener un solo archivo robots.txt.

2. Escribe las reglas de robots.txt

Puedes usar cualquier editor para crear el archivo, como NotePad de Windows, TextEdit y vi. Asegúrate de que el archivo se guarde con codificación UTF-8 y procede a aplicar las reglas.  Los rastreadores de Google responden al siguiente conjunto de reglas: "user-agent," "disallow," "allow" y "sitemap." Cada regla tiene su propósito diferente en términos de gestión de rastreadores.

3. Sube el archivo robots.txt

El siguiente paso es hacer que el archivo robots.txt recién creado sea accesible públicamente abriendo una ventana de navegación privada en tu navegador y dirigiéndote a la ubicación del archivo. Puedes comprobar si el robots.txt es accesible públicamente escribiendo el dominio del sitio, por ejemplo, "https://(site name)" y añadiendo "/robots.txt" al final.

Ejemplo de Robots.txt para bloquear bots extractores de datos de IA

Como establecimos anteriormente, incluir una regla de restricción para un bot en particular en el robots.txt de tu sitio web no desindexará la página ni la eliminará de la SERP. Al intentar acceder a tu página, el bot recibirá automáticamente un mensaje de error y será redirigido fuera, sin obtener acceso al contenido de la página.

La página seguirá siendo detectable para todos los usuarios y bots de IA, pero los bots que lleven el nombre incluido en el archivo robots.txt no tendrán acceso.

Este archivo de ejemplo bloquea:

  • NO - Asistente de búsqueda de IA
  • NO - Rastreador de búsqueda de IA
  • ALL - Extractor de datos de IA

Bloquear los extractores de datos, pero no el rastreador ni el asistente de búsqueda, tiene como objetivo restringir que los datos de un sitio web se utilicen para entrenamiento, pero permitir que la búsqueda/asistentes de IA envíen tráfico al sitio web.

Firewall

Existen múltiples posibilidades cuando se trata de suspender el acceso de los bots de IA con la ayuda de un firewall. Revisemos cada una de las posibilidades únicas:

  • Configurar el bloqueo de IP

Si conoces bien las direcciones utilizadas por los bots para acceder a tu dominio, puedes poner las IP en una lista negra a través del firewall de tu sitio web. Es una práctica comúnmente conocida para reducir el tráfico no intencional a tu sitio web y preservar recursos. Sin embargo, los bots pueden rotar entre múltiples IP.

  • Usar software CAPTCHA

Quizás el método más ampliamente preferido para suspender al 100% el tráfico de bots a tu sitio web es implementar un software CAPTCHA que requiera validación humana. A cada nuevo visitante se le pedirá que complete un desafío simple, como unir piezas de un rompecabezas o identificar objetos en un conjunto de imágenes para obtener acceso. Los firewalls pueden modificarse para activar CAPTCHA.

Usa una CDN (Content Delivery Network)

Los servicios CDN como Cloudflare o Amazon CloudFront pueden integrarse con el firewall de tu sitio web para reducir el tráfico de bots de IA. Al igual que con los desafíos CAPTCHA, solo las direcciones IP válidas pertenecientes a usuarios reales podrán acceder a tu sitio web.

Los desafíos emergentes de los cambios de nombre de los bots

Como una amplia variedad de webmasters dependen de robots.txt para suspender el tráfico de bots no deseado a su sitio web, cada regla dentro del archivo se establece para un bot específico. Después de que las empresas comenzaron a percibir la disminución del tráfico de sus bots, muchas decidieron asignar a sus bots un nuevo nombre que no estuviera en el archivo robots.txt de muchos sitios web.

Un ejemplo reciente es cómo Anthropic ha fusionado sus extractores de datos de IA llamados “ANTHROPIC-AI” y “CLAUDE-WEB” en un nuevo bot llamado “CLAUDEBOT.” Seguramente los sitios web tardaron un tiempo en enterarse de esto y, mientras tanto, el nuevo bot tuvo acceso sin precedentes a todos los sitios web de internet.

Declive de los bienes comunes de datos de IA y sus consecuencias

Con el uso creciente y generalizado de información pública por parte de empresas de IA para enseñar a modelos de lenguaje grandes, la ineficacia de los protocolos web se está volviendo evidente. Como respuesta a la extracción masiva de datos realizada por empresas de IA de datos web como C4, Dolma, y Refined Web, ha habido una disminución del 28%-45% en el acceso de los rastreadores.

Decline of AI Data Commons and Consequences
https://www.dataprovenance.org/Consent_in_Crisis.pdf

Un 45% completo de C4 ahora ha sido restringido, con muchas de las restricciones siendo diversas y escalando las leyes de las infraestructuras de IA de propósito general mediante robots.txt. La demanda de consentimiento de datos se está volviendo cada vez más desafiante no solo para la IA comercial, sino para todos los tipos de investigación académica y uso no comercial de IA.

Conclusión

La colisión entre las empresas de IA que intentan extraer tantos datos como sea posible para entrenar LLMs y los editores que trabajan para defender sus datos/ancho de banda del abuso ha dado lugar a una lucha interesante que se está desarrollando en un archivo poco conocido en todos los sitios web llamado robots.txt. 

Esta guía tiene como objetivo rastrear cómo se está desarrollando este drama con nuestro panel en vivo, viendo cuáles de los 1000 principales sitios web están bloqueando bots de IA, cómo bloquearlos y cuáles deberías bloquear. 

Si nos falta algún bot que te gustaría incluir, ponte en contacto.

Detector de contenido de IA & Verificador de plagio para profesionales del marketing y escritores

¡Usa nuestras herramientas líderes para asegurarte de poder publicar con integridad!