Bots como GPTBot de OpenAI, el Applebot, CCBot, Google-Extended, y Bytespider analizan, almacenan o extraen datos de tu sitio web para proporcionar datos con los que entrenar LLMs más avanzados.
En Originality.ai, nos importa el desarrollo responsable (que incluye la extracción ética de datos) y el uso (AI Detector) de herramientas de escritura de IA generativa como ChatGPT.
Este artículo hará un análisis profundo del propósito de los bots de IA, qué hacen, cómo bloquearlos y la interesante batalla por el futuro de la IA que se desarrolla en un archivo poco conocido llamado robots.txt.
Los bots de IA vienen en múltiples formas, incluidos asistentes de IA, extractores de datos de IA, y rastreadores de búsqueda de IA, todos para impulsar herramientas de IA líderes y motores de búsqueda de IA. Cada uno de estos bots de IA extrae datos de la web. Numerosos webmasters consideran estas prácticas inaceptables y quieren mantener sus datos o la información de su sitio web a salvo de ser extraídos.
A medida que más partes de internet bloquean los bots de IA, el número de palabras disponibles para empresas de IA como OpenAI, Anthropic para desarrollar su LLM más reciente (como GPT-4o, Claude 3.5) disminuirá, lo que resultará en una mejora futura más lenta de las herramientas de IA.
La forma más común es añadir el siguiente texto a tu archivo Robots.txt:
User-agent: name-of-bot
Disallow: /
Ejemplo:
User-agent: GPTBot
Disallow: /
Consulta la parte inferior de este artículo para obtener una explicación más detallada de las opciones para bloquear bots de IA y un archivo Robots.txt de muestra.
OpenAI en particular ha sido activa intentando asegurar asociaciones de datos para seguir impulsando sus esfuerzos de entrenamiento de LLM.
Robots.txt es un protocolo de internet que proporciona a los rastreadores de motores de búsqueda información sobre qué URLs puede acceder el rastreador en tu sitio web. Se usa principalmente para evitar sobrecargar el dominio con solicitudes producidas por rastreadores.
Es importante saber que Robots.txt es una solicitud que los bots deberían seguir, pero no “tiene” que seguirse.
En términos de filtrar y gestionar el tráfico de rastreadores hacia tu sitio web, el propósito de robots.txt tiene una aplicación diferente según el tipo de archivo:
El propósito principal de robots.txt es restringir el acceso de rastreadores a páginas específicas de tu sitio web. Supongamos que te preocupa que el servidor de tu sitio web esté sobrecargado por demasiadas solicitudes de Google. En ese caso, puedes impedir que los rastreadores de motores de búsqueda accedan a páginas específicas de tu sitio web para reducir la utilización.
Puedes usar el archivo robots.txt para gestionar el tráfico de rastreo hacia imágenes, videos y archivos de audio. Esto impediría que medios específicos aparezcan en la SERP (página de resultados del motor de búsqueda) en Google u otros motores de búsqueda.
Si crees que hay una tasa de utilización particular causada por archivos de estilo, imágenes o scripts sin importancia, puedes usar el archivo robots.txt para restringir el acceso de rastreadores, extractores, asistentes u otros bots de IA particulares.
Repasemos los diferentes tipos de bots y rastreadores de IA implementados por empresas en la web:
Los asistentes de IA como el ChatGPT-User propiedad de OpenAI y el Meta-ExternalFetcher implementado por Meta desempeñan un papel vital al responder a las consultas de los usuarios. Las respuestas pueden estar en formato de texto o voz y usan los datos web recopilados para construir la respuesta más útil posible al prompt del usuario.
La extracción web con IA es un procedimiento llevado a cabo por bots extractores de datos de IA para recopilar tantos datos útiles como sea posible para el entrenamiento de LLM. Empresas como Apple, ByteDance, Common Crawl, OpenAI y Anthropic usan extractores de datos de IA para crear un gran conjunto de datos de la web con el que entrenar LLMs.
Muchas empresas implementan rastreadores de búsqueda de IA para recopilar información sobre páginas específicas de sitios web, títulos, palabras clave, imágenes y enlaces en línea referenciados. Aunque los rastreadores de IA tienen el potencial de enviar tráfico a un sitio web, algunos propietarios de sitios web siguen optando por bloquearlos.
ChatGPT-User es un rastreador asistente de búsqueda enviado por ChatGPT de Open AI como resultado de prompts de usuarios. La mayoría de sus respuestas normalmente incluirían un resumen del contenido del sitio web, así como un enlace de referencia.
El tipo del rastreador ChatGPT-User es asistente de IA, ya que se usa para realizar tareas de forma inteligente en nombre del usuario de ChatGPT.
Se espera que el asistente de búsqueda ChatGPT-User realice visitas puntuales dada la solicitud del usuario, en lugar de navegar por la web automáticamente como otros rastreadores.
Para bloquear este rastreador, debes incluir la siguiente declaración en el robots.txt de tu sitio web:
User-agent: ChatGPT-User
Disallow: /
El rastreador Meta-ExternalFetcher es enviado por todos los productos de Meta AI para dirigir prompts de usuarios siempre que se requiera un enlace individual.
El asistente de IA Meta-ExternalFetcher se recupera para realizar tareas de forma inteligente en nombre del usuario de Meta AI.
De manera similar al rastreador ChatGPT-user, Meta-ExternalFetcher generalmente realiza visitas puntuales según la solicitud del usuario, en lugar de rastrear automáticamente la web.
Debes incluir el siguiente comando en el robots.txt de tu sitio web para impedir el acceso de Meta-ExternalFetcher:
User-agent: Meta-ExternalFetcher
Disallow: /
El rastreador web Amazonbot es utilizado por Amazon para indexar y registrar resultados de búsqueda, lo que permite que el asistente de IA Alexa responda preguntas con mayor precisión. La mayoría de las respuestas de Alexa generalmente contienen una referencia al sitio web.
Amazonbot es un rastreador de búsqueda de IA que se usa para indexar contenido web para los resultados de búsqueda impulsados por IA de Alexa.
Lo específico de los rastreadores de búsqueda es que no se adhieren a un esquema fijo de visitas para sitios web. La frecuencia de visitas se define por muchos factores y normalmente ocurre bajo demanda ante una consulta de usuario, incluso por parte de Amazonbot.
Puedes limitar el acceso de Amazonbot a tu sitio web escribiendo las siguientes líneas de comando en el robots.txt de tu sitio web:
User-agent: Amazonbot
Disallow: /
El rastreador de búsqueda Applebot se usa para registrar resultados de búsqueda, lo que permite que el asistente de IA Siri responda las preguntas de los usuarios de manera más eficaz. La mayoría de las respuestas de Siri contienen una referencia a los sitios web rastreados por Applebot.
Applebot es un rastreador de búsqueda de IA que indexa contenido web para construir resultados de búsqueda impulsados por IA.
El comportamiento de Applebot varía según múltiples factores, como la demanda de búsqueda, los sitios web rastreados y las consultas de los usuarios. Por defecto, los rastreadores de búsqueda no dependen de visitas fijas para proporcionar resultados.
Aunque no se aconseja bloquear rastreadores de búsqueda, puedes usar el siguiente comando en el robots.txt del sitio web para impedir el acceso de Applebot:
User-agent: Applebot
Disallow: /
El rastreador OAI-SearchBot se utiliza para construir un índice de sitios web que puede usarse como resultado del producto SearchGPT de OpenAI.
OAI-SearchBot es un rastreador de búsqueda de IA utilizado para indexar contenido web con el fin de proporcionar resultados de búsqueda impulsados por IA más precisos para el servicio SearchGPT de OpenAI.
El comportamiento de OAI-SearchBot puede definirse por la frecuencia de las búsquedas web y las consultas de los usuarios. Como cualquier otro rastreador de búsqueda, OAI-SearchBot no depende de visitas fijas a sitios web para proporcionar resultados.
Incluye el siguiente comando en el archivo robots.txt de tu sitio web para impedir activamente el acceso de OAI-SearchBot:
User-agent: OAI-SearchBot
Disallow: /
Perplexity utiliza el rastreador web PerplexityBot para indexar resultados de búsqueda y ofrecer una respuesta más eficaz para su asistente de IA. Las respuestas proporcionadas por el asistente normalmente muestran referencias en línea a una variedad de fuentes web.
PerplexityBot es un rastreador de búsqueda de IA diseñado para indexar resultados para resultados de búsqueda impulsados por IA por el asistente de IA de Perplexity.
Como la mayoría de los rastreadores de búsqueda, PerplexityBot no depende de un calendario de visitas fijo para las fuentes web que promueve. La frecuencia de las visitas puede variar según múltiples factores, como las consultas de los usuarios.
Puedes restringir el acceso de PerplexityBot a tu sitio web incluyendo la siguiente regla de token de agente en el robots.txt:
User-agent: PerplexityBot
Disallow: /
YouBot es un rastreador de búsqueda implementado por You.ai para indexar resultados de búsqueda y ofrecer respuestas de usuario más precisas por parte del asistente de IA de You. El bot generalmente remite mediante fuentes en línea a los sitios web referenciados.
El rastreador de búsqueda YouBot indexa contenido web para generar resultados de búsqueda impulsados por IA más precisos.
El rastreador YouBot no tiene un calendario de visitas establecido y la frecuencia de las visitas suele ocurrir bajo demanda o en respuesta a una consulta de usuario.
Debes pegar el siguiente comando en el archivo robots.txt de tu sitio web para impedir el acceso del rastreador YouBot:
User-agent: YouBot
Disallow: /
El extractor de datos de IA Applebot-Extended se utiliza para entrenar la línea de modelos LLM de APple que impulsan las funciones de IA generativa de la empresa. Este extractor Applebot tiene una amplia aplicación en todos los aspectos de la inteligencia de Apple, servicios y herramientas para desarrolladores.
Applebot-Extended es un extractor de datos de IA utilizado para descargar contenido web y para entrenar IA o LLM (modelos de lenguaje de gran tamaño)
Aunque sigue sin estar claro cómo eligen exactamente los extractores de datos de IA qué sitio web rastrear, se sabe que las fuentes con una mayor densidad de información atraen a este extractor Applebot. Tendría sentido que un LLM favoreciera los sitios web que cargan y actualizan regularmente la información web de la página.
Incluye el siguiente comando en el archivo robots.txt de tu sitio web para bloquear Applebot-Extended:
User-agent: Applebot-Extended
Disallow: /
Operado por ByteDance, Bytespider es un extractor de datos de IA para el propietario chino de TikTok. Se utiliza para descargar datos de entrenamiento de LLM y proporcionar datos relacionados.
Bytespider es un extractor de datos de IA utilizado para entrenar modelos de lenguaje de gran tamaño descargando contenido de la web.
El extractor de datos de IA Bytespider favorece las fuentes web con información actualizada regularmente y rica en datos para usarla como suministro para LLMs.
Incluye la siguiente regla de token de agente de uso en el robots.txt de tu sitio web:
User-agent: Bytespider
Disallow: /
CCBot es propiedad de Common Crawl para crear un repositorio de código abierto mediante datos de rastreo web disponibles para que cualquiera pueda acceder y usarlos.
CCBot es un extractor de datos de IA destinado a descargar contenido web y realizar entrenamiento de modelos de IA.
CCBot rastrea fuentes web ricas en información para realizar un entrenamiento de LLM más eficaz.
Incluye la siguiente regla en robots.txt para restringir el acceso de CCBot:
User-agent: CCBot
Disallow: /
El extractor de datos de IA ClaudeBot es operado por Anthropic para suministrar datos de entrenamiento a modelos de lenguaje de gran tamaño como Claude.
ClaudeBot es un extractor de datos de IA destinado a descargar contenido web y entrenar modelos de IA.
ClaudeBot elige qué sitios web rastrear según la densidad de información y la regularidad de las actualizaciones de información.
El acceso de ClaudeBot puede revocarse incluyendo la siguiente regla en el robots.txt:
User-agent: ClaudeBot
Disallow: /
Diffbot está diseñado para estructurar, comprender, agregar e incluso vender datos de sitios web debidamente estructurados para el entrenamiento de modelos de IA y el monitoreo en tiempo real.
Diffbot es un extractor de datos de IA diseñado para entrenar modelos de IA y descargar/estructurar información web.
La frecuencia de las visitas de Diffbot está definida por la calidad de la información de la fuente y la regularidad de las actualizaciones.
El rastreo de Diffbot puede impedirse aplicando la siguiente regla en el robots.txt:
User-agent: Diffbot
Disallow: /
FacebookBot es implementado por Meta para mejorar la eficiencia de la tecnología de reconocimiento de voz de IA y para entrenar modelos de IA.
FacebookBot es un rastreador extractor de datos de IA, utilizado para registrar contenido web y entrenamiento de LLM.
FacebookBot no tiene un calendario de visitas fijo, pero quizás reconoce y se basa en fuentes con información más rica y bien actualizada.
El acceso de FacebookBot puede revocarse con la siguiente regla:
User-agent: FacebookBot
Disallow: /
El rastreador Google-Extended se utiliza para suministrar información de entrenamiento para productos de IA propiedad de Google, como el asistente Gemini y las APIs generativas Vertex AI.
El rastreador Google-Extended es un extractor de datos de IA destinado a descargar información de la web y realizar entrenamiento de IA.
El calendario de visitas del bot Google-Extended también es flexible, pero está mucho más dirigido que otros rastreadores debido a la rica base de datos de Google de fuentes web de información fiable.
El rastreador Google-Extended puede ponerse en lista negra con la siguiente regla:
User-agent: Google-Extended
Disallow: /
GPTBot es desarrollado por OpenAI para rastrear fuentes web y descargar datos de entrenamiento para los modelos de lenguaje de gran tamaño de la empresa y productos como ChatGPT.
GPTBot es un extractor de datos de IA diseñado para descargar y suministrar una amplia gama de datos de la web.
Como otros extractores de datos de IA, GPTBot favorece las fuentes y sitios web ricos en información para suministrar información más relacionada para los procedimientos de entrenamiento de IA.
Puedes bloquear el extractor de datos de IA GPTBot con la siguiente regla de robots.txt:
User-agent: GPTBot
Disallow: /
Meta-ExternalAgent es una tecnología de rastreo desarrollada por Meta para mejorar las tecnologías de IA de la empresa mediante la descarga e indexación directa de contenido web.
Meta-ExternalAgent utiliza una tecnología de raspador de datos de IA para descargar e indexar contenido web, destinada al entrenamiento de IA.
Al igual que otros rastreadores desarrollados por la empresa, Meta-ExternalAgent utiliza una estrategia de rastreo flexible para identificar fuentes web ricas en información.
Este rastreador desarrollado por Meta puede restringirse mediante la siguiente regla robots.txt:
User-agent: Meta-ExternalAgent
Disallow: /
El rastreador omgili es propiedad de Webz.io y está diseñado para mantener una biblioteca creada de datos de rastreo web que luego se vende a otras empresas con fines de entrenamiento de IA.
El rastreador omgili es un raspador de datos de IA que descarga información de entrenamiento de IA de la web.
Dado que la información rastreada luego es vendida por Webz.io, el rastreador omgili realiza un seguimiento de sitios web creíbles y autorizados con información relacionada.
Utilice la siguiente regla para impedir el acceso del rastreador omgili a su sitio web:
User-agent: omgili
Disallow: /
El agente Anthropic-AI no confirmado tiende a utilizarse para descargar datos de entrenamiento relacionados y suministrarlos a productos impulsados por IA propiedad de la empresa, como Claude.
El tipo exacto del agente Anthropic-AI aún se desconoce debido a la ausencia de divulgación por parte de la empresa.
Debido a la ausencia de información relacionada sobre el agente Anthropic-AI, el rastreador puede utilizarse para múltiples fines, pero aún es difícil saberlo.
El agente Anthropic-AI puede bloquearse con la siguiente regla:
User-agent: anthropic-ai
Disallow: /
Claude-Web es otro agente de IA operado por Anthropic, sin documentación oficial sobre sus fines de uso. Se espera que Claude-Web proporcione datos relacionados de entrenamiento de LLM para Anthropic.
Claude-Web será un raspador de datos de IA o un rastreador de búsqueda estándar para el modelo de lenguaje grande Claude 3.5 de Anthropic.
Anthropic está reteniendo información sobre las funcionalidades de Claude-Web, pero el comportamiento del rastreador corresponderá al tipo de agente una vez que se divulgue por completo.
La siguiente regla se utiliza para suspender el acceso de rastreo del agente Claude-Web a su sitio web:
User-agent: Claude-Web
Disallow: /
Cohere-AI es un agente no documentado desarrollado por Cohere para suministrar a sus herramientas de IA generativa información de estudio relacionada. Recupera información de la web cuando los usuarios se lo solicitan a través de Cohere AI.
Como no hay documentación disponible para este agente Cohere AI, el tipo de rastreador aún es desconocido para muchos de los propietarios de sitios web.
Se sospecha que el agente Cohere-AI tendrá múltiples propósitos mediante diferentes patrones de comportamiento para suministrar a los usuarios de Cohere información relacionada y enlaces de fuentes en línea.
Puede suspender el acceso del Cohere-AI Agent mediante la siguiente regla:
User-agent: cohere-ai
Disallow: /
La función principal de Ai2Bot es rastrear “ciertos dominios” y adquirir contenido web para entrenar modelos de lenguaje.
Según lo informado por Ai2, Ai2Bot es un rastreador de búsqueda de IA, ya que analiza contenido, imágenes y videos en el sitio web rastreado.
Ai2Bot solo rastrea sitios web específicos, según lo informado por la empresa, pero puede ampliar su rango de dominios registrados día a día.
Incluya la siguiente regla en el robots.txt de su sitio web para suspender Ai2Bot:
User-agent: Ai2Bot
Disallow: /
La empresa Ai2 posee el bot Ai2Bot-Dolma y respeta las reglas de robots.txt. El contenido adquirido se utiliza para entrenar una variedad de modelos de lenguaje propiedad de la empresa.
Aunque el bot no tiene un tipo específico asignado, creemos que tiene el comportamiento de un rastreador de búsqueda de IA estándar.
Ai2Bot-Dolma solo rastrea “ciertos dominios” para encontrar el contenido web requerido para entrenar modelos de lenguaje.
Utilice la siguiente línea de robots.txt para restringir el acceso de Ai2Bot-Dolma:
User-agent: Ai2Bot-Dolma
Disallow: /
Aunque no se sabe mucho sobre este rastreador, respeta el robots.txt y se utiliza para adquirir datos para experimentos de aprendizaje automático.
El tipo del bot aún es desconocido, pero creemos que es un rastreador genérico o un raspador de datos de IA según su comportamiento web.
No está claro quién es el operador de este bot, pero los datos se utilizan para entrenar modelos de lenguaje grandes, aprendizaje automático y creación de conjuntos de datos.
Así es como puede suspender el acceso de FriendlyCrawler a su sitio web:
User-agent: FriendlyCrawler
Disallow: /
El rastreador GoogleOther es un bot propiedad de Google, pero aún no está claro si está relacionado con la IA o si es artificialmente inteligente en absoluto. Actualmente, solo un pequeño porcentaje de los sitios web con mejor rendimiento han bloqueado el bot GoogleOther.
El bot GoogleOther es un rastreador de motores de búsqueda que indexa contenido web para obtener resultados de motores de búsqueda más precisos o la SERP de Google.
Como cualquier otro rastreador de motores de búsqueda, el bot GoogleOther no se adhiere a un calendario de visitas particular y la frecuencia de visitas varía según la actividad del sitio web y la calidad del contenido.
Añada la siguiente regla al archivo robots.txt de su sitio web:
User-agent: GoogleOther
Disallow: /
GoogleOther-Image es la versión de GoogleOther propuesta para rastrear, analizar e indexar imágenes en la web
Al igual que GoogleOther, el bot GoogleOther-Image es un rastreador genérico utilizado por varios equipos de producto para hacer que el contenido del sitio web sea accesible públicamente.
Este rastreador no se ciñe a un calendario de visitas fijo, sino que analiza las fuentes de imágenes más confiables de la web e indexa información particular.
Puede bloquear este rastreador de Google con el siguiente comando:
User-agent: GoogleOther-Image
Disallow: /
Al igual que con el rastreador GoogleOther estándar y el bot que registra imágenes, GoogleOther-Video rastrea y analiza contenido de video en la web.
Este bot es un rastreador genérico que presta servicio a una variedad de equipos de producto y ayuda a las empresas a obtener un mayor alcance con los videos subidos a su sitio web.
Al igual que las otras versiones de GoogleOther, este rastreador también tiene un calendario de visitas flexible definido por la actividad y la calidad del contenido de video del sitio web.
Este bot de Google puede bloquearse con la siguiente línea de robots.txt:
User-agent: GoogleOther-Video
Disallow: /
ICC-Crawler es un agente que aún no ha sido categorizado por el creador. Aún se desconoce si este rastreador es artificialmente inteligente o tiene algo que ver con la IA.
Al igual que con su fuente, el tipo del bot ICC-Crawler también es desconocido.
El comportamiento del bot varía según el tipo de rastreador, particularmente si es un raspador de datos, un rastreador de motores de búsqueda o un archivador.
ICC-Crawler puede bloquearse con el siguiente comando:
User-agent: ICC-Crawler
Disallow: /
El bot Imagesift es propiedad de Hive, pero actualmente se desconoce si el rastreador está relacionado con la IA o es inteligente artificialmente.
ImagesiftBot es un recopilador de inteligencia que busca información útil en la web y registra o indexa los resultados en una base de datos.
El comportamiento de los rastreadores recopiladores de inteligencia depende de los objetivos de sus clientes. Por ejemplo, un cliente podría estar interesado en popularizar su marca, lo que hace que el bot rastree las redes sociales con más frecuencia que otros sitios web no relacionados.
Este rastreador se puede bloquear de la siguiente manera:
User-agent: ImagesiftBot
Disallow: /
PetalBot, propiedad de Huawei, está actualmente suspendido en el 2% de los sitios web indexados populares. Todavía se desconoce si este rastreador es inteligente artificialmente o está relacionado con la IA de alguna manera.
PetalBot es un rastreador de motor de búsqueda que indexa contenido web y adquiere datos de los resultados de los motores de búsqueda.
El comportamiento de PetalBot se define por la calidad del contenido y la actividad de los sitios web y dominios registrados. Los rastreadores de motores de búsqueda tienden a rastrear sitios web con una mayor calidad de contenido y actividad frecuente.
El acceso de PetalBot se puede suspender de la siguiente manera:
User-agent: PetalBot
Disallow: /
Scrapy es propiedad de Zyte y actualmente está bloqueado en más del 3% de los dominios registrados en la web.
Scrapy es un extractor de IA, cuyos rastreadores son conocidos por no respetar el robots.txt de un sitio web. Finalmente analizará la información requerida, incluso si eso significa acceder a un sitio web que tiene una regla disallow de robots.txt para Scrapy.
Predecir el horario de visitas de un extractor de IA es casi imposible. Estos rastreadores se envían con diferentes propósitos y es difícil saber qué sitios web rastrearía y con qué frecuencia.
Aunque robots.txt no hace mucho contra los extractores de IA, así es como se bloquea Scrapy:
User-agent: Scrapy
Disallow: /
Timpibot es propiedad de Timpi y actualmente está bloqueado en el 3% de los sitios web indexados populares. El único propósito de Timpibot es adquirir datos web para el entrenamiento de modelos de IA.
A diferencia de un extractor estándar, Timpibot es un extractor de datos de IA que depende únicamente de la inteligencia artificial para rastrear e indexar contenido web.
Al igual que con los extractores estándar, el horario de visitas de los extractores de datos de IA tampoco está claro. Estos rastreadores tienden a elegir sitios web con una mayor densidad de información y valor de contenido, dependiendo de la información requerida para el entrenamiento del modelo de IA.
El acceso de Timpibot se puede suspender con la siguiente regla de robots.txt:
User-agent: Timpibot
Disallow: /
VelenPublicCrawler es operado por Hunter y ha sido bloqueado por el 0% de los sitios web mejor indexados en la web.
El rastreador es un recopilador de inteligencia estándar, diseñado para recopilar información útil de los resultados web.
Los recopiladores de inteligencia tienden a cumplir los objetivos de sus clientes y, en la mayoría de los casos, tienen tareas específicas sobre qué información recopilar.
VelenPublicWebCrawler se puede bloquear con el siguiente comando:
User-agent: VelenPublicWebCrawler
Disallow: /
Webzio-Extended es otro rastreador propiedad de Webz.io, utilizado para mantener el repositorio de los datos de rastreo adquiridos. Luego, la información se vende a otras empresas y normalmente se utiliza para el entrenamiento de modelos de IA.
Webzio-Extended es un extractor de datos de IA que descarga contenido web con el propósito de entrenar modelos de IA.
Los extractores de datos de IA como Webzio-Extended no se adhieren a una visita fija de sitios web. Las fuentes de datos más ricas tienden a atraer más a los extractores y hacen que rastreen con mayor frecuencia.
El acceso de Webzio-Extended a tu sitio web se puede suspender con el siguiente comando:
User-agent: Webzio-Extended
Disallow: /
El rastreador facebookexternalhit es un bot enviado por Meta bloqueado en más del 6% de los sitios web populares registrados. Aún no está claro si el bot es inteligente artificialmente o está relacionado con la IA.
Facebookexternalhit es un recuperador que rastrea resultados web en nombre de una aplicación.
Los recuperadores normalmente se envían para visitar sitios web bajo demanda. Se utilizan para presentar los metadatos de un enlace en particular, un título o una imagen en miniatura, por ejemplo, al usuario solicitante.
Este rastreador de Meta se puede bloquear con la siguiente regla de robots.txt:
User-agent: facebookexternalhit
Disallow: /
Se sabe que img2dataset es el único rastreador web de la empresa, diseñado para descargar una gran cantidad de imágenes y convertirlas en conjuntos de datos para entrenar modelos de lenguaje grandes.
El tipo de img2dataset aún se desconoce, pero creemos que es un rastreador de motor de búsqueda de IA, según su comportamiento y horario de visitas.
Img2dataset tiende a rastrear sitios web con una base de datos de imágenes más rica y con una variedad de temas.
Este rastreador se puede suspender con la siguiente regla:
User-agent: img2dataset
Disallow: /
Existen múltiples posibilidades únicas para restringir el tráfico de bots no deseado a tu sitio web:
La forma más común es añadir el siguiente texto a tu archivo Robots.txt:
User-agent: name-of-bot
Disallow: /
Ejemplo:
User-agent: GPTBot
Disallow: /
Crear un archivo robots.txt fácilmente accesible implica varios pasos sencillos:
Durante este paso, debes acceder al directorio raíz del sitio web. Aquí es donde se debe almacenar el archivo para restringir eficazmente el acceso de los rastreadores a tu sitio web. Ten en cuenta que tu sitio web puede tener un solo archivo robots.txt.
Puedes usar cualquier editor para crear el archivo, como NotePad de Windows, TextEdit y vi. Asegúrate de que el archivo se guarde con codificación UTF-8 y procede a aplicar las reglas. Los rastreadores de Google responden al siguiente conjunto de reglas: "user-agent," "disallow," "allow" y "sitemap." Cada regla tiene su propósito diferente en términos de gestión de rastreadores.
El siguiente paso es hacer que el archivo robots.txt recién creado sea accesible públicamente abriendo una ventana de navegación privada en tu navegador y dirigiéndote a la ubicación del archivo. Puedes comprobar si el robots.txt es accesible públicamente escribiendo el dominio del sitio, por ejemplo, "https://(site name)" y añadiendo "/robots.txt" al final.
Como establecimos anteriormente, incluir una regla de restricción para un bot en particular en el robots.txt de tu sitio web no desindexará la página ni la eliminará de la SERP. Al intentar acceder a tu página, el bot recibirá automáticamente un mensaje de error y será redirigido fuera, sin obtener acceso al contenido de la página.
La página seguirá siendo detectable para todos los usuarios y bots de IA, pero los bots que lleven el nombre incluido en el archivo robots.txt no tendrán acceso.
Este archivo de ejemplo bloquea:
Bloquear los extractores de datos, pero no el rastreador ni el asistente de búsqueda, tiene como objetivo restringir que los datos de un sitio web se utilicen para entrenamiento, pero permitir que la búsqueda/asistentes de IA envíen tráfico al sitio web.
Existen múltiples posibilidades cuando se trata de suspender el acceso de los bots de IA con la ayuda de un firewall. Revisemos cada una de las posibilidades únicas:
Si conoces bien las direcciones utilizadas por los bots para acceder a tu dominio, puedes poner las IP en una lista negra a través del firewall de tu sitio web. Es una práctica comúnmente conocida para reducir el tráfico no intencional a tu sitio web y preservar recursos. Sin embargo, los bots pueden rotar entre múltiples IP.
Quizás el método más ampliamente preferido para suspender al 100% el tráfico de bots a tu sitio web es implementar un software CAPTCHA que requiera validación humana. A cada nuevo visitante se le pedirá que complete un desafío simple, como unir piezas de un rompecabezas o identificar objetos en un conjunto de imágenes para obtener acceso. Los firewalls pueden modificarse para activar CAPTCHA.
Los servicios CDN como Cloudflare o Amazon CloudFront pueden integrarse con el firewall de tu sitio web para reducir el tráfico de bots de IA. Al igual que con los desafíos CAPTCHA, solo las direcciones IP válidas pertenecientes a usuarios reales podrán acceder a tu sitio web.
Como una amplia variedad de webmasters dependen de robots.txt para suspender el tráfico de bots no deseado a su sitio web, cada regla dentro del archivo se establece para un bot específico. Después de que las empresas comenzaron a percibir la disminución del tráfico de sus bots, muchas decidieron asignar a sus bots un nuevo nombre que no estuviera en el archivo robots.txt de muchos sitios web.
Un ejemplo reciente es cómo Anthropic ha fusionado sus extractores de datos de IA llamados “ANTHROPIC-AI” y “CLAUDE-WEB” en un nuevo bot llamado “CLAUDEBOT.” Seguramente los sitios web tardaron un tiempo en enterarse de esto y, mientras tanto, el nuevo bot tuvo acceso sin precedentes a todos los sitios web de internet.
Con el uso creciente y generalizado de información pública por parte de empresas de IA para enseñar a modelos de lenguaje grandes, la ineficacia de los protocolos web se está volviendo evidente. Como respuesta a la extracción masiva de datos realizada por empresas de IA de datos web como C4, Dolma, y Refined Web, ha habido una disminución del 28%-45% en el acceso de los rastreadores.

Un 45% completo de C4 ahora ha sido restringido, con muchas de las restricciones siendo diversas y escalando las leyes de las infraestructuras de IA de propósito general mediante robots.txt. La demanda de consentimiento de datos se está volviendo cada vez más desafiante no solo para la IA comercial, sino para todos los tipos de investigación académica y uso no comercial de IA.
La colisión entre las empresas de IA que intentan extraer tantos datos como sea posible para entrenar LLMs y los editores que trabajan para defender sus datos/ancho de banda del abuso ha dado lugar a una lucha interesante que se está desarrollando en un archivo poco conocido en todos los sitios web llamado robots.txt.
Esta guía tiene como objetivo rastrear cómo se está desarrollando este drama con nuestro panel en vivo, viendo cuáles de los 1000 principales sitios web están bloqueando bots de IA, cómo bloquearlos y cuáles deberías bloquear.
Si nos falta algún bot que te gustaría incluir, ponte en contacto.