Impeça que bots de IA rastreiem sites usando Robots.txt

Veja o painel ao vivo mostrando os sites que estão bloqueando bots de IA como GPTBot, CCBot, Google-extended e ByteSpider de rastrear e extrair o conteúdo em seu site. Saiba quais crawlers / scrapers de IA fazem o quê e como bloqueá-los usando Robots.txt.

Bots como o GPTBot da OpenAI, o Applebot, CCBot, Google-Extended, e Bytespider analisam, armazenam ou fazem scraping dos dados do seu site para fornecer dados para treinar LLMs mais avançados. 

Na Originality.ai, nos importamos com o desenvolvimento responsável (que inclui scraping ético) e o uso (AI Detector) de ferramentas de escrita com IA generativa como ChatGPT.  

Este artigo fará uma análise aprofundada do propósito dos bots de IA, o que eles fazem, como bloqueá-los e a interessante batalha pelo futuro da IA que se desenrola em um arquivo pouco conhecido chamado robots.txt. 

O que são bots de IA?

Bots de IA vêm em várias formas, incluindo assistentes de IA, scrapers de dados de IA, e rastreadores de busca de IA, todos para impulsionar ferramentas de IA líderes e mecanismos de busca de IA. Cada um desses bots de IA extrai dados da web. Muitos webmasters consideram essas práticas inaceitáveis e querem manter seus dados ou as informações de seus sites protegidos contra scraping. 

Por que importa se os sites bloqueiam bots de IA?

À medida que mais partes da internet bloqueiam bots de IA, o número de palavras disponível para empresas de IA como  OpenAI, Anthropic para desenvolver seu LLM mais recente (como GPT-4o, Claude 3.5) diminuirá, resultando em melhorias futuras mais lentas das ferramentas de IA.

Como bloquear bots de IA (versão simples):

A forma mais comum é adicionar o seguinte texto ao seu arquivo Robots.txt:

User-agent: name-of-bot

Disallow: /

Exemplo:

User-agent: GPTBot

Disallow: /

Veja o final deste artigo para uma explicação mais aprofundada das opções para bloquear bots de IA e um arquivo Robots.txt de exemplo. 

A OpenAI, em particular, tem sido ativa na tentativa de garantir parcerias de dados para continuar alimentando seus esforços de treinamento de LLM. 

O que é robots.txt e o que ele faz?

Robots.txt é um protocolo da internet que fornece aos rastreadores de mecanismos de busca informações sobre quais URLs o rastreador pode acessar em seu site. Ele é usado principalmente para evitar a sobrecarga do domínio com solicitações produzidas por rastreadores. 

É importante saber que Robots.txt é uma solicitação que os bots devem seguir, mas que não “precisa” ser seguida. 

Em termos de filtragem e gerenciamento do tráfego de rastreadores para o seu site, o propósito do robots.txt tem uma aplicação diferente dependendo do tipo de arquivo:

Filtragem de páginas da web

O principal objetivo do robots.txt é restringir o acesso de rastreadores a páginas específicas do seu site. Suponha que você tenha preocupações de que o servidor do seu site esteja sobrecarregado por muitas solicitações do Google. Nesse caso, você pode impedir que rastreadores de mecanismos de busca acessem páginas específicas do seu site para reduzir a utilização.

Filtragem de arquivos de mídia

Você pode usar o arquivo robots.txt para gerenciar o tráfego de rastreamento para imagens, vídeos e arquivos de áudio. Isso impediria que mídias específicas aparecessem na SERP (Página de resultados do mecanismo de busca) no Google ou em outros mecanismos de busca.

Arquivo de recursos 

Se você acha que há uma taxa de utilização específica causada por arquivos de estilo, imagens ou scripts sem importância, pode usar o arquivo robots.txt para restringir o acesso de rastreadores, scrapers, assistentes de IA específicos ou outros bots.

Tipos de bots de IA

Vamos revisar os diferentes tipos de bots e rastreadores de IA implantados por empresas na web:

Assistentes de IA

Assistentes de IA, como o ChatGPT-User pertencente à OpenAI e o Meta-ExternalFetcher implantado pela Meta, desempenham um papel vital ao responder às consultas dos usuários. As respostas podem estar em formato de texto ou voz e usam os dados da web coletados para construir a resposta mais útil possível ao prompt do usuário.

Scrapers de dados de IA

O scraping da web com IA é um procedimento realizado por bots AI Data Scraper para coletar o máximo possível de dados úteis para o treinamento de LLM. Empresas como Apple, ByteDance, Common Crawl, OpenAI e Anthropic usam AI Data Scrapers para criar um grande conjunto de dados da web no qual LLMs podem ser treinados.

Rastreadores de busca de IA

Muitas empresas implantam rastreadores de busca de IA para coletar informações sobre páginas específicas de sites, títulos, palavras-chave, imagens e links inline referenciados. Embora os rastreadores de IA tenham o potencial de enviar tráfego para um site, alguns proprietários de sites ainda estão escolhendo bloqueá-los.

Descrição de bots de IA populares

Análise profunda de bots de IA populares

ChatGPT-User - Assistente de busca de IA 

Visão geral

ChatGPT-User é um rastreador assistente de busca enviado pelo ChatGPT da OpenAI como resultado de prompts de usuários. A maioria de suas respostas normalmente incluiria um resumo do conteúdo do site, bem como um link de referência.

Tipo

O tipo do rastreador ChatGPT-User é assistente de IA, pois ele é usado para realizar tarefas de forma inteligente em nome do usuário do ChatGPT.

Comportamento do rastreador

Espera-se que o ChatGPT-User Search Assistant faça visitas pontuais conforme a solicitação do usuário, em vez de navegar automaticamente pela web como outros rastreadores.

Como bloquear o ChatGPT-User Search Assistant?

Para bloquear este rastreador, você deve incluir a seguinte declaração no robots.txt do seu site:

User-agent: ChatGPT-User
Disallow: /

Meta-ExternalFetcher - Assistente de busca de IA 

Visão geral

O rastreador Meta-ExternalFetcher é enviado por todos os produtos da Meta AI para responder a prompts de usuários sempre que um link individual é necessário.

Tipo

O Meta-ExternalFetcher AI Assistant é buscado para executar tarefas de forma inteligente em nome do usuário da Meta AI.

Comportamento do rastreador

Semelhante ao rastreador ChatGPT-user, o Meta-ExternalFetcher geralmente faz visitas pontuais com base na solicitação do usuário, em vez de rastrear automaticamente a web.

Como bloquear o Meta-ExternalFetcher AI Assistant?

Você deve incluir o seguinte comando no robots.txt do seu site para impedir o acesso do Meta-ExternalFetcher:

User-agent: Meta-ExternalFetcher
Disallow: /

Amazonbot - Rastreador de busca de IA 

Visão geral

O rastreador da web Amazonbot é usado pela Amazon para indexar e registrar resultados de busca, o que permite que a Alexa AI Assistant responda a perguntas com mais precisão. A maioria das respostas da Alexa geralmente contém uma referência ao site.

Tipo

Amazonbot é um rastreador de busca de IA usado para indexar conteúdo da web para os resultados de busca com tecnologia de IA da Alexa.

Comportamento do rastreador

O aspecto específico dos rastreadores de busca é que eles não seguem um esquema fixo de visitas para sites. A frequência de visitas é definida por muitos fatores e normalmente ocorre sob demanda para uma consulta de usuário, inclusive pelo Amazonbot.

Como bloquear o rastreador de busca Amazonbot?

Você pode limitar o acesso do Amazonbot ao seu site digitando as seguintes linhas de comando no robots.txt do seu site:

User-agent: Amazonbot
Disallow: /

Applebot - Rastreador de busca de IA 

Visão geral

O rastreador de busca Applebot é usado para registrar resultados de busca, permitindo que a Siri AI Assistant responda às perguntas dos usuários de forma mais eficaz. A maioria das respostas da Siri contém uma referência aos sites rastreados pelo Applebot.

Tipo

Applebot é um rastreador de busca de IA que indexa conteúdo da web para construir resultados de busca com tecnologia de IA.

Comportamento do rastreador

O comportamento do Applebot varia com base em vários fatores, como demanda de busca, sites rastreados e consultas de usuários. Por padrão, os rastreadores de busca não dependem de visitas fixas para fornecer resultados.

Como bloquear o rastreador de busca Applebot

Embora não seja recomendado bloquear rastreadores de busca, você pode usar o seguinte comando no robots.txt do site para impedir o acesso do Applebot:

User-agent: Applebot
Disallow: /

OAI-SearchBot - Rastreador de busca de IA

Visão geral

O rastreador OAI-SearchBot é utilizado para construir um índice de sites que pode ser usado como resultado do produto SearchGPT da OpenAI.

Tipo

O OAI-SearchBot é um rastreador de busca de IA usado para indexar conteúdo da web a fim de fornecer resultados de busca com tecnologia de IA mais precisos para o serviço SearchGPT da OpenAI.

Comportamento do rastreador

O comportamento do OAI-SearchBot pode ser definido pela frequência de buscas na web e consultas de usuários. Como qualquer outro rastreador de busca, o OAI-SearchBot não depende de visitas fixas a sites para fornecer resultados.

Como bloquear o rastreador OAI-SearchBot?

Inclua o seguinte comando no arquivo robots.txt do seu site para impedir ativamente o acesso do OAI-SearchBot:

User-agent: OAI-SearchBot
Disallow: /

PerplexityBot - Rastreador de busca de IA

Visão geral

A Perplexity usa o rastreador da web PerplexityBot para indexar resultados de busca para uma resposta mais eficaz de seu AI Assistant.  As respostas fornecidas pelo assistente normalmente exibem referências inline a uma variedade de fontes da web.

Tipo

O PerplexityBot é um rastreador de busca de IA projetado para indexar resultados para resultados de busca com tecnologia de IA pelo Perplexity AI Assistant.

Comportamento do rastreador

Como a maioria dos rastreadores de busca, o PerplexityBot não depende de um cronograma fixo de visitas para as fontes da web que promove. A frequência de visitas pode variar com base em vários fatores, como consultas de usuários.

Como bloquear o rastreador de busca PerplexityBot?

Você pode restringir o acesso do PerplexityBot ao seu site incluindo a seguinte regra de token de agente no robots.txt:

User-agent: PerplexityBot
Disallow: /

YouBot - Rastreador de busca de IA

Visão geral

O YouBot é um rastreador de busca implantado pela You.ai para indexar resultados de busca para respostas mais precisas aos usuários pelo You AI Assistant. O bot geralmente faz referência por meio de fontes inline aos sites referenciados.

Tipo

O rastreador de busca YouBot indexa conteúdo da web para gerar resultados de busca com tecnologia de IA mais precisos.

Comportamento do rastreador

O rastreador YouBot não tem um cronograma de visitas definido, e a frequência das visitas frequentemente ocorre sob demanda ou em resposta a uma consulta de usuário.

Como bloquear o rastreador de busca YouBot?

Você deve colar o seguinte comando no arquivo robots.txt do seu site para impedir o acesso do rastreador YouBot:

User-agent: YouBot
Disallow: /

Applebot-Extended AI Data Scraper

Visão geral

O Applebot-Extended AI Data Scraper é usado para treinar a linha de modelos LLM da APple que alimentam os recursos de IA generativa da empresa. Este scraper Applebot tem uma ampla aplicação em todos os aspectos da Apple intelligence, Serviços e Ferramentas para Desenvolvedores.

Tipo

O Applebot-Extended é um AI Data Scraper usado para baixar conteúdo da web e treinar IA ou LLM (Large Language Models)

Comportamento do rastreador

Embora ainda não esteja claro exatamente como AI Data Scrapers escolhem qual site rastrear, sabe-se que fontes com maior densidade de informações atraem este scraper Applebot. Faria sentido para um LLM favorecer sites que enviam e atualizam regularmente as informações da web na página.

Como bloquear o Applebot-Extended AI Data Scraper?

Inclua o seguinte comando no arquivo robots.txt do seu site para bloquear o Applebot-Extended:

User-agent: Applebot-Extended
Disallow: /

Bytespider AI Data Scraper

Visão geral

Operado pela ByteDance, Bytespider é um AI Data Scraper para a proprietária chinesa do TikTok. Ele é usado para baixar dados de treinamento de LLM e fornecer dados relacionados.

Tipo

Bytespider é um AI Data Scraper usado para treinar Large Language Models baixando conteúdo da web.

Comportamento do rastreador

O Bytespider AI Data Scraper favorece fontes da web com informações regularmente atualizadas e ricas em fatos para usar como fornecimento para LLMs.

Como bloquear o Bytespider AI Data Scraper?

Inclua a seguinte regra de token de agente de uso no robots.txt do seu site:

User-agent: Bytespider
Disallow: /

CCBot AI Data Scraper

Visão geral

CCBot pertence à Common Crawl para construir um repositório de código aberto por meio de dados de rastreamento da web disponíveis para qualquer pessoa acessar e usar.

Tipo

O CCBot é um AI Data Scraper destinado a baixar conteúdo da web e conduzir treinamento de modelos de IA.

Comportamento do rastreador

O CCBot rastreia fontes da web ricas em informações para realizar um treinamento de LLM mais eficaz.

Como bloquear o CCBot AI Data Scraper?

Inclua a seguinte regra no robots.txt para restringir o acesso do CCBot:

User-agent: CCBot
Disallow: /

ClaudeBot - AI Data Scraper

Visão geral

O ClaudeBot AI Data Scraper é operado pela Anthropic para fornecer dados de treinamento a Large Language Models como Claude.

Tipo

O ClaudeBot é um AI Data Scraper destinado a baixar conteúdo da web e treinar modelos de IA.

Comportamento do rastreador

ClaudeBot escolhe quais sites rastrear com base na densidade de informações e na regularidade das atualizações de informações.

Como bloquear o ClaudeBot AI Data Scraper?

O acesso do ClaudeBot pode ser revogado incluindo a seguinte regra no robots.txt:

User-agent: ClaudeBot
Disallow: /

Diffbot - AI Data Scraper

Visão geral

O Diffbot é projetado para estruturar, compreender, agregar e até vender dados de sites devidamente estruturados para treinamento de modelos de IA e monitoramento em tempo real.

Tipo

O Diffbot é um AI Data Scraper projetado para treinar modelos de IA e baixar/estruturar informações da web.

Comportamento do rastreador

A frequência de visitas do Diffbot é definida pela qualidade das informações da fonte e pela regularidade das atualizações.

Como bloquear o Diffbot AI Data Scraper?

O rastreamento do Diffbot pode ser impedido aplicando a seguinte regra no robots.txt:

User-agent: Diffbot
Disallow: /

FacebookBot - AI Data Scraper

Visão geral

O FacebookBot é implantado pela Meta para aumentar a eficiência da tecnologia de reconhecimento de fala por IA e para treinar modelos de IA.

Tipo

FacebookBot é um rastreador AI Data Scraper, usado para registrar conteúdo da web e treinamento de LLM.

Comportamento do rastreador

O FacebookBot não tem um cronograma fixo de visitas, mas talvez reconheça e dependa de fontes com informações mais ricas e bem atualizadas.

Como bloquear o FacebookBot AI Data Scraper?

O acesso do FacebookBot pode ser revogado com a seguinte regra:

User-agent: FacebookBot
Disallow: /

Google-Extended - AI Data Scraper

Visão geral

O rastreador Google-Extended é usado para fornecer informações de treinamento para produtos de IA pertencentes ao Google, como o assistente Gemini e as APIs generativas Vertex AI.

Tipo

O rastreador Google-Extended é um AI Data Scraper destinado a baixar informações da web e conduzir treinamento de IA.

Comportamento do rastreador

O cronograma de visitas do bot Google-Extended também é flexível, mas é muito mais direcionado do que o de outros rastreadores devido ao rico banco de dados do Google de fontes de informações confiáveis na web.

Como bloquear o Google-Extended AI Data Scraper?

O rastreador Google-Extended pode ser colocado em lista de bloqueio com a seguinte regra:

User-agent: Google-Extended
Disallow: /

GPTBot - AI Data Scraper

Visão geral

O GPTBot é desenvolvido pela OpenAI para rastrear fontes da web e baixar dados de treinamento para os Large Language Models da empresa e produtos como ChatGPT.

Tipo

O GPTBot é um AI Data Scraper projetado para baixar e fornecer uma ampla variedade de dados da web.

Comportamento do rastreador

Como outros AI Data Scrapers, o GPTBot favorece fontes e sites ricos em informações para fornecer informações mais relevantes para procedimentos de treinamento de IA.

Como bloquear o GPTBot AI Data Scraper?

Você pode bloquear o GPTBot AI Data Scraper com a seguinte regra robots.txt:

User-agent: GPTBot
Disallow: /

Meta-ExternalAgent - Raspador de dados de IA

Visão geral

Meta-ExternalAgent é uma tecnologia de crawler desenvolvida pela Meta para melhorar as tecnologias de IA da empresa, baixando e indexando conteúdo da web diretamente.

Tipo

O Meta-ExternalAgent usa uma tecnologia de raspador de dados de IA para baixar e indexar conteúdo da web, destinada ao treinamento de IA.

Comportamento do crawler

Semelhante a outros crawlers desenvolvidos pela empresa, o Meta-ExternalAgent usa uma estratégia de rastreamento flexível para identificar fontes da web ricas em informações.

Como bloquear o raspador de dados de IA Meta-ExternalAgent?

Este crawler desenvolvido pela Meta pode ser restringido por meio da seguinte regra robots.txt:

User-agent: Meta-ExternalAgent
Disallow: /

omgili - Raspador de dados de IA

Visão geral

O crawler omgili pertence à Webz.io, projetado para manter uma biblioteca construída de dados de rastreamento da web que é então vendida a outras empresas para fins de treinamento de IA.

Tipo

O crawler omgili é um raspador de dados de IA que baixa informações de treinamento de IA da web.

Comportamento do crawler

Como as informações rastreadas são então vendidas pela Webz.io, o crawler omgili acompanha sites confiáveis e autorizados com informações relacionadas.

Como bloquear o raspador de dados de IA omgili?

Use a seguinte regra para impedir o acesso do crawler omgili ao seu site:

User-agent: omgili
Disallow: /

Anthropic-AI - Agente de IA não documentado 

Visão geral

O agente Anthropic-AI não confirmado tende a ser usado para baixar dados de treinamento relacionados e fornecê-los a produtos com tecnologia de IA pertencentes à empresa, como Claude.

Tipo

O tipo exato do agente Anthropic-AI ainda é desconhecido devido à ausência de divulgação pela empresa.

Comportamento do crawler

Devido à ausência de informações relacionadas sobre o agente Anthropic-AI, o crawler pode ser usado para múltiplos propósitos, mas ainda é difícil dizer.

Como bloquear o agente Anthropic-AI?

O agente Anthropic-AI pode ser bloqueado com a seguinte regra:

User-agent: anthropic-ai
Disallow: /

Claude-Web - Agente de IA não documentado

Visão geral

Claude-Web é outro agente de IA operado pela Anthropic, sem documentação oficial sobre seus propósitos de uso. Espera-se que o Claude-Web forneça dados de treinamento de LLM relacionados para a Anthropic.

Tipo

Claude-Web será um raspador de dados de IA ou um crawler de pesquisa padrão para o modelo de linguagem grande Claude 3.5 da Anthropic.

Comportamento do crawler

A Anthropic está retendo informações sobre as funcionalidades do Claude-Web, mas o comportamento do crawler corresponderá ao tipo do agente assim que ele for totalmente divulgado.

Como bloquear o agente Claude-Web?

A seguinte regra é usada para suspender o acesso de rastreamento do agente Claude-Web ao seu site:

User-agent: Claude-Web
Disallow: /

Agente Cohere-AI - Não documentado

Visão geral

Cohere-AI é um agente não documentado desenvolvido pela Cohere para fornecer às suas ferramentas de IA generativa informações de estudo relacionadas. Ele recupera informações da web quando solicitado por usuários por meio da Cohere AI.

Tipo

Como não há documentação disponível para este agente Cohere AI, o tipo do crawler ainda é desconhecido para muitos dos proprietários de sites.

Comportamento do crawler

Suspeita-se que o agente Cohere-AI seja multipropósito por meio de diferentes padrões comportamentais para fornecer aos usuários da Cohere informações relacionadas e links de fontes inline.

Como bloquear o agente Cohere-AI?

Você pode suspender o acesso do agente Cohere-AI por meio da seguinte regra:

User-agent: cohere-ai
Disallow: /

Ai2Bot - Crawler de pesquisa de IA

Visão geral

A função principal do Ai2Bot é rastrear “determinados domínios” e adquirir conteúdo da web para treinar modelos de linguagem.

Tipo

Conforme relatado pela Ai2, o Ai2Bot é um crawler de pesquisa de IA, pois analisa conteúdo, imagens e vídeos no site rastreado.

Comportamento do crawler

O Ai2Bot rastreia apenas sites específicos, conforme relatado pela empresa, mas pode ampliar sua gama de domínios registrados a cada dia.

Como bloquear o crawler de pesquisa de IA Ai2Bot?

Inclua a seguinte regra no robots.txt do seu site para suspender o Ai2Bot:

User-agent: Ai2Bot

Disallow: /

Ai2Bot-Dolma - Crawler de pesquisa de IA

Visão geral

A empresa Ai2 possui o bot Ai2Bot-Dolma e respeita as regras robots.txt. O conteúdo adquirido é usado para treinar uma variedade de modelos de linguagem pertencentes à empresa.

Tipo

Embora o bot não tenha um tipo específico atribuído, acreditamos que ele tenha o comportamento de um crawler de pesquisa de IA padrão.

Comportamento do crawler

O Ai2Bot-Dolma rastreia apenas “determinados domínios” para encontrar o conteúdo da web necessário para treinar modelos de linguagem.

Como bloquear o crawler de pesquisa de IA Ai2Bot-Dolma?

Use a seguinte linha robots.txt para restringir o acesso do Ai2Bot-Dolma:

User-agent: Ai2Bot-Dolma

Disallow: /

FriendlyCrawler - Desconhecido

Visão geral

Embora não se saiba muito sobre este crawler, ele respeita o robots.txt e é usado para adquirir dados para experimentos de aprendizado de máquina.

Tipo

O tipo do bot ainda é desconhecido, mas acreditamos que seja um crawler genérico ou um raspador de dados de IA com base em seu comportamento na web.

Comportamento do crawler

Não está claro quem é o operador deste bot, mas os dados são usados para treinamento de modelos de linguagem grandes, aprendizado de máquina e criação de conjuntos de dados.

Como bloquear o FriendlyCrawler?

Veja como suspender o acesso do FriendlyCrawler ao seu site:

User-agent: FriendlyCrawler

Disallow: /

GoogleOther - Crawler de mecanismo de pesquisa

Visão geral

O crawler GoogleOther é um bot pertencente ao Google, mas ainda não está claro se ele é relacionado à IA ou artificialmente inteligente. Atualmente, apenas uma pequena porcentagem dos sites de melhor desempenho bloqueou o bot GoogleOther.

Tipo

O bot GoogleOther é um crawler de mecanismo de pesquisa que indexa conteúdo da web para resultados de mecanismo de pesquisa mais precisos ou para a SERP do Google.

Comportamento do crawler

Como qualquer outro crawler de mecanismo de pesquisa, o bot GoogleOther não segue um cronograma de visitas específico, e a frequência de visitas varia de acordo com a atividade do site e a qualidade do conteúdo.

Como bloquear o crawler de mecanismo de pesquisa GoogleOther?

Adicione a seguinte regra ao arquivo robots.txt do seu site:

User-agent: GoogleOther

Disallow: /

GoogleOther-Image - Crawler genérico

Visão geral

GoogleOther-Image é a versão do GoogleOther proposta para rastrear, analisar e indexar imagens na web

Tipo

Assim como o GoogleOther, o bot GoogleOther-Image é um crawler genérico usado por várias equipes de produto para tornar o conteúdo de sites publicamente acessível. 

Comportamento do crawler

Este crawler não se prende a um cronograma de visitas fixo, mas analisa as fontes de imagens mais confiáveis na web e indexa informações específicas.

Como bloquear o crawler genérico GoogleOther-Image?

Você pode bloquear este crawler do Google com o seguinte comando:

User-agent: GoogleOther-Image

Disallow: /

GoogleOther-Video - Crawler genérico

Visão geral

Assim como o crawler GoogleOther padrão e o bot de registro de imagens, o GoogleOther-Video rastreia e analisa conteúdo de vídeo na web.

Tipo

Este bot é um crawler genérico que atende a uma variedade de equipes de produto e ajuda empresas a obter melhor alcance com os vídeos enviados ao seu site.

Comportamento do crawler

Como as outras versões do GoogleOther, este crawler também tem um cronograma de visitas flexível definido pela atividade e qualidade do conteúdo de vídeo do site.

Como bloquear o crawler genérico GoogleOther-Video?

Este bot do Google pode ser bloqueado com a seguinte linha robots.txt:

User-agent: GoogleOther-Video

Disallow: /

ICC-Crawler - Desconhecido

Visão geral

O ICC-Crawler é um agente que ainda não foi categorizado pelo criador. Ainda não se sabe se este crawler é artificialmente inteligente ou tem algo a ver com IA.

Tipo

Assim como sua origem, o tipo do bot ICC-Crawler também é desconhecido.

Comportamento do crawler

O comportamento do bot varia dependendo do tipo do crawler, especialmente se ele é um raspador de dados, crawler de mecanismo de pesquisa ou arquivador.

Como bloquear o ICC-Crawler?

O ICC-Crawler pode ser bloqueado com o seguinte comando:

User-agent: ICC-Crawler

Disallow: /

ImagesiftBot - Coletor de inteligência

Visão geral

O bot Imagesift pertence à Hive, mas atualmente não se sabe se o crawler é relacionado à IA ou artificialmente inteligente. 

Tipo

O ImagesiftBot é um coletor de inteligência que procura insights úteis na web e registra ou indexa os resultados em um banco de dados.

Comportamento do crawler

O comportamento dos crawlers coletores de inteligência depende dos objetivos de seus clientes. Por exemplo, um cliente pode estar interessado em popularizar sua marca, o que faz com que o bot rastreie redes sociais com mais frequência do que outros sites não relacionados.

Como bloquear o coletor de inteligência ImagesiftBot?

Este crawler pode ser bloqueado da seguinte forma:

User-agent: ImagesiftBot

Disallow: /

PetalBot - Crawler de mecanismo de pesquisa

Visão geral

O PetalBot pertencente à Huawei está atualmente suspenso em 2% dos sites indexados populares. Ainda não se sabe se este crawler é artificialmente inteligente ou relacionado à IA de alguma forma.

Tipo

PetalBot é um crawler de mecanismo de pesquisa que indexa conteúdo da web e adquire dados de resultados de mecanismos de pesquisa.

Comportamento do crawler

O comportamento do PetalBot é definido pela qualidade do conteúdo e pela atividade dos sites e domínios registrados. Crawlers de mecanismo de pesquisa tendem a rastrear sites com maior qualidade de conteúdo e atividade frequente.

Como bloquear o crawler de mecanismo de pesquisa PetalBot?

O acesso do PetalBot pode ser suspenso da seguinte forma:

User-agent: PetalBot

Disallow: /

Scrapy - Raspador de IA

Visão geral

Scrapy pertence à Zyte e atualmente está bloqueado em mais de 3% dos domínios registrados na web.

Tipo

Scrapy é um raspador de IA, que é um tipo de crawler notório por não respeitar o robots.txt de um site. Ele acabará analisando as informações necessárias, mesmo que isso signifique acessar um site que tenha uma regra robots.txt de disallow para Scrapy.

Comportamento do crawler

Prever o cronograma de visitas de um raspador de IA é quase impossível. Esses crawlers são enviados com diferentes propósitos, e é difícil dizer quais sites eles rastreariam e com que frequência.

Como bloquear o raspador de IA Scrapy?

Embora o robots.txt não faça muita coisa contra raspadores de IA, veja como bloquear o Scrapy:

User-agent: Scrapy

Disallow: /

Timpibot - Raspador de dados de IA

Visão geral

Timpibot pertence à Timpi e atualmente está bloqueado em 3% dos sites indexados populares. O único propósito do Timpibot é adquirir dados da web para treinamento de modelos de IA.

Tipo

Ao contrário de um raspador padrão, o Timpibot é um raspador de dados de IA que depende exclusivamente de inteligência artificial para rastrear e indexar conteúdo da web. 

Comportamento do crawler

Semelhante aos raspadores padrão, o cronograma de visitas dos raspadores de dados de IA também não é claro. Esses crawlers tendem a escolher sites com maior densidade de informações e valor de conteúdo, dependendo das informações necessárias para o treinamento do modelo de IA.

Como bloquear o raspador de dados de IA Timpibot?

O acesso do Timpibot pode ser suspenso com a seguinte regra robots.txt:

User-agent: Timpibot

Disallow: /

VelenPublicWebCrawler - Coletor de inteligência

Visão geral

O VelenPublicCrawler é operado pela Hunter e foi bloqueado por 0% dos sites mais bem indexados na web.

Tipo

O crawler é um coletor de inteligência padrão, destinado a coletar insights úteis de resultados da web.

Comportamento do crawler

Coletores de inteligência tendem a atender aos objetivos de seus clientes e, na maioria dos casos, têm tarefas específicas sobre quais informações coletar.

Como bloquear o coletor de inteligência VelenPublicWebCrawler?

VelenPublicWebCrawler pode ser bloqueado com o seguinte comando:

User-agent: VelenPublicWebCrawler

Disallow: /

Webzio-Extended - Raspador de dados de IA

Visão geral

Webzio-Extended é outro crawler pertencente à Webz.io, usado para manter o repositório dos dados de rastreamento adquiridos. As informações são então vendidas a outras empresas e normalmente usadas para treinamento de modelos de IA.

Tipo

Webzio-Extended é um raspador de dados de IA que baixa conteúdo da web com o propósito de treinar modelos de IA.

Comportamento do crawler

Raspadores de dados de IA, como Webzio-Extended, não seguem uma visitação fixa de sites. Fontes de dados mais ricas tendem a atrair mais os raspadores e fazer com que eles rastreiem com mais frequência.

Como bloquear o raspador de dados de IA Webzio-Extended?

O acesso do Webzio-Extended ao seu site pode ser suspenso com o seguinte comando:

User-agent: Webzio-Extended

Disallow: /

Facebookexternalhit - Fetcher

Visão geral

O crawler facebookexternalhit é um bot enviado pela Meta, bloqueado em mais de 6% dos sites populares registrados. Ainda não está claro se o bot é artificialmente inteligente ou relacionado à IA.

Tipo

Facebookexternalhit é um fetcher, que rastreia resultados da web em nome de uma aplicação. 

Comportamento do crawler

Fetchers normalmente são enviados para visitar sites sob demanda. Eles são usados para apresentar os metadados de um link específico, um título ou uma imagem em miniatura, por exemplo, ao usuário solicitante.

Como bloquear o fetcher Facebookexternalhit?

Este crawler da Meta pode ser bloqueado com a seguinte regra robots.txt:

User-agent: facebookexternalhit 

Disallow: /

Img2dataset - Desconhecido

Visão geral

Sabe-se que img2dataset é o único crawler da empresa, destinado a baixar grande número de imagens e convertê-las em conjuntos de dados para treinar modelos de linguagem grandes.

Tipo

O tipo do img2dataset ainda é desconhecido, mas acreditamos que seja um crawler de mecanismo de pesquisa de IA, com base em seu comportamento e cronograma de visitas.

Comportamento do crawler

Img2dataset tende a rastrear sites com um banco de dados de imagens mais rico e com uma variedade de temas.

Como bloquear o crawler img2dataset?

Este crawler pode ser suspenso com a seguinte regra:

User-agent: img2dataset

Disallow: /

Como bloquear bots de IA (versão avançada):

Existem várias possibilidades únicas para restringir o tráfego indesejado de bots ao seu site:

A forma mais comum é adicionar o seguinte texto ao seu arquivo Robots.txt:

User-agent: name-of-bot
Disallow: /

Exemplo:

User-agent: GPTBot
Disallow: /

Use Robots.txt

Criar um arquivo robots.txt facilmente acessível envolve várias etapas simples:

1. Crie um arquivo chamado "robots.txt"

Durante esta etapa, você deve acessar o diretório raiz do site. É nele que o arquivo deve ser armazenado para restringir efetivamente o acesso de crawlers ao seu site. Lembre-se de que seu site pode ter um único arquivo robots.txt.

2. Escreva as regras robots.txt

Você pode usar qualquer editor para criar o arquivo, como o NotePad do Windows, TextEdit e vi. Certifique-se de que o arquivo seja salvo em codificação UTF-8 e prossiga para a aplicação das regras.  Os crawlers do Google respondem ao seguinte conjunto de regras: "user-agent," "disallow," "allow" e "sitemap." Cada regra tem seu propósito diferente em termos de gerenciamento de crawlers.

3. Faça upload do arquivo robots.txt

A próxima etapa é tornar o arquivo robots.txt recém-criado publicamente acessível, abrindo uma janela de navegação privada no seu navegador e acessando a localização do arquivo. Você pode verificar se o robots.txt está publicamente acessível digitando o domínio do site, por exemplo, "https://(site name)" e adicionando "/robots.txt" ao final.

Exemplo de Robots.txt bloqueando bots raspadores de dados de IA

Como estabelecemos anteriormente, incluir uma regra de restrição para um bot específico no robots.txt do seu site não desindexará a página nem a removerá da SERP. Ao tentar acessar sua página, o bot receberá automaticamente uma mensagem de erro e será redirecionado para fora, sem obter acesso ao conteúdo da página.

A página ainda será descobrível por todos os usuários e bots de IA, mas bots que carregam a identificação listada no arquivo robots.txt não terão acesso.

Este arquivo de exemplo bloqueia:

  • NÃO - Assistente de pesquisa de IA
  • NÃO - Crawler de pesquisa de IA
  • TODOS - Raspador de dados de IA

Bloquear os raspadores de dados, mas não o crawler e o assistente de pesquisa, visa restringir que os dados de um site sejam usados para treinamento, mas permitir que a pesquisa/assistentes de IA enviem tráfego para o site.

Firewall

Existem várias possibilidades quando se trata de suspender o acesso de bots de IA com a ajuda de um firewall. Vamos revisar cada uma das possibilidades únicas:

  • Configure o bloqueio de IP

Se você conhece bem os endereços usados por bots para acessar seu domínio, pode colocar os IPs em blacklist por meio do firewall do seu site. É uma prática comumente conhecida para reduzir o tráfego não intencional para seu site e preservar recursos. No entanto, bots podem alternar entre vários IPs.

  • Use software CAPTCHA

Talvez o método mais amplamente preferido para suspender 100% do tráfego de bots para seu site seja implementar um software CAPTCHA que exige validação humana. Cada novo visitante será solicitado a concluir um desafio simples, como combinar peças de quebra-cabeça ou identificar objetos em um conjunto de imagens, para obter acesso. Firewalls podem ser modificados para acionar CAPTCHAs.

Use uma CDN (Content Delivery Network)

Serviços de CDN, como Cloudflare ou Amazon CloudFront, podem ser integrados ao firewall do seu site para reduzir o tráfego de bots de IA. Semelhante aos desafios CAPTCHA, apenas endereços IP válidos pertencentes a usuários reais terão permissão para acessar seu site.

Os desafios emergentes das mudanças de nomes de bots

Como uma ampla variedade de webmasters depende do robots.txt para suspender o tráfego indesejado de bots para seus sites, cada regra dentro do arquivo é definida para um bot específico. Depois que as empresas começaram a perceber o declínio do tráfego de seus bots, muitas decidiram atribuir um novo nome a seus bots que não estava no arquivo robots.txt de muitos sites.

Um exemplo recente é como a Anthropic fundiu seus raspadores de dados de IA chamados “ANTHROPIC-AI” e “CLAUDE-WEB” em um novo bot chamado “CLAUDEBOT.” Certamente levou algum tempo para os sites descobrirem isso e, nesse meio-tempo, o novo bot teve acesso sem precedentes a todos os sites na internet.

Declínio dos bens comuns de dados de IA e consequências

Com o uso crescente e generalizado de informações públicas por empresas de IA para ensinar modelos de linguagem grandes, a ineficácia dos protocolos da web está se tornando evidente. Como resposta à grande raspagem de dados conduzida por empresas de IA de dados da web, como C4, Dolma, e Refined Web, houve uma queda de mais de 28%-45% no acesso de crawlers.

Decline of AI Data Commons and Consequences
https://www.dataprovenance.org/Consent_in_Crisis.pdf

Um total de 45% do C4 agora foi restringido, com muitas das restrições sendo diversas e escalando as leis das infraestruturas de IA de uso geral por meio de robots.txt. A demanda por consentimento de dados está se tornando cada vez mais desafiadora não apenas para IA comercial, mas para todos os tipos de pesquisa acadêmica e uso não comercial de IA.

Conclusão

O choque entre empresas de IA tentando raspar o máximo de dados possível para treinar LLMs e editores trabalhando para defender seus dados/largura de banda contra abuso resultou em uma disputa interessante que está se desenrolando em um arquivo pouco conhecido em todos os sites chamado robots.txt. 

Este guia tem como objetivo acompanhar como esse drama está se desenrolando com nosso painel ao vivo, vendo quais dos 1000 principais sites estão bloqueando bots de IA, como bloqueá-los e quais você deve bloquear. 

Se estiver faltando algum bot que você gostaria que fosse incluído, entre em contato.

Detector de conteúdo de IA & Verificador de plágio para profissionais de marketing e escritores

Use nossas ferramentas líderes para garantir que você possa clicar em publicar com integridade!