Bots como o GPTBot da OpenAI, o Applebot, CCBot, Google-Extended, e Bytespider analisam, armazenam ou fazem scraping dos dados do seu site para fornecer dados para treinar LLMs mais avançados.
Na Originality.ai, nos importamos com o desenvolvimento responsável (que inclui scraping ético) e o uso (AI Detector) de ferramentas de escrita com IA generativa como ChatGPT.
Este artigo fará uma análise aprofundada do propósito dos bots de IA, o que eles fazem, como bloqueá-los e a interessante batalha pelo futuro da IA que se desenrola em um arquivo pouco conhecido chamado robots.txt.
Bots de IA vêm em várias formas, incluindo assistentes de IA, scrapers de dados de IA, e rastreadores de busca de IA, todos para impulsionar ferramentas de IA líderes e mecanismos de busca de IA. Cada um desses bots de IA extrai dados da web. Muitos webmasters consideram essas práticas inaceitáveis e querem manter seus dados ou as informações de seus sites protegidos contra scraping.
À medida que mais partes da internet bloqueiam bots de IA, o número de palavras disponível para empresas de IA como OpenAI, Anthropic para desenvolver seu LLM mais recente (como GPT-4o, Claude 3.5) diminuirá, resultando em melhorias futuras mais lentas das ferramentas de IA.
A forma mais comum é adicionar o seguinte texto ao seu arquivo Robots.txt:
User-agent: name-of-bot
Disallow: /
Exemplo:
User-agent: GPTBot
Disallow: /
Veja o final deste artigo para uma explicação mais aprofundada das opções para bloquear bots de IA e um arquivo Robots.txt de exemplo.
A OpenAI, em particular, tem sido ativa na tentativa de garantir parcerias de dados para continuar alimentando seus esforços de treinamento de LLM.
Robots.txt é um protocolo da internet que fornece aos rastreadores de mecanismos de busca informações sobre quais URLs o rastreador pode acessar em seu site. Ele é usado principalmente para evitar a sobrecarga do domínio com solicitações produzidas por rastreadores.
É importante saber que Robots.txt é uma solicitação que os bots devem seguir, mas que não “precisa” ser seguida.
Em termos de filtragem e gerenciamento do tráfego de rastreadores para o seu site, o propósito do robots.txt tem uma aplicação diferente dependendo do tipo de arquivo:
O principal objetivo do robots.txt é restringir o acesso de rastreadores a páginas específicas do seu site. Suponha que você tenha preocupações de que o servidor do seu site esteja sobrecarregado por muitas solicitações do Google. Nesse caso, você pode impedir que rastreadores de mecanismos de busca acessem páginas específicas do seu site para reduzir a utilização.
Você pode usar o arquivo robots.txt para gerenciar o tráfego de rastreamento para imagens, vídeos e arquivos de áudio. Isso impediria que mídias específicas aparecessem na SERP (Página de resultados do mecanismo de busca) no Google ou em outros mecanismos de busca.
Se você acha que há uma taxa de utilização específica causada por arquivos de estilo, imagens ou scripts sem importância, pode usar o arquivo robots.txt para restringir o acesso de rastreadores, scrapers, assistentes de IA específicos ou outros bots.
Vamos revisar os diferentes tipos de bots e rastreadores de IA implantados por empresas na web:
Assistentes de IA, como o ChatGPT-User pertencente à OpenAI e o Meta-ExternalFetcher implantado pela Meta, desempenham um papel vital ao responder às consultas dos usuários. As respostas podem estar em formato de texto ou voz e usam os dados da web coletados para construir a resposta mais útil possível ao prompt do usuário.
O scraping da web com IA é um procedimento realizado por bots AI Data Scraper para coletar o máximo possível de dados úteis para o treinamento de LLM. Empresas como Apple, ByteDance, Common Crawl, OpenAI e Anthropic usam AI Data Scrapers para criar um grande conjunto de dados da web no qual LLMs podem ser treinados.
Muitas empresas implantam rastreadores de busca de IA para coletar informações sobre páginas específicas de sites, títulos, palavras-chave, imagens e links inline referenciados. Embora os rastreadores de IA tenham o potencial de enviar tráfego para um site, alguns proprietários de sites ainda estão escolhendo bloqueá-los.
ChatGPT-User é um rastreador assistente de busca enviado pelo ChatGPT da OpenAI como resultado de prompts de usuários. A maioria de suas respostas normalmente incluiria um resumo do conteúdo do site, bem como um link de referência.
O tipo do rastreador ChatGPT-User é assistente de IA, pois ele é usado para realizar tarefas de forma inteligente em nome do usuário do ChatGPT.
Espera-se que o ChatGPT-User Search Assistant faça visitas pontuais conforme a solicitação do usuário, em vez de navegar automaticamente pela web como outros rastreadores.
Para bloquear este rastreador, você deve incluir a seguinte declaração no robots.txt do seu site:
User-agent: ChatGPT-User
Disallow: /
O rastreador Meta-ExternalFetcher é enviado por todos os produtos da Meta AI para responder a prompts de usuários sempre que um link individual é necessário.
O Meta-ExternalFetcher AI Assistant é buscado para executar tarefas de forma inteligente em nome do usuário da Meta AI.
Semelhante ao rastreador ChatGPT-user, o Meta-ExternalFetcher geralmente faz visitas pontuais com base na solicitação do usuário, em vez de rastrear automaticamente a web.
Você deve incluir o seguinte comando no robots.txt do seu site para impedir o acesso do Meta-ExternalFetcher:
User-agent: Meta-ExternalFetcher
Disallow: /
O rastreador da web Amazonbot é usado pela Amazon para indexar e registrar resultados de busca, o que permite que a Alexa AI Assistant responda a perguntas com mais precisão. A maioria das respostas da Alexa geralmente contém uma referência ao site.
Amazonbot é um rastreador de busca de IA usado para indexar conteúdo da web para os resultados de busca com tecnologia de IA da Alexa.
O aspecto específico dos rastreadores de busca é que eles não seguem um esquema fixo de visitas para sites. A frequência de visitas é definida por muitos fatores e normalmente ocorre sob demanda para uma consulta de usuário, inclusive pelo Amazonbot.
Você pode limitar o acesso do Amazonbot ao seu site digitando as seguintes linhas de comando no robots.txt do seu site:
User-agent: Amazonbot
Disallow: /
O rastreador de busca Applebot é usado para registrar resultados de busca, permitindo que a Siri AI Assistant responda às perguntas dos usuários de forma mais eficaz. A maioria das respostas da Siri contém uma referência aos sites rastreados pelo Applebot.
Applebot é um rastreador de busca de IA que indexa conteúdo da web para construir resultados de busca com tecnologia de IA.
O comportamento do Applebot varia com base em vários fatores, como demanda de busca, sites rastreados e consultas de usuários. Por padrão, os rastreadores de busca não dependem de visitas fixas para fornecer resultados.
Embora não seja recomendado bloquear rastreadores de busca, você pode usar o seguinte comando no robots.txt do site para impedir o acesso do Applebot:
User-agent: Applebot
Disallow: /
O rastreador OAI-SearchBot é utilizado para construir um índice de sites que pode ser usado como resultado do produto SearchGPT da OpenAI.
O OAI-SearchBot é um rastreador de busca de IA usado para indexar conteúdo da web a fim de fornecer resultados de busca com tecnologia de IA mais precisos para o serviço SearchGPT da OpenAI.
O comportamento do OAI-SearchBot pode ser definido pela frequência de buscas na web e consultas de usuários. Como qualquer outro rastreador de busca, o OAI-SearchBot não depende de visitas fixas a sites para fornecer resultados.
Inclua o seguinte comando no arquivo robots.txt do seu site para impedir ativamente o acesso do OAI-SearchBot:
User-agent: OAI-SearchBot
Disallow: /
A Perplexity usa o rastreador da web PerplexityBot para indexar resultados de busca para uma resposta mais eficaz de seu AI Assistant. As respostas fornecidas pelo assistente normalmente exibem referências inline a uma variedade de fontes da web.
O PerplexityBot é um rastreador de busca de IA projetado para indexar resultados para resultados de busca com tecnologia de IA pelo Perplexity AI Assistant.
Como a maioria dos rastreadores de busca, o PerplexityBot não depende de um cronograma fixo de visitas para as fontes da web que promove. A frequência de visitas pode variar com base em vários fatores, como consultas de usuários.
Você pode restringir o acesso do PerplexityBot ao seu site incluindo a seguinte regra de token de agente no robots.txt:
User-agent: PerplexityBot
Disallow: /
O YouBot é um rastreador de busca implantado pela You.ai para indexar resultados de busca para respostas mais precisas aos usuários pelo You AI Assistant. O bot geralmente faz referência por meio de fontes inline aos sites referenciados.
O rastreador de busca YouBot indexa conteúdo da web para gerar resultados de busca com tecnologia de IA mais precisos.
O rastreador YouBot não tem um cronograma de visitas definido, e a frequência das visitas frequentemente ocorre sob demanda ou em resposta a uma consulta de usuário.
Você deve colar o seguinte comando no arquivo robots.txt do seu site para impedir o acesso do rastreador YouBot:
User-agent: YouBot
Disallow: /
O Applebot-Extended AI Data Scraper é usado para treinar a linha de modelos LLM da APple que alimentam os recursos de IA generativa da empresa. Este scraper Applebot tem uma ampla aplicação em todos os aspectos da Apple intelligence, Serviços e Ferramentas para Desenvolvedores.
O Applebot-Extended é um AI Data Scraper usado para baixar conteúdo da web e treinar IA ou LLM (Large Language Models)
Embora ainda não esteja claro exatamente como AI Data Scrapers escolhem qual site rastrear, sabe-se que fontes com maior densidade de informações atraem este scraper Applebot. Faria sentido para um LLM favorecer sites que enviam e atualizam regularmente as informações da web na página.
Inclua o seguinte comando no arquivo robots.txt do seu site para bloquear o Applebot-Extended:
User-agent: Applebot-Extended
Disallow: /
Operado pela ByteDance, Bytespider é um AI Data Scraper para a proprietária chinesa do TikTok. Ele é usado para baixar dados de treinamento de LLM e fornecer dados relacionados.
Bytespider é um AI Data Scraper usado para treinar Large Language Models baixando conteúdo da web.
O Bytespider AI Data Scraper favorece fontes da web com informações regularmente atualizadas e ricas em fatos para usar como fornecimento para LLMs.
Inclua a seguinte regra de token de agente de uso no robots.txt do seu site:
User-agent: Bytespider
Disallow: /
CCBot pertence à Common Crawl para construir um repositório de código aberto por meio de dados de rastreamento da web disponíveis para qualquer pessoa acessar e usar.
O CCBot é um AI Data Scraper destinado a baixar conteúdo da web e conduzir treinamento de modelos de IA.
O CCBot rastreia fontes da web ricas em informações para realizar um treinamento de LLM mais eficaz.
Inclua a seguinte regra no robots.txt para restringir o acesso do CCBot:
User-agent: CCBot
Disallow: /
O ClaudeBot AI Data Scraper é operado pela Anthropic para fornecer dados de treinamento a Large Language Models como Claude.
O ClaudeBot é um AI Data Scraper destinado a baixar conteúdo da web e treinar modelos de IA.
ClaudeBot escolhe quais sites rastrear com base na densidade de informações e na regularidade das atualizações de informações.
O acesso do ClaudeBot pode ser revogado incluindo a seguinte regra no robots.txt:
User-agent: ClaudeBot
Disallow: /
O Diffbot é projetado para estruturar, compreender, agregar e até vender dados de sites devidamente estruturados para treinamento de modelos de IA e monitoramento em tempo real.
O Diffbot é um AI Data Scraper projetado para treinar modelos de IA e baixar/estruturar informações da web.
A frequência de visitas do Diffbot é definida pela qualidade das informações da fonte e pela regularidade das atualizações.
O rastreamento do Diffbot pode ser impedido aplicando a seguinte regra no robots.txt:
User-agent: Diffbot
Disallow: /
O FacebookBot é implantado pela Meta para aumentar a eficiência da tecnologia de reconhecimento de fala por IA e para treinar modelos de IA.
FacebookBot é um rastreador AI Data Scraper, usado para registrar conteúdo da web e treinamento de LLM.
O FacebookBot não tem um cronograma fixo de visitas, mas talvez reconheça e dependa de fontes com informações mais ricas e bem atualizadas.
O acesso do FacebookBot pode ser revogado com a seguinte regra:
User-agent: FacebookBot
Disallow: /
O rastreador Google-Extended é usado para fornecer informações de treinamento para produtos de IA pertencentes ao Google, como o assistente Gemini e as APIs generativas Vertex AI.
O rastreador Google-Extended é um AI Data Scraper destinado a baixar informações da web e conduzir treinamento de IA.
O cronograma de visitas do bot Google-Extended também é flexível, mas é muito mais direcionado do que o de outros rastreadores devido ao rico banco de dados do Google de fontes de informações confiáveis na web.
O rastreador Google-Extended pode ser colocado em lista de bloqueio com a seguinte regra:
User-agent: Google-Extended
Disallow: /
O GPTBot é desenvolvido pela OpenAI para rastrear fontes da web e baixar dados de treinamento para os Large Language Models da empresa e produtos como ChatGPT.
O GPTBot é um AI Data Scraper projetado para baixar e fornecer uma ampla variedade de dados da web.
Como outros AI Data Scrapers, o GPTBot favorece fontes e sites ricos em informações para fornecer informações mais relevantes para procedimentos de treinamento de IA.
Você pode bloquear o GPTBot AI Data Scraper com a seguinte regra robots.txt:
User-agent: GPTBot
Disallow: /
Meta-ExternalAgent é uma tecnologia de crawler desenvolvida pela Meta para melhorar as tecnologias de IA da empresa, baixando e indexando conteúdo da web diretamente.
O Meta-ExternalAgent usa uma tecnologia de raspador de dados de IA para baixar e indexar conteúdo da web, destinada ao treinamento de IA.
Semelhante a outros crawlers desenvolvidos pela empresa, o Meta-ExternalAgent usa uma estratégia de rastreamento flexível para identificar fontes da web ricas em informações.
Este crawler desenvolvido pela Meta pode ser restringido por meio da seguinte regra robots.txt:
User-agent: Meta-ExternalAgent
Disallow: /
O crawler omgili pertence à Webz.io, projetado para manter uma biblioteca construída de dados de rastreamento da web que é então vendida a outras empresas para fins de treinamento de IA.
O crawler omgili é um raspador de dados de IA que baixa informações de treinamento de IA da web.
Como as informações rastreadas são então vendidas pela Webz.io, o crawler omgili acompanha sites confiáveis e autorizados com informações relacionadas.
Use a seguinte regra para impedir o acesso do crawler omgili ao seu site:
User-agent: omgili
Disallow: /
O agente Anthropic-AI não confirmado tende a ser usado para baixar dados de treinamento relacionados e fornecê-los a produtos com tecnologia de IA pertencentes à empresa, como Claude.
O tipo exato do agente Anthropic-AI ainda é desconhecido devido à ausência de divulgação pela empresa.
Devido à ausência de informações relacionadas sobre o agente Anthropic-AI, o crawler pode ser usado para múltiplos propósitos, mas ainda é difícil dizer.
O agente Anthropic-AI pode ser bloqueado com a seguinte regra:
User-agent: anthropic-ai
Disallow: /
Claude-Web é outro agente de IA operado pela Anthropic, sem documentação oficial sobre seus propósitos de uso. Espera-se que o Claude-Web forneça dados de treinamento de LLM relacionados para a Anthropic.
Claude-Web será um raspador de dados de IA ou um crawler de pesquisa padrão para o modelo de linguagem grande Claude 3.5 da Anthropic.
A Anthropic está retendo informações sobre as funcionalidades do Claude-Web, mas o comportamento do crawler corresponderá ao tipo do agente assim que ele for totalmente divulgado.
A seguinte regra é usada para suspender o acesso de rastreamento do agente Claude-Web ao seu site:
User-agent: Claude-Web
Disallow: /
Cohere-AI é um agente não documentado desenvolvido pela Cohere para fornecer às suas ferramentas de IA generativa informações de estudo relacionadas. Ele recupera informações da web quando solicitado por usuários por meio da Cohere AI.
Como não há documentação disponível para este agente Cohere AI, o tipo do crawler ainda é desconhecido para muitos dos proprietários de sites.
Suspeita-se que o agente Cohere-AI seja multipropósito por meio de diferentes padrões comportamentais para fornecer aos usuários da Cohere informações relacionadas e links de fontes inline.
Você pode suspender o acesso do agente Cohere-AI por meio da seguinte regra:
User-agent: cohere-ai
Disallow: /
A função principal do Ai2Bot é rastrear “determinados domínios” e adquirir conteúdo da web para treinar modelos de linguagem.
Conforme relatado pela Ai2, o Ai2Bot é um crawler de pesquisa de IA, pois analisa conteúdo, imagens e vídeos no site rastreado.
O Ai2Bot rastreia apenas sites específicos, conforme relatado pela empresa, mas pode ampliar sua gama de domínios registrados a cada dia.
Inclua a seguinte regra no robots.txt do seu site para suspender o Ai2Bot:
User-agent: Ai2Bot
Disallow: /
A empresa Ai2 possui o bot Ai2Bot-Dolma e respeita as regras robots.txt. O conteúdo adquirido é usado para treinar uma variedade de modelos de linguagem pertencentes à empresa.
Embora o bot não tenha um tipo específico atribuído, acreditamos que ele tenha o comportamento de um crawler de pesquisa de IA padrão.
O Ai2Bot-Dolma rastreia apenas “determinados domínios” para encontrar o conteúdo da web necessário para treinar modelos de linguagem.
Use a seguinte linha robots.txt para restringir o acesso do Ai2Bot-Dolma:
User-agent: Ai2Bot-Dolma
Disallow: /
Embora não se saiba muito sobre este crawler, ele respeita o robots.txt e é usado para adquirir dados para experimentos de aprendizado de máquina.
O tipo do bot ainda é desconhecido, mas acreditamos que seja um crawler genérico ou um raspador de dados de IA com base em seu comportamento na web.
Não está claro quem é o operador deste bot, mas os dados são usados para treinamento de modelos de linguagem grandes, aprendizado de máquina e criação de conjuntos de dados.
Veja como suspender o acesso do FriendlyCrawler ao seu site:
User-agent: FriendlyCrawler
Disallow: /
O crawler GoogleOther é um bot pertencente ao Google, mas ainda não está claro se ele é relacionado à IA ou artificialmente inteligente. Atualmente, apenas uma pequena porcentagem dos sites de melhor desempenho bloqueou o bot GoogleOther.
O bot GoogleOther é um crawler de mecanismo de pesquisa que indexa conteúdo da web para resultados de mecanismo de pesquisa mais precisos ou para a SERP do Google.
Como qualquer outro crawler de mecanismo de pesquisa, o bot GoogleOther não segue um cronograma de visitas específico, e a frequência de visitas varia de acordo com a atividade do site e a qualidade do conteúdo.
Adicione a seguinte regra ao arquivo robots.txt do seu site:
User-agent: GoogleOther
Disallow: /
GoogleOther-Image é a versão do GoogleOther proposta para rastrear, analisar e indexar imagens na web
Assim como o GoogleOther, o bot GoogleOther-Image é um crawler genérico usado por várias equipes de produto para tornar o conteúdo de sites publicamente acessível.
Este crawler não se prende a um cronograma de visitas fixo, mas analisa as fontes de imagens mais confiáveis na web e indexa informações específicas.
Você pode bloquear este crawler do Google com o seguinte comando:
User-agent: GoogleOther-Image
Disallow: /
Assim como o crawler GoogleOther padrão e o bot de registro de imagens, o GoogleOther-Video rastreia e analisa conteúdo de vídeo na web.
Este bot é um crawler genérico que atende a uma variedade de equipes de produto e ajuda empresas a obter melhor alcance com os vídeos enviados ao seu site.
Como as outras versões do GoogleOther, este crawler também tem um cronograma de visitas flexível definido pela atividade e qualidade do conteúdo de vídeo do site.
Este bot do Google pode ser bloqueado com a seguinte linha robots.txt:
User-agent: GoogleOther-Video
Disallow: /
O ICC-Crawler é um agente que ainda não foi categorizado pelo criador. Ainda não se sabe se este crawler é artificialmente inteligente ou tem algo a ver com IA.
Assim como sua origem, o tipo do bot ICC-Crawler também é desconhecido.
O comportamento do bot varia dependendo do tipo do crawler, especialmente se ele é um raspador de dados, crawler de mecanismo de pesquisa ou arquivador.
O ICC-Crawler pode ser bloqueado com o seguinte comando:
User-agent: ICC-Crawler
Disallow: /
O bot Imagesift pertence à Hive, mas atualmente não se sabe se o crawler é relacionado à IA ou artificialmente inteligente.
O ImagesiftBot é um coletor de inteligência que procura insights úteis na web e registra ou indexa os resultados em um banco de dados.
O comportamento dos crawlers coletores de inteligência depende dos objetivos de seus clientes. Por exemplo, um cliente pode estar interessado em popularizar sua marca, o que faz com que o bot rastreie redes sociais com mais frequência do que outros sites não relacionados.
Este crawler pode ser bloqueado da seguinte forma:
User-agent: ImagesiftBot
Disallow: /
O PetalBot pertencente à Huawei está atualmente suspenso em 2% dos sites indexados populares. Ainda não se sabe se este crawler é artificialmente inteligente ou relacionado à IA de alguma forma.
PetalBot é um crawler de mecanismo de pesquisa que indexa conteúdo da web e adquire dados de resultados de mecanismos de pesquisa.
O comportamento do PetalBot é definido pela qualidade do conteúdo e pela atividade dos sites e domínios registrados. Crawlers de mecanismo de pesquisa tendem a rastrear sites com maior qualidade de conteúdo e atividade frequente.
O acesso do PetalBot pode ser suspenso da seguinte forma:
User-agent: PetalBot
Disallow: /
Scrapy pertence à Zyte e atualmente está bloqueado em mais de 3% dos domínios registrados na web.
Scrapy é um raspador de IA, que é um tipo de crawler notório por não respeitar o robots.txt de um site. Ele acabará analisando as informações necessárias, mesmo que isso signifique acessar um site que tenha uma regra robots.txt de disallow para Scrapy.
Prever o cronograma de visitas de um raspador de IA é quase impossível. Esses crawlers são enviados com diferentes propósitos, e é difícil dizer quais sites eles rastreariam e com que frequência.
Embora o robots.txt não faça muita coisa contra raspadores de IA, veja como bloquear o Scrapy:
User-agent: Scrapy
Disallow: /
Timpibot pertence à Timpi e atualmente está bloqueado em 3% dos sites indexados populares. O único propósito do Timpibot é adquirir dados da web para treinamento de modelos de IA.
Ao contrário de um raspador padrão, o Timpibot é um raspador de dados de IA que depende exclusivamente de inteligência artificial para rastrear e indexar conteúdo da web.
Semelhante aos raspadores padrão, o cronograma de visitas dos raspadores de dados de IA também não é claro. Esses crawlers tendem a escolher sites com maior densidade de informações e valor de conteúdo, dependendo das informações necessárias para o treinamento do modelo de IA.
O acesso do Timpibot pode ser suspenso com a seguinte regra robots.txt:
User-agent: Timpibot
Disallow: /
O VelenPublicCrawler é operado pela Hunter e foi bloqueado por 0% dos sites mais bem indexados na web.
O crawler é um coletor de inteligência padrão, destinado a coletar insights úteis de resultados da web.
Coletores de inteligência tendem a atender aos objetivos de seus clientes e, na maioria dos casos, têm tarefas específicas sobre quais informações coletar.
VelenPublicWebCrawler pode ser bloqueado com o seguinte comando:
User-agent: VelenPublicWebCrawler
Disallow: /
Webzio-Extended é outro crawler pertencente à Webz.io, usado para manter o repositório dos dados de rastreamento adquiridos. As informações são então vendidas a outras empresas e normalmente usadas para treinamento de modelos de IA.
Webzio-Extended é um raspador de dados de IA que baixa conteúdo da web com o propósito de treinar modelos de IA.
Raspadores de dados de IA, como Webzio-Extended, não seguem uma visitação fixa de sites. Fontes de dados mais ricas tendem a atrair mais os raspadores e fazer com que eles rastreiem com mais frequência.
O acesso do Webzio-Extended ao seu site pode ser suspenso com o seguinte comando:
User-agent: Webzio-Extended
Disallow: /
O crawler facebookexternalhit é um bot enviado pela Meta, bloqueado em mais de 6% dos sites populares registrados. Ainda não está claro se o bot é artificialmente inteligente ou relacionado à IA.
Facebookexternalhit é um fetcher, que rastreia resultados da web em nome de uma aplicação.
Fetchers normalmente são enviados para visitar sites sob demanda. Eles são usados para apresentar os metadados de um link específico, um título ou uma imagem em miniatura, por exemplo, ao usuário solicitante.
Este crawler da Meta pode ser bloqueado com a seguinte regra robots.txt:
User-agent: facebookexternalhit
Disallow: /
Sabe-se que img2dataset é o único crawler da empresa, destinado a baixar grande número de imagens e convertê-las em conjuntos de dados para treinar modelos de linguagem grandes.
O tipo do img2dataset ainda é desconhecido, mas acreditamos que seja um crawler de mecanismo de pesquisa de IA, com base em seu comportamento e cronograma de visitas.
Img2dataset tende a rastrear sites com um banco de dados de imagens mais rico e com uma variedade de temas.
Este crawler pode ser suspenso com a seguinte regra:
User-agent: img2dataset
Disallow: /
Existem várias possibilidades únicas para restringir o tráfego indesejado de bots ao seu site:
A forma mais comum é adicionar o seguinte texto ao seu arquivo Robots.txt:
User-agent: name-of-bot
Disallow: /
Exemplo:
User-agent: GPTBot
Disallow: /
Criar um arquivo robots.txt facilmente acessível envolve várias etapas simples:
Durante esta etapa, você deve acessar o diretório raiz do site. É nele que o arquivo deve ser armazenado para restringir efetivamente o acesso de crawlers ao seu site. Lembre-se de que seu site pode ter um único arquivo robots.txt.
Você pode usar qualquer editor para criar o arquivo, como o NotePad do Windows, TextEdit e vi. Certifique-se de que o arquivo seja salvo em codificação UTF-8 e prossiga para a aplicação das regras. Os crawlers do Google respondem ao seguinte conjunto de regras: "user-agent," "disallow," "allow" e "sitemap." Cada regra tem seu propósito diferente em termos de gerenciamento de crawlers.
A próxima etapa é tornar o arquivo robots.txt recém-criado publicamente acessível, abrindo uma janela de navegação privada no seu navegador e acessando a localização do arquivo. Você pode verificar se o robots.txt está publicamente acessível digitando o domínio do site, por exemplo, "https://(site name)" e adicionando "/robots.txt" ao final.
Como estabelecemos anteriormente, incluir uma regra de restrição para um bot específico no robots.txt do seu site não desindexará a página nem a removerá da SERP. Ao tentar acessar sua página, o bot receberá automaticamente uma mensagem de erro e será redirecionado para fora, sem obter acesso ao conteúdo da página.
A página ainda será descobrível por todos os usuários e bots de IA, mas bots que carregam a identificação listada no arquivo robots.txt não terão acesso.
Este arquivo de exemplo bloqueia:
Bloquear os raspadores de dados, mas não o crawler e o assistente de pesquisa, visa restringir que os dados de um site sejam usados para treinamento, mas permitir que a pesquisa/assistentes de IA enviem tráfego para o site.
Existem várias possibilidades quando se trata de suspender o acesso de bots de IA com a ajuda de um firewall. Vamos revisar cada uma das possibilidades únicas:
Se você conhece bem os endereços usados por bots para acessar seu domínio, pode colocar os IPs em blacklist por meio do firewall do seu site. É uma prática comumente conhecida para reduzir o tráfego não intencional para seu site e preservar recursos. No entanto, bots podem alternar entre vários IPs.
Talvez o método mais amplamente preferido para suspender 100% do tráfego de bots para seu site seja implementar um software CAPTCHA que exige validação humana. Cada novo visitante será solicitado a concluir um desafio simples, como combinar peças de quebra-cabeça ou identificar objetos em um conjunto de imagens, para obter acesso. Firewalls podem ser modificados para acionar CAPTCHAs.
Serviços de CDN, como Cloudflare ou Amazon CloudFront, podem ser integrados ao firewall do seu site para reduzir o tráfego de bots de IA. Semelhante aos desafios CAPTCHA, apenas endereços IP válidos pertencentes a usuários reais terão permissão para acessar seu site.
Como uma ampla variedade de webmasters depende do robots.txt para suspender o tráfego indesejado de bots para seus sites, cada regra dentro do arquivo é definida para um bot específico. Depois que as empresas começaram a perceber o declínio do tráfego de seus bots, muitas decidiram atribuir um novo nome a seus bots que não estava no arquivo robots.txt de muitos sites.
Um exemplo recente é como a Anthropic fundiu seus raspadores de dados de IA chamados “ANTHROPIC-AI” e “CLAUDE-WEB” em um novo bot chamado “CLAUDEBOT.” Certamente levou algum tempo para os sites descobrirem isso e, nesse meio-tempo, o novo bot teve acesso sem precedentes a todos os sites na internet.
Com o uso crescente e generalizado de informações públicas por empresas de IA para ensinar modelos de linguagem grandes, a ineficácia dos protocolos da web está se tornando evidente. Como resposta à grande raspagem de dados conduzida por empresas de IA de dados da web, como C4, Dolma, e Refined Web, houve uma queda de mais de 28%-45% no acesso de crawlers.

Um total de 45% do C4 agora foi restringido, com muitas das restrições sendo diversas e escalando as leis das infraestruturas de IA de uso geral por meio de robots.txt. A demanda por consentimento de dados está se tornando cada vez mais desafiadora não apenas para IA comercial, mas para todos os tipos de pesquisa acadêmica e uso não comercial de IA.
O choque entre empresas de IA tentando raspar o máximo de dados possível para treinar LLMs e editores trabalhando para defender seus dados/largura de banda contra abuso resultou em uma disputa interessante que está se desenrolando em um arquivo pouco conhecido em todos os sites chamado robots.txt.
Este guia tem como objetivo acompanhar como esse drama está se desenrolando com nosso painel ao vivo, vendo quais dos 1000 principais sites estão bloqueando bots de IA, como bloqueá-los e quais você deve bloquear.
Se estiver faltando algum bot que você gostaria que fosse incluído, entre em contato.