Bots wie OpenAIs GPTBot, der Applebot, CCBot, Google-Extended, und Bytespider analysieren, speichern oder scrapen die Daten Ihrer Website, um Daten für das Training fortschrittlicherer LLMs bereitzustellen.
Bei Originality.ai legen wir Wert auf verantwortungsvolle Entwicklung (einschließlich ethischem Scraping) und die Nutzung (AI Detector) von generativen KI-Schreibtools wie ChatGPT.
Dieser Artikel wird ausführlich auf den Zweck von KI-Bots eingehen, was sie tun, wie man sie blockiert und auf den interessanten Kampf um die Zukunft der KI, der sich in einer kaum bekannten Datei namens robots.txt abspielt.
KI-Bots gibt es in mehreren Formen, darunter KI-Assistenten, KI-Daten-Scraper, und KI-Such-Crawler, die alle führende KI-Tools und KI-Suchmaschinen antreiben. Jeder dieser KI-Bots extrahiert Daten aus dem Web. Zahlreiche Webmaster halten diese Praktiken für inakzeptabel und möchten ihre Daten oder Website-Informationen vor Scraping schützen.
Da immer mehr Teile des Internets KI-Bots blockieren, wird die Anzahl der Wörter, die KI-Unternehmen wie OpenAI, Anthropic für die Entwicklung ihres neuesten LLM (wie GPT-4o, Claude 3.5) zur Verfügung steht, zurückgehen, was zu einer langsameren zukünftigen Verbesserung von KI-Tools führt.
Die gängigste Methode besteht darin, den folgenden Text zu Ihrer Robots.txt-Datei hinzuzufügen:
User-agent: name-of-bot
Disallow: /
Beispiel:
User-agent: GPTBot
Disallow: /
Eine ausführlichere Erklärung der Optionen zum Blockieren von KI-Bots sowie eine Beispiel-Robots.txt-Datei finden Sie am Ende dieses Artikels.
Insbesondere OpenAI war aktiv bemüht, Daten-Partnerschaften zu sichern, um seine LLM-Trainingsbemühungen weiter voranzutreiben.
Robots.txt ist ein Internetprotokoll, das Suchmaschinen-Crawlern Informationen darüber liefert, auf welche URLs der Crawler auf Ihrer Website zugreifen kann. Es wird hauptsächlich verwendet, um eine Überlastung der Domain durch von Crawlern erzeugte Anfragen zu verhindern.
Es ist wichtig zu wissen, dass Robots.txt eine Aufforderung ist, der Bots folgen sollten, die aber nicht „befolgt werden muss“.
In Bezug auf das Filtern und Verwalten des Crawler-Traffics auf Ihrer Website hat robots.txt je nach Dateityp eine unterschiedliche Anwendung:
Der Hauptzweck von robots.txt besteht darin, den Crawler-Zugriff auf bestimmte Seiten Ihrer Website einzuschränken. Angenommen, Sie haben Bedenken, dass der Server Ihrer Website durch zu viele Google-Anfragen überlastet wird. In diesem Fall können Sie verhindern, dass Suchmaschinen-Crawler auf bestimmte Seiten Ihrer Website zugreifen, um die Auslastung zu reduzieren.
Sie können die robots.txt-Datei verwenden, um den Crawl-Traffic zu Bildern, Videos und Audiodateien zu verwalten. Dadurch würde verhindert, dass bestimmte Medien in der SERP (Search Engine Results Page) auf Google oder anderen Suchmaschinen erscheinen.
Wenn Sie der Meinung sind, dass es eine bestimmte Auslastungsrate gibt, die durch unwichtige Stil-Dateien, Bilder oder Skripte verursacht wird, können Sie die robots.txt-Datei verwenden, um den Zugriff bestimmter KI-Crawler, Scraper, Assistenten oder anderer Bots einzuschränken.
Sehen wir uns die verschiedenen Arten von KI-Bots und Crawlern an, die von Unternehmen im Web eingesetzt werden:
KI-Assistenten wie der ChatGPT-User von OpenAI und der von Meta eingesetzte Meta-ExternalFetcher spielen eine wichtige Rolle bei der Beantwortung von Nutzeranfragen. Die Antworten können entweder in Text- oder Sprachformat erfolgen und verwenden die gesammelten Webdaten, um die für den Prompt des Nutzers hilfreichste Antwort zu erstellen.
KI-Web-Scraping ist ein Verfahren, das von KI-Daten-Scraper- Bots durchgeführt wird, um so viele nützliche Daten wie möglich für das LLM-Training zu sammeln. Unternehmen wie Apple, ByteDance, Common Crawl, OpenAI und Anthropic verwenden KI-Daten-Scraper, um einen großen Datensatz des Webs aufzubauen, mit dem LLMs trainiert werden können.
Viele Unternehmen setzen KI-Such-Crawler ein, um Informationen über bestimmte Website-Seiten, Titel, Keywords, Bilder und referenzierte Inline-Links zu sammeln. Während KI-Crawler das Potenzial haben, Traffic auf eine Website zu senden, entscheiden sich einige Website-Betreiber dennoch dafür, sie zu blockieren.
ChatGPT-User ist ein Suchassistent-Crawler, der von Open AIs ChatGPT als Ergebnis von Nutzer-Prompts ausgesendet wird. Die meisten seiner Antworten enthalten typischerweise eine Zusammenfassung des Website-Inhalts sowie einen Referenzlink.
Der Typ des ChatGPT-User-Crawlers ist KI-Assistent, da er verwendet wird, um im Auftrag des ChatGPT-Nutzers Aufgaben intelligent auszuführen.
Vom ChatGPT-User-Suchassistenten wird erwartet, dass er auf Anfrage des Nutzers einmalige Besuche durchführt, anstatt das Web automatisch wie andere Crawler zu durchsuchen.
Um diesen Crawler zu blockieren, müssen Sie die folgende Anweisung in die robots.txt Ihrer Website aufnehmen:
User-agent: ChatGPT-User
Disallow: /
Der Meta-ExternalFetcher-Crawler wird von allen Produkten von Meta AI ausgesendet, um Nutzer-Prompts zu bedienen, wenn ein einzelner Link erforderlich ist.
Der Meta-ExternalFetcher-KI-Assistent wird abgerufen, um im Auftrag des Meta AI-Nutzers Aufgaben intelligent auszuführen.
Ähnlich wie der ChatGPT-User-Crawler führt der Meta-ExternalFetcher im Allgemeinen einmalige Besuche auf Grundlage der Anfrage des Nutzers durch, anstatt das Web automatisch zu crawlen.
Sie müssen den folgenden Befehl in die robots.txt Ihrer Website aufnehmen, um den Zugriff von Meta-ExternalFetcher zu verhindern:
User-agent: Meta-ExternalFetcher
Disallow: /
Der Amazonbot-Webcrawler wird von Amazon verwendet, um Suchergebnisse zu indexieren und zu registrieren, wodurch der Alexa-KI-Assistent Fragen genauer beantworten kann. Die meisten Antworten von Alexa enthalten im Allgemeinen einen Verweis auf die Website.
Amazonbot ist ein KI-Such-Crawler, der zur Indexierung von Webinhalten für Alexas KI-gestützte Suchergebnisse verwendet wird.
Das Besondere an Such-Crawlern ist, dass sie keinem festen Besuchsschema für Websites folgen. Die Besuchshäufigkeit wird durch viele Faktoren definiert und erfolgt typischerweise auf Anfrage zu einer Nutzerabfrage, auch beim Amazonbot.
Sie können den Zugriff des Amazonbot auf Ihre Website einschränken, indem Sie die folgenden Befehlszeilen in die robots.txt Ihrer Website eingeben:
User-agent: Amazonbot
Disallow: /
Der Applebot-Such-Crawler wird verwendet, um Suchergebnisse zu registrieren, wodurch der Siri-KI-Assistent Nutzerfragen effektiver beantworten kann. Die meisten Antworten von Siri enthalten einen Verweis auf die von Applebot gecrawlten Websites.
Applebot ist ein KI-Such-Crawler, der Webinhalte indexiert, um KI-gestützte Suchergebnisse zu erstellen.
Das Verhalten des Applebot variiert je nach mehreren Faktoren, wie Suchnachfrage, gecrawlten Websites und Nutzerabfragen. Standardmäßig verlassen sich Such-Crawler nicht auf feste Besuche, um Ergebnisse bereitzustellen.
Obwohl es nicht empfohlen wird, Such-Crawler zu blockieren, können Sie den folgenden Befehl in der robots.txt der Website verwenden, um den Zugriff des Applebot zu verhindern:
User-agent: Applebot
Disallow: /
Der OAI-SearchBot-Crawler wird verwendet, um einen Index von Websites zu erstellen, der als Ergebnis von OpenAIs SearchGPT-Produkt genutzt werden kann.
Der OAI-SearchBot ist ein KI-Such-Crawler, der zur Indexierung von Webinhalten verwendet wird, um genauere KI-gestützte Suchergebnisse für OpenAIs SearchGPT-Dienst bereitzustellen.
Das Verhalten des OAI-SearchBot kann durch die Häufigkeit von Websuchen und Nutzerabfragen definiert werden. Wie jeder andere Such-Crawler verlässt sich der OAI-SearchBot nicht auf feste Website-Besuche, um Ergebnisse bereitzustellen.
Fügen Sie den folgenden Befehl in die robots.txt-Datei Ihrer Website ein, um den Zugriff des OAI-SearchBot aktiv zu verhindern:
User-agent: OAI-SearchBot
Disallow: /
Perplexity verwendet den PerplexityBot-Webcrawler, um Suchergebnisse für eine effektivere Antwort seines KI-Assistenten zu indexieren. Die vom Assistenten bereitgestellten Antworten zeigen normalerweise Inline-Verweise auf eine Vielzahl von Webquellen an.
Der PerplexityBot ist ein KI-Such-Crawler, der dazu entwickelt wurde, Ergebnisse für KI-gestützte Suchergebnisse des Perplexity-KI-Assistenten zu indexieren.
Wie die meisten Such-Crawler hängt der PerplexityBot nicht von einem festen Besuchsplan für die Webquellen ab, die er bewirbt. Die Häufigkeit der Besuche kann je nach mehreren Faktoren variieren, etwa Nutzerabfragen.
Sie können den Zugriff von PerplexityBot auf Ihre Website einschränken, indem Sie die folgende Agent-Token-Regel in die robots.txt aufnehmen:
User-agent: PerplexityBot
Disallow: /
Der YouBot ist ein Such-Crawler, der von You.ai eingesetzt wird, um Suchergebnisse für genauere Nutzerantworten durch den You-KI-Assistenten zu indexieren. Der Bot verweist im Allgemeinen über Inline-Quellen auf die referenzierten Websites.
Der YouBot-Such-Crawler indexiert Webinhalte, um genauere KI-gestützte Suchergebnisse zu generieren.
Der YouBot-Crawler hat keinen festen Besuchsplan, und die Häufigkeit der Besuche erfolgt häufig auf Anfrage oder als Reaktion auf eine Nutzerabfrage.
Sie müssen den folgenden Befehl in die robots.txt-Datei Ihrer Website einfügen, um den Zugriff des YouBot-Crawlers zu verhindern:
User-agent: YouBot
Disallow: /
Der Applebot-Extended-KI-Daten-Scraper wird verwendet, um APples Reihe von LLM-Modellen zu trainieren, die die generativen KI-Funktionen des Unternehmens antreiben. Dieser Applebot-Scraper findet breite Anwendung in allen Aspekten von Apple Intelligence, Services und Developer Tools.
Der Applebot-Extended ist ein KI-Daten-Scraper, der zum Herunterladen von Webinhalten und zum Trainieren von KI oder LLM (Large Language Models) verwendet wird
Während unklar bleibt, wie genau KI-Daten-Scraper auswählen, welche Website sie crawlen, ist bekannt, dass Quellen mit höherer Informationsdichte diesen Scraper Applebot anziehen. Es wäre sinnvoll, wenn ein LLM Websites bevorzugt, die regelmäßig Webinformationen auf der Seite hochladen und aktualisieren.
Fügen Sie den folgenden Befehl in die robots.txt-Datei Ihrer Website ein, um den Applebot-Extended zu blockieren:
User-agent: Applebot-Extended
Disallow: /
Bytespider wird von ByteDance betrieben und ist ein KI-Daten-Scraper des chinesischen Eigentümers von TikTok. Er wird verwendet, um LLM-Trainingsdaten herunterzuladen und relevante Daten bereitzustellen.
Bytespider ist ein KI-Daten-Scraper, der verwendet wird, um Large Language Models durch das Herunterladen von Inhalten aus dem Web zu trainieren.
Der Bytespider-KI-Daten-Scraper bevorzugt Webquellen mit regelmäßig aktualisierten und faktenreichen Informationen, die als Zufuhr für LLMs verwendet werden.
Fügen Sie die folgende User-Agent-Token-Regel in die robots.txt Ihrer Website ein:
User-agent: Bytespider
Disallow: /
CCBot gehört Common Crawl, um ein Open-Source-Repository durch Web-Crawl-Daten aufzubauen, auf das jeder zugreifen und das jeder nutzen kann.
Der CCBot ist ein KI-Daten-Scraper, der dazu dient, Webinhalte herunterzuladen und KI-Modelltraining durchzuführen.
Der CCBot crawlt informationsreiche Webquellen, um ein effektiveres LLM-Training zu ermöglichen.
Fügen Sie die folgende Regel in robots.txt ein, um den Zugriff von CCBot einzuschränken:
User-agent: CCBot
Disallow: /
Der ClaudeBot-KI-Daten-Scraper wird von Anthropic betrieben, um Large Language Models wie Claude mit Trainingsdaten zu versorgen.
Der ClaudeBot ist ein KI-Daten-Scraper, der dazu dient, Webinhalte herunterzuladen und KI-Modelle zu trainieren.
ClaudeBot wählt anhand der Informationsdichte und der Regelmäßigkeit von Informationsaktualisierungen aus, welche Websites gecrawlt werden.
Der Zugriff des ClaudeBot kann durch Aufnahme der folgenden Regel in die robots.txt widerrufen werden:
User-agent: ClaudeBot
Disallow: /
Der Diffbot ist darauf ausgelegt, ordnungsgemäß strukturierte Website-Daten für KI-Modelltraining und Echtzeitüberwachung zu strukturieren, zu verstehen, zu aggregieren und sogar zu verkaufen.
Der Diffbot ist ein KI-Daten-Scraper, der dazu entwickelt wurde, KI-Modelle zu trainieren und Webinformationen herunterzuladen/zu strukturieren.
Die Besuchshäufigkeit des Diffbot wird durch die Informationsqualität der Quelle und die Regelmäßigkeit der Aktualisierungen bestimmt.
Das Crawlen durch den Diffbot kann verhindert werden, indem die folgende Regel in der robots.txt angewendet wird:
User-agent: Diffbot
Disallow: /
Der FacebookBot wird von Meta eingesetzt, um die Effizienz der KI-Spracherkennungstechnologie zu verbessern und KI-Modelle zu trainieren.
FacebookBot ist ein KI-Daten-Scraper-Crawler, der zur Registrierung von Webinhalten und zum LLM-Training verwendet wird.
Der FacebookBot hat keinen festen Besuchsplan, erkennt aber möglicherweise Quellen mit reichhaltigeren und gut aktualisierten Informationen und verlässt sich darauf.
Der Zugriff des FacebookBot kann mit der folgenden Regel widerrufen werden:
User-agent: FacebookBot
Disallow: /
Der Google-Extended-Crawler wird verwendet, um Trainingsinformationen für KI-Produkte von Google bereitzustellen, wie den Gemini-Assistenten und die generativen Vertex AI-APIs.
Der Google-Extended-Crawler ist ein KI-Daten-Scraper, der dazu dient, Informationen aus dem Web herunterzuladen und KI-Training durchzuführen.
Der Besuchsplan des Google-Extended-Bots ist ebenfalls flexibel, aber er ist aufgrund von Googles umfangreicher Datenbank zuverlässiger Informations-Webquellen viel zielgerichteter als andere Crawler.
Der Google-Extended-Crawler kann mit der folgenden Regel auf die Blacklist gesetzt werden:
User-agent: Google-Extended
Disallow: /
Der GPTBot wird von OpenAI entwickelt, um Webquellen zu crawlen und Trainingsdaten für die Large Language Models des Unternehmens sowie Produkte wie ChatGPT herunterzuladen.
Der GPTBot ist ein KI-Daten-Scraper, der darauf ausgelegt ist, eine breite Palette von Daten aus dem Web herunterzuladen und bereitzustellen.
Wie andere KI-Daten-Scraper bevorzugt der GPTBot informationsreiche Quellen und Websites, um relevantere Informationen für KI-Trainingsverfahren bereitzustellen.
Sie können den GPTBot-KI-Daten-Scraper mit der folgenden robots.txt-Regel blockieren:
User-agent: GPTBot
Disallow: /
Meta-ExternalAgent ist eine von Meta entwickelte Crawler-Technologie, um die KI-Technologien des Unternehmens durch direktes Herunterladen und Indexieren von Webinhalten zu verbessern.
Der Meta-ExternalAgent verwendet eine KI-Datenscraper-Technologie, um Webinhalte herunterzuladen und zu indexieren, die für KI-Training bestimmt sind.
Ähnlich wie andere vom Unternehmen entwickelte Crawler verwendet der Meta-ExternalAgent eine flexible Crawling-Strategie, um informationsreiche Webquellen gezielt zu identifizieren.
Dieser von Meta entwickelte Crawler kann durch die folgende robots.txt-Regel eingeschränkt werden:
User-agent: Meta-ExternalAgent
Disallow: /
Der omgili-Crawler gehört Webz.io und wurde entwickelt, um eine aufgebaute Bibliothek von Web-Crawl-Daten zu pflegen, die anschließend an andere Unternehmen für KI-Trainingszwecke verkauft wird.
Der omgili-Crawler ist ein KI-Datenscraper, der KI-Trainingsinformationen aus dem Web herunterlädt.
Da die gecrawlten Informationen anschließend von Webz.io verkauft werden, verfolgt der omgili-Crawler glaubwürdige und autorisierte Websites mit relevanten Informationen.
Verwenden Sie die folgende Regel, um den Zugriff des omgili-Crawlers auf Ihre Website zu verhindern:
User-agent: omgili
Disallow: /
Der unbestätigte Anthropic-AI-Agent wird tendenziell dazu verwendet, relevante Trainingsdaten herunterzuladen und sie KI-gestützten Produkten des Unternehmens, wie Claude, bereitzustellen.
Der genaue Typ des Anthropic-AI-Agenten ist aufgrund fehlender Offenlegung durch das Unternehmen noch unbekannt.
Aufgrund fehlender relevanter Informationen über den Anthropic-AI-Agenten kann der Crawler für mehrere Zwecke verwendet werden, aber es ist weiterhin schwer zu sagen.
Der Anthropic-AI-Agent kann mit der folgenden Regel blockiert werden:
User-agent: anthropic-ai
Disallow: /
Claude-Web ist ein weiterer von Anthropic betriebener KI-Agent, ohne offizielle Dokumentation zu seinen Verwendungszwecken. Es wird erwartet, dass Claude-Web relevante LLM-Trainingsdaten für Anthropic bereitstellt.
Claude-Web wird entweder ein KI-Datenscraper oder ein standardmäßiger Such-Crawler für Anthropics Claude 3.5 Large Language Model sein.
Anthropic hält Informationen über die Funktionen von Claude-Web zurück, aber das Verhalten des Crawlers wird dem Typ des Agenten entsprechen, sobald dieser vollständig offengelegt ist.
Die folgende Regel wird verwendet, um den Crawling-Zugriff des Claude-Web-Agenten auf Ihre Website auszusetzen:
User-agent: Claude-Web
Disallow: /
Cohere-AI ist ein undokumentierter Agent, der von Cohere entwickelt wurde, um seine generativen KI-Tools mit relevanten Studieninformationen zu versorgen. Er ruft Informationen aus dem Web ab, wenn Benutzer über Cohere AI dazu auffordern.
Da für diesen Cohere-AI-Agenten keine Dokumentation verfügbar ist, ist der Typ des Crawlers vielen Website-Betreibern noch unbekannt.
Es wird vermutet, dass der Cohere-AI-Agent durch verschiedene Verhaltensmuster mehrfach einsetzbar sein wird, um Cohere-Benutzer mit relevanten Informationen und eingebetteten Quellenlinks zu versorgen.
Sie können den Zugriff des Cohere-AI Agenten durch die folgende Regel aussetzen:
User-agent: cohere-ai
Disallow: /
Die Hauptfunktion des Ai2Bot besteht darin, „bestimmte Domains“ zu crawlen und Webinhalte zum Training von Sprachmodellen zu erfassen.
Wie von Ai2 berichtet, ist der Ai2Bot ein KI-Such-Crawler, da er Inhalte, Bilder und Videos auf der gecrawlten Website analysiert.
Der Ai2Bot crawlt laut Angaben des Unternehmens nur bestimmte Websites, kann seinen Bereich registrierter Domains jedoch von Tag zu Tag erweitern.
Fügen Sie die folgende Regel in die robots.txt Ihrer Website ein, um den Ai2Bot auszusetzen:
User-agent: Ai2Bot
Disallow: /
Das Unternehmen Ai2 besitzt den Ai2Bot-Dolma-Bot und respektiert robots.txt-Regeln. Die erfassten Inhalte werden verwendet, um eine Vielzahl von Sprachmodellen des Unternehmens zu trainieren.
Obwohl dem Bot kein spezifischer Typ zugewiesen ist, glauben wir, dass er das Verhalten eines standardmäßigen KI-Such-Crawlers aufweist.
Der Ai2Bot-Dolma crawlt nur „bestimmte Domains“, um die für das Training von Sprachmodellen erforderlichen Webinhalte zu finden.
Verwenden Sie die folgende robots.txt-Zeile, um den Zugriff von Ai2Bot-Dolma einzuschränken:
User-agent: Ai2Bot-Dolma
Disallow: /
Obwohl über diesen Crawler nicht viel bekannt ist, respektiert er die robots.txt und wird verwendet, um Daten für Experimente im Bereich maschinelles Lernen zu erfassen.
Der Typ des Bots ist noch unbekannt, aber wir glauben, dass er basierend auf seinem Webverhalten entweder ein generischer Crawler oder ein KI-Datenscraper ist.
Es ist unklar, wer der Betreiber dieses Bots ist, aber die Daten werden für das Training großer Sprachmodelle, maschinelles Lernen und die Erstellung von Datensätzen verwendet.
So setzen Sie den Zugriff von FriendlyCrawler auf Ihre Website aus:
User-agent: FriendlyCrawler
Disallow: /
Der GoogleOther-Crawler ist ein Bot von Google, aber es ist weiterhin unklar, ob er KI-bezogen oder überhaupt künstlich intelligent ist. Derzeit hat nur ein einzelner Prozentsatz der leistungsstärksten Websites den GoogleOther-Bot blockiert.
Der GoogleOther-Bot ist ein Suchmaschinen-Crawler, der Webinhalte für genauere Suchmaschinenergebnisse oder die Google-SERP indexiert.
Wie jeder andere Suchmaschinen-Crawler folgt der GoogleOther-Bot keinem bestimmten Besuchsplan, und die Besuchshäufigkeit variiert je nach Website-Aktivität und Inhaltsqualität.
Fügen Sie die folgende Regel zur robots.txt-Datei Ihrer Website hinzu:
User-agent: GoogleOther
Disallow: /
GoogleOther-Image ist die Version von GoogleOther, die dafür vorgesehen ist, Bilder im Web zu crawlen, zu analysieren und zu indexieren
Wie GoogleOther ist der GoogleOther-Image-Bot ein generischer Crawler, der von verschiedenen Produktteams verwendet wird, um Website-Inhalte öffentlich zugänglich zu machen.
Dieser Crawler hält sich nicht an einen festen Besuchsplan, sondern analysiert die zuverlässigsten Bildquellen im Web und indexiert bestimmte Informationen.
Sie können diesen Google-Crawler mit dem folgenden Befehl blockieren:
User-agent: GoogleOther-Image
Disallow: /
Ebenso wie der standardmäßige GoogleOther-Crawler und der bilderregistrierende Bot crawlt und analysiert GoogleOther-Video Videoinhalte im Web.
Dieser Bot ist ein generischer Crawler, der einer Vielzahl von Produktteams dient und Unternehmen dabei hilft, mit den auf ihrer Website hochgeladenen Videos eine bessere Reichweite zu erzielen.
Wie die anderen Versionen von GoogleOther hat auch dieser Crawler einen flexiblen Besuchsplan, der durch die Aktivität und Qualität der Website-Videoinhalte definiert wird.
Dieser Google-Bot kann mit der folgenden robots.txt-Zeile blockiert werden:
User-agent: GoogleOther-Video
Disallow: /
Der ICC-Crawler ist ein Agent, der vom Ersteller noch nicht kategorisiert wurde. Es ist weiterhin unbekannt, ob dieser Crawler künstlich intelligent ist oder etwas mit KI zu tun hat.
Wie seine Quelle ist auch der Typ des ICC-Crawler-Bots unbekannt.
Das Verhalten des Bots variiert je nach Typ des Crawlers, insbesondere danach, ob es sich um einen Datenscraper, Suchmaschinen-Crawler oder Archivierer handelt.
Der ICC-Crawler kann mit dem folgenden Befehl blockiert werden:
User-agent: ICC-Crawler
Disallow: /
Der Imagesift-Bot gehört Hive, aber derzeit ist unbekannt, ob der Crawler KI-bezogen oder künstlich intelligent ist.
Der ImagesiftBot ist ein Informationssammler, der im Web nach nützlichen Erkenntnissen sucht und die Ergebnisse in einer Datenbank registriert oder indexiert.
Das Verhalten von Informationssammler-Crawlern hängt von den Zielen ihrer Kunden ab. Beispielsweise könnte ein Kunde daran interessiert sein, seine Marke bekannter zu machen, was dazu führt, dass der Bot soziale Medien häufiger crawlt als andere, nicht verwandte Websites.
Dieser Crawler kann auf folgende Weise blockiert werden:
User-agent: ImagesiftBot
Disallow: /
Der PetalBot von Huawei ist derzeit auf 2% der beliebten indexierten Websites ausgesetzt. Es ist weiterhin unbekannt, ob dieser Crawler künstlich intelligent ist oder in irgendeiner Weise mit KI in Zusammenhang steht.
PetalBot ist ein Suchmaschinen-Crawler, der Webinhalte indexiert und Daten aus Suchmaschinenergebnissen erfasst.
Das Verhalten von PetalBot wird durch die Qualität der Inhalte und die Aktivität der registrierten Websites und Domains bestimmt. Suchmaschinen-Crawler neigen dazu, Websites mit höherer Inhaltsqualität und häufiger Aktivität zu crawlen.
Der Zugriff von PetalBot kann auf folgende Weise ausgesetzt werden:
User-agent: PetalBot
Disallow: /
Scrapy gehört Zyte und ist derzeit auf mehr als 3% der registrierten Domains im Web blockiert.
Scrapy ist ein KI-Scraper; diese Crawler sind dafür berüchtigt, die robots.txt einer Website nicht zu respektieren. Er wird schließlich die erforderlichen Informationen analysieren, selbst wenn dies bedeutet, auf eine Website zuzugreifen, die eine robots.txt-Disallow-Regel für Scrapy hat.
Den Besuchsplan eines KI-Scrapers vorherzusagen, ist nahezu unmöglich. Diese Crawler werden mit unterschiedlichen Zwecken eingesetzt, und es ist schwer zu sagen, welche Websites sie crawlen würden und wie oft.
Obwohl robots.txt gegen KI-Scraper nicht viel ausrichtet, können Sie Scrapy so blockieren:
User-agent: Scrapy
Disallow: /
Timpibot gehört Timpi und ist derzeit auf 3% der beliebten indexierten Websites blockiert. Der einzige Zweck von Timpibot besteht darin, Webdaten für das Training von KI-Modellen zu erfassen.
Im Gegensatz zu einem standardmäßigen Scraper ist Timpibot ein KI-Datenscraper, der sich ausschließlich auf künstliche Intelligenz stützt, um Webinhalte zu crawlen und zu indexieren.
Ähnlich wie bei standardmäßigen Scrapern ist auch der Besuchsplan von KI-Datenscrapern unklar. Diese Crawler neigen dazu, Websites mit höherer Informationsdichte und höherem Inhaltswert auszuwählen, abhängig von den für das Training des KI-Modells erforderlichen Informationen.
Der Zugriff von Timpibot kann mit der folgenden robots.txt-Regel ausgesetzt werden:
User-agent: Timpibot
Disallow: /
Der VelenPublicCrawler wird von Hunter betrieben und wurde von 0% der am besten indexierten Websites im Web blockiert.
Der Crawler ist ein standardmäßiger Informationssammler, der dazu bestimmt ist, nützliche Erkenntnisse aus Webergebnissen zu sammeln.
Informationssammler neigen dazu, die Ziele ihrer Kunden zu erfüllen, und haben in den meisten Fällen spezifische Aufgaben in Bezug darauf, welche Informationen gesammelt werden sollen.
VelenPublicWebCrawler kann mit dem folgenden Befehl blockiert werden:
User-agent: VelenPublicWebCrawler
Disallow: /
Webzio-Extended ist ein weiterer Crawler von Webz.io, der verwendet wird, um das Repository der erfassten Crawl-Daten zu pflegen. Die Informationen werden anschließend an andere Unternehmen verkauft und typischerweise für das Training von KI-Modellen verwendet.
Webzio-Extended ist ein KI-Datenscraper, der Webinhalte zum Zweck des Trainings von KI-Modellen herunterlädt.
KI-Datenscraper wie Webzio-Extended halten sich nicht an einen festen Besuchsplan für Websites. Datenreichere Quellen ziehen die Scraper tendenziell stärker an und führen dazu, dass sie häufiger crawlen.
Der Zugriff von Webzio-Extended auf Ihre Website kann mit dem folgenden Befehl ausgesetzt werden:
User-agent: Webzio-Extended
Disallow: /
Der facebookexternalhit-Crawler ist ein von Meta eingesetzter Bot, der auf mehr als 6% der registrierten beliebten Websites blockiert ist. Es ist weiterhin unklar, ob der Bot künstlich intelligent oder mit KI verbunden ist.
Facebookexternalhit ist ein Fetcher, der Webergebnisse im Auftrag einer Anwendung crawlt.
Fetcher werden typischerweise eingesetzt, um Websites auf Anfrage zu besuchen. Sie werden verwendet, um dem anfragenden Benutzer die Metadaten eines bestimmten Links, beispielsweise einen Titel oder ein Miniaturbild, zu präsentieren.
Dieser Meta-Crawler kann mit der folgenden robots.txt-Regel blockiert werden:
User-agent: facebookexternalhit
Disallow: /
Es ist bekannt, dass img2dataset der einzige Webcrawler des Unternehmens ist, der dazu dient, eine große Anzahl von Bildern herunterzuladen und sie in Datensätze umzuwandeln, um große Sprachmodelle zu trainieren.
Der Typ von img2dataset ist noch unbekannt, aber wir glauben, dass es sich basierend auf seinem Verhalten und Besuchsplan um einen KI-Suchmaschinen-Crawler handelt.
Img2dataset neigt dazu, Websites mit einer reichhaltigeren Bilddatenbank und einer Vielzahl von Themen zu crawlen.
Dieser Crawler kann mit der folgenden Regel ausgesetzt werden:
User-agent: img2dataset
Disallow: /
Es gibt mehrere einzigartige Möglichkeiten, unerwünschten Bot-Traffic auf Ihre Website einzuschränken:
Die gängigste Methode besteht darin, den folgenden Text zu Ihrer Robots.txt-Datei hinzuzufügen:
User-agent: name-of-bot
Disallow: /
Beispiel:
User-agent: GPTBot
Disallow: /
Das Erstellen einer leicht zugänglichen robots.txt-Datei umfasst mehrere einfache Schritte:
Während dieses Schritts müssen Sie auf das Stammverzeichnis der Website zugreifen. Dort muss die Datei gespeichert werden, um den Crawler-Zugriff auf Ihre Website effektiv einzuschränken. Beachten Sie, dass Ihre Website nur eine einzige robots.txt-Datei haben kann.
Sie können jeden Editor verwenden, um die Datei zu erstellen, beispielsweise Windows's NotePad, TextEdit und vi. Stellen Sie sicher, dass die Datei in UTF-8-Codierung gespeichert wird, und fahren Sie mit dem Anwenden der Regeln fort. Googles Crawler reagieren auf die folgenden Regeln: "user-agent," "disallow," "allow" und "sitemap." Jede Regel hat ihren eigenen Zweck im Hinblick auf die Verwaltung von Crawlern.
Der nächste Schritt besteht darin, die neu erstellte robots.txt-Datei öffentlich zugänglich zu machen, indem Sie ein privates Browserfenster in Ihrem Browser öffnen und zum Speicherort der Datei navigieren. Sie können prüfen, ob die robots.txt öffentlich zugänglich ist, indem Sie die Seitendomain eingeben, zum Beispiel "https://(site name)", und am Ende "/robots.txt" hinzufügen.
Wie wir bereits zuvor festgestellt haben, wird das Einfügen einer Einschränkungsregel für einen bestimmten Bot in die robots.txt Ihrer Website die Seite weder deindexieren noch aus der SERP entfernen. Beim Versuch, auf Ihre Seite zuzugreifen, erhält der Bot automatisch eine Fehlermeldung und wird weggeleitet, ohne Zugriff auf den Inhalt der Seite zu erhalten.
Die Seite bleibt weiterhin für alle Benutzer und KI-Bots auffindbar, aber Bots mit dem in der robots.txt-Datei aufgeführten Namensschild haben keinen Zugriff.
Diese Beispieldatei blockiert:
Das Blockieren der Datenscraper, aber nicht des Crawlers und Suchassistenten, zielt darauf ab, zu verhindern, dass die Daten einer Website für Training verwendet werden, während KI-Suche/Assistenten weiterhin Traffic an die Website senden dürfen.
Es gibt mehrere Möglichkeiten, den Zugriff von KI-Bots mithilfe einer Firewall auszusetzen. Lassen Sie uns jede der einzigartigen Möglichkeiten betrachten:
Wenn Sie die von Bots verwendeten Adressen kennen, um auf Ihre Domain zuzugreifen, können Sie die IPs auf eine Blacklist setzen über die Firewall Ihrer Website. Es ist eine allgemein bekannte Praxis, unbeabsichtigten Traffic auf Ihrer Website zu reduzieren und Ressourcen zu schonen. Bots können jedoch mehrere IPs durchwechseln.
Die vielleicht am weitesten bevorzugte Methode, um Bot-Traffic auf Ihrer Website zu 100% auszusetzen, ist die Implementierung einer CAPTCHA-Software, die eine menschliche Validierung erfordert. Jeder neue Besucher wird aufgefordert, eine einfache Aufgabe zu lösen, etwa Puzzleteile zuzuordnen oder Objekte auf einer Reihe von Bildern zu identifizieren, um Zugriff zu erhalten. Firewalls können so geändert werden, dass sie CAPTCHAs auslösen.
CDN-Dienste wie Cloudflare oder Amazon CloudFront können in die Firewall Ihrer Website integriert werden, um den Traffic von KI-Bots zu reduzieren. Ähnlich wie bei CAPTCHA-Herausforderungen dürfen nur gültige IP-Adressen, die echten Benutzern gehören, auf Ihre Website zugreifen.
Da eine große Zahl von Webmastern auf robots.txt setzt, um unerwünschten Bot-Traffic auf ihrer Website auszusetzen, ist jede Regel innerhalb der Datei auf einen bestimmten Bot ausgerichtet. Nachdem Unternehmen begannen, den Traffic-Rückgang ihrer Bots zu spüren, entschieden sich viele, ihren Bots einen neuen Namen zuzuweisen , der in der robots.txt-Datei vieler Websites nicht enthalten war.
Ein aktuelles Beispiel ist, wie Anthropic seine KI-Datenscraper namens „ANTHROPIC-AI“ und „CLAUDE-WEB“ zu einem neuen Bot namens „CLAUDEBOT“ zusammengeführt hat. Es dauerte sicherlich eine Weile, bis Websites davon erfuhren, und in der Zwischenzeit hatte der neue Bot beispiellosen Zugriff auf alle Websites im Internet.
Mit der zunehmenden und weit verbreiteten Nutzung öffentlicher Informationen durch KI-Unternehmen, um große Sprachmodelle zu trainieren, wird die Ineffektivität von Webprotokollen offensichtlich. Als Reaktion auf das umfangreiche Datenscraping, das von Webdaten-KI-Unternehmen wie C4, Dolma, und Refined Web durchgeführt wurde, gab es einen Rückgang von über 28%-45% beim Crawler-Zugriff.

Ganze 45% von C4 wurden nun eingeschränkt, wobei viele der Einschränkungen vielfältig sind und die Gesetze allgemeiner KI-Infrastrukturen über robots.txt skalieren. Die Nachfrage nach Datenzustimmung wird nicht nur für kommerzielle KI, sondern für alle Arten akademischer Forschung und nichtkommerzieller KI-Nutzung immer anspruchsvoller.
Der Zusammenprall von KI-Unternehmen, die versuchen, so viele Daten wie möglich zu scrapen, um LLMs zu trainieren, und Publishern, die daran arbeiten, ihre Daten/Bandbreite vor Missbrauch zu schützen, hat zu einem interessanten Konflikt geführt, der sich in einer wenig bekannten Datei auf allen Websites abspielt, der robots.txt.
Dieser Leitfaden zielt darauf ab, nachzuverfolgen, wie sich dieses Drama entwickelt, wobei unser Live-Dashboard zeigt, welche der top 1000 Websites KI-Bots blockieren, wie man sie blockiert und welche Sie blockieren sollten.
Wenn wir Bots übersehen haben, die Sie gerne aufgenommen hätten, melden Sie sich bitte.