KI-Bots mit Robots.txt daran hindern, Websites zu crawlen

Sehen Sie sich das Live-Dashboard an, das die Websites zeigt, die AI Bots wie GPTBot, CCBot, Google-extended und ByteSpider daran hindern, die Inhalte auf ihrer Website zu crawlen und zu scrapen. Erfahren Sie, welche AI-Crawler / Scraper was tun und wie Sie sie mithilfe von Robots.txt blockieren können.

Bots wie OpenAIs GPTBot, der Applebot, CCBot, Google-Extended, und Bytespider analysieren, speichern oder scrapen die Daten Ihrer Website, um Daten für das Training fortschrittlicherer LLMs bereitzustellen. 

Bei Originality.ai legen wir Wert auf verantwortungsvolle Entwicklung (einschließlich ethischem Scraping) und die Nutzung (AI Detector) von generativen KI-Schreibtools wie ChatGPT.  

Dieser Artikel wird ausführlich auf den Zweck von KI-Bots eingehen, was sie tun, wie man sie blockiert und auf den interessanten Kampf um die Zukunft der KI, der sich in einer kaum bekannten Datei namens robots.txt abspielt. 

Was sind KI-Bots?

KI-Bots gibt es in mehreren Formen, darunter KI-Assistenten, KI-Daten-Scraper, und KI-Such-Crawler, die alle führende KI-Tools und KI-Suchmaschinen antreiben. Jeder dieser KI-Bots extrahiert Daten aus dem Web. Zahlreiche Webmaster halten diese Praktiken für inakzeptabel und möchten ihre Daten oder Website-Informationen vor Scraping schützen. 

Warum ist es wichtig, wenn Websites KI-Bots blockieren?

Da immer mehr Teile des Internets KI-Bots blockieren, wird die Anzahl der Wörter, die KI-Unternehmen wie  OpenAI, Anthropic für die Entwicklung ihres neuesten LLM (wie GPT-4o, Claude 3.5) zur Verfügung steht, zurückgehen, was zu einer langsameren zukünftigen Verbesserung von KI-Tools führt.

Wie man KI-Bots blockiert (einfache Version):

Die gängigste Methode besteht darin, den folgenden Text zu Ihrer Robots.txt-Datei hinzuzufügen:

User-agent: name-of-bot

Disallow: /

Beispiel:

User-agent: GPTBot

Disallow: /

Eine ausführlichere Erklärung der Optionen zum Blockieren von KI-Bots sowie eine Beispiel-Robots.txt-Datei finden Sie am Ende dieses Artikels. 

Insbesondere OpenAI war aktiv bemüht, Daten-Partnerschaften zu sichern, um seine LLM-Trainingsbemühungen weiter voranzutreiben. 

Was ist robots.txt und was macht es?

Robots.txt ist ein Internetprotokoll, das Suchmaschinen-Crawlern Informationen darüber liefert, auf welche URLs der Crawler auf Ihrer Website zugreifen kann. Es wird hauptsächlich verwendet, um eine Überlastung der Domain durch von Crawlern erzeugte Anfragen zu verhindern. 

Es ist wichtig zu wissen, dass Robots.txt eine Aufforderung ist, der Bots folgen sollten, die aber nicht „befolgt werden muss“. 

In Bezug auf das Filtern und Verwalten des Crawler-Traffics auf Ihrer Website hat robots.txt je nach Dateityp eine unterschiedliche Anwendung:

Filterung von Webseiten

Der Hauptzweck von robots.txt besteht darin, den Crawler-Zugriff auf bestimmte Seiten Ihrer Website einzuschränken. Angenommen, Sie haben Bedenken, dass der Server Ihrer Website durch zu viele Google-Anfragen überlastet wird. In diesem Fall können Sie verhindern, dass Suchmaschinen-Crawler auf bestimmte Seiten Ihrer Website zugreifen, um die Auslastung zu reduzieren.

Filterung von Mediendateien

Sie können die robots.txt-Datei verwenden, um den Crawl-Traffic zu Bildern, Videos und Audiodateien zu verwalten. Dadurch würde verhindert, dass bestimmte Medien in der SERP (Search Engine Results Page) auf Google oder anderen Suchmaschinen erscheinen.

Ressourcendatei 

Wenn Sie der Meinung sind, dass es eine bestimmte Auslastungsrate gibt, die durch unwichtige Stil-Dateien, Bilder oder Skripte verursacht wird, können Sie die robots.txt-Datei verwenden, um den Zugriff bestimmter KI-Crawler, Scraper, Assistenten oder anderer Bots einzuschränken.

Arten von KI-Bots

Sehen wir uns die verschiedenen Arten von KI-Bots und Crawlern an, die von Unternehmen im Web eingesetzt werden:

KI-Assistenten

KI-Assistenten wie der ChatGPT-User von OpenAI und der von Meta eingesetzte Meta-ExternalFetcher spielen eine wichtige Rolle bei der Beantwortung von Nutzeranfragen. Die Antworten können entweder in Text- oder Sprachformat erfolgen und verwenden die gesammelten Webdaten, um die für den Prompt des Nutzers hilfreichste Antwort zu erstellen.

KI-Daten-Scraper

KI-Web-Scraping ist ein Verfahren, das von KI-Daten-Scraper- Bots durchgeführt wird, um so viele nützliche Daten wie möglich für das LLM-Training zu sammeln. Unternehmen wie Apple, ByteDance, Common Crawl, OpenAI und Anthropic verwenden KI-Daten-Scraper, um einen großen Datensatz des Webs aufzubauen, mit dem LLMs trainiert werden können.

KI-Such-Crawler

Viele Unternehmen setzen KI-Such-Crawler ein, um Informationen über bestimmte Website-Seiten, Titel, Keywords, Bilder und referenzierte Inline-Links zu sammeln. Während KI-Crawler das Potenzial haben, Traffic auf eine Website zu senden, entscheiden sich einige Website-Betreiber dennoch dafür, sie zu blockieren.

Beschreibung beliebter KI-Bots

Tiefgehende Analyse beliebter KI-Bots

ChatGPT-User - KI-Suchassistent 

Überblick

ChatGPT-User ist ein Suchassistent-Crawler, der von Open AIs ChatGPT als Ergebnis von Nutzer-Prompts ausgesendet wird. Die meisten seiner Antworten enthalten typischerweise eine Zusammenfassung des Website-Inhalts sowie einen Referenzlink.

Typ

Der Typ des ChatGPT-User-Crawlers ist KI-Assistent, da er verwendet wird, um im Auftrag des ChatGPT-Nutzers Aufgaben intelligent auszuführen.

Crawler-Verhalten

Vom ChatGPT-User-Suchassistenten wird erwartet, dass er auf Anfrage des Nutzers einmalige Besuche durchführt, anstatt das Web automatisch wie andere Crawler zu durchsuchen.

Wie blockiert man den ChatGPT-User-Suchassistenten?

Um diesen Crawler zu blockieren, müssen Sie die folgende Anweisung in die robots.txt Ihrer Website aufnehmen:

User-agent: ChatGPT-User
Disallow: /

Meta-ExternalFetcher - KI-Suchassistent 

Überblick

Der Meta-ExternalFetcher-Crawler wird von allen Produkten von Meta AI ausgesendet, um Nutzer-Prompts zu bedienen, wenn ein einzelner Link erforderlich ist.

Typ

Der Meta-ExternalFetcher-KI-Assistent wird abgerufen, um im Auftrag des Meta AI-Nutzers Aufgaben intelligent auszuführen.

Crawler-Verhalten

Ähnlich wie der ChatGPT-User-Crawler führt der Meta-ExternalFetcher im Allgemeinen einmalige Besuche auf Grundlage der Anfrage des Nutzers durch, anstatt das Web automatisch zu crawlen.

Wie blockiert man den Meta-ExternalFetcher-KI-Assistenten?

Sie müssen den folgenden Befehl in die robots.txt Ihrer Website aufnehmen, um den Zugriff von Meta-ExternalFetcher zu verhindern:

User-agent: Meta-ExternalFetcher
Disallow: /

Amazonbot - KI-Such-Crawler 

Überblick

Der Amazonbot-Webcrawler wird von Amazon verwendet, um Suchergebnisse zu indexieren und zu registrieren, wodurch der Alexa-KI-Assistent Fragen genauer beantworten kann. Die meisten Antworten von Alexa enthalten im Allgemeinen einen Verweis auf die Website.

Typ

Amazonbot ist ein KI-Such-Crawler, der zur Indexierung von Webinhalten für Alexas KI-gestützte Suchergebnisse verwendet wird.

Crawler-Verhalten

Das Besondere an Such-Crawlern ist, dass sie keinem festen Besuchsschema für Websites folgen. Die Besuchshäufigkeit wird durch viele Faktoren definiert und erfolgt typischerweise auf Anfrage zu einer Nutzerabfrage, auch beim Amazonbot.

Wie blockiert man den Amazonbot-Such-Crawler?

Sie können den Zugriff des Amazonbot auf Ihre Website einschränken, indem Sie die folgenden Befehlszeilen in die robots.txt Ihrer Website eingeben:

User-agent: Amazonbot
Disallow: /

Applebot - KI-Such-Crawler 

Überblick

Der Applebot-Such-Crawler wird verwendet, um Suchergebnisse zu registrieren, wodurch der Siri-KI-Assistent Nutzerfragen effektiver beantworten kann. Die meisten Antworten von Siri enthalten einen Verweis auf die von Applebot gecrawlten Websites.

Typ

Applebot ist ein KI-Such-Crawler, der Webinhalte indexiert, um KI-gestützte Suchergebnisse zu erstellen.

Crawler-Verhalten

Das Verhalten des Applebot variiert je nach mehreren Faktoren, wie Suchnachfrage, gecrawlten Websites und Nutzerabfragen. Standardmäßig verlassen sich Such-Crawler nicht auf feste Besuche, um Ergebnisse bereitzustellen.

Wie blockiert man den Applebot-Such-Crawler?

Obwohl es nicht empfohlen wird, Such-Crawler zu blockieren, können Sie den folgenden Befehl in der robots.txt der Website verwenden, um den Zugriff des Applebot zu verhindern:

User-agent: Applebot
Disallow: /

OAI-SearchBot - KI-Such-Crawler

Überblick

Der OAI-SearchBot-Crawler wird verwendet, um einen Index von Websites zu erstellen, der als Ergebnis von OpenAIs SearchGPT-Produkt genutzt werden kann.

Typ

Der OAI-SearchBot ist ein KI-Such-Crawler, der zur Indexierung von Webinhalten verwendet wird, um genauere KI-gestützte Suchergebnisse für OpenAIs SearchGPT-Dienst bereitzustellen.

Crawler-Verhalten

Das Verhalten des OAI-SearchBot kann durch die Häufigkeit von Websuchen und Nutzerabfragen definiert werden. Wie jeder andere Such-Crawler verlässt sich der OAI-SearchBot nicht auf feste Website-Besuche, um Ergebnisse bereitzustellen.

Wie blockiert man den OAI-SearchBot-Crawler?

Fügen Sie den folgenden Befehl in die robots.txt-Datei Ihrer Website ein, um den Zugriff des OAI-SearchBot aktiv zu verhindern:

User-agent: OAI-SearchBot
Disallow: /

PerplexityBot - KI-Such-Crawler

Überblick

Perplexity verwendet den PerplexityBot-Webcrawler, um Suchergebnisse für eine effektivere Antwort seines KI-Assistenten zu indexieren.  Die vom Assistenten bereitgestellten Antworten zeigen normalerweise Inline-Verweise auf eine Vielzahl von Webquellen an.

Typ

Der PerplexityBot ist ein KI-Such-Crawler, der dazu entwickelt wurde, Ergebnisse für KI-gestützte Suchergebnisse des Perplexity-KI-Assistenten zu indexieren.

Crawler-Verhalten

Wie die meisten Such-Crawler hängt der PerplexityBot nicht von einem festen Besuchsplan für die Webquellen ab, die er bewirbt. Die Häufigkeit der Besuche kann je nach mehreren Faktoren variieren, etwa Nutzerabfragen.

Wie blockiert man den PerplexityBot-Such-Crawler?

Sie können den Zugriff von PerplexityBot auf Ihre Website einschränken, indem Sie die folgende Agent-Token-Regel in die robots.txt aufnehmen:

User-agent: PerplexityBot
Disallow: /

YouBot - KI-Such-Crawler

Überblick

Der YouBot ist ein Such-Crawler, der von You.ai eingesetzt wird, um Suchergebnisse für genauere Nutzerantworten durch den You-KI-Assistenten zu indexieren. Der Bot verweist im Allgemeinen über Inline-Quellen auf die referenzierten Websites.

Typ

Der YouBot-Such-Crawler indexiert Webinhalte, um genauere KI-gestützte Suchergebnisse zu generieren.

Crawler-Verhalten

Der YouBot-Crawler hat keinen festen Besuchsplan, und die Häufigkeit der Besuche erfolgt häufig auf Anfrage oder als Reaktion auf eine Nutzerabfrage.

Wie blockiert man den YouBot-Such-Crawler?

Sie müssen den folgenden Befehl in die robots.txt-Datei Ihrer Website einfügen, um den Zugriff des YouBot-Crawlers zu verhindern:

User-agent: YouBot
Disallow: /

Applebot-Extended KI-Daten-Scraper

Überblick

Der Applebot-Extended-KI-Daten-Scraper wird verwendet, um APples Reihe von LLM-Modellen zu trainieren, die die generativen KI-Funktionen des Unternehmens antreiben. Dieser Applebot-Scraper findet breite Anwendung in allen Aspekten von Apple Intelligence, Services und Developer Tools.

Typ

Der Applebot-Extended ist ein KI-Daten-Scraper, der zum Herunterladen von Webinhalten und zum Trainieren von KI oder LLM (Large Language Models) verwendet wird

Crawler-Verhalten

Während unklar bleibt, wie genau KI-Daten-Scraper auswählen, welche Website sie crawlen, ist bekannt, dass Quellen mit höherer Informationsdichte diesen Scraper Applebot anziehen. Es wäre sinnvoll, wenn ein LLM Websites bevorzugt, die regelmäßig Webinformationen auf der Seite hochladen und aktualisieren.

Wie blockiert man den Applebot-Extended-KI-Daten-Scraper?

Fügen Sie den folgenden Befehl in die robots.txt-Datei Ihrer Website ein, um den Applebot-Extended zu blockieren:

User-agent: Applebot-Extended
Disallow: /

Bytespider KI-Daten-Scraper

Überblick

Bytespider wird von ByteDance betrieben und ist ein KI-Daten-Scraper des chinesischen Eigentümers von TikTok. Er wird verwendet, um LLM-Trainingsdaten herunterzuladen und relevante Daten bereitzustellen.

Typ

Bytespider ist ein KI-Daten-Scraper, der verwendet wird, um Large Language Models durch das Herunterladen von Inhalten aus dem Web zu trainieren.

Crawler-Verhalten

Der Bytespider-KI-Daten-Scraper bevorzugt Webquellen mit regelmäßig aktualisierten und faktenreichen Informationen, die als Zufuhr für LLMs verwendet werden.

Wie blockiert man den Bytespider-KI-Daten-Scraper?

Fügen Sie die folgende User-Agent-Token-Regel in die robots.txt Ihrer Website ein:

User-agent: Bytespider
Disallow: /

CCBot KI-Daten-Scraper

Überblick

CCBot gehört Common Crawl, um ein Open-Source-Repository durch Web-Crawl-Daten aufzubauen, auf das jeder zugreifen und das jeder nutzen kann.

Typ

Der CCBot ist ein KI-Daten-Scraper, der dazu dient, Webinhalte herunterzuladen und KI-Modelltraining durchzuführen.

Crawler-Verhalten

Der CCBot crawlt informationsreiche Webquellen, um ein effektiveres LLM-Training zu ermöglichen.

Wie blockiert man den CCBot-KI-Daten-Scraper?

Fügen Sie die folgende Regel in robots.txt ein, um den Zugriff von CCBot einzuschränken:

User-agent: CCBot
Disallow: /

ClaudeBot - KI-Daten-Scraper

Überblick

Der ClaudeBot-KI-Daten-Scraper wird von Anthropic betrieben, um Large Language Models wie Claude mit Trainingsdaten zu versorgen.

Typ

Der ClaudeBot ist ein KI-Daten-Scraper, der dazu dient, Webinhalte herunterzuladen und KI-Modelle zu trainieren.

Crawler-Verhalten

ClaudeBot wählt anhand der Informationsdichte und der Regelmäßigkeit von Informationsaktualisierungen aus, welche Websites gecrawlt werden.

Wie blockiert man den ClaudeBot-KI-Daten-Scraper?

Der Zugriff des ClaudeBot kann durch Aufnahme der folgenden Regel in die robots.txt widerrufen werden:

User-agent: ClaudeBot
Disallow: /

Diffbot - KI-Daten-Scraper

Überblick

Der Diffbot ist darauf ausgelegt, ordnungsgemäß strukturierte Website-Daten für KI-Modelltraining und Echtzeitüberwachung zu strukturieren, zu verstehen, zu aggregieren und sogar zu verkaufen.

Typ

Der Diffbot ist ein KI-Daten-Scraper, der dazu entwickelt wurde, KI-Modelle zu trainieren und Webinformationen herunterzuladen/zu strukturieren.

Crawler-Verhalten

Die Besuchshäufigkeit des Diffbot wird durch die Informationsqualität der Quelle und die Regelmäßigkeit der Aktualisierungen bestimmt.

Wie blockiert man den Diffbot-KI-Daten-Scraper?

Das Crawlen durch den Diffbot kann verhindert werden, indem die folgende Regel in der robots.txt angewendet wird:

User-agent: Diffbot
Disallow: /

FacebookBot - KI-Daten-Scraper

Überblick

Der FacebookBot wird von Meta eingesetzt, um die Effizienz der KI-Spracherkennungstechnologie zu verbessern und KI-Modelle zu trainieren.

Typ

FacebookBot ist ein KI-Daten-Scraper-Crawler, der zur Registrierung von Webinhalten und zum LLM-Training verwendet wird.

Crawler-Verhalten

Der FacebookBot hat keinen festen Besuchsplan, erkennt aber möglicherweise Quellen mit reichhaltigeren und gut aktualisierten Informationen und verlässt sich darauf.

Wie blockiert man den FacebookBot-KI-Daten-Scraper?

Der Zugriff des FacebookBot kann mit der folgenden Regel widerrufen werden:

User-agent: FacebookBot
Disallow: /

Google-Extended - KI-Daten-Scraper

Überblick

Der Google-Extended-Crawler wird verwendet, um Trainingsinformationen für KI-Produkte von Google bereitzustellen, wie den Gemini-Assistenten und die generativen Vertex AI-APIs.

Typ

Der Google-Extended-Crawler ist ein KI-Daten-Scraper, der dazu dient, Informationen aus dem Web herunterzuladen und KI-Training durchzuführen.

Crawler-Verhalten

Der Besuchsplan des Google-Extended-Bots ist ebenfalls flexibel, aber er ist aufgrund von Googles umfangreicher Datenbank zuverlässiger Informations-Webquellen viel zielgerichteter als andere Crawler.

Wie blockiert man den Google-Extended-KI-Daten-Scraper?

Der Google-Extended-Crawler kann mit der folgenden Regel auf die Blacklist gesetzt werden:

User-agent: Google-Extended
Disallow: /

GPTBot - KI-Daten-Scraper

Überblick

Der GPTBot wird von OpenAI entwickelt, um Webquellen zu crawlen und Trainingsdaten für die Large Language Models des Unternehmens sowie Produkte wie ChatGPT herunterzuladen.

Typ

Der GPTBot ist ein KI-Daten-Scraper, der darauf ausgelegt ist, eine breite Palette von Daten aus dem Web herunterzuladen und bereitzustellen.

Crawler-Verhalten

Wie andere KI-Daten-Scraper bevorzugt der GPTBot informationsreiche Quellen und Websites, um relevantere Informationen für KI-Trainingsverfahren bereitzustellen.

Wie blockiert man den GPTBot-KI-Daten-Scraper?

Sie können den GPTBot-KI-Daten-Scraper mit der folgenden robots.txt-Regel blockieren:

User-agent: GPTBot
Disallow: /

Meta-ExternalAgent - KI-Datenscraper

Überblick

Meta-ExternalAgent ist eine von Meta entwickelte Crawler-Technologie, um die KI-Technologien des Unternehmens durch direktes Herunterladen und Indexieren von Webinhalten zu verbessern.

Typ

Der Meta-ExternalAgent verwendet eine KI-Datenscraper-Technologie, um Webinhalte herunterzuladen und zu indexieren, die für KI-Training bestimmt sind.

Crawler-Verhalten

Ähnlich wie andere vom Unternehmen entwickelte Crawler verwendet der Meta-ExternalAgent eine flexible Crawling-Strategie, um informationsreiche Webquellen gezielt zu identifizieren.

Wie blockiert man den KI-Datenscraper Meta-ExternalAgent?

Dieser von Meta entwickelte Crawler kann durch die folgende robots.txt-Regel eingeschränkt werden:

User-agent: Meta-ExternalAgent
Disallow: /

omgili - KI-Datenscraper

Überblick

Der omgili-Crawler gehört Webz.io und wurde entwickelt, um eine aufgebaute Bibliothek von Web-Crawl-Daten zu pflegen, die anschließend an andere Unternehmen für KI-Trainingszwecke verkauft wird.

Typ

Der omgili-Crawler ist ein KI-Datenscraper, der KI-Trainingsinformationen aus dem Web herunterlädt.

Crawler-Verhalten

Da die gecrawlten Informationen anschließend von Webz.io verkauft werden, verfolgt der omgili-Crawler glaubwürdige und autorisierte Websites mit relevanten Informationen.

Wie blockiert man den KI-Datenscraper omgili?

Verwenden Sie die folgende Regel, um den Zugriff des omgili-Crawlers auf Ihre Website zu verhindern:

User-agent: omgili
Disallow: /

Anthropic-AI - Undokumentierter KI-Agent 

Überblick

Der unbestätigte Anthropic-AI-Agent wird tendenziell dazu verwendet, relevante Trainingsdaten herunterzuladen und sie KI-gestützten Produkten des Unternehmens, wie Claude, bereitzustellen.

Typ

Der genaue Typ des Anthropic-AI-Agenten ist aufgrund fehlender Offenlegung durch das Unternehmen noch unbekannt.

Crawler-Verhalten

Aufgrund fehlender relevanter Informationen über den Anthropic-AI-Agenten kann der Crawler für mehrere Zwecke verwendet werden, aber es ist weiterhin schwer zu sagen.

Wie blockiert man den Anthropic-AI-Agenten?

Der Anthropic-AI-Agent kann mit der folgenden Regel blockiert werden:

User-agent: anthropic-ai
Disallow: /

Claude-Web - Undokumentierter KI-Agent

Überblick

Claude-Web ist ein weiterer von Anthropic betriebener KI-Agent, ohne offizielle Dokumentation zu seinen Verwendungszwecken. Es wird erwartet, dass Claude-Web relevante LLM-Trainingsdaten für Anthropic bereitstellt.

Typ

Claude-Web wird entweder ein KI-Datenscraper oder ein standardmäßiger Such-Crawler für Anthropics Claude 3.5 Large Language Model sein.

Crawler-Verhalten

Anthropic hält Informationen über die Funktionen von Claude-Web zurück, aber das Verhalten des Crawlers wird dem Typ des Agenten entsprechen, sobald dieser vollständig offengelegt ist.

Wie blockiert man den Claude-Web-Agenten?

Die folgende Regel wird verwendet, um den Crawling-Zugriff des Claude-Web-Agenten auf Ihre Website auszusetzen:

User-agent: Claude-Web
Disallow: /

Cohere-AI Agent - Undokumentiert

Überblick

Cohere-AI ist ein undokumentierter Agent, der von Cohere entwickelt wurde, um seine generativen KI-Tools mit relevanten Studieninformationen zu versorgen. Er ruft Informationen aus dem Web ab, wenn Benutzer über Cohere AI dazu auffordern.

Typ

Da für diesen Cohere-AI-Agenten keine Dokumentation verfügbar ist, ist der Typ des Crawlers vielen Website-Betreibern noch unbekannt.

Crawler-Verhalten

Es wird vermutet, dass der Cohere-AI-Agent durch verschiedene Verhaltensmuster mehrfach einsetzbar sein wird, um Cohere-Benutzer mit relevanten Informationen und eingebetteten Quellenlinks zu versorgen.

Wie blockiert man den Cohere-AI-Agenten?

Sie können den Zugriff des Cohere-AI Agenten durch die folgende Regel aussetzen:

User-agent: cohere-ai
Disallow: /

Ai2Bot - KI-Such-Crawler

Überblick

Die Hauptfunktion des Ai2Bot besteht darin, „bestimmte Domains“ zu crawlen und Webinhalte zum Training von Sprachmodellen zu erfassen.

Typ

Wie von Ai2 berichtet, ist der Ai2Bot ein KI-Such-Crawler, da er Inhalte, Bilder und Videos auf der gecrawlten Website analysiert.

Crawler-Verhalten

Der Ai2Bot crawlt laut Angaben des Unternehmens nur bestimmte Websites, kann seinen Bereich registrierter Domains jedoch von Tag zu Tag erweitern.

Wie blockiert man den KI-Such-Crawler Ai2Bot?

Fügen Sie die folgende Regel in die robots.txt Ihrer Website ein, um den Ai2Bot auszusetzen:

User-agent: Ai2Bot

Disallow: /

Ai2Bot-Dolma - KI-Such-Crawler

Überblick

Das Unternehmen Ai2 besitzt den Ai2Bot-Dolma-Bot und respektiert robots.txt-Regeln. Die erfassten Inhalte werden verwendet, um eine Vielzahl von Sprachmodellen des Unternehmens zu trainieren.

Typ

Obwohl dem Bot kein spezifischer Typ zugewiesen ist, glauben wir, dass er das Verhalten eines standardmäßigen KI-Such-Crawlers aufweist.

Crawler-Verhalten

Der Ai2Bot-Dolma crawlt nur „bestimmte Domains“, um die für das Training von Sprachmodellen erforderlichen Webinhalte zu finden.

Wie blockiert man den KI-Such-Crawler Ai2Bot-Dolma?

Verwenden Sie die folgende robots.txt-Zeile, um den Zugriff von Ai2Bot-Dolma einzuschränken:

User-agent: Ai2Bot-Dolma

Disallow: /

FriendlyCrawler - Unbekannt

Überblick

Obwohl über diesen Crawler nicht viel bekannt ist, respektiert er die robots.txt und wird verwendet, um Daten für Experimente im Bereich maschinelles Lernen zu erfassen.

Typ

Der Typ des Bots ist noch unbekannt, aber wir glauben, dass er basierend auf seinem Webverhalten entweder ein generischer Crawler oder ein KI-Datenscraper ist.

Crawler-Verhalten

Es ist unklar, wer der Betreiber dieses Bots ist, aber die Daten werden für das Training großer Sprachmodelle, maschinelles Lernen und die Erstellung von Datensätzen verwendet.

Wie blockiert man FriendlyCrawler?

So setzen Sie den Zugriff von FriendlyCrawler auf Ihre Website aus:

User-agent: FriendlyCrawler

Disallow: /

GoogleOther - Suchmaschinen-Crawler

Überblick

Der GoogleOther-Crawler ist ein Bot von Google, aber es ist weiterhin unklar, ob er KI-bezogen oder überhaupt künstlich intelligent ist. Derzeit hat nur ein einzelner Prozentsatz der leistungsstärksten Websites den GoogleOther-Bot blockiert.

Typ

Der GoogleOther-Bot ist ein Suchmaschinen-Crawler, der Webinhalte für genauere Suchmaschinenergebnisse oder die Google-SERP indexiert.

Crawler-Verhalten

Wie jeder andere Suchmaschinen-Crawler folgt der GoogleOther-Bot keinem bestimmten Besuchsplan, und die Besuchshäufigkeit variiert je nach Website-Aktivität und Inhaltsqualität.

Wie blockiert man den Suchmaschinen-Crawler GoogleOther?

Fügen Sie die folgende Regel zur robots.txt-Datei Ihrer Website hinzu:

User-agent: GoogleOther

Disallow: /

GoogleOther-Image - Generischer Crawler

Überblick

GoogleOther-Image ist die Version von GoogleOther, die dafür vorgesehen ist, Bilder im Web zu crawlen, zu analysieren und zu indexieren

Typ

Wie GoogleOther ist der GoogleOther-Image-Bot ein generischer Crawler, der von verschiedenen Produktteams verwendet wird, um Website-Inhalte öffentlich zugänglich zu machen. 

Crawler-Verhalten

Dieser Crawler hält sich nicht an einen festen Besuchsplan, sondern analysiert die zuverlässigsten Bildquellen im Web und indexiert bestimmte Informationen.

Wie blockiert man den generischen Crawler GoogleOther-Image?

Sie können diesen Google-Crawler mit dem folgenden Befehl blockieren:

User-agent: GoogleOther-Image

Disallow: /

GoogleOther-Video - Generischer Crawler

Überblick

Ebenso wie der standardmäßige GoogleOther-Crawler und der bilderregistrierende Bot crawlt und analysiert GoogleOther-Video Videoinhalte im Web.

Typ

Dieser Bot ist ein generischer Crawler, der einer Vielzahl von Produktteams dient und Unternehmen dabei hilft, mit den auf ihrer Website hochgeladenen Videos eine bessere Reichweite zu erzielen.

Crawler-Verhalten

Wie die anderen Versionen von GoogleOther hat auch dieser Crawler einen flexiblen Besuchsplan, der durch die Aktivität und Qualität der Website-Videoinhalte definiert wird.

Wie blockiert man den generischen Crawler GoogleOther-Video?

Dieser Google-Bot kann mit der folgenden robots.txt-Zeile blockiert werden:

User-agent: GoogleOther-Video

Disallow: /

ICC-Crawler - Unbekannt

Überblick

Der ICC-Crawler ist ein Agent, der vom Ersteller noch nicht kategorisiert wurde. Es ist weiterhin unbekannt, ob dieser Crawler künstlich intelligent ist oder etwas mit KI zu tun hat.

Typ

Wie seine Quelle ist auch der Typ des ICC-Crawler-Bots unbekannt.

Crawler-Verhalten

Das Verhalten des Bots variiert je nach Typ des Crawlers, insbesondere danach, ob es sich um einen Datenscraper, Suchmaschinen-Crawler oder Archivierer handelt.

Wie blockiert man ICC-Crawler?

Der ICC-Crawler kann mit dem folgenden Befehl blockiert werden:

User-agent: ICC-Crawler

Disallow: /

ImagesiftBot - Informationssammler

Überblick

Der Imagesift-Bot gehört Hive, aber derzeit ist unbekannt, ob der Crawler KI-bezogen oder künstlich intelligent ist. 

Typ

Der ImagesiftBot ist ein Informationssammler, der im Web nach nützlichen Erkenntnissen sucht und die Ergebnisse in einer Datenbank registriert oder indexiert.

Crawler-Verhalten

Das Verhalten von Informationssammler-Crawlern hängt von den Zielen ihrer Kunden ab. Beispielsweise könnte ein Kunde daran interessiert sein, seine Marke bekannter zu machen, was dazu führt, dass der Bot soziale Medien häufiger crawlt als andere, nicht verwandte Websites.

Wie blockiert man den Informationssammler ImagesiftBot?

Dieser Crawler kann auf folgende Weise blockiert werden:

User-agent: ImagesiftBot

Disallow: /

PetalBot - Suchmaschinen-Crawler

Überblick

Der PetalBot von Huawei ist derzeit auf 2% der beliebten indexierten Websites ausgesetzt. Es ist weiterhin unbekannt, ob dieser Crawler künstlich intelligent ist oder in irgendeiner Weise mit KI in Zusammenhang steht.

Typ

PetalBot ist ein Suchmaschinen-Crawler, der Webinhalte indexiert und Daten aus Suchmaschinenergebnissen erfasst.

Crawler-Verhalten

Das Verhalten von PetalBot wird durch die Qualität der Inhalte und die Aktivität der registrierten Websites und Domains bestimmt. Suchmaschinen-Crawler neigen dazu, Websites mit höherer Inhaltsqualität und häufiger Aktivität zu crawlen.

Wie blockiert man den Suchmaschinen-Crawler PetalBot?

Der Zugriff von PetalBot kann auf folgende Weise ausgesetzt werden:

User-agent: PetalBot

Disallow: /

Scrapy - KI-Scraper

Überblick

Scrapy gehört Zyte und ist derzeit auf mehr als 3% der registrierten Domains im Web blockiert.

Typ

Scrapy ist ein KI-Scraper; diese Crawler sind dafür berüchtigt, die robots.txt einer Website nicht zu respektieren. Er wird schließlich die erforderlichen Informationen analysieren, selbst wenn dies bedeutet, auf eine Website zuzugreifen, die eine robots.txt-Disallow-Regel für Scrapy hat.

Crawler-Verhalten

Den Besuchsplan eines KI-Scrapers vorherzusagen, ist nahezu unmöglich. Diese Crawler werden mit unterschiedlichen Zwecken eingesetzt, und es ist schwer zu sagen, welche Websites sie crawlen würden und wie oft.

Wie blockiert man den KI-Scraper Scrapy?

Obwohl robots.txt gegen KI-Scraper nicht viel ausrichtet, können Sie Scrapy so blockieren:

User-agent: Scrapy

Disallow: /

Timpibot - KI-Datenscraper

Überblick

Timpibot gehört Timpi und ist derzeit auf 3% der beliebten indexierten Websites blockiert. Der einzige Zweck von Timpibot besteht darin, Webdaten für das Training von KI-Modellen zu erfassen.

Typ

Im Gegensatz zu einem standardmäßigen Scraper ist Timpibot ein KI-Datenscraper, der sich ausschließlich auf künstliche Intelligenz stützt, um Webinhalte zu crawlen und zu indexieren. 

Crawler-Verhalten

Ähnlich wie bei standardmäßigen Scrapern ist auch der Besuchsplan von KI-Datenscrapern unklar. Diese Crawler neigen dazu, Websites mit höherer Informationsdichte und höherem Inhaltswert auszuwählen, abhängig von den für das Training des KI-Modells erforderlichen Informationen.

Wie blockiert man den KI-Datenscraper Timpibot?

Der Zugriff von Timpibot kann mit der folgenden robots.txt-Regel ausgesetzt werden:

User-agent: Timpibot

Disallow: /

VelenPublicWebCrawler - Informationssammler

Überblick

Der VelenPublicCrawler wird von Hunter betrieben und wurde von 0% der am besten indexierten Websites im Web blockiert.

Typ

Der Crawler ist ein standardmäßiger Informationssammler, der dazu bestimmt ist, nützliche Erkenntnisse aus Webergebnissen zu sammeln.

Crawler-Verhalten

Informationssammler neigen dazu, die Ziele ihrer Kunden zu erfüllen, und haben in den meisten Fällen spezifische Aufgaben in Bezug darauf, welche Informationen gesammelt werden sollen.

Wie blockiert man den Informationssammler VelenPublicWebCrawler?

VelenPublicWebCrawler kann mit dem folgenden Befehl blockiert werden:

User-agent: VelenPublicWebCrawler

Disallow: /

Webzio-Extended - KI-Datenscraper

Überblick

Webzio-Extended ist ein weiterer Crawler von Webz.io, der verwendet wird, um das Repository der erfassten Crawl-Daten zu pflegen. Die Informationen werden anschließend an andere Unternehmen verkauft und typischerweise für das Training von KI-Modellen verwendet.

Typ

Webzio-Extended ist ein KI-Datenscraper, der Webinhalte zum Zweck des Trainings von KI-Modellen herunterlädt.

Crawler-Verhalten

KI-Datenscraper wie Webzio-Extended halten sich nicht an einen festen Besuchsplan für Websites. Datenreichere Quellen ziehen die Scraper tendenziell stärker an und führen dazu, dass sie häufiger crawlen.

Wie blockiert man den KI-Datenscraper Webzio-Extended?

Der Zugriff von Webzio-Extended auf Ihre Website kann mit dem folgenden Befehl ausgesetzt werden:

User-agent: Webzio-Extended

Disallow: /

Facebookexternalhit - Fetcher

Überblick

Der facebookexternalhit-Crawler ist ein von Meta eingesetzter Bot, der auf mehr als 6% der registrierten beliebten Websites blockiert ist. Es ist weiterhin unklar, ob der Bot künstlich intelligent oder mit KI verbunden ist.

Typ

Facebookexternalhit ist ein Fetcher, der Webergebnisse im Auftrag einer Anwendung crawlt. 

Crawler-Verhalten

Fetcher werden typischerweise eingesetzt, um Websites auf Anfrage zu besuchen. Sie werden verwendet, um dem anfragenden Benutzer die Metadaten eines bestimmten Links, beispielsweise einen Titel oder ein Miniaturbild, zu präsentieren.

Wie blockiert man den Fetcher Facebookexternalhit?

Dieser Meta-Crawler kann mit der folgenden robots.txt-Regel blockiert werden:

User-agent: facebookexternalhit 

Disallow: /

Img2dataset - Unbekannt

Überblick

Es ist bekannt, dass img2dataset der einzige Webcrawler des Unternehmens ist, der dazu dient, eine große Anzahl von Bildern herunterzuladen und sie in Datensätze umzuwandeln, um große Sprachmodelle zu trainieren.

Typ

Der Typ von img2dataset ist noch unbekannt, aber wir glauben, dass es sich basierend auf seinem Verhalten und Besuchsplan um einen KI-Suchmaschinen-Crawler handelt.

Crawler-Verhalten

Img2dataset neigt dazu, Websites mit einer reichhaltigeren Bilddatenbank und einer Vielzahl von Themen zu crawlen.

Wie blockiert man den img2dataset-Crawler?

Dieser Crawler kann mit der folgenden Regel ausgesetzt werden:

User-agent: img2dataset

Disallow: /

Wie man KI-Bots blockiert (erweiterte Version):

Es gibt mehrere einzigartige Möglichkeiten, unerwünschten Bot-Traffic auf Ihre Website einzuschränken:

Die gängigste Methode besteht darin, den folgenden Text zu Ihrer Robots.txt-Datei hinzuzufügen:

User-agent: name-of-bot
Disallow: /

Beispiel:

User-agent: GPTBot
Disallow: /

Robots.txt verwenden

Das Erstellen einer leicht zugänglichen robots.txt-Datei umfasst mehrere einfache Schritte:

1. Erstellen Sie eine Datei mit dem Namen "robots.txt"

Während dieses Schritts müssen Sie auf das Stammverzeichnis der Website zugreifen. Dort muss die Datei gespeichert werden, um den Crawler-Zugriff auf Ihre Website effektiv einzuschränken. Beachten Sie, dass Ihre Website nur eine einzige robots.txt-Datei haben kann.

2. Schreiben Sie die robots.txt-Regeln

Sie können jeden Editor verwenden, um die Datei zu erstellen, beispielsweise Windows's NotePad, TextEdit und vi. Stellen Sie sicher, dass die Datei in UTF-8-Codierung gespeichert wird, und fahren Sie mit dem Anwenden der Regeln fort.  Googles Crawler reagieren auf die folgenden Regeln: "user-agent," "disallow," "allow" und "sitemap." Jede Regel hat ihren eigenen Zweck im Hinblick auf die Verwaltung von Crawlern.

3. Laden Sie die robots.txt-Datei hoch

Der nächste Schritt besteht darin, die neu erstellte robots.txt-Datei öffentlich zugänglich zu machen, indem Sie ein privates Browserfenster in Ihrem Browser öffnen und zum Speicherort der Datei navigieren. Sie können prüfen, ob die robots.txt öffentlich zugänglich ist, indem Sie die Seitendomain eingeben, zum Beispiel "https://(site name)", und am Ende "/robots.txt" hinzufügen.

Beispiel für Robots.txt zum Blockieren von KI-Datenscraper-Bots

Wie wir bereits zuvor festgestellt haben, wird das Einfügen einer Einschränkungsregel für einen bestimmten Bot in die robots.txt Ihrer Website die Seite weder deindexieren noch aus der SERP entfernen. Beim Versuch, auf Ihre Seite zuzugreifen, erhält der Bot automatisch eine Fehlermeldung und wird weggeleitet, ohne Zugriff auf den Inhalt der Seite zu erhalten.

Die Seite bleibt weiterhin für alle Benutzer und KI-Bots auffindbar, aber Bots mit dem in der robots.txt-Datei aufgeführten Namensschild haben keinen Zugriff.

Diese Beispieldatei blockiert:

  • NEIN - KI-Suchassistent
  • NEIN - KI-Such-Crawler
  • ALLE - KI-Datenscraper

Das Blockieren der Datenscraper, aber nicht des Crawlers und Suchassistenten, zielt darauf ab, zu verhindern, dass die Daten einer Website für Training verwendet werden, während KI-Suche/Assistenten weiterhin Traffic an die Website senden dürfen.

Firewall

Es gibt mehrere Möglichkeiten, den Zugriff von KI-Bots mithilfe einer Firewall auszusetzen. Lassen Sie uns jede der einzigartigen Möglichkeiten betrachten:

  • IP-Blockierung einrichten

Wenn Sie die von Bots verwendeten Adressen kennen, um auf Ihre Domain zuzugreifen, können Sie die IPs auf eine Blacklist setzen über die Firewall Ihrer Website. Es ist eine allgemein bekannte Praxis, unbeabsichtigten Traffic auf Ihrer Website zu reduzieren und Ressourcen zu schonen. Bots können jedoch mehrere IPs durchwechseln.

  • CAPTCHA-Software verwenden

Die vielleicht am weitesten bevorzugte Methode, um Bot-Traffic auf Ihrer Website zu 100% auszusetzen, ist die Implementierung einer CAPTCHA-Software, die eine menschliche Validierung erfordert. Jeder neue Besucher wird aufgefordert, eine einfache Aufgabe zu lösen, etwa Puzzleteile zuzuordnen oder Objekte auf einer Reihe von Bildern zu identifizieren, um Zugriff zu erhalten. Firewalls können so geändert werden, dass sie CAPTCHAs auslösen.

Verwenden Sie ein CDN (Content Delivery Network)

CDN-Dienste wie Cloudflare oder Amazon CloudFront können in die Firewall Ihrer Website integriert werden, um den Traffic von KI-Bots zu reduzieren. Ähnlich wie bei CAPTCHA-Herausforderungen dürfen nur gültige IP-Adressen, die echten Benutzern gehören, auf Ihre Website zugreifen.

Die aufkommenden Herausforderungen durch Änderungen von Bot-Namen

Da eine große Zahl von Webmastern auf robots.txt setzt, um unerwünschten Bot-Traffic auf ihrer Website auszusetzen, ist jede Regel innerhalb der Datei auf einen bestimmten Bot ausgerichtet. Nachdem Unternehmen begannen, den Traffic-Rückgang ihrer Bots zu spüren, entschieden sich viele, ihren Bots einen neuen Namen zuzuweisen , der in der robots.txt-Datei vieler Websites nicht enthalten war.

Ein aktuelles Beispiel ist, wie Anthropic seine KI-Datenscraper namens „ANTHROPIC-AI“ und „CLAUDE-WEB“ zu einem neuen Bot namens „CLAUDEBOT“ zusammengeführt hat. Es dauerte sicherlich eine Weile, bis Websites davon erfuhren, und in der Zwischenzeit hatte der neue Bot beispiellosen Zugriff auf alle Websites im Internet.

Rückgang der KI-Daten-Allmende und Folgen

Mit der zunehmenden und weit verbreiteten Nutzung öffentlicher Informationen durch KI-Unternehmen, um große Sprachmodelle zu trainieren, wird die Ineffektivität von Webprotokollen offensichtlich. Als Reaktion auf das umfangreiche Datenscraping, das von Webdaten-KI-Unternehmen wie C4, Dolma, und Refined Web durchgeführt wurde, gab es einen Rückgang von über 28%-45% beim Crawler-Zugriff.

Decline of AI Data Commons and Consequences
https://www.dataprovenance.org/Consent_in_Crisis.pdf

Ganze 45% von C4 wurden nun eingeschränkt, wobei viele der Einschränkungen vielfältig sind und die Gesetze allgemeiner KI-Infrastrukturen über robots.txt skalieren. Die Nachfrage nach Datenzustimmung wird nicht nur für kommerzielle KI, sondern für alle Arten akademischer Forschung und nichtkommerzieller KI-Nutzung immer anspruchsvoller.

Fazit

Der Zusammenprall von KI-Unternehmen, die versuchen, so viele Daten wie möglich zu scrapen, um LLMs zu trainieren, und Publishern, die daran arbeiten, ihre Daten/Bandbreite vor Missbrauch zu schützen, hat zu einem interessanten Konflikt geführt, der sich in einer wenig bekannten Datei auf allen Websites abspielt, der robots.txt. 

Dieser Leitfaden zielt darauf ab, nachzuverfolgen, wie sich dieses Drama entwickelt, wobei unser Live-Dashboard zeigt, welche der top 1000 Websites KI-Bots blockieren, wie man sie blockiert und welche Sie blockieren sollten. 

Wenn wir Bots übersehen haben, die Sie gerne aufgenommen hätten, melden Sie sich bitte.

KI-Content-Detector & Plagiatsprüfer für Marketer und Autoren

Nutzen Sie unsere führenden Tools, um sicherzustellen, dass Sie mit Integrität auf „Veröffentlichen“ klicken können!