Quaryan
Kostenlos starten Dashboard

Sprache

Kostenloses Tool · Ohne Konto

Robots.txt KI-Crawler-Check

Gib deine Webadresse ein und sieh Crawler für Crawler, welche KI-Assistenten deine robots.txt deine Website lesen lässt — ChatGPT, Claude, Perplexity, Gemini, Apple Intelligence und mehr — und welche sie aussperrt. Kostenlos, sofort, ohne Konto.

Kostenlos · Ohne Konto · Ein paar Sekunden

So funktioniert es

So funktioniert der KI-Crawler-Check

01

Er liest deine robots.txt wie ein Crawler

Quaryan fragt deine robots.txt so ab, wie es ein Crawler tut: Weiterleitungen folgend, eine fehlende Datei als Erlaubnis für alles und einen Serverfehler als „Zutritt verboten“ gewertet.

02

Er ordnet jedem Crawler seine Regeln zu

Für jeden der achtzehn Crawler sucht er die Gruppe, die ihn nennt – oder, wenn keine das tut, die für alle Crawler (*) – und wendet die genaueste Regel auf deine Startseite an, genau wie es der robots.txt-Standard RFC 9309 vorschreibt.

03

Er zeigt dir die entscheidende Zeile

Erlaubt, erlaubt mit Ausnahmen oder gesperrt – mit der Zeile deiner robots.txt, die das entscheidet. So weißt du genau, was du ändern musst, und ob du es so gewollt hast.

Die Crawler

Die KI-Crawler, die wir prüfen, und was jeder tut

Drei Arten von Crawlern lesen deine Website für KI, und es lohnt sich, sie unterschiedlich zu behandeln. Such-Crawler indexieren Seiten für die Antworten, die Assistenten heute geben, und verlinken zurück. Abrufer lesen eine Seite, wenn jemand den Assistenten danach fragt. Trainings-Crawler sammeln Seiten, um künftige Modelle zu trainieren. Wer die ersten beiden sperrt, fehlt in Antworten; wer die dritten sperrt, hält seine Seiten aus dem Training heraus. Dazu kommen zwei Suchmaschinen – Google und Bing –, aus deren Index KI-Antworten schöpfen.

User-agentUnternehmenWas er tut
KI-Suche und Antworten
OAI-SearchBot OpenAI Indexiert Seiten, damit die ChatGPT-Suche sie zeigen und verlinken kann. Nicht fürs Training.
Claude-SearchBot Anthropic Indexiert Seiten, um die Suchergebnisse in Claudes Antworten zu verbessern.
PerplexityBot Perplexity Indexiert Seiten für die Antworten von Perplexity, die ihre Quellen nennen und verlinken.
DuckAssistBot DuckDuckGo Ruft Seiten ab, um die KI-gestützten Antworten von DuckDuckGo zu schreiben.
Abruf, wenn jemand nach einer Seite fragt
ChatGPT-User OpenAI Ruft eine Seite ab, wenn jemand ChatGPT danach fragt oder einen Link teilt.
Claude-User Anthropic Ruft eine Seite ab, wenn jemand Claude danach fragt.
Perplexity-User Perplexity Ruft eine Seite ab, wenn jemand Perplexity danach fragt.
MistralAI-User Mistral AI Ruft eine Seite ab, wenn jemand in Le Chat von Mistral danach fragt.
KI-Training
GPTBot OpenAI Sammelt Seiten, um die Modelle von OpenAI zu trainieren.
ClaudeBot Anthropic Sammelt Seiten, um Anthropics Claude-Modelle zu trainieren.
Google-Extended Google Kein Crawler, sondern ein Token: entscheidet, ob von Google gecrawlte Seiten für die Gemini-Modelle genutzt werden dürfen. Ohne Einfluss auf die Google-Suche.
Applebot-Extended Apple Ein Token: entscheidet, ob von Applebot gecrawlte Seiten Apples KI-Modelle trainieren dürfen. Ohne Einfluss auf Siri und Spotlight.
Meta-ExternalAgent Meta Sammelt Seiten für Metas KI, auch zum Training ihrer Modelle.
Amazonbot Amazon Amazons Crawler, genutzt, um die eigenen Dienste zu verbessern, auch zum Training von KI-Modellen.
CCBot Common Crawl Der Crawler von Common Crawl. Dessen freies Webarchiv ist eine verbreitete Quelle für KI-Trainingsdaten.
Bytespider ByteDance Der Crawler von ByteDance, genutzt zum Training seiner KI-Modelle.
Suchmaschinen hinter KI-Antworten
Googlebot Google Die Google-Suche, einschließlich KI-Übersichten und KI-Modus.
Bingbot Microsoft Die Bing-Suche, aus der auch die Antworten von Microsoft Copilot schöpfen.

Erlauben oder sperren

So erlaubst oder sperrst du KI-Crawler in der robots.txt

Die robots.txt ist eine einfache Textdatei im Stammverzeichnis deiner Website. Jede Gruppe beginnt mit den Crawlern, für die sie gilt (User-agent), und nennt, was sie nicht lesen dürfen (Disallow) oder doch (Allow). Drei häufige Varianten:

Alle Crawler hereinlassen

Die Voreinstellung – und dasselbe, als gäbe es gar keine robots.txt.

User-agent: *
Allow: /

KI-Training aussperren, in KI-Antworten bleiben

Sperrt die Crawler aus, die Seiten fürs Training sammeln, und lässt die herein, die dich in Antworten bringen und Besucher schicken.

User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: Meta-ExternalAgent
User-agent: CCBot
User-agent: Bytespider
Disallow: /

User-agent: *
Allow: /

Einen einzelnen Crawler aussperren

Eine Gruppe nennt ihn; alles andere bleibt, wie es ist.

User-agent: GPTBot
Disallow: /
robots.txt prüfen

Kostenlos · Ohne Konto · Ein paar Sekunden

FAQ

Fragen zu KI-Crawlern und robots.txt

Wie prüfe ich, ob meine robots.txt KI-Crawler sperrt?

Gib deine Webadresse oben auf dieser Seite in den Check ein. Er liest deine robots.txt so, wie es ein Crawler tut, und zeigt für GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended und dreizehn weitere, ob jeder deine Website lesen darf – und welche Zeile das entscheidet.

Was ist der Unterschied zwischen GPTBot, OAI-SearchBot und ChatGPT-User?

Es sind drei Crawler von OpenAI mit drei Aufgaben. GPTBot sammelt Seiten, um die Modelle von OpenAI zu trainieren. OAI-SearchBot indexiert Seiten, damit die ChatGPT-Suche sie zeigen und verlinken kann. ChatGPT-User ruft eine Seite ab, wenn jemand ChatGPT danach fragt. Wer GPTBot sperrt, hält seine Seiten aus dem Training heraus, ohne aus den Antworten von ChatGPT zu fallen; wer OAI-SearchBot sperrt, erreicht das Gegenteil.

Sollte ich KI-Crawler sperren?

Sperre die, für die du einen Grund hast, und keine weiteren. Trainings-Crawler wie GPTBot, ClaudeBot oder Google-Extended auszusperren hält deine Seiten aus künftigen Modellen heraus. Such-Crawler wie OAI-SearchBot, Claude-SearchBot oder PerplexityBot auszusperren hält dich aus den Antworten heraus, die Leute heute lesen – und das kostet die meisten Unternehmen Kunden.

Entfernt das Sperren von Google-Extended meine Website aus der Google-Suche oder den KI-Übersichten?

Nein. Google-Extended ist kein Crawler, sondern ein robots.txt-Token: Es entscheidet, ob von Google gecrawlte Seiten für die Gemini-Modelle genutzt werden dürfen. Die Google-Suche, einschließlich der KI-Übersichten, folgt den Regeln für Googlebot – das Sperren von Google-Extended ändert also weder dein Ranking noch, ob du dort erscheinst.

Hält die robots.txt KI-Unternehmen davon ab, meine Inhalte zu nutzen?

Die robots.txt ist eine Bitte, kein Schloss. Die großen KI-Unternehmen sagen, dass ihre Crawler sich daran halten, aber sie wirkt nur auf das, was ab jetzt gecrawlt wird – bereits gesammelte Seiten bleiben gesammelt –, und Abrufer, die im Auftrag einer Person handeln, folgen womöglich nicht denselben Regeln. Was privat bleiben soll, gehört hinter ein Login.

Was passiert, wenn meine robots.txt einen Fehler zurückgibt?

Antwortet die robots.txt mit einem Serverfehler (einem 5xx-Status), müssen Crawler deine ganze Website als gesperrt behandeln, bis sie wieder antwortet. Fehlt sie (ein 404), dürfen sie alles lesen. Der Check zeigt dir, welcher der beiden Fälle auf deine Website zutrifft.

Was ist eine llms.txt?

Die llms.txt ist eine vorgeschlagene Datei im Stammverzeichnis einer Website, die KI-Assistenten eine kurze Zusammenfassung der Website in einfachem Text gibt und auf ihre nützlichsten Seiten verlinkt. Sie ist kein Standard, und kein Assistent muss sie lesen; der Check zeigt, ob deine Website eine hat. Erstelle eine llms.txt für deine Website

Ist der KI-Crawler-Check kostenlos?

Ja. Er ist kostenlos, braucht kein Konto und dauert ein paar Sekunden. Jeder Besucher kann dreißig Prüfungen pro Stunde machen, und ein Ergebnis wird zehn Minuten lang aufbewahrt, damit eine Website nicht zweimal hintereinander abgefragt wird.

Weiter

Crawler können dich lesen. Nennt ChatGPT dich auch?

Lesbar zu sein ist der erste Schritt. Der kostenlose ChatGPT-Sichtbarkeits-Check stellt ChatGPT die Fragen deiner Kunden und zeigt, ob es dich nennt – und wen es stattdessen nennt.

Kostenlos · ohne Karte

Kostenlos starten