KI-Crawler im Überblick:
GPTBot, ClaudeBot & Co. steuern

Jeder große KI-Anbieter betreibt eigene Crawler — und du entscheidest per robots.txt, welche davon deine Inhalte nutzen dürfen. Diese Übersicht zeigt alle wichtigen Bots, ihre Aufgaben laut Anbieter-Dokumentation und fertige robots.txt-Beispiele zum Zulassen oder Blockieren.

Die wichtigsten KI-Crawler auf einen Blick

User-AgentBetreiberAufgabe laut Anbieter-DokumentationRelevanz für Zitate
GPTBotOpenAISammelt Inhalte, die auch für das Modell-Training verwendet werden könnenHoch
OAI-SearchBotOpenAIIndexierung für die ChatGPT-Suche mit Quellen-VerlinkungSehr hoch
ChatGPT-UserOpenAIRuft Seiten ab, wenn ein ChatGPT-Nutzer sie konkret anfragtHoch
ClaudeBotAnthropicCrawlt Inhalte für ClaudeHoch
PerplexityBotPerplexityIndexierung für die Perplexity-Antwortsuche mit QuellenangabeSehr hoch
Google-ExtendedGoogleSteuerungs-Token: darf Google gecrawlte Inhalte für Gemini/KI nutzen? (kein eigener Crawler)Hoch
CCBotCommon CrawlOffenes Webarchiv — Basis vieler KI-TrainingsdatensätzeGering (Training)
BytespiderByteDanceCrawling, u. a. für KI-TrainingGering (Training)
Applebot-ExtendedAppleSteuerungs-Token: dürfen Applebot-Daten für Apple-KI-Training genutzt werden?Gering (Training)
Meta-ExternalAgentMetaCrawling für Meta-KI, u. a. TrainingGering (Training)
Merkregel: Such-Crawler (OAI-SearchBot, PerplexityBot & Co.) bringen Zitate und Klicks. Reine Trainings-Crawler (CCBot, Bytespider …) bringen keine direkte Sichtbarkeit — sie zu blockieren ist eine legitime Abwägung, kein GEO-Fehler.

robots.txt: KI-Sichtbarkeit maximieren

Wenn deine robots.txt keine Regeln für diese Bots enthält, gelten die allgemeinen User-agent: *-Regeln — bei einem simplen Allow: / dürfen also alle rein. Wer es explizit machen will:

# KI-Such-Crawler ausdrücklich zulassen
User-agent: GPTBot
User-agent: OAI-SearchBot
User-agent: ClaudeBot
User-agent: PerplexityBot
User-agent: Google-Extended
Allow: /

robots.txt: Nur KI-Training unterbinden

Der Mittelweg für alle, die in KI-Suchen zitiert werden, aber nicht ins Modell-Training einfließen wollen:

# Trainings-Crawler blockieren, Such-Crawler bleiben erlaubt
User-agent: CCBot
User-agent: Bytespider
User-agent: Applebot-Extended
User-agent: Meta-ExternalAgent
Disallow: /

Wichtig zu wissen: Die robots.txt ist eine Konvention, kein technischer Zwang. Die großen Anbieter erklären öffentlich, sie zu respektieren; wer Inhalte hart schützen muss, braucht zusätzlich serverseitige Maßnahmen.

Prüfen statt raten

Ob deine robots.txt KI-Crawler blockiert — absichtlich oder versehentlich — zeigt dir der kostenlose GEO-Check in Sekunden: Er wertet die Regeln für alle hier gelisteten Bots aus und bewertet zusätzlich Maschinenlesbarkeit, E-E-A-T-Signale und Antwort-Struktur deiner Seite.

Blockiert deine robots.txt KI-Crawler?

Der GEO-Check prüft die Regeln für alle wichtigen KI-Bots plus llms.txt, Schema-Markup und Antwort-Struktur — kostenlos, ohne Anmeldung.

Jetzt kostenlos prüfen

Häufige Fragen

Sollte ich KI-Crawler blockieren oder zulassen?
Wer in KI-Antworten zitiert werden will, lässt die Such-Crawler zu. Reine Trainings-Crawler (CCBot, Bytespider …) zu blockieren kostet keine Zitierfähigkeit — eine bewusste Abwägung, kein Fehler.
Was ist der Unterschied zwischen GPTBot und OAI-SearchBot?
Beide gehören zu OpenAI: GPTBot sammelt Inhalte, die auch fürs Training genutzt werden können; OAI-SearchBot indexiert für die ChatGPT-Suche mit Quellen-Verlinkung. Man kann den einen erlauben und den anderen blockieren.
Hält sich jeder Bot an die robots.txt?
Die robots.txt ist eine Konvention, kein Zwang. Die großen Anbieter erklären öffentlich, sie zu respektieren; harter Schutz erfordert serverseitige Maßnahmen.
Was ist Google-Extended?
Kein eigener Crawler, sondern ein Steuerungs-Token: Es legt fest, ob Google ohnehin gecrawlte Inhalte für seine KI-Modelle (Gemini) nutzen darf. Laut Google ohne Einfluss auf das Ranking in der klassischen Suche.