KI-Crawler im Überblick:
GPTBot, ClaudeBot & Co. steuern
Jeder große KI-Anbieter betreibt eigene Crawler — und du entscheidest per robots.txt, welche davon deine Inhalte nutzen dürfen. Diese Übersicht zeigt alle wichtigen Bots, ihre Aufgaben laut Anbieter-Dokumentation und fertige robots.txt-Beispiele zum Zulassen oder Blockieren.
Die wichtigsten KI-Crawler auf einen Blick
| User-Agent | Betreiber | Aufgabe laut Anbieter-Dokumentation | Relevanz für Zitate |
|---|---|---|---|
| GPTBot | OpenAI | Sammelt Inhalte, die auch für das Modell-Training verwendet werden können | Hoch |
| OAI-SearchBot | OpenAI | Indexierung für die ChatGPT-Suche mit Quellen-Verlinkung | Sehr hoch |
| ChatGPT-User | OpenAI | Ruft Seiten ab, wenn ein ChatGPT-Nutzer sie konkret anfragt | Hoch |
| ClaudeBot | Anthropic | Crawlt Inhalte für Claude | Hoch |
| PerplexityBot | Perplexity | Indexierung für die Perplexity-Antwortsuche mit Quellenangabe | Sehr hoch |
| Google-Extended | Steuerungs-Token: darf Google gecrawlte Inhalte für Gemini/KI nutzen? (kein eigener Crawler) | Hoch | |
| CCBot | Common Crawl | Offenes Webarchiv — Basis vieler KI-Trainingsdatensätze | Gering (Training) |
| Bytespider | ByteDance | Crawling, u. a. für KI-Training | Gering (Training) |
| Applebot-Extended | Apple | Steuerungs-Token: dürfen Applebot-Daten für Apple-KI-Training genutzt werden? | Gering (Training) |
| Meta-ExternalAgent | Meta | Crawling für Meta-KI, u. a. Training | Gering (Training) |
robots.txt: KI-Sichtbarkeit maximieren
Wenn deine robots.txt keine Regeln für diese Bots enthält, gelten die allgemeinen User-agent: *-Regeln — bei einem simplen Allow: / dürfen also alle rein. Wer es explizit machen will:
# KI-Such-Crawler ausdrücklich zulassen User-agent: GPTBot User-agent: OAI-SearchBot User-agent: ClaudeBot User-agent: PerplexityBot User-agent: Google-Extended Allow: /
robots.txt: Nur KI-Training unterbinden
Der Mittelweg für alle, die in KI-Suchen zitiert werden, aber nicht ins Modell-Training einfließen wollen:
# Trainings-Crawler blockieren, Such-Crawler bleiben erlaubt User-agent: CCBot User-agent: Bytespider User-agent: Applebot-Extended User-agent: Meta-ExternalAgent Disallow: /
Wichtig zu wissen: Die robots.txt ist eine Konvention, kein technischer Zwang. Die großen Anbieter erklären öffentlich, sie zu respektieren; wer Inhalte hart schützen muss, braucht zusätzlich serverseitige Maßnahmen.
Prüfen statt raten
Ob deine robots.txt KI-Crawler blockiert — absichtlich oder versehentlich — zeigt dir der kostenlose GEO-Check in Sekunden: Er wertet die Regeln für alle hier gelisteten Bots aus und bewertet zusätzlich Maschinenlesbarkeit, E-E-A-T-Signale und Antwort-Struktur deiner Seite.
Blockiert deine robots.txt KI-Crawler?
Der GEO-Check prüft die Regeln für alle wichtigen KI-Bots plus llms.txt, Schema-Markup und Antwort-Struktur — kostenlos, ohne Anmeldung.
Jetzt kostenlos prüfen