Training verbieten, Suche erlauben
Die meisten Anbieter trennen den Trainings-Crawler vom Such-Crawler. Damit kannst du aus dem Modelltraining aussteigen und trotzdem als zitierte Quelle erscheinen.
Trainings-Bots sperren
Disallow für: GPTBot (OpenAI), ClaudeBot (Anthropic), CCBot (Common Crawl), plus die Token Google-Extended und Applebot-Extended. Optional Meta-ExternalAgent, wenn du auch aus dem Llama-Training willst.
Such-Bots erlauben
Allow für: OAI-SearchBot und ChatGPT-User (ChatGPT-Suche), Claude-SearchBot und Claude-User (Claude), PerplexityBot und Perplexity-User (Perplexity), Googlebot (Google-Suche und KI-Übersichten).
Grauzonen
Nicht jeder Anbieter trennt sauber: Common Crawl kennt keine Suche, Bytespider mischt beides. Und ein Textausschnitt kann in einer KI-Übersicht landen, auch wenn du Training verboten hast — das folgt der Suchindexierung.
Konfiguration prüfen
citeglass zeigt je Bot getrennt die geltende robots.txt-Regel und die echte Server-Antwort — so siehst du auf einen Blick, ob die Trennung „Training aus, Suche an“ tatsächlich greift.
Prüf deine eigene Seite
citeglass zeigt in rund 30 Sekunden, wo deine Website für KI-Systeme unlesbar ist — kostenlos und ohne Login.
Weiterlesen
Allgemeine Information, keine Rechtsberatung. GEO ist ein junges Feld — Empfehlungen können sich ändern.