Start › Wissen › KI-Crawler im Detail
CCBot und Common Crawl
Common Crawl erstellt ein frei verfügbares Web-Archiv, das in die Trainingsdaten zahlreicher Sprachmodelle einfließt.
Warum CCBot besonders ist
Sperrst du nur GPTBot und ClaudeBot, kann dein Inhalt trotzdem über den Common-Crawl-Datensatz in Modelle gelangen. Wer Training grundsätzlich ablehnt, muss CCBot mitdenken.
Blockieren
„User-agent: CCBot“ gefolgt von „Disallow: /“. Common Crawl respektiert die robots.txt beim nächsten Crawl-Durchlauf; bestehende Archiv-Einträge bleiben, bis der Datensatz neu erhoben wird.
Abwägung
Common Crawl wird auch für Forschung, Suchprojekte und Archivierung genutzt. Eine Sperre trifft alle diese Zwecke, nicht nur kommerzielles KI-Training.
Regel prüfen
citeglass zeigt, ob deine robots.txt CCBot erlaubt oder sperrt und ob die Regel bot-spezifisch ist oder nur über den „User-agent: *“-Block greift.
Prüf deine eigene Seite
citeglass zeigt in rund 30 Sekunden, wo deine Website für KI-Systeme unlesbar ist — kostenlos und ohne Login.
Weiterlesen
Allgemeine Information, keine Rechtsberatung. GEO ist ein junges Feld — Empfehlungen können sich ändern.