Start › Wissen › KI-Crawler im Detail
GPTBot erlauben oder blockieren
GPTBot ist der Crawler, mit dem OpenAI öffentlich zugängliche Inhalte für das Training zukünftiger Modelle sammelt.
Wofür GPTBot zuständig ist
GPTBot lädt Seiten für Trainingsdaten — nicht für die Beantwortung einer konkreten Nutzerfrage in ChatGPT. Für die Live-Suche in ChatGPT sind OAI-SearchBot und ChatGPT-User zuständig. Wer GPTBot sperrt, aber in der KI-Suche sichtbar bleiben will, muss diese beiden weiterhin erlauben.
Zulassen
Ein eigener Block gibt GPTBot vollen Zugriff: „User-agent: GPTBot“ gefolgt von „Allow: /“. Wichtig: Ein bot-spezifischer Block ersetzt für GPTBot den „User-agent: *“-Block vollständig — nötige Disallow-Regeln dort wiederholen.
Blockieren
„User-agent: GPTBot“ gefolgt von „Disallow: /“ hält GPTBot von der ganzen Domain fern. OpenAI respektiert die robots.txt in der Regel innerhalb von 24 Stunden. Bereits ins Training eingeflossene Inhalte holt das nicht zurück.
Prüfen, ob es wirkt
GPTBot hält sich an die robots.txt — kommt aber trotzdem nicht durch, wenn eine WAF oder ein Bot-Schutz den User-Agent vorher mit 403 abweist. citeglass ruft deine Seite mit dem echten GPTBot-User-Agent ab und zeigt, ob die robots.txt-Regel und die tatsächliche Server-Antwort übereinstimmen.
Prüf deine eigene Seite
citeglass zeigt in rund 30 Sekunden, wo deine Website für KI-Systeme unlesbar ist — kostenlos und ohne Login.
Weiterlesen
- OAI-SearchBot und ChatGPT-User
- KI-Crawler in der robots.txt steuern
- Training verbieten, Suche erlauben
Allgemeine Information, keine Rechtsberatung. GEO ist ein junges Feld — Empfehlungen können sich ändern.