Geprüft am 4.9.2026 · https://www.nytimes.com/
Es gibt 2 kritische Blocker für die KI-Auffindbarkeit — die solltest du zuerst beheben.
KI-Crawler-Matrix
Je Bot: was deine robots.txt erlaubt — und was dein Server dem Bot-User-Agent wirklich zurückgibt. Rot hinterlegte Zeilen: robots erlaubt, aber der Server blockt (meist eine WAF- oder Bot-Schutz-Regel).
| Bot | Betreiber | robots.txt | Server-Antwort |
|---|---|---|---|
| GPTBot | OpenAI | blockiert | blockiert (403 / WAF) |
| OAI-SearchBot | OpenAI | blockiert | blockiert (403 / WAF) |
| ChatGPT-User | OpenAI | blockiert | blockiert (403 / WAF) |
| ClaudeBot | Anthropic | blockiert | blockiert (403 / WAF) |
| Claude-SearchBot | Anthropic | blockiert | blockiert (403 / WAF) |
| Claude-User | Anthropic | blockiert | blockiert (403 / WAF) |
| PerplexityBot | Perplexity | blockiert | blockiert (403 / WAF) |
| Perplexity-User | Perplexity | blockiert | blockiert (403 / WAF) |
| Google-Extended | Google (Gemini-Training) | blockiert | — |
| Googlebot | Google (KI-Übersichten) | erlaubt | 200 + Inhalt |
| CCBot | Common Crawl (Trainingsdaten vieler LLMs) | blockiert | blockiert (403 / WAF) |
| Bytespider | ByteDance (Doubao) | blockiert | blockiert (403 / WAF) |
| Amazonbot | Amazon (Alexa/Rufus) | erlaubt | blockiert (403 / WAF) |
| Applebot-Extended | Apple (Intelligence-Training) | blockiert | — |
| Meta-ExternalAgent | Meta (Llama/Meta AI) | blockiert | blockiert (403 / WAF) |
Wie kommt der Score zustande?
| Wichtige KI-Crawler sind per robots.txt gesperrt | -32 |
| Server blockt Bots, obwohl robots.txt sie erlaubt | -6 |
| Seitentitel zu kurz oder zu lang | -6 |
| Keine llms.txt | -5 |
| Kein Organisation-Schema | -4 |
| Kein Autoren- oder Urhebersignal | -4 |
| Kein sichtbares oder ausgezeichnetes Datum | -3 |
| Kein FAQ- oder HowTo-Markup | -2 |
| Ergebnis | 38 / 100 |
Zugang für KI-Crawler
Wichtige KI-Crawler sind per robots.txt gesperrt
Deine robots.txt verbietet 5 zentralen KI-Crawlern den Zugriff: GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended. Diese Systeme können deine Inhalte dann nicht laden und nicht als Quelle verwenden.
Das solltest du tun: Prüfe je Bot, ob die Sperre gewollt ist. Für KI-Sichtbarkeit sollten mindestens GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot und Google-Extended erlaubt sein.
User-agent: GPTBot Allow: / User-agent: PerplexityBot Allow: /
Server blockt Bots, obwohl robots.txt sie erlaubt
Für 1 Bot(s) von Amazon (Alexa/Rufus) sagt die robots.txt „erlaubt“, aber der Server antwortet mit 403 oder einer Bot-Schutz-Seite. Meist eine WAF-, Firewall- oder CDN-Regel, die den Crawler an der robots.txt vorbei aussperrt.
Das solltest du tun: Setze in deiner WAF / bei Cloudflare / in der Firewall die User-Agents bzw. IP-Bereiche der gewünschten KI-Crawler auf eine Ausnahmeliste. Verifiziere sie über DNS-Reverse-Lookup, nicht nur über den User-Agent-String.
Struktur & maschinelles Verständnis
Seitentitel zu kurz oder zu lang
Der <title> ist 66 Zeichen lang. Sinnvoll sind rund 30–60 Zeichen: aussagekräftig genug, um das Thema zu benennen, kurz genug, um nicht abgeschnitten zu werden.
Das solltest du tun: Formuliere einen prägnanten Titel, der Thema und ggf. Marke enthält.
Keine llms.txt
Unter /llms.txt liegt keine Datei. llms.txt ist eine kurze, in Markdown gehaltene Übersicht deiner wichtigsten Inhalte, die einige KI-Systeme zur Orientierung nutzen.
Das solltest du tun: Lege eine /llms.txt an: eine H1 mit dem Namen, ein kurzer Absatz zum Angebot und eine Linkliste zu den zentralen Seiten.
# Deine Firma > Kurzbeschreibung in einem Satz. ## Wichtige Seiten - [Produkt](https://deine-domain.de/produkt): … - [Preise](https://deine-domain.de/preise): … - [Über uns](https://deine-domain.de/ueber-uns): …
Kein Organisation-Schema
Es gibt JSON-LD, aber keinen „Organization“-Eintrag. KI-Systeme können deine Marke dann schlechter als eindeutige Entität einordnen und mit externen Quellen verknüpfen.
Das solltest du tun: Füge ein „Organization“-Schema mit name, url, logo und sameAs (Links zu deinen offiziellen Profilen) hinzu.
Kein FAQ- oder HowTo-Markup
Frage-Antwort- und Schritt-für-Schritt-Inhalte sind ohne FAQPage- oder HowTo-Markup für KI-Systeme schwerer als direkt zitierfähige Antwort zu erkennen.
Das solltest du tun: Wo die Seite echte Fragen beantwortet oder Anleitungen gibt, zeichne sie als FAQPage bzw. HowTo aus (kein Markup ohne sichtbar passenden Inhalt).
Vertrauens- und Entitätssignale (E-E-A-T)
Kein Autoren- oder Urhebersignal
Es ist kein Autor erkennbar (weder Meta-Tag, rel=author noch JSON-LD Person). Für „Experience“ und „Expertise“ im E-E-A-T-Sinn ist eine benannte, nachvollziehbare Urheberschaft wichtig.
Das solltest du tun: Nenne bei redaktionellen Inhalten einen Autor mit Namen und verlinke eine Autorenseite; zeichne ihn zusätzlich als JSON-LD „Person“ aus.
Kein sichtbares oder ausgezeichnetes Datum
Es ist kein Veröffentlichungs- oder Änderungsdatum erkennbar (weder <time>, article:published_time noch datePublished im JSON-LD). KI-Systeme bevorzugen bei vielen Fragen aktuelle Quellen.
Das solltest du tun: Zeige bei Inhalten mit zeitlichem Bezug ein Datum sichtbar an und zeichne datePublished / dateModified im JSON-LD aus.
In Ordnung (7)
- Der Hauptinhalt steht ohne JavaScript im HTML.
- Strukturierte Daten (JSON-LD) sind vorhanden. — WebSite, NewsMediaOrganization
- Genau eine H1-Überschrift.
- Canonical-URL ist gesetzt.
- Sitemap ist erreichbar.
- Schnelle Server-Antwortzeit.
- Kein noindex — die Seite darf indexiert werden.
Nächste Schritte
- Wichtige KI-Crawler sind per robots.txt gesperrt. Prüfe je Bot, ob die Sperre gewollt ist. Für KI-Sichtbarkeit sollten mindestens GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot und Google-Extended erlaubt sein.
- Server blockt Bots, obwohl robots.txt sie erlaubt. Setze in deiner WAF / bei Cloudflare / in der Firewall die User-Agents bzw. IP-Bereiche der gewünschten KI-Crawler auf eine Ausnahmeliste. Verifiziere sie über DNS-Reverse-Lookup, nicht nur über den User-Agent-String.
- Seitentitel zu kurz oder zu lang. Formuliere einen prägnanten Titel, der Thema und ggf. Marke enthält.
Wöchentlicher Re-Scan mit E-Mail-Alarm bei jeder Änderung. In Vorbereitung — trag deine Adresse ein.
Methodik & Grenzen
Geprüft am 4.9.2026. citeglass ruft nytimes.com und die zugehörigen Dateien (robots.txt, llms.txt, sitemap.xml) per HTTP ab — einmal als normaler Browser, einmal je KI-Crawler-User-Agent. Es wird kein JavaScript ausgeführt. Zeit bis zum ersten Byte: 235 ms.
Was das nicht ist: Kein Rank- oder Zitat-Tracking, keine Aussage darüber, ob ein Modell dich tatsächlich nennt, und keine Prüfung von Inhalten, die erst per JavaScript nachgeladen werden. Eine Momentaufnahme aus Sicht einer Server-IP.