Geprüft am 24.9.2026 · https://www.nytimes.com/
Es gibt 2 kritische Blocker für die KI-Auffindbarkeit — die solltest du zuerst beheben.
KI-Crawler-Matrix
Je Bot: was deine robots.txt erlaubt — und was dein Server dem Bot-User-Agent wirklich zurückgibt. Rot hinterlegte Zeilen: robots erlaubt, aber der Server blockt (meist eine WAF- oder Bot-Schutz-Regel).
| Bot | Betreiber | robots.txt | Server-Antwort |
|---|---|---|---|
| GPTBot | OpenAI | blockiert | blockiert (403 / WAF) |
| OAI-SearchBot | OpenAI | blockiert | blockiert (403 / WAF) |
| ChatGPT-User | OpenAI | blockiert | blockiert (403 / WAF) |
| ClaudeBot | Anthropic | blockiert | blockiert (403 / WAF) |
| Claude-SearchBot | Anthropic | blockiert | blockiert (403 / WAF) |
| Claude-User | Anthropic | blockiert | blockiert (403 / WAF) |
| PerplexityBot | Perplexity | blockiert | blockiert (403 / WAF) |
| Perplexity-User | Perplexity | blockiert | blockiert (403 / WAF) |
| Google-Extended | Google (Gemini-Training) | blockiert | — |
| Googlebot | Google (KI-Übersichten) | erlaubt | blockiert (403 / WAF) |
| CCBot | Common Crawl (Trainingsdaten vieler LLMs) | blockiert | blockiert (403 / WAF) |
| Bytespider | ByteDance (Doubao) | blockiert | blockiert (403 / WAF) |
| Amazonbot | Amazon (Alexa/Rufus) | erlaubt | blockiert (403 / WAF) |
| Applebot-Extended | Apple (Intelligence-Training) | blockiert | — |
| Meta-ExternalAgent | Meta (Llama/Meta AI) | blockiert | blockiert (403 / WAF) |
Wie kommt der Score zustande?
| KI-Such-Bots sind per robots.txt gesperrt | -32 |
| Server blockt Bots, obwohl robots.txt sie erlaubt | -12 |
| Sehr wenig Text im HTML | -10 |
| Keine strukturierten Daten (JSON-LD) | -8 |
| Seitentitel zu kurz oder zu lang | -6 |
| Nicht genau eine H1-Überschrift | -5 |
| Meta-Description fehlt oder ist unpassend | -5 |
| Keine llms.txt | -5 |
| Kein Autoren- oder Urhebersignal | -4 |
| Keine sameAs-Verknüpfungen | -3 |
| Kein Link zu Impressum / Über uns / Kontakt | -3 |
| Kein sichtbares oder ausgezeichnetes Datum | -3 |
| Keine Canonical-URL | -3 |
| Ergebnis | 1 / 100 |
Zugang für KI-Crawler
KI-Such-Bots sind per robots.txt gesperrt
Deine robots.txt sperrt 6 Bots, die Inhalte für Antworten in KI-Assistenten und Suchmaschinen abrufen: OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, PerplexityBot, Perplexity-User. Solange sie gesperrt sind, kann deine Seite dort nicht als Quelle erscheinen.
Das solltest du tun: Prüfe je Bot, ob die Sperre gewollt ist. Wer nur das KI-Training ausschließen will, sperrt die Trainings-Bots (GPTBot, ClaudeBot, Google-Extended) und lässt die Such-Bots zu.
User-agent: OAI-SearchBot Allow: / User-agent: ChatGPT-User Allow: / User-agent: Claude-SearchBot Allow: / User-agent: Claude-User Allow: / User-agent: PerplexityBot Allow: / User-agent: Perplexity-User Allow: /
Server blockt Bots, obwohl robots.txt sie erlaubt
Für 2 Bot(s) von Google (KI-Übersichten), Amazon (Alexa/Rufus) sagt die robots.txt „erlaubt“, aber der Server antwortet mit 403 oder einer Bot-Schutz-Seite. Meist eine WAF-, Firewall- oder CDN-Regel, die den Crawler an der robots.txt vorbei aussperrt.
Das solltest du tun: Setze in deiner WAF / bei Cloudflare / in der Firewall die User-Agents bzw. IP-Bereiche der gewünschten KI-Crawler auf eine Ausnahmeliste. Verifiziere sie über DNS-Reverse-Lookup, nicht nur über den User-Agent-String.
KI-Training ausgeschlossen
Deine robots.txt sperrt Crawler, die Inhalte für das Training von Sprachmodellen sammeln: GPTBot, ClaudeBot, Google-Extended, CCBot, Applebot-Extended. Das verhindert keine Zitate — Such- und Abruf-Bots wie OAI-SearchBot, PerplexityBot und der Googlebot für die KI-Übersichten sind davon getrennt.
Das solltest du tun: Nichts zu tun, wenn der Ausschluss gewollt ist. Achte nur darauf, dass die Such-Bots erlaubt bleiben.
Inhalt ohne JavaScript
Sehr wenig Text im HTML
Im initialen HTML stehen nur rund 55 Zeichen sichtbarer Text. Das reicht KI-Systemen kaum, um das Thema der Seite sicher zu erfassen.
Das solltest du tun: Stelle sicher, dass der eigentliche Inhalt vollständig im HTML steht und nicht in Bildern, iframes oder per JavaScript nachgeladenen Blöcken steckt.
Struktur & maschinelles Verständnis
Keine strukturierten Daten (JSON-LD)
Die Seite enthält kein JSON-LD. Strukturierte Daten helfen KI-Systemen, Entitäten, Autor, Organisation, Datum und Seitentyp eindeutig zu erkennen — ohne sie muss alles aus dem Fließtext geraten werden.
Das solltest du tun: Ergänze mindestens ein „Organization“- und ein zum Seitentyp passendes Schema (Article, Product, FAQPage …) als JSON-LD im <head>.
<script type="application/ld+json">
{"@context":"https://schema.org","@type":"Organization",
"name":"Deine Firma","url":"https://deine-domain.de",
"sameAs":["https://www.linkedin.com/company/…"]}
</script>Seitentitel zu kurz oder zu lang
Der <title> ist 11 Zeichen lang. Sinnvoll sind rund 30–60 Zeichen: aussagekräftig genug, um das Thema zu benennen, kurz genug, um nicht abgeschnitten zu werden.
Das solltest du tun: Formuliere einen prägnanten Titel, der Thema und ggf. Marke enthält.
Nicht genau eine H1-Überschrift
Die Seite hat 0 H1-Überschriften. Eine eindeutige H1 sagt Mensch und Maschine, worum es auf der Seite primär geht.
Das solltest du tun: Setze genau eine H1, die das Hauptthema der Seite benennt. Alles darunter beginnt bei H2.
Meta-Description fehlt oder ist unpassend
Die Meta-Description ist 0 Zeichen lang. Sie ist oft das erste, was KI-Systeme und Suchmaschinen als Zusammenfassung der Seite lesen.
Das solltest du tun: Schreibe eine eigenständige Zusammenfassung der Seite in ein bis zwei Sätzen (rund 120–200 Zeichen), kein aneinandergereihtes Keyword-Set.
Keine llms.txt
Unter /llms.txt liegt keine Datei. llms.txt ist eine kurze, in Markdown gehaltene Übersicht deiner wichtigsten Inhalte, die einige KI-Systeme zur Orientierung nutzen.
Das solltest du tun: Lege eine /llms.txt an: eine H1 mit dem Namen, ein kurzer Absatz zum Angebot und eine Linkliste zu den zentralen Seiten.
# Deine Firma > Kurzbeschreibung in einem Satz. ## Wichtige Seiten - [Produkt](https://deine-domain.de/produkt): … - [Preise](https://deine-domain.de/preise): … - [Über uns](https://deine-domain.de/ueber-uns): …
Vertrauens- und Entitätssignale (E-E-A-T)
Kein Autoren- oder Urhebersignal
Es ist kein Autor erkennbar (weder Meta-Tag, rel=author noch JSON-LD Person). Für „Experience“ und „Expertise“ im E-E-A-T-Sinn ist eine benannte, nachvollziehbare Urheberschaft wichtig.
Das solltest du tun: Nenne bei redaktionellen Inhalten einen Autor mit Namen und verlinke eine Autorenseite; zeichne ihn zusätzlich als JSON-LD „Person“ aus.
Keine sameAs-Verknüpfungen
Im JSON-LD fehlt „sameAs“. Damit ordnen KI-Systeme deine Marke oder Person klar bekannten Entitäten zu (Wikidata, LinkedIn, Branchenverzeichnisse).
Das solltest du tun: Ergänze in Organization bzw. Person ein „sameAs“ mit den URLs deiner offiziellen Profile und Verzeichnis-Einträge.
Kein Link zu Impressum / Über uns / Kontakt
Auf der geprüften Seite ist kein Link zu Impressum, „Über uns“ oder Kontakt erkennbar. Solche Seiten sind ein starkes Vertrauenssignal (Trust) und helfen bei der Entitäts-Zuordnung.
Das solltest du tun: Verlinke Impressum bzw. „Über uns“ und Kontakt gut sichtbar, üblicherweise im Footer jeder Seite.
Kein sichtbares oder ausgezeichnetes Datum
Es ist kein Veröffentlichungs- oder Änderungsdatum erkennbar (weder <time>, article:published_time noch datePublished im JSON-LD). KI-Systeme bevorzugen bei vielen Fragen aktuelle Quellen.
Das solltest du tun: Zeige bei Inhalten mit zeitlichem Bezug ein Datum sichtbar an und zeichne datePublished / dateModified im JSON-LD aus.
Technische Basis
Keine Canonical-URL
Die Seite setzt kein <link rel="canonical">. Ohne Canonical kann bei mehreren URL-Varianten unklar bleiben, welche Fassung die maßgebliche ist.
Das solltest du tun: Setze auf jeder Seite ein selbstreferenzierendes <link rel="canonical"> mit der bevorzugten URL.
In Ordnung (3)
- Sitemap ist erreichbar.
- Schnelle Server-Antwortzeit.
- Kein noindex — die Seite darf indexiert werden.
Nächste Schritte
- KI-Such-Bots sind per robots.txt gesperrt. Prüfe je Bot, ob die Sperre gewollt ist. Wer nur das KI-Training ausschließen will, sperrt die Trainings-Bots (GPTBot, ClaudeBot, Google-Extended) und lässt die Such-Bots zu.
- Server blockt Bots, obwohl robots.txt sie erlaubt. Setze in deiner WAF / bei Cloudflare / in der Firewall die User-Agents bzw. IP-Bereiche der gewünschten KI-Crawler auf eine Ausnahmeliste. Verifiziere sie über DNS-Reverse-Lookup, nicht nur über den User-Agent-String.
- Sehr wenig Text im HTML. Stelle sicher, dass der eigentliche Inhalt vollständig im HTML steht und nicht in Bildern, iframes oder per JavaScript nachgeladenen Blöcken steckt.
Wöchentlicher Re-Scan mit E-Mail-Alarm bei jeder Änderung. In Vorbereitung — trag deine Adresse ein.
Methodik & Grenzen
Geprüft am 24.9.2026. citeglass ruft nytimes.com und die zugehörigen Dateien (robots.txt, llms.txt, sitemap.xml) per HTTP ab — einmal als normaler Browser, einmal je KI-Crawler-User-Agent. Es wird kein JavaScript ausgeführt. Zeit bis zum ersten Byte: 99 ms.
Was das nicht ist: Kein Rank- oder Zitat-Tracking, keine Aussage darüber, ob ein Modell dich tatsächlich nennt, und keine Prüfung von Inhalten, die erst per JavaScript nachgeladen werden. Eine Momentaufnahme aus Sicht einer Server-IP.