Deutsch
citeglass · KI-Sichtbarkeits-Check

Geprüft am 4.9.2026 · https://www.nytimes.com/

Es gibt 2 kritische Blocker für die KI-Auffindbarkeit — die solltest du zuerst beheben.

F
38 / 100
2 kritisch · 1 zu prüfen

KI-Crawler-Matrix

Je Bot: was deine robots.txt erlaubt — und was dein Server dem Bot-User-Agent wirklich zurückgibt. Rot hinterlegte Zeilen: robots erlaubt, aber der Server blockt (meist eine WAF- oder Bot-Schutz-Regel).

BotBetreiberrobots.txtServer-Antwort
GPTBotOpenAIblockiertblockiert (403 / WAF)
OAI-SearchBotOpenAIblockiertblockiert (403 / WAF)
ChatGPT-UserOpenAIblockiertblockiert (403 / WAF)
ClaudeBotAnthropicblockiertblockiert (403 / WAF)
Claude-SearchBotAnthropicblockiertblockiert (403 / WAF)
Claude-UserAnthropicblockiertblockiert (403 / WAF)
PerplexityBotPerplexityblockiertblockiert (403 / WAF)
Perplexity-UserPerplexityblockiertblockiert (403 / WAF)
Google-ExtendedGoogle (Gemini-Training)blockiert
GooglebotGoogle (KI-Übersichten)erlaubt200 + Inhalt
CCBotCommon Crawl (Trainingsdaten vieler LLMs)blockiertblockiert (403 / WAF)
BytespiderByteDance (Doubao)blockiertblockiert (403 / WAF)
AmazonbotAmazon (Alexa/Rufus)erlaubtblockiert (403 / WAF)
Applebot-ExtendedApple (Intelligence-Training)blockiert
Meta-ExternalAgentMeta (Llama/Meta AI)blockiertblockiert (403 / WAF)
Wie kommt der Score zustande?
Wichtige KI-Crawler sind per robots.txt gesperrt-32
Server blockt Bots, obwohl robots.txt sie erlaubt-6
Seitentitel zu kurz oder zu lang-6
Keine llms.txt-5
Kein Organisation-Schema-4
Kein Autoren- oder Urhebersignal-4
Kein sichtbares oder ausgezeichnetes Datum-3
Kein FAQ- oder HowTo-Markup-2
Ergebnis38 / 100

Zugang für KI-Crawler

kritisch

Wichtige KI-Crawler sind per robots.txt gesperrt

Deine robots.txt verbietet 5 zentralen KI-Crawlern den Zugriff: GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended. Diese Systeme können deine Inhalte dann nicht laden und nicht als Quelle verwenden.

Das solltest du tun: Prüfe je Bot, ob die Sperre gewollt ist. Für KI-Sichtbarkeit sollten mindestens GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot und Google-Extended erlaubt sein.

User-agent: GPTBot
Allow: /

User-agent: PerplexityBot
Allow: /
kritisch

Server blockt Bots, obwohl robots.txt sie erlaubt

Für 1 Bot(s) von Amazon (Alexa/Rufus) sagt die robots.txt „erlaubt“, aber der Server antwortet mit 403 oder einer Bot-Schutz-Seite. Meist eine WAF-, Firewall- oder CDN-Regel, die den Crawler an der robots.txt vorbei aussperrt.

Das solltest du tun: Setze in deiner WAF / bei Cloudflare / in der Firewall die User-Agents bzw. IP-Bereiche der gewünschten KI-Crawler auf eine Ausnahmeliste. Verifiziere sie über DNS-Reverse-Lookup, nicht nur über den User-Agent-String.

Struktur & maschinelles Verständnis

zu prüfen

Seitentitel zu kurz oder zu lang

Der <title> ist 66 Zeichen lang. Sinnvoll sind rund 30–60 Zeichen: aussagekräftig genug, um das Thema zu benennen, kurz genug, um nicht abgeschnitten zu werden.

Das solltest du tun: Formuliere einen prägnanten Titel, der Thema und ggf. Marke enthält.

Hinweis

Keine llms.txt

Unter /llms.txt liegt keine Datei. llms.txt ist eine kurze, in Markdown gehaltene Übersicht deiner wichtigsten Inhalte, die einige KI-Systeme zur Orientierung nutzen.

Das solltest du tun: Lege eine /llms.txt an: eine H1 mit dem Namen, ein kurzer Absatz zum Angebot und eine Linkliste zu den zentralen Seiten.

# Deine Firma

> Kurzbeschreibung in einem Satz.

## Wichtige Seiten
- [Produkt](https://deine-domain.de/produkt): …
- [Preise](https://deine-domain.de/preise): …
- [Über uns](https://deine-domain.de/ueber-uns): …
Hinweis

Kein Organisation-Schema

Es gibt JSON-LD, aber keinen „Organization“-Eintrag. KI-Systeme können deine Marke dann schlechter als eindeutige Entität einordnen und mit externen Quellen verknüpfen.

Das solltest du tun: Füge ein „Organization“-Schema mit name, url, logo und sameAs (Links zu deinen offiziellen Profilen) hinzu.

Hinweis

Kein FAQ- oder HowTo-Markup

Frage-Antwort- und Schritt-für-Schritt-Inhalte sind ohne FAQPage- oder HowTo-Markup für KI-Systeme schwerer als direkt zitierfähige Antwort zu erkennen.

Das solltest du tun: Wo die Seite echte Fragen beantwortet oder Anleitungen gibt, zeichne sie als FAQPage bzw. HowTo aus (kein Markup ohne sichtbar passenden Inhalt).

Vertrauens- und Entitätssignale (E-E-A-T)

Hinweis

Kein Autoren- oder Urhebersignal

Es ist kein Autor erkennbar (weder Meta-Tag, rel=author noch JSON-LD Person). Für „Experience“ und „Expertise“ im E-E-A-T-Sinn ist eine benannte, nachvollziehbare Urheberschaft wichtig.

Das solltest du tun: Nenne bei redaktionellen Inhalten einen Autor mit Namen und verlinke eine Autorenseite; zeichne ihn zusätzlich als JSON-LD „Person“ aus.

Hinweis

Kein sichtbares oder ausgezeichnetes Datum

Es ist kein Veröffentlichungs- oder Änderungsdatum erkennbar (weder <time>, article:published_time noch datePublished im JSON-LD). KI-Systeme bevorzugen bei vielen Fragen aktuelle Quellen.

Das solltest du tun: Zeige bei Inhalten mit zeitlichem Bezug ein Datum sichtbar an und zeichne datePublished / dateModified im JSON-LD aus.

In Ordnung (7)
  • Der Hauptinhalt steht ohne JavaScript im HTML.
  • Strukturierte Daten (JSON-LD) sind vorhanden. — WebSite, NewsMediaOrganization
  • Genau eine H1-Überschrift.
  • Canonical-URL ist gesetzt.
  • Sitemap ist erreichbar.
  • Schnelle Server-Antwortzeit.
  • Kein noindex — die Seite darf indexiert werden.

Nächste Schritte

  1. Wichtige KI-Crawler sind per robots.txt gesperrt. Prüfe je Bot, ob die Sperre gewollt ist. Für KI-Sichtbarkeit sollten mindestens GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot und Google-Extended erlaubt sein.
  2. Server blockt Bots, obwohl robots.txt sie erlaubt. Setze in deiner WAF / bei Cloudflare / in der Firewall die User-Agents bzw. IP-Bereiche der gewünschten KI-Crawler auf eine Ausnahmeliste. Verifiziere sie über DNS-Reverse-Lookup, nicht nur über den User-Agent-String.
  3. Seitentitel zu kurz oder zu lang. Formuliere einen prägnanten Titel, der Thema und ggf. Marke enthält.
Diese Seite überwachen

Wöchentlicher Re-Scan mit E-Mail-Alarm bei jeder Änderung. In Vorbereitung — trag deine Adresse ein.

Methodik & Grenzen

Geprüft am 4.9.2026. citeglass ruft nytimes.com und die zugehörigen Dateien (robots.txt, llms.txt, sitemap.xml) per HTTP ab — einmal als normaler Browser, einmal je KI-Crawler-User-Agent. Es wird kein JavaScript ausgeführt. Zeit bis zum ersten Byte: 235 ms.

Was das nicht ist: Kein Rank- oder Zitat-Tracking, keine Aussage darüber, ob ein Modell dich tatsächlich nennt, und keine Prüfung von Inhalten, die erst per JavaScript nachgeladen werden. Eine Momentaufnahme aus Sicht einer Server-IP.

Andere Website prüfen