Deutsch
citeglass · KI-Sichtbarkeits-Check

Geprüft am 24.9.2026 · https://www.nytimes.com/

Es gibt 2 kritische Blocker für die KI-Auffindbarkeit — die solltest du zuerst beheben.

F
1 / 100
2 kritisch · 5 zu prüfen
Seit dem letzten Scan: Score -37 · 2 behoben · 8 neu

KI-Crawler-Matrix

Je Bot: was deine robots.txt erlaubt — und was dein Server dem Bot-User-Agent wirklich zurückgibt. Rot hinterlegte Zeilen: robots erlaubt, aber der Server blockt (meist eine WAF- oder Bot-Schutz-Regel).

BotBetreiberrobots.txtServer-Antwort
GPTBotOpenAIblockiertblockiert (403 / WAF)
OAI-SearchBotOpenAIblockiertblockiert (403 / WAF)
ChatGPT-UserOpenAIblockiertblockiert (403 / WAF)
ClaudeBotAnthropicblockiertblockiert (403 / WAF)
Claude-SearchBotAnthropicblockiertblockiert (403 / WAF)
Claude-UserAnthropicblockiertblockiert (403 / WAF)
PerplexityBotPerplexityblockiertblockiert (403 / WAF)
Perplexity-UserPerplexityblockiertblockiert (403 / WAF)
Google-ExtendedGoogle (Gemini-Training)blockiert—
GooglebotGoogle (KI-Übersichten)erlaubtblockiert (403 / WAF)
CCBotCommon Crawl (Trainingsdaten vieler LLMs)blockiertblockiert (403 / WAF)
BytespiderByteDance (Doubao)blockiertblockiert (403 / WAF)
AmazonbotAmazon (Alexa/Rufus)erlaubtblockiert (403 / WAF)
Applebot-ExtendedApple (Intelligence-Training)blockiert—
Meta-ExternalAgentMeta (Llama/Meta AI)blockiertblockiert (403 / WAF)
Wie kommt der Score zustande?
KI-Such-Bots sind per robots.txt gesperrt-32
Server blockt Bots, obwohl robots.txt sie erlaubt-12
Sehr wenig Text im HTML-10
Keine strukturierten Daten (JSON-LD)-8
Seitentitel zu kurz oder zu lang-6
Nicht genau eine H1-Überschrift-5
Meta-Description fehlt oder ist unpassend-5
Keine llms.txt-5
Kein Autoren- oder Urhebersignal-4
Keine sameAs-Verknüpfungen-3
Kein Link zu Impressum / Über uns / Kontakt-3
Kein sichtbares oder ausgezeichnetes Datum-3
Keine Canonical-URL-3
Ergebnis1 / 100

Zugang für KI-Crawler

kritisch

KI-Such-Bots sind per robots.txt gesperrt

Deine robots.txt sperrt 6 Bots, die Inhalte für Antworten in KI-Assistenten und Suchmaschinen abrufen: OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, PerplexityBot, Perplexity-User. Solange sie gesperrt sind, kann deine Seite dort nicht als Quelle erscheinen.

Das solltest du tun: Prüfe je Bot, ob die Sperre gewollt ist. Wer nur das KI-Training ausschließen will, sperrt die Trainings-Bots (GPTBot, ClaudeBot, Google-Extended) und lässt die Such-Bots zu.

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Claude-User
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Perplexity-User
Allow: /
kritisch

Server blockt Bots, obwohl robots.txt sie erlaubt

Für 2 Bot(s) von Google (KI-Übersichten), Amazon (Alexa/Rufus) sagt die robots.txt „erlaubt“, aber der Server antwortet mit 403 oder einer Bot-Schutz-Seite. Meist eine WAF-, Firewall- oder CDN-Regel, die den Crawler an der robots.txt vorbei aussperrt.

Das solltest du tun: Setze in deiner WAF / bei Cloudflare / in der Firewall die User-Agents bzw. IP-Bereiche der gewünschten KI-Crawler auf eine Ausnahmeliste. Verifiziere sie über DNS-Reverse-Lookup, nicht nur über den User-Agent-String.

Hinweis

KI-Training ausgeschlossen

Deine robots.txt sperrt Crawler, die Inhalte für das Training von Sprachmodellen sammeln: GPTBot, ClaudeBot, Google-Extended, CCBot, Applebot-Extended. Das verhindert keine Zitate — Such- und Abruf-Bots wie OAI-SearchBot, PerplexityBot und der Googlebot für die KI-Übersichten sind davon getrennt.

Das solltest du tun: Nichts zu tun, wenn der Ausschluss gewollt ist. Achte nur darauf, dass die Such-Bots erlaubt bleiben.

Inhalt ohne JavaScript

zu prüfen

Sehr wenig Text im HTML

Im initialen HTML stehen nur rund 55 Zeichen sichtbarer Text. Das reicht KI-Systemen kaum, um das Thema der Seite sicher zu erfassen.

Das solltest du tun: Stelle sicher, dass der eigentliche Inhalt vollständig im HTML steht und nicht in Bildern, iframes oder per JavaScript nachgeladenen Blöcken steckt.

Struktur & maschinelles Verständnis

zu prüfen

Keine strukturierten Daten (JSON-LD)

Die Seite enthält kein JSON-LD. Strukturierte Daten helfen KI-Systemen, Entitäten, Autor, Organisation, Datum und Seitentyp eindeutig zu erkennen — ohne sie muss alles aus dem Fließtext geraten werden.

Das solltest du tun: Ergänze mindestens ein „Organization“- und ein zum Seitentyp passendes Schema (Article, Product, FAQPage …) als JSON-LD im <head>.

<script type="application/ld+json">
{"@context":"https://schema.org","@type":"Organization",
 "name":"Deine Firma","url":"https://deine-domain.de",
 "sameAs":["https://www.linkedin.com/company/…"]}
</script>
zu prüfen

Seitentitel zu kurz oder zu lang

Der <title> ist 11 Zeichen lang. Sinnvoll sind rund 30–60 Zeichen: aussagekräftig genug, um das Thema zu benennen, kurz genug, um nicht abgeschnitten zu werden.

Das solltest du tun: Formuliere einen prägnanten Titel, der Thema und ggf. Marke enthält.

zu prüfen

Nicht genau eine H1-Überschrift

Die Seite hat 0 H1-Überschriften. Eine eindeutige H1 sagt Mensch und Maschine, worum es auf der Seite primär geht.

Das solltest du tun: Setze genau eine H1, die das Hauptthema der Seite benennt. Alles darunter beginnt bei H2.

zu prüfen

Meta-Description fehlt oder ist unpassend

Die Meta-Description ist 0 Zeichen lang. Sie ist oft das erste, was KI-Systeme und Suchmaschinen als Zusammenfassung der Seite lesen.

Das solltest du tun: Schreibe eine eigenständige Zusammenfassung der Seite in ein bis zwei Sätzen (rund 120–200 Zeichen), kein aneinandergereihtes Keyword-Set.

Hinweis

Keine llms.txt

Unter /llms.txt liegt keine Datei. llms.txt ist eine kurze, in Markdown gehaltene Übersicht deiner wichtigsten Inhalte, die einige KI-Systeme zur Orientierung nutzen.

Das solltest du tun: Lege eine /llms.txt an: eine H1 mit dem Namen, ein kurzer Absatz zum Angebot und eine Linkliste zu den zentralen Seiten.

# Deine Firma

> Kurzbeschreibung in einem Satz.

## Wichtige Seiten
- [Produkt](https://deine-domain.de/produkt): …
- [Preise](https://deine-domain.de/preise): …
- [Über uns](https://deine-domain.de/ueber-uns): …

Vertrauens- und Entitätssignale (E-E-A-T)

Hinweis

Kein Autoren- oder Urhebersignal

Es ist kein Autor erkennbar (weder Meta-Tag, rel=author noch JSON-LD Person). Für „Experience“ und „Expertise“ im E-E-A-T-Sinn ist eine benannte, nachvollziehbare Urheberschaft wichtig.

Das solltest du tun: Nenne bei redaktionellen Inhalten einen Autor mit Namen und verlinke eine Autorenseite; zeichne ihn zusätzlich als JSON-LD „Person“ aus.

Hinweis

Keine sameAs-Verknüpfungen

Im JSON-LD fehlt „sameAs“. Damit ordnen KI-Systeme deine Marke oder Person klar bekannten Entitäten zu (Wikidata, LinkedIn, Branchenverzeichnisse).

Das solltest du tun: Ergänze in Organization bzw. Person ein „sameAs“ mit den URLs deiner offiziellen Profile und Verzeichnis-Einträge.

Hinweis

Kein Link zu Impressum / Über uns / Kontakt

Auf der geprüften Seite ist kein Link zu Impressum, „Über uns“ oder Kontakt erkennbar. Solche Seiten sind ein starkes Vertrauenssignal (Trust) und helfen bei der Entitäts-Zuordnung.

Das solltest du tun: Verlinke Impressum bzw. „Über uns“ und Kontakt gut sichtbar, üblicherweise im Footer jeder Seite.

Hinweis

Kein sichtbares oder ausgezeichnetes Datum

Es ist kein Veröffentlichungs- oder Änderungsdatum erkennbar (weder <time>, article:published_time noch datePublished im JSON-LD). KI-Systeme bevorzugen bei vielen Fragen aktuelle Quellen.

Das solltest du tun: Zeige bei Inhalten mit zeitlichem Bezug ein Datum sichtbar an und zeichne datePublished / dateModified im JSON-LD aus.

Technische Basis

Hinweis

Keine Canonical-URL

Die Seite setzt kein <link rel="canonical">. Ohne Canonical kann bei mehreren URL-Varianten unklar bleiben, welche Fassung die maßgebliche ist.

Das solltest du tun: Setze auf jeder Seite ein selbstreferenzierendes <link rel="canonical"> mit der bevorzugten URL.

In Ordnung (3)
  • Sitemap ist erreichbar.
  • Schnelle Server-Antwortzeit.
  • Kein noindex — die Seite darf indexiert werden.

Nächste Schritte

  1. KI-Such-Bots sind per robots.txt gesperrt. Prüfe je Bot, ob die Sperre gewollt ist. Wer nur das KI-Training ausschließen will, sperrt die Trainings-Bots (GPTBot, ClaudeBot, Google-Extended) und lässt die Such-Bots zu.
  2. Server blockt Bots, obwohl robots.txt sie erlaubt. Setze in deiner WAF / bei Cloudflare / in der Firewall die User-Agents bzw. IP-Bereiche der gewünschten KI-Crawler auf eine Ausnahmeliste. Verifiziere sie über DNS-Reverse-Lookup, nicht nur über den User-Agent-String.
  3. Sehr wenig Text im HTML. Stelle sicher, dass der eigentliche Inhalt vollständig im HTML steht und nicht in Bildern, iframes oder per JavaScript nachgeladenen Blöcken steckt.
Diese Seite überwachen

Wöchentlicher Re-Scan mit E-Mail-Alarm bei jeder Änderung. In Vorbereitung — trag deine Adresse ein.

Methodik & Grenzen

Geprüft am 24.9.2026. citeglass ruft nytimes.com und die zugehörigen Dateien (robots.txt, llms.txt, sitemap.xml) per HTTP ab — einmal als normaler Browser, einmal je KI-Crawler-User-Agent. Es wird kein JavaScript ausgeführt. Zeit bis zum ersten Byte: 99 ms.

Was das nicht ist: Kein Rank- oder Zitat-Tracking, keine Aussage darüber, ob ein Modell dich tatsächlich nennt, und keine Prüfung von Inhalten, die erst per JavaScript nachgeladen werden. Eine Momentaufnahme aus Sicht einer Server-IP.

Andere Website prüfen