Geprüft am 24.9.2026 · https://www.heise.de/
Keine harten Blocker, aber 2 Punkte schwächen die KI-Auffindbarkeit.
KI-Crawler-Matrix
Je Bot: was deine robots.txt erlaubt — und was dein Server dem Bot-User-Agent wirklich zurückgibt. Rot hinterlegte Zeilen: robots erlaubt, aber der Server blockt (meist eine WAF- oder Bot-Schutz-Regel).
| Bot | Betreiber | robots.txt | Server-Antwort |
|---|---|---|---|
| GPTBot | OpenAI | erlaubt | 200 + Inhalt |
| OAI-SearchBot | OpenAI | erlaubt | 200 + Inhalt |
| ChatGPT-User | OpenAI | erlaubt | 200 + Inhalt |
| ClaudeBot | Anthropic | erlaubt | 200 + Inhalt |
| Claude-SearchBot | Anthropic | erlaubt | 200 + Inhalt |
| Claude-User | Anthropic | erlaubt | 200 + Inhalt |
| PerplexityBot | Perplexity | erlaubt | 200 + Inhalt |
| Perplexity-User | Perplexity | erlaubt | 200 + Inhalt |
| Google-Extended | Google (Gemini-Training) | blockiert | — |
| Googlebot | Google (KI-Übersichten) | erlaubt (über User-agent: *) | 200 + Inhalt |
| CCBot | Common Crawl (Trainingsdaten vieler LLMs) | blockiert | 200 + Inhalt |
| Bytespider | ByteDance (Doubao) | blockiert | 200 + Inhalt |
| Amazonbot | Amazon (Alexa/Rufus) | blockiert | 200 + Inhalt |
| Applebot-Extended | Apple (Intelligence-Training) | blockiert | — |
| Meta-ExternalAgent | Meta (Llama/Meta AI) | blockiert | 200 + Inhalt |
Wie kommt der Score zustande?
| Seitentitel zu kurz oder zu lang | -6 |
| Nicht genau eine H1-Überschrift | -5 |
| Keine llms.txt | -5 |
| Kein Organisation-Schema | -4 |
| Kein Autoren- oder Urhebersignal | -4 |
| Keine sameAs-Verknüpfungen | -3 |
| Kein FAQ- oder HowTo-Markup | -2 |
| Ergebnis | 71 / 100 |
Zugang für KI-Crawler
KI-Training ausgeschlossen
Deine robots.txt sperrt Crawler, die Inhalte für das Training von Sprachmodellen sammeln: Google-Extended, CCBot, Applebot-Extended. Das verhindert keine Zitate — Such- und Abruf-Bots wie OAI-SearchBot, PerplexityBot und der Googlebot für die KI-Übersichten sind davon getrennt.
Das solltest du tun: Nichts zu tun, wenn der Ausschluss gewollt ist. Achte nur darauf, dass die Such-Bots erlaubt bleiben.
Struktur & maschinelles Verständnis
Seitentitel zu kurz oder zu lang
Der <title> ist 67 Zeichen lang. Sinnvoll sind rund 30–60 Zeichen: aussagekräftig genug, um das Thema zu benennen, kurz genug, um nicht abgeschnitten zu werden.
Das solltest du tun: Formuliere einen prägnanten Titel, der Thema und ggf. Marke enthält.
Nicht genau eine H1-Überschrift
Die Seite hat 0 H1-Überschriften. Eine eindeutige H1 sagt Mensch und Maschine, worum es auf der Seite primär geht.
Das solltest du tun: Setze genau eine H1, die das Hauptthema der Seite benennt. Alles darunter beginnt bei H2.
Keine llms.txt
Unter /llms.txt liegt keine Datei. llms.txt ist eine kurze, in Markdown gehaltene Übersicht deiner wichtigsten Inhalte, die einige KI-Systeme zur Orientierung nutzen.
Das solltest du tun: Lege eine /llms.txt an: eine H1 mit dem Namen, ein kurzer Absatz zum Angebot und eine Linkliste zu den zentralen Seiten.
# Deine Firma > Kurzbeschreibung in einem Satz. ## Wichtige Seiten - [Produkt](https://deine-domain.de/produkt): … - [Preise](https://deine-domain.de/preise): … - [Über uns](https://deine-domain.de/ueber-uns): …
Kein Organisation-Schema
Es gibt JSON-LD, aber keinen „Organization“-Eintrag. KI-Systeme können deine Marke dann schlechter als eindeutige Entität einordnen und mit externen Quellen verknüpfen.
Das solltest du tun: Füge ein „Organization“-Schema mit name, url, logo und sameAs (Links zu deinen offiziellen Profilen) hinzu.
Kein FAQ- oder HowTo-Markup
Frage-Antwort- und Schritt-für-Schritt-Inhalte sind ohne FAQPage- oder HowTo-Markup für KI-Systeme schwerer als direkt zitierfähige Antwort zu erkennen.
Das solltest du tun: Wo die Seite echte Fragen beantwortet oder Anleitungen gibt, zeichne sie als FAQPage bzw. HowTo aus (kein Markup ohne sichtbar passenden Inhalt).
Vertrauens- und Entitätssignale (E-E-A-T)
Kein Autoren- oder Urhebersignal
Es ist kein Autor erkennbar (weder Meta-Tag, rel=author noch JSON-LD Person). Für „Experience“ und „Expertise“ im E-E-A-T-Sinn ist eine benannte, nachvollziehbare Urheberschaft wichtig.
Das solltest du tun: Nenne bei redaktionellen Inhalten einen Autor mit Namen und verlinke eine Autorenseite; zeichne ihn zusätzlich als JSON-LD „Person“ aus.
Keine sameAs-Verknüpfungen
Im JSON-LD fehlt „sameAs“. Damit ordnen KI-Systeme deine Marke oder Person klar bekannten Entitäten zu (Wikidata, LinkedIn, Branchenverzeichnisse).
Das solltest du tun: Ergänze in Organization bzw. Person ein „sameAs“ mit den URLs deiner offiziellen Profile und Verzeichnis-Einträge.
In Ordnung (6)
- Der Hauptinhalt steht ohne JavaScript im HTML.
- Strukturierte Daten (JSON-LD) sind vorhanden. — ItemList, Thing
- Canonical-URL ist gesetzt.
- Sitemap ist erreichbar.
- Schnelle Server-Antwortzeit.
- Kein noindex — die Seite darf indexiert werden.
Nächste Schritte
- Seitentitel zu kurz oder zu lang. Formuliere einen prägnanten Titel, der Thema und ggf. Marke enthält.
- Nicht genau eine H1-Überschrift. Setze genau eine H1, die das Hauptthema der Seite benennt. Alles darunter beginnt bei H2.
- Keine llms.txt. Lege eine /llms.txt an: eine H1 mit dem Namen, ein kurzer Absatz zum Angebot und eine Linkliste zu den zentralen Seiten.
Wöchentlicher Re-Scan mit E-Mail-Alarm bei jeder Änderung. In Vorbereitung — trag deine Adresse ein.
Methodik & Grenzen
Geprüft am 24.9.2026. citeglass ruft heise.de und die zugehörigen Dateien (robots.txt, llms.txt, sitemap.xml) per HTTP ab — einmal als normaler Browser, einmal je KI-Crawler-User-Agent. Es wird kein JavaScript ausgeführt. Zeit bis zum ersten Byte: 67 ms.
Was das nicht ist: Kein Rank- oder Zitat-Tracking, keine Aussage darüber, ob ein Modell dich tatsächlich nennt, und keine Prüfung von Inhalten, die erst per JavaScript nachgeladen werden. Eine Momentaufnahme aus Sicht einer Server-IP.