Geprüft am 23.9.2026 · https://rehau-termopane.ro/
Es gibt 1 kritische Blocker für die KI-Auffindbarkeit — die solltest du zuerst beheben.
KI-Crawler-Matrix
Je Bot: was deine robots.txt erlaubt — und was dein Server dem Bot-User-Agent wirklich zurückgibt. Rot hinterlegte Zeilen: robots erlaubt, aber der Server blockt (meist eine WAF- oder Bot-Schutz-Regel).
| Bot | Betreiber | robots.txt | Server-Antwort |
|---|---|---|---|
| GPTBot | OpenAI | nicht genannt | blockiert (403 / WAF) |
| OAI-SearchBot | OpenAI | nicht genannt | 200 + Inhalt |
| ChatGPT-User | OpenAI | nicht genannt | 200 + Inhalt |
| ClaudeBot | Anthropic | nicht genannt | 200 + Inhalt |
| Claude-SearchBot | Anthropic | nicht genannt | Fehler / Zeitüberschreitung |
| Claude-User | Anthropic | nicht genannt | 200 + Inhalt |
| PerplexityBot | Perplexity | nicht genannt | Fehler / Zeitüberschreitung |
| Perplexity-User | Perplexity | nicht genannt | Fehler / Zeitüberschreitung |
| Google-Extended | Google (Gemini-Training) | nicht genannt | — |
| Googlebot | Google (KI-Übersichten) | nicht genannt | 200 + Inhalt |
| CCBot | Common Crawl (Trainingsdaten vieler LLMs) | nicht genannt | 200 + Inhalt |
| Bytespider | ByteDance (Doubao) | nicht genannt | 200 + Inhalt |
| Amazonbot | Amazon (Alexa/Rufus) | nicht genannt | 200 + Inhalt |
| Applebot-Extended | Apple (Intelligence-Training) | nicht genannt | — |
| Meta-ExternalAgent | Meta (Llama/Meta AI) | nicht genannt | blockiert (403 / WAF) |
Wie kommt der Score zustande?
| Server blockt Bots, obwohl robots.txt sie erlaubt | -12 |
| Keine llms.txt | -5 |
| Keine sitemap.xml gefunden | -4 |
| Überschriften-Ebenen werden übersprungen | -3 |
| Keine sameAs-Verknüpfungen | -3 |
| Keine robots.txt gefunden | -2 |
| Kein FAQ- oder HowTo-Markup | -2 |
| Ergebnis | 69 / 100 |
Zugang für KI-Crawler
Server blockt Bots, obwohl robots.txt sie erlaubt
Für 2 Bot(s) von OpenAI, Meta (Llama/Meta AI) sagt die robots.txt „erlaubt“, aber der Server antwortet mit 403 oder einer Bot-Schutz-Seite. Meist eine WAF-, Firewall- oder CDN-Regel, die den Crawler an der robots.txt vorbei aussperrt.
Das solltest du tun: Setze in deiner WAF / bei Cloudflare / in der Firewall die User-Agents bzw. IP-Bereiche der gewünschten KI-Crawler auf eine Ausnahmeliste. Verifiziere sie über DNS-Reverse-Lookup, nicht nur über den User-Agent-String.
Keine robots.txt gefunden
Unter /robots.txt war keine gültige Datei erreichbar. Crawler gehen dann von „alles erlaubt“ aus — funktioniert, aber du hast keine Steuerung und kein Sitemap-Signal.
Das solltest du tun: Lege eine robots.txt im Wurzelverzeichnis an, mindestens mit einem Sitemap-Verweis und den gewünschten Allow-/Disallow-Regeln.
User-agent: * Allow: / Sitemap: https://deine-domain.de/sitemap.xml
Struktur & maschinelles Verständnis
Keine llms.txt
Unter /llms.txt liegt keine Datei. llms.txt ist eine kurze, in Markdown gehaltene Übersicht deiner wichtigsten Inhalte, die einige KI-Systeme zur Orientierung nutzen.
Das solltest du tun: Lege eine /llms.txt an: eine H1 mit dem Namen, ein kurzer Absatz zum Angebot und eine Linkliste zu den zentralen Seiten.
# Deine Firma > Kurzbeschreibung in einem Satz. ## Wichtige Seiten - [Produkt](https://deine-domain.de/produkt): … - [Preise](https://deine-domain.de/preise): … - [Über uns](https://deine-domain.de/ueber-uns): …
Überschriften-Ebenen werden übersprungen
In der Überschriften-Folge fehlt mindestens eine Ebene (z. B. H2 direkt auf H4). Das erschwert es, die inhaltliche Gliederung maschinell zu rekonstruieren.
Das solltest du tun: Nutze die Überschriften-Ebenen lückenlos und in Reihenfolge (H1 → H2 → H3 …).
Kein FAQ- oder HowTo-Markup
Frage-Antwort- und Schritt-für-Schritt-Inhalte sind ohne FAQPage- oder HowTo-Markup für KI-Systeme schwerer als direkt zitierfähige Antwort zu erkennen.
Das solltest du tun: Wo die Seite echte Fragen beantwortet oder Anleitungen gibt, zeichne sie als FAQPage bzw. HowTo aus (kein Markup ohne sichtbar passenden Inhalt).
Vertrauens- und Entitätssignale (E-E-A-T)
Keine sameAs-Verknüpfungen
Im JSON-LD fehlt „sameAs“. Damit ordnen KI-Systeme deine Marke oder Person klar bekannten Entitäten zu (Wikidata, LinkedIn, Branchenverzeichnisse).
Das solltest du tun: Ergänze in Organization bzw. Person ein „sameAs“ mit den URLs deiner offiziellen Profile und Verzeichnis-Einträge.
Technische Basis
Keine sitemap.xml gefunden
Unter /sitemap.xml war keine gültige XML-Sitemap erreichbar und die robots.txt nennt keine. Eine Sitemap hilft Crawlern, alle relevanten URLs zu finden.
Das solltest du tun: Erzeuge eine sitemap.xml mit allen indexierbaren URLs und verweise in der robots.txt darauf.
In Ordnung (8)
- Der Hauptinhalt steht ohne JavaScript im HTML.
- Strukturierte Daten (JSON-LD) sind vorhanden. — HomeAndConstructionBusiness, Organization, WebSite, ImageObject, WebPage, Person, Article, VideoObject
- Organisation ist als JSON-LD ausgezeichnet.
- Genau eine H1-Überschrift.
- Canonical-URL ist gesetzt.
- Seitentitel hat eine sinnvolle Länge.
- Ein Autoren-/Urhebersignal ist vorhanden.
- Schnelle Server-Antwortzeit.
Nächste Schritte
- Server blockt Bots, obwohl robots.txt sie erlaubt. Setze in deiner WAF / bei Cloudflare / in der Firewall die User-Agents bzw. IP-Bereiche der gewünschten KI-Crawler auf eine Ausnahmeliste. Verifiziere sie über DNS-Reverse-Lookup, nicht nur über den User-Agent-String.
- Keine llms.txt. Lege eine /llms.txt an: eine H1 mit dem Namen, ein kurzer Absatz zum Angebot und eine Linkliste zu den zentralen Seiten.
- Keine sitemap.xml gefunden. Erzeuge eine sitemap.xml mit allen indexierbaren URLs und verweise in der robots.txt darauf.
Wöchentlicher Re-Scan mit E-Mail-Alarm bei jeder Änderung. In Vorbereitung — trag deine Adresse ein.
Methodik & Grenzen
Geprüft am 23.9.2026. citeglass ruft rehau-termopane.ro und die zugehörigen Dateien (robots.txt, llms.txt, sitemap.xml) per HTTP ab — einmal als normaler Browser, einmal je KI-Crawler-User-Agent. Es wird kein JavaScript ausgeführt. Zeit bis zum ersten Byte: 774 ms.
Was das nicht ist: Kein Rank- oder Zitat-Tracking, keine Aussage darüber, ob ein Modell dich tatsächlich nennt, und keine Prüfung von Inhalten, die erst per JavaScript nachgeladen werden. Eine Momentaufnahme aus Sicht einer Server-IP.