Vérifié le 24/09/2026 · https://www.heise.de/
Il y a 1 blocages critiques pour la découvrabilité IA — corrigez-les en premier.
Matrice des robots IA
Pour chaque robot : ce que votre robots.txt autorise — et ce que votre serveur renvoie réellement à l'agent utilisateur du robot. Lignes en rouge : robots l'autorise, mais le serveur le bloque (généralement une règle de WAF ou de protection anti-robots).
| Robot | Opérateur | robots.txt | Réponse du serveur |
|---|---|---|---|
| GPTBot | OpenAI | autorisé | 200 + contenu |
| OAI-SearchBot | OpenAI | autorisé | 200 + contenu |
| ChatGPT-User | OpenAI | autorisé | 200 + contenu |
| ClaudeBot | Anthropic | autorisé | 200 + contenu |
| Claude-SearchBot | Anthropic | autorisé | 200 + contenu |
| Claude-User | Anthropic | autorisé | 200 + contenu |
| PerplexityBot | Perplexity | autorisé | 200 + contenu |
| Perplexity-User | Perplexity | autorisé | 200 + contenu |
| Google-Extended | Google (Gemini-Training) | bloqué | — |
| Googlebot | Google (KI-Übersichten) | autorisé (via User-agent: *) | 200 + contenu |
| CCBot | Common Crawl (Trainingsdaten vieler LLMs) | bloqué | 200 + contenu |
| Bytespider | ByteDance (Doubao) | bloqué | 200 + contenu |
| Amazonbot | Amazon (Alexa/Rufus) | bloqué | 200 + contenu |
| Applebot-Extended | Apple (Intelligence-Training) | bloqué | — |
| Meta-ExternalAgent | Meta (Llama/Meta AI) | bloqué | 200 + contenu |
Comment la note est-elle calculée ?
| Des robots de recherche IA sont bloqués dans robots.txt | -8 |
| Titre de page trop court ou trop long | -6 |
| Pas exactement un titre H1 | -5 |
| Aucun llms.txt | -5 |
| Aucun schéma Organization | -4 |
| Aucun signal d'auteur | -4 |
| Aucun lien sameAs | -3 |
| Aucun balisage FAQ ou HowTo | -2 |
| Résultat | 63 / 100 |
Accès pour les robots IA
Des robots de recherche IA sont bloqués dans robots.txt
Votre robots.txt bloque 1 robots qui récupèrent du contenu pour les réponses des assistants IA et des moteurs de recherche : Google-Extended. Tant qu’ils sont bloqués, votre site ne peut pas y apparaître comme source.
Voici ce que vous devriez faire : Vérifiez pour chaque robot si le blocage est voulu. Pour exclure seulement l’entraînement de l’IA, bloquez les robots d’entraînement (GPTBot, ClaudeBot, Google-Extended) et autorisez les robots de recherche.
Structure et compréhension machine
Titre de page trop court ou trop long
Le <title> fait 67 caractères. Environ 30 à 60 caractères sont raisonnables : assez descriptif pour nommer le sujet, assez court pour ne pas être tronqué.
Voici ce que vous devriez faire : Rédigez un titre concis contenant le sujet et, le cas échéant, la marque.
Pas exactement un titre H1
La page a 0 titres H1. Un H1 unique et sans ambiguïté indique aux humains et aux machines le sujet principal de la page.
Voici ce que vous devriez faire : Définissez exactement un H1 qui nomme le sujet principal de la page. Tout le reste commence à H2.
Aucun llms.txt
Il n'y a aucun fichier à /llms.txt. llms.txt est un court aperçu Markdown de vos contenus clés que certains systèmes IA utilisent pour s'orienter.
Voici ce que vous devriez faire : Créez un /llms.txt : un H1 avec le nom, un court paragraphe sur l'offre et une liste de liens vers les pages centrales.
# Votre entreprise > Description en une phrase. ## Pages clés - [Produit](https://votre-domaine.fr/produit) : … - [Tarifs](https://votre-domaine.fr/tarifs) : … - [À propos](https://votre-domaine.fr/a-propos) : …
Aucun schéma Organization
Il y a du JSON-LD, mais aucune entrée « Organization ». Les systèmes IA situent alors moins bien votre marque comme entité distincte et la relient moins bien à des sources externes.
Voici ce que vous devriez faire : Ajoutez un schéma « Organization » avec name, url, logo et sameAs (liens vers vos profils officiels).
Aucun balisage FAQ ou HowTo
Les contenus de type question-réponse et pas-à-pas sont plus difficiles à reconnaître comme réponses directement citables pour les systèmes IA sans balisage FAQPage ou HowTo.
Voici ce que vous devriez faire : Là où la page répond à de vraies questions ou donne des instructions, balisez-la en FAQPage ou HowTo (pas de balisage sans contenu visiblement correspondant).
Signaux de confiance et d'entité (E-E-A-T)
Aucun signal d'auteur
Aucun auteur n'est identifiable (ni méta-balise, ni rel=author, ni JSON-LD Person). Pour l'« expérience » et l'« expertise » au sens E-E-A-T, une paternité nommée et vérifiable compte.
Voici ce que vous devriez faire : Pour les contenus éditoriaux, nommez un auteur et liez une page auteur ; balisez-le aussi en JSON-LD « Person ».
Aucun lien sameAs
Le JSON-LD ne comporte pas de « sameAs ». Il permet aux systèmes IA de rattacher clairement votre marque ou personne à des entités connues (Wikidata, LinkedIn, annuaires professionnels).
Voici ce que vous devriez faire : Ajoutez un « sameAs » dans Organization ou Person avec les URL de vos profils officiels et fiches d'annuaire.
Conforme (6)
- Le contenu principal est dans le HTML sans JavaScript.
- Des données structurées (JSON-LD) sont présentes. — ItemList, Thing
- Une URL canonique est définie.
- Le sitemap est accessible.
- Temps de réponse du serveur rapide.
- Pas de noindex — la page peut être indexée.
Prochaines étapes
- Des robots de recherche IA sont bloqués dans robots.txt. Vérifiez pour chaque robot si le blocage est voulu. Pour exclure seulement l’entraînement de l’IA, bloquez les robots d’entraînement (GPTBot, ClaudeBot, Google-Extended) et autorisez les robots de recherche.
- Titre de page trop court ou trop long. Rédigez un titre concis contenant le sujet et, le cas échéant, la marque.
- Pas exactement un titre H1. Définissez exactement un H1 qui nomme le sujet principal de la page. Tout le reste commence à H2.
Nouvelle analyse hebdomadaire avec alerte e-mail à chaque changement. En préparation — inscrivez votre adresse.
Méthode et limites
Vérifié le 24/09/2026. citeglass récupère heise.de et ses fichiers associés (robots.txt, llms.txt, sitemap.xml) via HTTP — une fois comme navigateur normal, une fois par agent utilisateur de robot IA. Aucun JavaScript n'est exécuté. Temps jusqu'au premier octet : 65 ms.
Ce que ce n'est pas : Pas de suivi de position ni de citation, aucune affirmation sur le fait qu'un modèle vous nomme réellement, et aucun contrôle du contenu chargé via JavaScript. Un instantané du point de vue d'une seule IP serveur.