Vérifié le 04/09/2026 · https://www.nytimes.com/
Il y a 2 blocages critiques pour la découvrabilité IA — corrigez-les en premier.
Matrice des robots IA
Pour chaque robot : ce que votre robots.txt autorise — et ce que votre serveur renvoie réellement à l'agent utilisateur du robot. Lignes en rouge : robots l'autorise, mais le serveur le bloque (généralement une règle de WAF ou de protection anti-robots).
| Robot | Opérateur | robots.txt | Réponse du serveur |
|---|---|---|---|
| GPTBot | OpenAI | bloqué | bloqué (403 / WAF) |
| OAI-SearchBot | OpenAI | bloqué | bloqué (403 / WAF) |
| ChatGPT-User | OpenAI | bloqué | bloqué (403 / WAF) |
| ClaudeBot | Anthropic | bloqué | bloqué (403 / WAF) |
| Claude-SearchBot | Anthropic | bloqué | bloqué (403 / WAF) |
| Claude-User | Anthropic | bloqué | bloqué (403 / WAF) |
| PerplexityBot | Perplexity | bloqué | bloqué (403 / WAF) |
| Perplexity-User | Perplexity | bloqué | bloqué (403 / WAF) |
| Google-Extended | Google (Gemini-Training) | bloqué | — |
| Googlebot | Google (KI-Übersichten) | autorisé | 200 + contenu |
| CCBot | Common Crawl (Trainingsdaten vieler LLMs) | bloqué | bloqué (403 / WAF) |
| Bytespider | ByteDance (Doubao) | bloqué | bloqué (403 / WAF) |
| Amazonbot | Amazon (Alexa/Rufus) | autorisé | bloqué (403 / WAF) |
| Applebot-Extended | Apple (Intelligence-Training) | bloqué | — |
| Meta-ExternalAgent | Meta (Llama/Meta AI) | bloqué | bloqué (403 / WAF) |
Comment la note est-elle calculée ?
| Des robots IA majeurs sont bloqués dans robots.txt | -32 |
| Le serveur bloque des robots que robots.txt autorise | -6 |
| Titre de page trop court ou trop long | -6 |
| Aucun llms.txt | -5 |
| Aucun schéma Organization | -4 |
| Aucun signal d'auteur | -4 |
| Aucune date visible ou balisée | -3 |
| Aucun balisage FAQ ou HowTo | -2 |
| Résultat | 38 / 100 |
Accès pour les robots IA
Des robots IA majeurs sont bloqués dans robots.txt
Votre robots.txt interdit l'accès à 5 robots IA centraux : GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended. Ces systèmes ne peuvent alors pas charger votre contenu ni l'utiliser comme source.
Voici ce que vous devriez faire : Vérifiez robot par robot si le blocage est voulu. Pour la visibilité IA, au moins GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot et Google-Extended devraient être autorisés.
User-agent: GPTBot Allow: / User-agent: PerplexityBot Allow: /
Le serveur bloque des robots que robots.txt autorise
Pour 1 robot(s) de Amazon (Alexa/Rufus), robots.txt dit « autorisé », mais le serveur répond par un 403 ou une page de protection anti-robots. Généralement une règle de WAF, de pare-feu ou de CDN qui exclut le robot en contournant robots.txt.
Voici ce que vous devriez faire : Ajoutez les agents utilisateurs et/ou plages IP des robots IA souhaités à une liste d'autorisation dans votre WAF / Cloudflare / pare-feu. Vérifiez-les par résolution DNS inverse, pas seulement par la chaîne d'agent utilisateur.
Structure et compréhension machine
Titre de page trop court ou trop long
Le <title> fait 66 caractères. Environ 30 à 60 caractères sont raisonnables : assez descriptif pour nommer le sujet, assez court pour ne pas être tronqué.
Voici ce que vous devriez faire : Rédigez un titre concis contenant le sujet et, le cas échéant, la marque.
Aucun llms.txt
Il n'y a aucun fichier à /llms.txt. llms.txt est un court aperçu Markdown de vos contenus clés que certains systèmes IA utilisent pour s'orienter.
Voici ce que vous devriez faire : Créez un /llms.txt : un H1 avec le nom, un court paragraphe sur l'offre et une liste de liens vers les pages centrales.
# Votre entreprise > Description en une phrase. ## Pages clés - [Produit](https://votre-domaine.fr/produit) : … - [Tarifs](https://votre-domaine.fr/tarifs) : … - [À propos](https://votre-domaine.fr/a-propos) : …
Aucun schéma Organization
Il y a du JSON-LD, mais aucune entrée « Organization ». Les systèmes IA situent alors moins bien votre marque comme entité distincte et la relient moins bien à des sources externes.
Voici ce que vous devriez faire : Ajoutez un schéma « Organization » avec name, url, logo et sameAs (liens vers vos profils officiels).
Aucun balisage FAQ ou HowTo
Les contenus de type question-réponse et pas-à-pas sont plus difficiles à reconnaître comme réponses directement citables pour les systèmes IA sans balisage FAQPage ou HowTo.
Voici ce que vous devriez faire : Là où la page répond à de vraies questions ou donne des instructions, balisez-la en FAQPage ou HowTo (pas de balisage sans contenu visiblement correspondant).
Signaux de confiance et d'entité (E-E-A-T)
Aucun signal d'auteur
Aucun auteur n'est identifiable (ni méta-balise, ni rel=author, ni JSON-LD Person). Pour l'« expérience » et l'« expertise » au sens E-E-A-T, une paternité nommée et vérifiable compte.
Voici ce que vous devriez faire : Pour les contenus éditoriaux, nommez un auteur et liez une page auteur ; balisez-le aussi en JSON-LD « Person ».
Aucune date visible ou balisée
Aucune date de publication ou de modification n'est identifiable (ni <time>, ni article:published_time, ni datePublished dans le JSON-LD). Pour de nombreuses questions, les systèmes IA privilégient les sources récentes.
Voici ce que vous devriez faire : Pour les contenus datés, affichez une date visiblement et balisez datePublished / dateModified dans le JSON-LD.
Conforme (7)
- Le contenu principal est dans le HTML sans JavaScript.
- Des données structurées (JSON-LD) sont présentes. — WebSite, NewsMediaOrganization
- Exactement un titre H1.
- Une URL canonique est définie.
- Le sitemap est accessible.
- Temps de réponse du serveur rapide.
- Pas de noindex — la page peut être indexée.
Prochaines étapes
- Des robots IA majeurs sont bloqués dans robots.txt. Vérifiez robot par robot si le blocage est voulu. Pour la visibilité IA, au moins GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot et Google-Extended devraient être autorisés.
- Le serveur bloque des robots que robots.txt autorise. Ajoutez les agents utilisateurs et/ou plages IP des robots IA souhaités à une liste d'autorisation dans votre WAF / Cloudflare / pare-feu. Vérifiez-les par résolution DNS inverse, pas seulement par la chaîne d'agent utilisateur.
- Titre de page trop court ou trop long. Rédigez un titre concis contenant le sujet et, le cas échéant, la marque.
Nouvelle analyse hebdomadaire avec alerte e-mail à chaque changement. En préparation — inscrivez votre adresse.
Méthode et limites
Vérifié le 04/09/2026. citeglass récupère nytimes.com et ses fichiers associés (robots.txt, llms.txt, sitemap.xml) via HTTP — une fois comme navigateur normal, une fois par agent utilisateur de robot IA. Aucun JavaScript n'est exécuté. Temps jusqu'au premier octet : 235 ms.
Ce que ce n'est pas : Pas de suivi de position ni de citation, aucune affirmation sur le fait qu'un modèle vous nomme réellement, et aucun contrôle du contenu chargé via JavaScript. Un instantané du point de vue d'une seule IP serveur.