Français
citeglass · Contrôle de visibilité IA

Vérifié le 24/09/2026 · https://www.nytimes.com/

Il y a 2 blocages critiques pour la découvrabilité IA — corrigez-les en premier.

F
1 / 100
2 critiques · 5 à vérifier
Depuis la dernière analyse : Score -37 · 2 corrigés · 8 nouveaux

Matrice des robots IA

Pour chaque robot : ce que votre robots.txt autorise — et ce que votre serveur renvoie réellement à l'agent utilisateur du robot. Lignes en rouge : robots l'autorise, mais le serveur le bloque (généralement une règle de WAF ou de protection anti-robots).

RobotOpérateurrobots.txtRéponse du serveur
GPTBotOpenAIbloquébloqué (403 / WAF)
OAI-SearchBotOpenAIbloquébloqué (403 / WAF)
ChatGPT-UserOpenAIbloquébloqué (403 / WAF)
ClaudeBotAnthropicbloquébloqué (403 / WAF)
Claude-SearchBotAnthropicbloquébloqué (403 / WAF)
Claude-UserAnthropicbloquébloqué (403 / WAF)
PerplexityBotPerplexitybloquébloqué (403 / WAF)
Perplexity-UserPerplexitybloquébloqué (403 / WAF)
Google-ExtendedGoogle (Gemini-Training)bloqué—
GooglebotGoogle (KI-Übersichten)autorisébloqué (403 / WAF)
CCBotCommon Crawl (Trainingsdaten vieler LLMs)bloquébloqué (403 / WAF)
BytespiderByteDance (Doubao)bloquébloqué (403 / WAF)
AmazonbotAmazon (Alexa/Rufus)autorisébloqué (403 / WAF)
Applebot-ExtendedApple (Intelligence-Training)bloqué—
Meta-ExternalAgentMeta (Llama/Meta AI)bloquébloqué (403 / WAF)
Comment la note est-elle calculée ?
Des robots de recherche IA sont bloqués dans robots.txt-32
Le serveur bloque des robots que robots.txt autorise-12
Très peu de texte dans le HTML-10
Aucune donnée structurée (JSON-LD)-8
Titre de page trop court ou trop long-6
Pas exactement un titre H1-5
Méta-description absente ou inadaptée-5
Aucun llms.txt-5
Aucun signal d'auteur-4
Aucun lien sameAs-3
Aucun lien vers mentions légales / à propos / contact-3
Aucune date visible ou balisée-3
Aucune URL canonique-3
Résultat1 / 100

Accès pour les robots IA

critique

Des robots de recherche IA sont bloqués dans robots.txt

Votre robots.txt bloque 6 robots qui récupèrent du contenu pour les réponses des assistants IA et des moteurs de recherche : OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, PerplexityBot, Perplexity-User. Tant qu’ils sont bloqués, votre site ne peut pas y apparaître comme source.

Voici ce que vous devriez faire : Vérifiez pour chaque robot si le blocage est voulu. Pour exclure seulement l’entraînement de l’IA, bloquez les robots d’entraînement (GPTBot, ClaudeBot, Google-Extended) et autorisez les robots de recherche.

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Claude-User
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Perplexity-User
Allow: /
critique

Le serveur bloque des robots que robots.txt autorise

Pour 2 robot(s) de Google (KI-Übersichten), Amazon (Alexa/Rufus), robots.txt dit « autorisé », mais le serveur répond par un 403 ou une page de protection anti-robots. Généralement une règle de WAF, de pare-feu ou de CDN qui exclut le robot en contournant robots.txt.

Voici ce que vous devriez faire : Ajoutez les agents utilisateurs et/ou plages IP des robots IA souhaités à une liste d'autorisation dans votre WAF / Cloudflare / pare-feu. Vérifiez-les par résolution DNS inverse, pas seulement par la chaîne d'agent utilisateur.

remarque

Entraînement IA exclu

Votre robots.txt bloque des robots qui collectent du contenu pour entraîner des modèles de langage : GPTBot, ClaudeBot, Google-Extended, CCBot, Applebot-Extended. Cela n’empêche pas les citations — les robots de recherche et de récupération comme OAI-SearchBot, PerplexityBot et Googlebot pour les AI Overviews sont distincts.

Voici ce que vous devriez faire : Rien à faire si l’exclusion est voulue. Veillez seulement à ce que les robots de recherche restent autorisés.

Contenu sans JavaScript

à vérifier

Très peu de texte dans le HTML

Le HTML initial ne contient qu'environ 55 caractères de texte visible. C'est à peine suffisant pour que les systèmes IA saisissent le sujet de la page avec certitude.

Voici ce que vous devriez faire : Assurez-vous que le contenu réel figure entièrement dans le HTML et non dans des images, des iframes ou des blocs chargés via JavaScript.

Structure et compréhension machine

à vérifier

Aucune donnée structurée (JSON-LD)

La page ne contient aucun JSON-LD. Les données structurées aident les systèmes IA à reconnaître sans ambiguïté les entités, l'auteur, l'organisation, la date et le type de page — sans elles, tout doit être deviné à partir du texte.

Voici ce que vous devriez faire : Ajoutez au moins un schéma « Organization » et un schéma adapté au type de page (Article, Product, FAQPage …) en JSON-LD dans le <head>.

<script type="application/ld+json">
{"@context":"https://schema.org","@type":"Organization",
 "name":"Votre entreprise","url":"https://votre-domaine.fr",
 "sameAs":["https://www.linkedin.com/company/…"]}
</script>
à vérifier

Titre de page trop court ou trop long

Le <title> fait 11 caractères. Environ 30 à 60 caractères sont raisonnables : assez descriptif pour nommer le sujet, assez court pour ne pas être tronqué.

Voici ce que vous devriez faire : Rédigez un titre concis contenant le sujet et, le cas échéant, la marque.

à vérifier

Pas exactement un titre H1

La page a 0 titres H1. Un H1 unique et sans ambiguïté indique aux humains et aux machines le sujet principal de la page.

Voici ce que vous devriez faire : Définissez exactement un H1 qui nomme le sujet principal de la page. Tout le reste commence à H2.

à vérifier

Méta-description absente ou inadaptée

La méta-description fait 0 caractères. C'est souvent la première chose que les systèmes IA et les moteurs de recherche lisent comme résumé de la page.

Voici ce que vous devriez faire : Rédigez un résumé autonome de la page en une ou deux phrases (environ 120 à 200 caractères), pas une suite de mots-clés.

remarque

Aucun llms.txt

Il n'y a aucun fichier à /llms.txt. llms.txt est un court aperçu Markdown de vos contenus clés que certains systèmes IA utilisent pour s'orienter.

Voici ce que vous devriez faire : Créez un /llms.txt : un H1 avec le nom, un court paragraphe sur l'offre et une liste de liens vers les pages centrales.

# Votre entreprise

> Description en une phrase.

## Pages clés
- [Produit](https://votre-domaine.fr/produit) : …
- [Tarifs](https://votre-domaine.fr/tarifs) : …
- [À propos](https://votre-domaine.fr/a-propos) : …

Signaux de confiance et d'entité (E-E-A-T)

remarque

Aucun signal d'auteur

Aucun auteur n'est identifiable (ni méta-balise, ni rel=author, ni JSON-LD Person). Pour l'« expérience » et l'« expertise » au sens E-E-A-T, une paternité nommée et vérifiable compte.

Voici ce que vous devriez faire : Pour les contenus éditoriaux, nommez un auteur et liez une page auteur ; balisez-le aussi en JSON-LD « Person ».

remarque

Aucun lien sameAs

Le JSON-LD ne comporte pas de « sameAs ». Il permet aux systèmes IA de rattacher clairement votre marque ou personne à des entités connues (Wikidata, LinkedIn, annuaires professionnels).

Voici ce que vous devriez faire : Ajoutez un « sameAs » dans Organization ou Person avec les URL de vos profils officiels et fiches d'annuaire.

remarque

Aucun lien vers mentions légales / à propos / contact

Aucun lien vers des mentions légales, une page « À propos » ou un contact n'est identifiable sur la page contrôlée. Ces pages sont un fort signal de confiance et aident au rattachement d'entité.

Voici ce que vous devriez faire : Liez les mentions légales ou « À propos » et le contact de façon visible, généralement dans le pied de page de chaque page.

remarque

Aucune date visible ou balisée

Aucune date de publication ou de modification n'est identifiable (ni <time>, ni article:published_time, ni datePublished dans le JSON-LD). Pour de nombreuses questions, les systèmes IA privilégient les sources récentes.

Voici ce que vous devriez faire : Pour les contenus datés, affichez une date visiblement et balisez datePublished / dateModified dans le JSON-LD.

Base technique

remarque

Aucune URL canonique

La page ne définit pas de <link rel="canonical">. Sans canonical, il peut rester ambigu de savoir quelle version fait autorité lorsque plusieurs variantes d'URL existent.

Voici ce que vous devriez faire : Définissez un <link rel="canonical"> autoréférent avec l'URL préférée sur chaque page.

Conforme (3)
  • Le sitemap est accessible.
  • Temps de réponse du serveur rapide.
  • Pas de noindex — la page peut être indexée.

Prochaines étapes

  1. Des robots de recherche IA sont bloqués dans robots.txt. Vérifiez pour chaque robot si le blocage est voulu. Pour exclure seulement l’entraînement de l’IA, bloquez les robots d’entraînement (GPTBot, ClaudeBot, Google-Extended) et autorisez les robots de recherche.
  2. Le serveur bloque des robots que robots.txt autorise. Ajoutez les agents utilisateurs et/ou plages IP des robots IA souhaités à une liste d'autorisation dans votre WAF / Cloudflare / pare-feu. Vérifiez-les par résolution DNS inverse, pas seulement par la chaîne d'agent utilisateur.
  3. Très peu de texte dans le HTML. Assurez-vous que le contenu réel figure entièrement dans le HTML et non dans des images, des iframes ou des blocs chargés via JavaScript.
Surveiller cette page

Nouvelle analyse hebdomadaire avec alerte e-mail à chaque changement. En préparation — inscrivez votre adresse.

Méthode et limites

Vérifié le 24/09/2026. citeglass récupère nytimes.com et ses fichiers associés (robots.txt, llms.txt, sitemap.xml) via HTTP — une fois comme navigateur normal, une fois par agent utilisateur de robot IA. Aucun JavaScript n'est exécuté. Temps jusqu'au premier octet : 99 ms.

Ce que ce n'est pas : Pas de suivi de position ni de citation, aucune affirmation sur le fait qu'un modèle vous nomme réellement, et aucun contrôle du contenu chargé via JavaScript. Un instantané du point de vue d'une seule IP serveur.

Vérifier un autre site