Italiano
citeglass · Controllo di visibilità IA

Controllato il 04/09/2026 · https://www.nytimes.com/

Ci sono 2 blocchi critici per la reperibilità da parte dell'IA — risolvili per primi.

F
38 / 100
2 critici · 1 da verificare

Matrice dei crawler IA

Per ogni bot: cosa consente il tuo robots.txt — e cosa il tuo server restituisce davvero allo user agent del bot. Righe evidenziate in rosso: robots lo consente, ma il server lo blocca (di solito una regola di WAF o di protezione anti-bot).

BotGestorerobots.txtRisposta del server
GPTBotOpenAIbloccatobloccato (403 / WAF)
OAI-SearchBotOpenAIbloccatobloccato (403 / WAF)
ChatGPT-UserOpenAIbloccatobloccato (403 / WAF)
ClaudeBotAnthropicbloccatobloccato (403 / WAF)
Claude-SearchBotAnthropicbloccatobloccato (403 / WAF)
Claude-UserAnthropicbloccatobloccato (403 / WAF)
PerplexityBotPerplexitybloccatobloccato (403 / WAF)
Perplexity-UserPerplexitybloccatobloccato (403 / WAF)
Google-ExtendedGoogle (Gemini-Training)bloccato
GooglebotGoogle (KI-Übersichten)consentito200 + contenuto
CCBotCommon Crawl (Trainingsdaten vieler LLMs)bloccatobloccato (403 / WAF)
BytespiderByteDance (Doubao)bloccatobloccato (403 / WAF)
AmazonbotAmazon (Alexa/Rufus)consentitobloccato (403 / WAF)
Applebot-ExtendedApple (Intelligence-Training)bloccato
Meta-ExternalAgentMeta (Llama/Meta AI)bloccatobloccato (403 / WAF)
Come si calcola il punteggio?
Crawler IA importanti sono bloccati in robots.txt-32
Il server blocca bot che robots.txt consente-6
Titolo della pagina troppo corto o troppo lungo-6
Nessun llms.txt-5
Nessuno schema Organization-4
Nessun segnale di autore-4
Nessuna data visibile o marcata-3
Nessun markup FAQ o HowTo-2
Risultato38 / 100

Accesso per i crawler IA

critico

Crawler IA importanti sono bloccati in robots.txt

Il tuo robots.txt vieta l'accesso a 5 crawler IA centrali: GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended. Questi sistemi non possono quindi caricare i tuoi contenuti né usarli come fonte.

Ecco cosa dovresti fare: Verifica per ogni bot se il blocco è voluto. Per la visibilità IA dovrebbero essere consentiti almeno GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot e Google-Extended.

User-agent: GPTBot
Allow: /

User-agent: PerplexityBot
Allow: /
critico

Il server blocca bot che robots.txt consente

Per 1 bot di Amazon (Alexa/Rufus), robots.txt dice «consentito», ma il server risponde con un 403 o una pagina di protezione anti-bot. Di solito una regola di WAF, firewall o CDN che esclude il crawler aggirando robots.txt.

Ecco cosa dovresti fare: Aggiungi gli user agent e/o gli intervalli IP dei crawler IA desiderati a una lista di consentiti nel tuo WAF / Cloudflare / firewall. Verificali tramite DNS inverso, non solo tramite la stringa user agent.

Struttura e comprensione automatica

da verificare

Titolo della pagina troppo corto o troppo lungo

Il <title> è lungo 66 caratteri. Circa 30-60 caratteri sono sensati: abbastanza descrittivo da nominare l'argomento, abbastanza corto da non essere troncato.

Ecco cosa dovresti fare: Scrivi un titolo conciso che contenga l'argomento e, se pertinente, il marchio.

nota

Nessun llms.txt

Non c'è alcun file a /llms.txt. llms.txt è una breve panoramica in Markdown dei tuoi contenuti chiave che alcuni sistemi IA usano per orientarsi.

Ecco cosa dovresti fare: Crea un /llms.txt: un H1 con il nome, un breve paragrafo sull'offerta e un elenco di link alle pagine centrali.

# La tua azienda

> Descrizione in una frase.

## Pagine chiave
- [Prodotto](https://il-tuo-dominio.it/prodotto): …
- [Prezzi](https://il-tuo-dominio.it/prezzi): …
- [Chi siamo](https://il-tuo-dominio.it/chi-siamo): …
nota

Nessuno schema Organization

C'è JSON-LD, ma nessuna voce «Organization». I sistemi IA collocano allora peggio il tuo marchio come entità distinta e lo collegano peggio a fonti esterne.

Ecco cosa dovresti fare: Aggiungi uno schema «Organization» con name, url, logo e sameAs (link ai tuoi profili ufficiali).

nota

Nessun markup FAQ o HowTo

I contenuti in forma di domanda-risposta e passo-passo sono più difficili da riconoscere come risposte direttamente citabili per i sistemi IA senza markup FAQPage o HowTo.

Ecco cosa dovresti fare: Dove la pagina risponde a domande reali o dà istruzioni, marcala come FAQPage o HowTo (nessun markup senza contenuto visibilmente corrispondente).

Segnali di fiducia e di entità (E-E-A-T)

nota

Nessun segnale di autore

Nessun autore è riconoscibile (né meta tag, né rel=author, né JSON-LD Person). Per «esperienza» e «competenza» in senso E-E-A-T conta una paternità nominata e verificabile.

Ecco cosa dovresti fare: Per i contenuti redazionali, indica un autore e collega una pagina autore; marcalo anche come JSON-LD «Person».

nota

Nessuna data visibile o marcata

Nessuna data di pubblicazione o modifica è riconoscibile (né <time>, né article:published_time, né datePublished nel JSON-LD). Per molte domande i sistemi IA preferiscono fonti aggiornate.

Ecco cosa dovresti fare: Per i contenuti con un riferimento temporale, mostra una data in modo visibile e marca datePublished / dateModified nel JSON-LD.

Conforme (7)
  • Il contenuto principale è nell'HTML senza JavaScript.
  • Sono presenti dati strutturati (JSON-LD). — WebSite, NewsMediaOrganization
  • Esattamente un titolo H1.
  • È impostata una URL canonica.
  • La sitemap è raggiungibile.
  • Tempo di risposta del server rapido.
  • Nessun noindex — la pagina può essere indicizzata.

Prossimi passi

  1. Crawler IA importanti sono bloccati in robots.txt. Verifica per ogni bot se il blocco è voluto. Per la visibilità IA dovrebbero essere consentiti almeno GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot e Google-Extended.
  2. Il server blocca bot che robots.txt consente. Aggiungi gli user agent e/o gli intervalli IP dei crawler IA desiderati a una lista di consentiti nel tuo WAF / Cloudflare / firewall. Verificali tramite DNS inverso, non solo tramite la stringa user agent.
  3. Titolo della pagina troppo corto o troppo lungo. Scrivi un titolo conciso che contenga l'argomento e, se pertinente, il marchio.
Monitora questa pagina

Nuova scansione settimanale con avviso via e-mail a ogni cambiamento. In preparazione — inserisci il tuo indirizzo.

Metodo e limiti

Controllato il 04/09/2026. citeglass recupera nytimes.com e i file associati (robots.txt, llms.txt, sitemap.xml) via HTTP — una volta come browser normale, una volta per ogni user agent di crawler IA. Non viene eseguito JavaScript. Tempo al primo byte: 235 ms.

Cosa non è: Nessun monitoraggio di posizioni o citazioni, nessuna affermazione sul fatto che un modello ti nomini davvero, e nessun controllo di contenuti caricati via JavaScript. Un'istantanea dal punto di vista di un IP server.

Controlla un altro sito