Italiano
citeglass · Controllo di visibilità IA

Controllato il 24/09/2026 · https://www.nytimes.com/

Ci sono 2 blocchi critici per la reperibilità da parte dell'IA — risolvili per primi.

F
1 / 100
2 critici · 5 da verificare
Dall'ultima scansione: Punteggio -37 · 2 risolti · 8 nuovi

Matrice dei crawler IA

Per ogni bot: cosa consente il tuo robots.txt — e cosa il tuo server restituisce davvero allo user agent del bot. Righe evidenziate in rosso: robots lo consente, ma il server lo blocca (di solito una regola di WAF o di protezione anti-bot).

BotGestorerobots.txtRisposta del server
GPTBotOpenAIbloccatobloccato (403 / WAF)
OAI-SearchBotOpenAIbloccatobloccato (403 / WAF)
ChatGPT-UserOpenAIbloccatobloccato (403 / WAF)
ClaudeBotAnthropicbloccatobloccato (403 / WAF)
Claude-SearchBotAnthropicbloccatobloccato (403 / WAF)
Claude-UserAnthropicbloccatobloccato (403 / WAF)
PerplexityBotPerplexitybloccatobloccato (403 / WAF)
Perplexity-UserPerplexitybloccatobloccato (403 / WAF)
Google-ExtendedGoogle (Gemini-Training)bloccato—
GooglebotGoogle (KI-Übersichten)consentitobloccato (403 / WAF)
CCBotCommon Crawl (Trainingsdaten vieler LLMs)bloccatobloccato (403 / WAF)
BytespiderByteDance (Doubao)bloccatobloccato (403 / WAF)
AmazonbotAmazon (Alexa/Rufus)consentitobloccato (403 / WAF)
Applebot-ExtendedApple (Intelligence-Training)bloccato—
Meta-ExternalAgentMeta (Llama/Meta AI)bloccatobloccato (403 / WAF)
Come si calcola il punteggio?
Bot di ricerca IA bloccati in robots.txt-32
Il server blocca bot che robots.txt consente-12
Pochissimo testo nell'HTML-10
Nessun dato strutturato (JSON-LD)-8
Titolo della pagina troppo corto o troppo lungo-6
Non esattamente un titolo H1-5
Meta description assente o inadeguata-5
Nessun llms.txt-5
Nessun segnale di autore-4
Nessun collegamento sameAs-3
Nessun link a note legali / chi siamo / contatti-3
Nessuna data visibile o marcata-3
Nessuna URL canonica-3
Risultato1 / 100

Accesso per i crawler IA

critico

Bot di ricerca IA bloccati in robots.txt

Il tuo robots.txt blocca 6 bot che recuperano contenuti per le risposte di assistenti IA e motori di ricerca: OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, PerplexityBot, Perplexity-User. Finché sono bloccati, il tuo sito non può comparire lì come fonte.

Ecco cosa dovresti fare: Verifica per ogni bot se il blocco è voluto. Se vuoi escludere solo l’addestramento dell’IA, blocca i bot di addestramento (GPTBot, ClaudeBot, Google-Extended) e consenti i bot di ricerca.

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Claude-User
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Perplexity-User
Allow: /
critico

Il server blocca bot che robots.txt consente

Per 2 bot di Google (KI-Übersichten), Amazon (Alexa/Rufus), robots.txt dice «consentito», ma il server risponde con un 403 o una pagina di protezione anti-bot. Di solito una regola di WAF, firewall o CDN che esclude il crawler aggirando robots.txt.

Ecco cosa dovresti fare: Aggiungi gli user agent e/o gli intervalli IP dei crawler IA desiderati a una lista di consentiti nel tuo WAF / Cloudflare / firewall. Verificali tramite DNS inverso, non solo tramite la stringa user agent.

nota

Addestramento IA escluso

Il tuo robots.txt blocca crawler che raccolgono contenuti per addestrare modelli linguistici: GPTBot, ClaudeBot, Google-Extended, CCBot, Applebot-Extended. Questo non impedisce le citazioni: i bot di ricerca e recupero come OAI-SearchBot, PerplexityBot e Googlebot per le AI Overviews sono separati.

Ecco cosa dovresti fare: Nulla da fare se l’esclusione è voluta. Assicurati solo che i bot di ricerca restino consentiti.

Contenuto senza JavaScript

da verificare

Pochissimo testo nell'HTML

L'HTML iniziale contiene solo circa 55 caratteri di testo visibile. È appena sufficiente perché i sistemi IA colgano con sicurezza l'argomento della pagina.

Ecco cosa dovresti fare: Assicurati che il contenuto effettivo sia interamente nell'HTML e non in immagini, iframe o blocchi caricati via JavaScript.

Struttura e comprensione automatica

da verificare

Nessun dato strutturato (JSON-LD)

La pagina non contiene JSON-LD. I dati strutturati aiutano i sistemi IA a riconoscere senza ambiguità entità, autore, organizzazione, data e tipo di pagina — senza di essi tutto va dedotto dal testo.

Ecco cosa dovresti fare: Aggiungi almeno uno schema «Organization» e uno adatto al tipo di pagina (Article, Product, FAQPage …) come JSON-LD nel <head>.

<script type="application/ld+json">
{"@context":"https://schema.org","@type":"Organization",
 "name":"La tua azienda","url":"https://il-tuo-dominio.it",
 "sameAs":["https://www.linkedin.com/company/…"]}
</script>
da verificare

Titolo della pagina troppo corto o troppo lungo

Il <title> è lungo 11 caratteri. Circa 30-60 caratteri sono sensati: abbastanza descrittivo da nominare l'argomento, abbastanza corto da non essere troncato.

Ecco cosa dovresti fare: Scrivi un titolo conciso che contenga l'argomento e, se pertinente, il marchio.

da verificare

Non esattamente un titolo H1

La pagina ha 0 titoli H1. Un H1 unico e inequivocabile indica a persone e macchine l'argomento principale della pagina.

Ecco cosa dovresti fare: Imposta esattamente un H1 che nomini l'argomento principale della pagina. Tutto il resto parte da H2.

da verificare

Meta description assente o inadeguata

La meta description è lunga 0 caratteri. È spesso la prima cosa che i sistemi IA e i motori di ricerca leggono come riassunto della pagina.

Ecco cosa dovresti fare: Scrivi un riassunto autonomo della pagina in una o due frasi (circa 120-200 caratteri), non una sequenza di parole chiave.

nota

Nessun llms.txt

Non c'è alcun file a /llms.txt. llms.txt è una breve panoramica in Markdown dei tuoi contenuti chiave che alcuni sistemi IA usano per orientarsi.

Ecco cosa dovresti fare: Crea un /llms.txt: un H1 con il nome, un breve paragrafo sull'offerta e un elenco di link alle pagine centrali.

# La tua azienda

> Descrizione in una frase.

## Pagine chiave
- [Prodotto](https://il-tuo-dominio.it/prodotto): …
- [Prezzi](https://il-tuo-dominio.it/prezzi): …
- [Chi siamo](https://il-tuo-dominio.it/chi-siamo): …

Segnali di fiducia e di entità (E-E-A-T)

nota

Nessun segnale di autore

Nessun autore è riconoscibile (né meta tag, né rel=author, né JSON-LD Person). Per «esperienza» e «competenza» in senso E-E-A-T conta una paternità nominata e verificabile.

Ecco cosa dovresti fare: Per i contenuti redazionali, indica un autore e collega una pagina autore; marcalo anche come JSON-LD «Person».

nota

Nessun collegamento sameAs

Nel JSON-LD manca «sameAs». Permette ai sistemi IA di associare chiaramente il tuo marchio o la tua persona a entità note (Wikidata, LinkedIn, directory di settore).

Ecco cosa dovresti fare: Aggiungi un «sameAs» in Organization o Person con le URL dei tuoi profili ufficiali e delle schede in directory.

nota

Nessun link a note legali / chi siamo / contatti

Sulla pagina controllata non è riconoscibile alcun link a note legali, a una pagina «Chi siamo» o ai contatti. Tali pagine sono un forte segnale di fiducia e aiutano l'associazione di entità.

Ecco cosa dovresti fare: Collega le note legali o «Chi siamo» e i contatti in modo visibile, di solito nel piè di pagina di ogni pagina.

nota

Nessuna data visibile o marcata

Nessuna data di pubblicazione o modifica è riconoscibile (né <time>, né article:published_time, né datePublished nel JSON-LD). Per molte domande i sistemi IA preferiscono fonti aggiornate.

Ecco cosa dovresti fare: Per i contenuti con un riferimento temporale, mostra una data in modo visibile e marca datePublished / dateModified nel JSON-LD.

Base tecnica

nota

Nessuna URL canonica

La pagina non imposta un <link rel="canonical">. Senza canonical può restare poco chiaro quale versione sia quella di riferimento quando esistono più varianti di URL.

Ecco cosa dovresti fare: Imposta un <link rel="canonical"> autoreferenziale con la URL preferita su ogni pagina.

Conforme (3)
  • La sitemap è raggiungibile.
  • Tempo di risposta del server rapido.
  • Nessun noindex — la pagina può essere indicizzata.

Prossimi passi

  1. Bot di ricerca IA bloccati in robots.txt. Verifica per ogni bot se il blocco è voluto. Se vuoi escludere solo l’addestramento dell’IA, blocca i bot di addestramento (GPTBot, ClaudeBot, Google-Extended) e consenti i bot di ricerca.
  2. Il server blocca bot che robots.txt consente. Aggiungi gli user agent e/o gli intervalli IP dei crawler IA desiderati a una lista di consentiti nel tuo WAF / Cloudflare / firewall. Verificali tramite DNS inverso, non solo tramite la stringa user agent.
  3. Pochissimo testo nell'HTML. Assicurati che il contenuto effettivo sia interamente nell'HTML e non in immagini, iframe o blocchi caricati via JavaScript.
Monitora questa pagina

Nuova scansione settimanale con avviso via e-mail a ogni cambiamento. In preparazione — inserisci il tuo indirizzo.

Metodo e limiti

Controllato il 24/09/2026. citeglass recupera nytimes.com e i file associati (robots.txt, llms.txt, sitemap.xml) via HTTP — una volta come browser normale, una volta per ogni user agent di crawler IA. Non viene eseguito JavaScript. Tempo al primo byte: 99 ms.

Cosa non è: Nessun monitoraggio di posizioni o citazioni, nessuna affermazione sul fatto che un modello ti nomini davvero, e nessun controllo di contenuti caricati via JavaScript. Un'istantanea dal punto di vista di un IP server.

Controlla un altro sito