Controllato il 04/09/2026 · https://www.nytimes.com/
Ci sono 2 blocchi critici per la reperibilità da parte dell'IA — risolvili per primi.
Matrice dei crawler IA
Per ogni bot: cosa consente il tuo robots.txt — e cosa il tuo server restituisce davvero allo user agent del bot. Righe evidenziate in rosso: robots lo consente, ma il server lo blocca (di solito una regola di WAF o di protezione anti-bot).
| Bot | Gestore | robots.txt | Risposta del server |
|---|---|---|---|
| GPTBot | OpenAI | bloccato | bloccato (403 / WAF) |
| OAI-SearchBot | OpenAI | bloccato | bloccato (403 / WAF) |
| ChatGPT-User | OpenAI | bloccato | bloccato (403 / WAF) |
| ClaudeBot | Anthropic | bloccato | bloccato (403 / WAF) |
| Claude-SearchBot | Anthropic | bloccato | bloccato (403 / WAF) |
| Claude-User | Anthropic | bloccato | bloccato (403 / WAF) |
| PerplexityBot | Perplexity | bloccato | bloccato (403 / WAF) |
| Perplexity-User | Perplexity | bloccato | bloccato (403 / WAF) |
| Google-Extended | Google (Gemini-Training) | bloccato | — |
| Googlebot | Google (KI-Übersichten) | consentito | 200 + contenuto |
| CCBot | Common Crawl (Trainingsdaten vieler LLMs) | bloccato | bloccato (403 / WAF) |
| Bytespider | ByteDance (Doubao) | bloccato | bloccato (403 / WAF) |
| Amazonbot | Amazon (Alexa/Rufus) | consentito | bloccato (403 / WAF) |
| Applebot-Extended | Apple (Intelligence-Training) | bloccato | — |
| Meta-ExternalAgent | Meta (Llama/Meta AI) | bloccato | bloccato (403 / WAF) |
Come si calcola il punteggio?
| Crawler IA importanti sono bloccati in robots.txt | -32 |
| Il server blocca bot che robots.txt consente | -6 |
| Titolo della pagina troppo corto o troppo lungo | -6 |
| Nessun llms.txt | -5 |
| Nessuno schema Organization | -4 |
| Nessun segnale di autore | -4 |
| Nessuna data visibile o marcata | -3 |
| Nessun markup FAQ o HowTo | -2 |
| Risultato | 38 / 100 |
Accesso per i crawler IA
Crawler IA importanti sono bloccati in robots.txt
Il tuo robots.txt vieta l'accesso a 5 crawler IA centrali: GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended. Questi sistemi non possono quindi caricare i tuoi contenuti né usarli come fonte.
Ecco cosa dovresti fare: Verifica per ogni bot se il blocco è voluto. Per la visibilità IA dovrebbero essere consentiti almeno GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot e Google-Extended.
User-agent: GPTBot Allow: / User-agent: PerplexityBot Allow: /
Il server blocca bot che robots.txt consente
Per 1 bot di Amazon (Alexa/Rufus), robots.txt dice «consentito», ma il server risponde con un 403 o una pagina di protezione anti-bot. Di solito una regola di WAF, firewall o CDN che esclude il crawler aggirando robots.txt.
Ecco cosa dovresti fare: Aggiungi gli user agent e/o gli intervalli IP dei crawler IA desiderati a una lista di consentiti nel tuo WAF / Cloudflare / firewall. Verificali tramite DNS inverso, non solo tramite la stringa user agent.
Struttura e comprensione automatica
Titolo della pagina troppo corto o troppo lungo
Il <title> è lungo 66 caratteri. Circa 30-60 caratteri sono sensati: abbastanza descrittivo da nominare l'argomento, abbastanza corto da non essere troncato.
Ecco cosa dovresti fare: Scrivi un titolo conciso che contenga l'argomento e, se pertinente, il marchio.
Nessun llms.txt
Non c'è alcun file a /llms.txt. llms.txt è una breve panoramica in Markdown dei tuoi contenuti chiave che alcuni sistemi IA usano per orientarsi.
Ecco cosa dovresti fare: Crea un /llms.txt: un H1 con il nome, un breve paragrafo sull'offerta e un elenco di link alle pagine centrali.
# La tua azienda > Descrizione in una frase. ## Pagine chiave - [Prodotto](https://il-tuo-dominio.it/prodotto): … - [Prezzi](https://il-tuo-dominio.it/prezzi): … - [Chi siamo](https://il-tuo-dominio.it/chi-siamo): …
Nessuno schema Organization
C'è JSON-LD, ma nessuna voce «Organization». I sistemi IA collocano allora peggio il tuo marchio come entità distinta e lo collegano peggio a fonti esterne.
Ecco cosa dovresti fare: Aggiungi uno schema «Organization» con name, url, logo e sameAs (link ai tuoi profili ufficiali).
Nessun markup FAQ o HowTo
I contenuti in forma di domanda-risposta e passo-passo sono più difficili da riconoscere come risposte direttamente citabili per i sistemi IA senza markup FAQPage o HowTo.
Ecco cosa dovresti fare: Dove la pagina risponde a domande reali o dà istruzioni, marcala come FAQPage o HowTo (nessun markup senza contenuto visibilmente corrispondente).
Segnali di fiducia e di entità (E-E-A-T)
Nessun segnale di autore
Nessun autore è riconoscibile (né meta tag, né rel=author, né JSON-LD Person). Per «esperienza» e «competenza» in senso E-E-A-T conta una paternità nominata e verificabile.
Ecco cosa dovresti fare: Per i contenuti redazionali, indica un autore e collega una pagina autore; marcalo anche come JSON-LD «Person».
Nessuna data visibile o marcata
Nessuna data di pubblicazione o modifica è riconoscibile (né <time>, né article:published_time, né datePublished nel JSON-LD). Per molte domande i sistemi IA preferiscono fonti aggiornate.
Ecco cosa dovresti fare: Per i contenuti con un riferimento temporale, mostra una data in modo visibile e marca datePublished / dateModified nel JSON-LD.
Conforme (7)
- Il contenuto principale è nell'HTML senza JavaScript.
- Sono presenti dati strutturati (JSON-LD). — WebSite, NewsMediaOrganization
- Esattamente un titolo H1.
- È impostata una URL canonica.
- La sitemap è raggiungibile.
- Tempo di risposta del server rapido.
- Nessun noindex — la pagina può essere indicizzata.
Prossimi passi
- Crawler IA importanti sono bloccati in robots.txt. Verifica per ogni bot se il blocco è voluto. Per la visibilità IA dovrebbero essere consentiti almeno GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot e Google-Extended.
- Il server blocca bot che robots.txt consente. Aggiungi gli user agent e/o gli intervalli IP dei crawler IA desiderati a una lista di consentiti nel tuo WAF / Cloudflare / firewall. Verificali tramite DNS inverso, non solo tramite la stringa user agent.
- Titolo della pagina troppo corto o troppo lungo. Scrivi un titolo conciso che contenga l'argomento e, se pertinente, il marchio.
Nuova scansione settimanale con avviso via e-mail a ogni cambiamento. In preparazione — inserisci il tuo indirizzo.
Metodo e limiti
Controllato il 04/09/2026. citeglass recupera nytimes.com e i file associati (robots.txt, llms.txt, sitemap.xml) via HTTP — una volta come browser normale, una volta per ogni user agent di crawler IA. Non viene eseguito JavaScript. Tempo al primo byte: 235 ms.
Cosa non è: Nessun monitoraggio di posizioni o citazioni, nessuna affermazione sul fatto che un modello ti nomini davvero, e nessun controllo di contenuti caricati via JavaScript. Un'istantanea dal punto di vista di un IP server.