Controllato il 04/09/2026 · https://example.org/
Nessun blocco netto, ma 4 punti indeboliscono la reperibilità da parte dell'IA.
Matrice dei crawler IA
Per ogni bot: cosa consente il tuo robots.txt — e cosa il tuo server restituisce davvero allo user agent del bot. Righe evidenziate in rosso: robots lo consente, ma il server lo blocca (di solito una regola di WAF o di protezione anti-bot).
| Bot | Gestore | robots.txt | Risposta del server |
|---|---|---|---|
| GPTBot | OpenAI | non nominato | 200 + contenuto |
| OAI-SearchBot | OpenAI | non nominato | 200 + contenuto |
| ChatGPT-User | OpenAI | non nominato | 200 + contenuto |
| ClaudeBot | Anthropic | non nominato | 200 + contenuto |
| Claude-SearchBot | Anthropic | non nominato | 200 + contenuto |
| Claude-User | Anthropic | non nominato | 200 + contenuto |
| PerplexityBot | Perplexity | non nominato | 200 + contenuto |
| Perplexity-User | Perplexity | non nominato | 200 + contenuto |
| Google-Extended | Google (Gemini-Training) | non nominato | — |
| Googlebot | Google (KI-Übersichten) | non nominato | 200 + contenuto |
| CCBot | Common Crawl (Trainingsdaten vieler LLMs) | non nominato | 200 + contenuto |
| Bytespider | ByteDance (Doubao) | non nominato | 200 + contenuto |
| Amazonbot | Amazon (Alexa/Rufus) | non nominato | 200 + contenuto |
| Applebot-Extended | Apple (Intelligence-Training) | non nominato | — |
| Meta-ExternalAgent | Meta (Llama/Meta AI) | non nominato | 200 + contenuto |
Come si calcola il punteggio?
| Pochissimo testo nell'HTML | -10 |
| Nessun dato strutturato (JSON-LD) | -8 |
| Titolo della pagina troppo corto o troppo lungo | -6 |
| Meta description assente o inadeguata | -5 |
| Nessun llms.txt | -5 |
| Nessun segnale di autore | -4 |
| Nessun sitemap.xml trovato | -4 |
| Nessun collegamento sameAs | -3 |
| Nessun link a note legali / chi siamo / contatti | -3 |
| Nessuna data visibile o marcata | -3 |
| Nessuna URL canonica | -3 |
| Nessun robots.txt trovato | -2 |
| Risultato | 44 / 100 |
Accesso per i crawler IA
Nessun robots.txt trovato
Nessun file valido era raggiungibile a /robots.txt. I crawler assumono allora «tutto consentito» — funziona, ma non hai controllo né segnale di sitemap.
Ecco cosa dovresti fare: Crea un robots.txt nella radice, almeno con un riferimento alla sitemap e le regole allow/disallow desiderate.
User-agent: * Allow: / Sitemap: https://il-tuo-dominio.it/sitemap.xml
Contenuto senza JavaScript
Pochissimo testo nell'HTML
L'HTML iniziale contiene solo circa 142 caratteri di testo visibile. È appena sufficiente perché i sistemi IA colgano con sicurezza l'argomento della pagina.
Ecco cosa dovresti fare: Assicurati che il contenuto effettivo sia interamente nell'HTML e non in immagini, iframe o blocchi caricati via JavaScript.
Struttura e comprensione automatica
Nessun dato strutturato (JSON-LD)
La pagina non contiene JSON-LD. I dati strutturati aiutano i sistemi IA a riconoscere senza ambiguità entità, autore, organizzazione, data e tipo di pagina — senza di essi tutto va dedotto dal testo.
Ecco cosa dovresti fare: Aggiungi almeno uno schema «Organization» e uno adatto al tipo di pagina (Article, Product, FAQPage …) come JSON-LD nel <head>.
<script type="application/ld+json">
{"@context":"https://schema.org","@type":"Organization",
"name":"La tua azienda","url":"https://il-tuo-dominio.it",
"sameAs":["https://www.linkedin.com/company/…"]}
</script>Titolo della pagina troppo corto o troppo lungo
Il <title> è lungo 14 caratteri. Circa 30-60 caratteri sono sensati: abbastanza descrittivo da nominare l'argomento, abbastanza corto da non essere troncato.
Ecco cosa dovresti fare: Scrivi un titolo conciso che contenga l'argomento e, se pertinente, il marchio.
Meta description assente o inadeguata
La meta description è lunga 0 caratteri. È spesso la prima cosa che i sistemi IA e i motori di ricerca leggono come riassunto della pagina.
Ecco cosa dovresti fare: Scrivi un riassunto autonomo della pagina in una o due frasi (circa 120-200 caratteri), non una sequenza di parole chiave.
Nessun llms.txt
Non c'è alcun file a /llms.txt. llms.txt è una breve panoramica in Markdown dei tuoi contenuti chiave che alcuni sistemi IA usano per orientarsi.
Ecco cosa dovresti fare: Crea un /llms.txt: un H1 con il nome, un breve paragrafo sull'offerta e un elenco di link alle pagine centrali.
# La tua azienda > Descrizione in una frase. ## Pagine chiave - [Prodotto](https://il-tuo-dominio.it/prodotto): … - [Prezzi](https://il-tuo-dominio.it/prezzi): … - [Chi siamo](https://il-tuo-dominio.it/chi-siamo): …
Segnali di fiducia e di entità (E-E-A-T)
Nessun segnale di autore
Nessun autore è riconoscibile (né meta tag, né rel=author, né JSON-LD Person). Per «esperienza» e «competenza» in senso E-E-A-T conta una paternità nominata e verificabile.
Ecco cosa dovresti fare: Per i contenuti redazionali, indica un autore e collega una pagina autore; marcalo anche come JSON-LD «Person».
Nessun collegamento sameAs
Nel JSON-LD manca «sameAs». Permette ai sistemi IA di associare chiaramente il tuo marchio o la tua persona a entità note (Wikidata, LinkedIn, directory di settore).
Ecco cosa dovresti fare: Aggiungi un «sameAs» in Organization o Person con le URL dei tuoi profili ufficiali e delle schede in directory.
Nessun link a note legali / chi siamo / contatti
Sulla pagina controllata non è riconoscibile alcun link a note legali, a una pagina «Chi siamo» o ai contatti. Tali pagine sono un forte segnale di fiducia e aiutano l'associazione di entità.
Ecco cosa dovresti fare: Collega le note legali o «Chi siamo» e i contatti in modo visibile, di solito nel piè di pagina di ogni pagina.
Nessuna data visibile o marcata
Nessuna data di pubblicazione o modifica è riconoscibile (né <time>, né article:published_time, né datePublished nel JSON-LD). Per molte domande i sistemi IA preferiscono fonti aggiornate.
Ecco cosa dovresti fare: Per i contenuti con un riferimento temporale, mostra una data in modo visibile e marca datePublished / dateModified nel JSON-LD.
Base tecnica
Nessun sitemap.xml trovato
Nessuna sitemap XML valida era raggiungibile a /sitemap.xml e robots.txt non ne nomina alcuna. Una sitemap aiuta i crawler a trovare tutte le URL rilevanti.
Ecco cosa dovresti fare: Genera una sitemap.xml con tutte le URL indicizzabili e falla riferire in robots.txt.
Nessuna URL canonica
La pagina non imposta un <link rel="canonical">. Senza canonical può restare poco chiaro quale versione sia quella di riferimento quando esistono più varianti di URL.
Ecco cosa dovresti fare: Imposta un <link rel="canonical"> autoreferenziale con la URL preferita su ogni pagina.
Conforme (2)
- Esattamente un titolo H1.
- Tempo di risposta del server rapido.
Prossimi passi
- Pochissimo testo nell'HTML. Assicurati che il contenuto effettivo sia interamente nell'HTML e non in immagini, iframe o blocchi caricati via JavaScript.
- Nessun dato strutturato (JSON-LD). Aggiungi almeno uno schema «Organization» e uno adatto al tipo di pagina (Article, Product, FAQPage …) come JSON-LD nel <head>.
- Titolo della pagina troppo corto o troppo lungo. Scrivi un titolo conciso che contenga l'argomento e, se pertinente, il marchio.
Nuova scansione settimanale con avviso via e-mail a ogni cambiamento. In preparazione — inserisci il tuo indirizzo.
Metodo e limiti
Controllato il 04/09/2026. citeglass recupera example.org e i file associati (robots.txt, llms.txt, sitemap.xml) via HTTP — una volta come browser normale, una volta per ogni user agent di crawler IA. Non viene eseguito JavaScript. Tempo al primo byte: 21 ms.
Cosa non è: Nessun monitoraggio di posizioni o citazioni, nessuna affermazione sul fatto che un modello ti nomini davvero, e nessun controllo di contenuti caricati via JavaScript. Un'istantanea dal punto di vista di un IP server.