Italiano
citeglass · Controllo di visibilità IA

HomeRisorse › Fondamenti

Guidare i crawler IA in robots.txt

Ogni grande fornitore di IA gestisce i propri crawler con nomi user agent propri. Tramite robots.txt decidi, bot per bot, se può caricare i tuoi contenuti.

I principali crawler IA

OpenAI: GPTBot (addestramento), OAI-SearchBot (ricerca ChatGPT), ChatGPT-User (recupero su richiesta dell'utente). Anthropic: ClaudeBot, Claude-SearchBot, Claude-User. Perplexity: PerplexityBot, Perplexity-User. Google: Google-Extended (addestramento Gemini) — il recupero effettivo per le panoramiche IA passa dal Googlebot normale. Inoltre Common Crawl (CCBot), Amazonbot, Bytespider, Applebot-Extended e Meta-ExternalAgent.

Consentire in modo specifico

Per la massima visibilità IA, dai ai bot rilevanti un blocco proprio con «Allow: /». Importante: un blocco specifico per bot sostituisce completamente il blocco «User-agent: *» per quel bot — ripeti lì le regole disallow necessarie.

Escludere in modo specifico

Se rifiuti l'addestramento ma vuoi restare visibile nella ricerca IA, puoi bloccare GPTBot e Google-Extended e consentire OAI-SearchBot e Googlebot. È una decisione di contenuto, non puramente tecnica.

Perché robots.txt spesso non basta

Molti siti consentono i bot in robots.txt ma li bloccano a livello di server: una regola di WAF, un «Bot Fight Mode» di Cloudflare o un firewall respinge il crawler con un 403. Il bot rispetta robots.txt e comunque non entra. citeglass rende visibile questa discrepanza.

Verificare

Le liste di consentiti dovrebbero contenere bot verificati. OpenAI, Anthropic, Perplexity e Google pubblicano gli intervalli IP dei loro crawler; verifica inoltre tramite DNS inverso invece di fidarti solo della stringa user agent.

Controlla il tuo sito

citeglass mostra in circa 30 secondi dove il tuo sito è illeggibile per i sistemi IA — gratis e senza registrazione.

Continua a leggere

Informazione generale, non consulenza legale. Il GEO è un campo giovane — le raccomandazioni possono cambiare.