Vietare l'addestramento, consentire la ricerca
La maggior parte dei fornitori separa il crawler di addestramento da quello di ricerca. Così puoi uscire dall'addestramento del modello e comparire comunque come fonte citata.
Bloccare i bot di addestramento
Disallow per: GPTBot (OpenAI), ClaudeBot (Anthropic), CCBot (Common Crawl), più i token Google-Extended e Applebot-Extended. In opzione Meta-ExternalAgent se vuoi uscire anche dall'addestramento di Llama.
Consentire i bot di ricerca
Allow per: OAI-SearchBot e ChatGPT-User (ricerca di ChatGPT), Claude-SearchBot e Claude-User (Claude), PerplexityBot e Perplexity-User (Perplexity), Googlebot (Ricerca Google e panoramiche IA).
Zone grigie
Non tutti i fornitori separano in modo netto: Common Crawl non ha ricerca, Bytespider mescola le due cose. E un estratto può finire in una panoramica IA anche se hai vietato l'addestramento: questo segue l'indicizzazione della ricerca.
Verificare la configurazione
citeglass mostra separatamente, per ogni bot, la regola del robots.txt applicabile e la risposta reale del server, così vedi a colpo d'occhio se la separazione «addestramento no, ricerca sì» tiene davvero.
Controlla il tuo sito
citeglass mostra in circa 30 secondi dove il tuo sito è illeggibile per i sistemi IA — gratis e senza registrazione.
Continua a leggere
Informazione generale, non consulenza legale. Il GEO è un campo giovane — le raccomandazioni possono cambiare.