Bloccare tutti i crawler IA
Chi vuole tenere i contenuti fuori dai sistemi di IA per principio ha bisogno di regole per ogni bot nominato: un carattere jolly non basta, perché molti bot lo ignorano o si aspettano blocchi propri.
L'elenco dei bot
Come minimo occorre considerare: GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, Claude-SearchBot, Claude-User, PerplexityBot, Perplexity-User, Google-Extended, CCBot, Bytespider, Amazonbot, Applebot-Extended, Meta-ExternalAgent. Un blocco dedicato per bot con «Disallow: /».
Cosa non può fare il robots.txt
Il robots.txt è una richiesta, non un obbligo. Bot come Bytespider o Perplexity sono stati criticati per averlo aggirato. Per blocchi netti, aggiungi regole WAF o firewall sugli user agent e, dove possibile, su intervalli di IP verificati.
Il prezzo
Un blocco completo ti esclude dalle risposte di IA con link alla fonte, cioè da una parte crescente della ricerca di informazioni. Per molti siti ha più senso la variante più mirata: bloccare l'addestramento, consentire la ricerca.
Verificare l'effetto
citeglass richiama la tua pagina con ciascuno di questi user agent e mostra in una matrice quale bot è bloccato secondo il robots.txt e se il tuo server applica davvero il blocco.
Controlla il tuo sito
citeglass mostra in circa 30 secondi dove il tuo sito è illeggibile per i sistemi IA — gratis e senza registrazione.
Continua a leggere
- Vietare l'addestramento, consentire la ricerca
- Guidare i crawler IA in robots.txt
- CCBot e Common Crawl
Informazione generale, non consulenza legale. Il GEO è un campo giovane — le raccomandazioni possono cambiare.