Home › Risorse › I crawler IA nel dettaglio
CCBot e Common Crawl
Common Crawl crea un archivio del web liberamente disponibile che confluisce nei dati di addestramento di numerosi modelli linguistici.
Perché CCBot è particolare
Se blocchi solo GPTBot e ClaudeBot, il tuo contenuto può comunque raggiungere i modelli tramite il dataset di Common Crawl. Chi rifiuta l'addestramento per principio deve considerare CCBot.
Bloccarlo
«User-agent: CCBot» seguito da «Disallow: /». Common Crawl rispetta il robots.txt al passaggio successivo; le voci d'archivio esistenti restano finché il dataset non viene raccolto di nuovo.
Il compromesso
Common Crawl è usato anche per ricerca, progetti di motori e archiviazione. Un blocco colpisce tutti questi scopi, non solo l'addestramento commerciale di IA.
Verificare la regola
citeglass mostra se il tuo robots.txt consente o blocca CCBot e se la regola è specifica per il bot o si applica solo tramite il blocco «User-agent: *».
Controlla il tuo sito
citeglass mostra in circa 30 secondi dove il tuo sito è illeggibile per i sistemi IA — gratis e senza registrazione.
Continua a leggere
Informazione generale, non consulenza legale. Il GEO è un campo giovane — le raccomandazioni possono cambiare.