Accueil › Ressources › Les robots d'IA en détail
CCBot et Common Crawl
Common Crawl constitue une archive du web librement disponible, qui alimente les données d'entraînement de nombreux modèles de langage.
Pourquoi CCBot est à part
Si vous ne bloquez que GPTBot et ClaudeBot, votre contenu peut quand même atteindre les modèles via le jeu de données Common Crawl. Qui refuse l'entraînement par principe doit tenir compte de CCBot.
Le bloquer
« User-agent: CCBot » suivi de « Disallow: / ». Common Crawl respecte robots.txt au prochain passage ; les entrées d'archive existantes demeurent jusqu'à une nouvelle collecte du jeu de données.
Le compromis
Common Crawl sert aussi à la recherche, à des projets de moteurs et à l'archivage. Un blocage touche tous ces usages, pas seulement l'entraînement commercial d'IA.
Vérifier la règle
citeglass indique si votre robots.txt autorise ou bloque CCBot et si la règle est spécifique au robot ou ne s'applique que via le bloc « User-agent: * ».
Vérifiez votre propre site
citeglass montre en 30 secondes environ où votre site est illisible pour les systèmes IA — gratuit et sans compte.
À lire aussi
Information générale, pas un conseil juridique. Le GEO est un domaine jeune — les recommandations peuvent évoluer.