Français
citeglass · Contrôle de visibilité IA

AccueilRessources › Les robots d'IA en détail

CCBot et Common Crawl

Common Crawl constitue une archive du web librement disponible, qui alimente les données d'entraînement de nombreux modèles de langage.

Pourquoi CCBot est à part

Si vous ne bloquez que GPTBot et ClaudeBot, votre contenu peut quand même atteindre les modèles via le jeu de données Common Crawl. Qui refuse l'entraînement par principe doit tenir compte de CCBot.

Le bloquer

« User-agent: CCBot » suivi de « Disallow: / ». Common Crawl respecte robots.txt au prochain passage ; les entrées d'archive existantes demeurent jusqu'à une nouvelle collecte du jeu de données.

Le compromis

Common Crawl sert aussi à la recherche, à des projets de moteurs et à l'archivage. Un blocage touche tous ces usages, pas seulement l'entraînement commercial d'IA.

Vérifier la règle

citeglass indique si votre robots.txt autorise ou bloque CCBot et si la règle est spécifique au robot ou ne s'applique que via le bloc « User-agent: * ».

Vérifiez votre propre site

citeglass montre en 30 secondes environ où votre site est illisible pour les systèmes IA — gratuit et sans compte.

À lire aussi

Information générale, pas un conseil juridique. Le GEO est un domaine jeune — les recommandations peuvent évoluer.