Accueil › Ressources › Thèmes
Interdire l'entraînement, autoriser la recherche
La plupart des fournisseurs séparent le robot d'entraînement du robot de recherche. Vous pouvez ainsi sortir de l'entraînement du modèle tout en apparaissant comme source citée.
Bloquer les robots d'entraînement
Disallow pour : GPTBot (OpenAI), ClaudeBot (Anthropic), CCBot (Common Crawl), plus les jetons Google-Extended et Applebot-Extended. En option Meta-ExternalAgent si vous voulez aussi sortir de l'entraînement de Llama.
Autoriser les robots de recherche
Allow pour : OAI-SearchBot et ChatGPT-User (recherche ChatGPT), Claude-SearchBot et Claude-User (Claude), PerplexityBot et Perplexity-User (Perplexity), Googlebot (recherche Google et aperçus IA).
Zones grises
Tous les fournisseurs ne séparent pas proprement : Common Crawl n'a pas de recherche, Bytespider mélange les deux. Et un extrait peut se retrouver dans un aperçu IA même si vous avez interdit l'entraînement — cela suit l'indexation de la recherche.
Vérifier la configuration
citeglass indique séparément, pour chaque robot, la règle robots.txt applicable et la réponse réelle du serveur — vous voyez ainsi d'un coup d'œil si la séparation « entraînement non, recherche oui » tient vraiment.
Vérifiez votre propre site
citeglass montre en 30 secondes environ où votre site est illisible pour les systèmes IA — gratuit et sans compte.
À lire aussi
Information générale, pas un conseil juridique. Le GEO est un domaine jeune — les recommandations peuvent évoluer.