Bloquear el entrenamiento, permitir la búsqueda
La mayoría de proveedores separan el rastreador de entrenamiento del de búsqueda. Así puedes salir del entrenamiento del modelo y aun así aparecer como fuente citada.
Bloquear los bots de entrenamiento
Disallow para: GPTBot (OpenAI), ClaudeBot (Anthropic), CCBot (Common Crawl), más los tokens Google-Extended y Applebot-Extended. Opcionalmente Meta-ExternalAgent si también quieres salir del entrenamiento de Llama.
Permitir los bots de búsqueda
Allow para: OAI-SearchBot y ChatGPT-User (búsqueda de ChatGPT), Claude-SearchBot y Claude-User (Claude), PerplexityBot y Perplexity-User (Perplexity), Googlebot (Búsqueda de Google y resúmenes con IA).
Zonas grises
No todos los proveedores separan con limpieza: Common Crawl no tiene búsqueda, Bytespider mezcla ambas cosas. Y un fragmento puede acabar en un resumen con IA aunque hayas bloqueado el entrenamiento: eso sigue la indexación de búsqueda.
Comprobar la configuración
citeglass muestra por separado, para cada bot, la regla de robots.txt aplicable y la respuesta real del servidor, para que veas de un vistazo si la separación «entrenamiento no, búsqueda sí» funciona de verdad.
Comprueba tu propio sitio
citeglass muestra en unos 30 segundos dónde tu web es ilegible para los sistemas de IA — gratis y sin registro.
Seguir leyendo
Información general, no asesoramiento jurídico. El GEO es un campo joven — las recomendaciones pueden cambiar.