Bloquear todos los rastreadores de IA
Quien quiera mantener el contenido fuera de los sistemas de IA por principio necesita reglas para cada bot con nombre: un comodín no basta, porque muchos bots lo ignoran o esperan sus propios bloques.
La lista de bots
Como mínimo hay que tener en cuenta: GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, Claude-SearchBot, Claude-User, PerplexityBot, Perplexity-User, Google-Extended, CCBot, Bytespider, Amazonbot, Applebot-Extended, Meta-ExternalAgent. Un bloque propio por bot con «Disallow: /».
Lo que robots.txt no puede hacer
robots.txt es una petición, no una imposición. Se ha criticado a bots como Bytespider o Perplexity por eludirla. Para bloqueos tajantes, añade reglas de WAF o firewall sobre los agentes de usuario y, donde sea posible, sobre rangos de IP verificados.
El precio
Un bloqueo completo te saca de las respuestas de IA con enlace a la fuente, es decir, de una parte creciente de la búsqueda de información. Para muchos sitios tiene más sentido la variante más selectiva: bloquear entrenamiento, permitir búsqueda.
Comprobar el efecto
citeglass solicita tu página con cada uno de estos agentes de usuario y muestra en una matriz qué bot está bloqueado según robots.txt y si tu servidor aplica el bloqueo realmente.
Comprueba tu propio sitio
citeglass muestra en unos 30 segundos dónde tu web es ilegible para los sistemas de IA — gratis y sin registro.
Seguir leyendo
- Bloquear el entrenamiento, permitir la búsqueda
- Controlar los rastreadores de IA en robots.txt
- CCBot y Common Crawl
Información general, no asesoramiento jurídico. El GEO es un campo joven — las recomendaciones pueden cambiar.