Inicio › Recursos › Rastreadores de IA en detalle
CCBot y Common Crawl
Common Crawl crea un archivo web de acceso libre que alimenta los datos de entrenamiento de numerosos modelos de lenguaje.
Por qué CCBot es especial
Si bloqueas solo GPTBot y ClaudeBot, tu contenido puede llegar igualmente a los modelos a través del conjunto de datos de Common Crawl. Quien rechace el entrenamiento por principio debe tener en cuenta a CCBot.
Bloquearlo
«User-agent: CCBot» seguido de «Disallow: /». Common Crawl respeta robots.txt en el siguiente rastreo; las entradas de archivo existentes permanecen hasta que el conjunto de datos se vuelva a recopilar.
La contrapartida
Common Crawl también se usa para investigación, proyectos de búsqueda y archivado. Un bloqueo afecta a todos esos fines, no solo al entrenamiento comercial de IA.
Comprobar la regla
citeglass muestra si tu robots.txt permite o bloquea a CCBot y si la regla es específica del bot o solo se aplica mediante el bloque «User-agent: *».
Comprueba tu propio sitio
citeglass muestra en unos 30 segundos dónde tu web es ilegible para los sistemas de IA — gratis y sin registro.
Seguir leyendo
- Permitir o bloquear GPTBot
- Bloquear todos los rastreadores de IA
- Controlar los rastreadores de IA en robots.txt
Información general, no asesoramiento jurídico. El GEO es un campo joven — las recomendaciones pueden cambiar.