Início › Recursos › Os rastreadores de IA em detalhe
CCBot e Common Crawl
O Common Crawl cria um arquivo da web de acesso livre que alimenta os dados de treino de numerosos modelos de linguagem.
Porque o CCBot é especial
Se bloqueares apenas o GPTBot e o ClaudeBot, o teu conteúdo pode mesmo assim chegar aos modelos através do conjunto de dados do Common Crawl. Quem recusa o treino por princípio tem de contar com o CCBot.
Bloqueá-lo
«User-agent: CCBot» seguido de «Disallow: /». O Common Crawl respeita o robots.txt na próxima recolha; as entradas de arquivo existentes permanecem até o conjunto de dados ser recolhido de novo.
O compromisso
O Common Crawl também é usado para investigação, projetos de pesquisa e arquivo. Um bloqueio atinge todos esses fins, não só o treino comercial de IA.
Verificar a regra
O citeglass mostra se o teu robots.txt permite ou bloqueia o CCBot e se a regra é específica do bot ou só se aplica pelo bloco «User-agent: *».
Verifique o seu próprio site
O citeglass mostra em cerca de 30 segundos onde o seu site é ilegível para os sistemas de IA — gratuito e sem registo.
Continuar a ler
- Permitir ou bloquear o GPTBot
- Bloquear todos os rastreadores de IA
- Controlar os rastreadores de IA no robots.txt
Informação geral, não aconselhamento jurídico. O GEO é um campo jovem — as recomendações podem mudar.