Proibir o treino, permitir a pesquisa
A maioria dos fornecedores separa o rastreador de treino do de pesquisa. Assim podes sair do treino do modelo e mesmo assim aparecer como fonte citada.
Bloquear os bots de treino
Disallow para: GPTBot (OpenAI), ClaudeBot (Anthropic), CCBot (Common Crawl), mais os tokens Google-Extended e Applebot-Extended. Opcionalmente Meta-ExternalAgent se também quiseres sair do treino do Llama.
Permitir os bots de pesquisa
Allow para: OAI-SearchBot e ChatGPT-User (pesquisa do ChatGPT), Claude-SearchBot e Claude-User (Claude), PerplexityBot e Perplexity-User (Perplexity), Googlebot (Pesquisa Google e resumos de IA).
Zonas cinzentas
Nem todos os fornecedores separam de forma limpa: o Common Crawl não tem pesquisa, o Bytespider mistura as duas coisas. E um excerto pode acabar num resumo de IA mesmo que tenhas proibido o treino — isso segue a indexação da pesquisa.
Verificar a configuração
O citeglass mostra em separado, para cada bot, a regra do robots.txt aplicável e a resposta real do servidor, para veres num relance se a separação «treino não, pesquisa sim» se mantém de facto.
Verifique o seu próprio site
O citeglass mostra em cerca de 30 segundos onde o seu site é ilegível para os sistemas de IA — gratuito e sem registo.
Continuar a ler
Informação geral, não aconselhamento jurídico. O GEO é um campo jovem — as recomendações podem mudar.