Bloquear todos os rastreadores de IA
Quem quiser manter o conteúdo fora dos sistemas de IA por princípio precisa de regras para cada bot nomeado — um caractere universal não basta, porque muitos bots o ignoram ou esperam blocos próprios.
A lista de bots
No mínimo, há que ter em conta: GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, Claude-SearchBot, Claude-User, PerplexityBot, Perplexity-User, Google-Extended, CCBot, Bytespider, Amazonbot, Applebot-Extended, Meta-ExternalAgent. Um bloco dedicado por bot com «Disallow: /».
O que o robots.txt não consegue fazer
O robots.txt é um pedido, não uma imposição. Bots como o Bytespider ou o Perplexity foram criticados por o contornar. Para bloqueios firmes, acrescenta regras de WAF ou firewall sobre os agentes de utilizador e, onde possível, sobre intervalos de IP verificados.
O preço
Um bloqueio completo retira-te das respostas de IA com ligação à fonte — ou seja, de uma parte crescente da procura de informação. Para muitos sites faz mais sentido a variante mais dirigida: bloquear o treino, permitir a pesquisa.
Verificar o efeito
O citeglass solicita a tua página com cada um destes agentes de utilizador e mostra numa matriz que bot está bloqueado segundo o robots.txt e se o teu servidor aplica o bloqueio de facto.
Verifique o seu próprio site
O citeglass mostra em cerca de 30 segundos onde o seu site é ilegível para os sistemas de IA — gratuito e sem registo.
Continuar a ler
- Proibir o treino, permitir a pesquisa
- Controlar os rastreadores de IA no robots.txt
- CCBot e Common Crawl
Informação geral, não aconselhamento jurídico. O GEO é um campo jovem — as recomendações podem mudar.