Start › Kennisbank › Basis
AI-crawlers sturen in robots.txt
Elke grote AI-aanbieder heeft eigen crawlers met eigen user-agentnamen. Via robots.txt bepaal je per bot of die je inhoud mag laden.
De belangrijkste AI-crawlers
OpenAI: GPTBot (training), OAI-SearchBot (ChatGPT-zoeken), ChatGPT-User (ophalen op verzoek van de gebruiker). Anthropic: ClaudeBot, Claude-SearchBot, Claude-User. Perplexity: PerplexityBot, Perplexity-User. Google: Google-Extended (Gemini-training) — het feitelijke ophalen voor AI-overzichten loopt via de gewone Googlebot. Daarnaast Common Crawl (CCBot), Amazonbot, Bytespider, Applebot-Extended en Meta-ExternalAgent.
Gericht toestaan
Voor maximale AI-zichtbaarheid geef je de relevante bots een eigen blok met 'Allow: /'. Belangrijk: een botspecifiek blok vervangt voor die bot het 'User-agent: *'-blok volledig — herhaal daar de nodige disallowregels.
Gericht uitsluiten
Als je training weigert maar zichtbaar wilt blijven in AI-zoeken, kun je GPTBot en Google-Extended blokkeren en OAI-SearchBot en Googlebot toestaan. Dat is een inhoudelijke beslissing, niet puur technisch.
Waarom robots.txt vaak niet genoeg is
Veel sites staan bots toe in robots.txt maar blokkeren ze op serverniveau: een WAF-regel, een Cloudflare 'Bot Fight Mode' of een firewall wijst de crawler af met een 403. De bot houdt zich aan robots.txt en komt er toch niet in. citeglass maakt dit verschil zichtbaar.
Verifiëren
Toelatingslijsten horen geverifieerde bots te bevatten. OpenAI, Anthropic, Perplexity en Google publiceren de IP-bereiken van hun crawlers; controleer daarnaast via reverse-DNS in plaats van alleen op de user-agentstring te vertrouwen.
Controleer je eigen site
citeglass laat in ongeveer 30 seconden zien waar je website onleesbaar is voor AI-systemen — gratis en zonder account.
Verder lezen
Algemene informatie, geen juridisch advies. GEO is een jong vakgebied — aanbevelingen kunnen veranderen.