Úvod › Znalostní báze › Základy
Řízení AI robotů v robots.txt
Každý velký poskytovatel AI provozuje vlastní roboty s vlastními názvy user agentů. Přes robots.txt rozhodujete u každého robota, zda smí načíst váš obsah.
Nejdůležitější AI roboti
OpenAI: GPTBot (trénink), OAI-SearchBot (vyhledávání ChatGPT), ChatGPT-User (načtení na žádost uživatele). Anthropic: ClaudeBot, Claude-SearchBot, Claude-User. Perplexity: PerplexityBot, Perplexity-User. Google: Google-Extended (trénink Gemini) — vlastní načtení pro AI přehledy probíhá přes běžný Googlebot. Dále Common Crawl (CCBot), Amazonbot, Bytespider, Applebot-Extended a Meta-ExternalAgent.
Cílené povolení
Pro maximální viditelnost pro AI dáte relevantním robotům vlastní blok s „Allow: /“. Důležité: blok specifický pro robota pro daného robota zcela nahradí blok „User-agent: *“ — zopakujte tam potřebná pravidla disallow.
Cílené vyloučení
Pokud odmítáte trénink, ale chcete zůstat viditelní ve vyhledávání AI, můžete zablokovat GPTBot a Google-Extended a povolit OAI-SearchBot a Googlebot. Je to obsahové rozhodnutí, ne čistě technické.
Proč robots.txt často nestačí
Mnoho webů povoluje roboty v robots.txt, ale blokuje je na úrovni serveru: pravidlo WAF, „Bot Fight Mode“ Cloudflare nebo firewall robota odmítne kódem 403. Robot se řídí robots.txt a přesto se nedostane dovnitř. citeglass tento rozpor zviditelňuje.
Ověření
Seznamy povolených by měly obsahovat ověřené roboty. OpenAI, Anthropic, Perplexity a Google zveřejňují rozsahy IP svých robotů; ověřujte navíc přes zpětný DNS, místo abyste spoléhali jen na řetězec user agenta.
Zkontrolujte vlastní web
citeglass ukáže během asi 30 sekund, kde je váš web pro AI systémy nečitelný — zdarma a bez přihlášení.
Číst dál
Obecná informace, nikoli právní poradenství. GEO je mladý obor — doporučení se mohou měnit.