Головна › База знань › Основи
Керування ШІ-краулерами в robots.txt
Кожен великий ШІ-постачальник експлуатує власних краулерів із власними іменами user-agent. Через robots.txt ви вирішуєте по кожному боту, чи може він завантажити ваш вміст.
Найважливіші ШІ-краулери
OpenAI: GPTBot (навчання), OAI-SearchBot (пошук ChatGPT), ChatGPT-User (забір за запитом користувача). Anthropic: ClaudeBot, Claude-SearchBot, Claude-User. Perplexity: PerplexityBot, Perplexity-User. Google: Google-Extended (навчання Gemini) — фактичний забір для ШІ-оглядів іде через звичайний Googlebot. Крім того, Common Crawl (CCBot), Amazonbot, Bytespider, Applebot-Extended і Meta-ExternalAgent.
Цілеспрямовано дозволяти
Для максимальної видимості для ШІ дайте потрібним ботам власний блок з «Allow: /». Важливо: специфічний для бота блок повністю замінює для цього бота блок «User-agent: *» — повторіть там необхідні правила disallow.
Цілеспрямовано виключати
Якщо ви відмовляєтеся від навчання, але хочете лишатися видимим у ШІ-пошуку, ви можете заблокувати GPTBot і Google-Extended і дозволити OAI-SearchBot та Googlebot. Це змістовне рішення, а не суто технічне.
Чому robots.txt часто недостатньо
Багато сайтів дозволяють ботів у robots.txt, але блокують їх на рівні сервера: правило WAF, «Bot Fight Mode» Cloudflare або брандмауер відхиляє краулера з 403. Бот дотримується robots.txt і все одно не потрапляє всередину. citeglass робить цю розбіжність видимою.
Перевіряти
У списках дозволених мають бути перевірені боти. OpenAI, Anthropic, Perplexity і Google публікують діапазони IP своїх краулерів; перевіряйте додатково за зворотним DNS, а не покладайтеся лише на рядок user-agent.
Перевірте власний сайт
citeglass приблизно за 30 секунд показує, де ваш сайт нечитабельний для ШІ-систем — безкоштовно й без входу.
Читати далі
Загальна інформація, не юридична консультація. GEO — молода галузь, рекомендації можуть змінюватися.