Главная › База знаний › Основы
Управление ИИ-краулерами в robots.txt
Каждый крупный ИИ-поставщик эксплуатирует собственных краулеров с собственными именами user-agent. Через robots.txt вы решаете по каждому боту, может ли он загрузить ваше содержимое.
Важнейшие ИИ-краулеры
OpenAI: GPTBot (обучение), OAI-SearchBot (поиск ChatGPT), ChatGPT-User (забор по запросу пользователя). Anthropic: ClaudeBot, Claude-SearchBot, Claude-User. Perplexity: PerplexityBot, Perplexity-User. Google: Google-Extended (обучение Gemini) — фактический забор для ИИ-обзоров идёт через обычный Googlebot. Кроме того, Common Crawl (CCBot), Amazonbot, Bytespider, Applebot-Extended и Meta-ExternalAgent.
Целенаправленно разрешать
Для максимальной ИИ-видимости дайте нужным ботам собственный блок с «Allow: /». Важно: специфичный для бота блок полностью заменяет для этого бота блок «User-agent: *» — повторите там необходимые правила disallow.
Целенаправленно исключать
Если вы отказываетесь от обучения, но хотите оставаться видимым в ИИ-поиске, вы можете заблокировать GPTBot и Google-Extended и разрешить OAI-SearchBot и Googlebot. Это содержательное решение, а не чисто техническое.
Почему robots.txt часто недостаточно
Многие сайты разрешают ботов в robots.txt, но блокируют их на уровне сервера: правило WAF, «Bot Fight Mode» Cloudflare или брандмауэр отклоняет краулера с 403. Бот соблюдает robots.txt и всё равно не попадает внутрь. citeglass делает это расхождение видимым.
Проверять
В списках разрешённых должны быть проверенные боты. OpenAI, Anthropic, Perplexity и Google публикуют диапазоны IP своих краулеров; проверяйте дополнительно по обратному DNS, а не полагайтесь только на строку user-agent.
Проверьте свой сайт
citeglass примерно за 30 секунд показывает, где ваш сайт нечитаем для ИИ-систем — бесплатно и без входа.
Читать дальше
Общая информация, не юридическая консультация. GEO — молодая область, рекомендации могут меняться.