Проверено 23.09.2026 · https://rehau-termopane.ro/
Для обнаруживаемости ИИ есть 1 критических препятствий — устраните их в первую очередь.
Матрица ИИ-краулеров
Для каждого бота: что разрешает ваш robots.txt — и что сервер на самом деле возвращает user-agent'у бота. Строки, выделенные красным: robots разрешает, но сервер блокирует (обычно правило WAF или защиты от ботов).
| Бот | Оператор | robots.txt | Ответ сервера |
|---|---|---|---|
| GPTBot | OpenAI | не указан | заблокировано (403 / WAF) |
| OAI-SearchBot | OpenAI | не указан | 200 + содержимое |
| ChatGPT-User | OpenAI | не указан | 200 + содержимое |
| ClaudeBot | Anthropic | не указан | 200 + содержимое |
| Claude-SearchBot | Anthropic | не указан | ошибка / тайм-аут |
| Claude-User | Anthropic | не указан | 200 + содержимое |
| PerplexityBot | Perplexity | не указан | ошибка / тайм-аут |
| Perplexity-User | Perplexity | не указан | ошибка / тайм-аут |
| Google-Extended | Google (Gemini-Training) | не указан | — |
| Googlebot | Google (KI-Übersichten) | не указан | 200 + содержимое |
| CCBot | Common Crawl (Trainingsdaten vieler LLMs) | не указан | 200 + содержимое |
| Bytespider | ByteDance (Doubao) | не указан | 200 + содержимое |
| Amazonbot | Amazon (Alexa/Rufus) | не указан | 200 + содержимое |
| Applebot-Extended | Apple (Intelligence-Training) | не указан | — |
| Meta-ExternalAgent | Meta (Llama/Meta AI) | не указан | заблокировано (403 / WAF) |
Как складывается оценка?
| Сервер блокирует ботов, хотя robots.txt их разрешает | -12 |
| Нет llms.txt | -5 |
| sitemap.xml не найден | -4 |
| Уровни заголовков пропускаются | -3 |
| Нет связей sameAs | -3 |
| robots.txt не найден | -2 |
| Нет разметки FAQ или HowTo | -2 |
| Результат | 69 / 100 |
Доступ для ИИ-краулеров
Сервер блокирует ботов, хотя robots.txt их разрешает
Для 2 бота(ов) от OpenAI, Meta (Llama/Meta AI) robots.txt говорит «разрешено», но сервер отвечает 403 или страницей защиты от ботов. Обычно правило WAF, брандмауэра или CDN закрывает доступ краулеру в обход robots.txt.
Что вам следует сделать: Добавьте user-agent'ы и/или диапазоны IP нужных ИИ-краулеров в список разрешённых в вашем WAF / Cloudflare / брандмауэре. Проверяйте их по обратному DNS, а не только по строке user-agent.
robots.txt не найден
По адресу /robots.txt не был доступен ни один действительный файл. Краулеры тогда исходят из «всё разрешено» — работает, но у вас нет управления и нет сигнала sitemap.
Что вам следует сделать: Создайте robots.txt в корневом каталоге, как минимум со ссылкой на sitemap и нужными правилами allow/disallow.
User-agent: * Allow: / Sitemap: https://ваш-домен.ru/sitemap.xml
Структура и машинная понятность
Нет llms.txt
По адресу /llms.txt нет файла. llms.txt — это краткий обзор вашего ключевого содержимого в Markdown, который некоторые ИИ-системы используют для ориентации.
Что вам следует сделать: Создайте /llms.txt: H1 с названием, короткий абзац о предложении и список ссылок на центральные страницы.
# Ваша компания > Описание в одном предложении. ## Важные страницы - [Продукт](https://ваш-домен.ru/product): … - [Цены](https://ваш-домен.ru/pricing): … - [О нас](https://ваш-домен.ru/about): …
Уровни заголовков пропускаются
Последовательность заголовков пропускает хотя бы один уровень (например, с H2 сразу на H4). Это затрудняет автоматическое восстановление структуры содержимого.
Что вам следует сделать: Используйте уровни заголовков без пропусков и по порядку (H1 → H2 → H3 …).
Нет разметки FAQ или HowTo
Содержимое в формате «вопрос — ответ» и пошаговые инструкции без разметки FAQPage или HowTo сложнее распознать ИИ-системам как напрямую цитируемый ответ.
Что вам следует сделать: Там, где страница отвечает на реальные вопросы или даёт инструкции, разметьте её как FAQPage или HowTo (никакой разметки без видимого соответствующего содержимого).
Сигналы доверия и сущности (E-E-A-T)
Нет связей sameAs
В JSON-LD отсутствует «sameAs». С ним ИИ-системы чётко сопоставляют ваш бренд или человека с известными сущностями (Wikidata, LinkedIn, отраслевые каталоги).
Что вам следует сделать: Добавьте «sameAs» в Organization или Person с URL ваших официальных профилей и записей в каталогах.
Техническая основа
sitemap.xml не найден
По адресу /sitemap.xml не был доступен действительный XML-sitemap, и robots.txt не называет ни одного. Sitemap помогает краулерам найти все релевантные URL.
Что вам следует сделать: Сгенерируйте sitemap.xml со всеми индексируемыми URL и сошлитесь на него в robots.txt.
В порядке (8)
- Основное содержимое в HTML без JavaScript.
- Структурированные данные (JSON-LD) присутствуют. — HomeAndConstructionBusiness, Organization, WebSite, ImageObject, WebPage, Person, Article, VideoObject
- Организация размечена как JSON-LD.
- Ровно один заголовок H1.
- Установлен canonical URL.
- Заголовок страницы имеет разумную длину.
- Сигнал авторства присутствует.
- Быстрое время ответа сервера.
Следующие шаги
- Сервер блокирует ботов, хотя robots.txt их разрешает. Добавьте user-agent'ы и/или диапазоны IP нужных ИИ-краулеров в список разрешённых в вашем WAF / Cloudflare / брандмауэре. Проверяйте их по обратному DNS, а не только по строке user-agent.
- Нет llms.txt. Создайте /llms.txt: H1 с названием, короткий абзац о предложении и список ссылок на центральные страницы.
- sitemap.xml не найден. Сгенерируйте sitemap.xml со всеми индексируемыми URL и сошлитесь на него в robots.txt.
Еженедельное повторное сканирование с уведомлением по e-mail при каждом изменении. В подготовке — введите свой адрес.
Метод и границы
Проверено 23.09.2026. citeglass забирает rehau-termopane.ro и связанные файлы (robots.txt, llms.txt, sitemap.xml) через HTTP — один раз как обычный браузер, один раз для каждого user-agent'а ИИ-краулера. JavaScript не выполняется. Время до первого байта: 774 мс.
Чем это не является: Никакого отслеживания позиций или цитирований, никакого утверждения о том, называет ли модель вас на самом деле, и никакой проверки содержимого, загружаемого через JavaScript. Снимок с точки зрения одного серверного IP.