Проверено 04.09.2026 · https://example.com/
Жёстких препятствий нет, но 4 пунктов ослабляют обнаруживаемость ИИ.
Матрица ИИ-краулеров
Для каждого бота: что разрешает ваш robots.txt — и что сервер на самом деле возвращает user-agent'у бота. Строки, выделенные красным: robots разрешает, но сервер блокирует (обычно правило WAF или защиты от ботов).
| Бот | Оператор | robots.txt | Ответ сервера |
|---|---|---|---|
| GPTBot | OpenAI | не указан | 200 + содержимое |
| OAI-SearchBot | OpenAI | не указан | 200 + содержимое |
| ChatGPT-User | OpenAI | не указан | 200 + содержимое |
| ClaudeBot | Anthropic | не указан | 200 + содержимое |
| Claude-SearchBot | Anthropic | не указан | 200 + содержимое |
| Claude-User | Anthropic | не указан | 200 + содержимое |
| PerplexityBot | Perplexity | не указан | 200 + содержимое |
| Perplexity-User | Perplexity | не указан | 200 + содержимое |
| Google-Extended | Google (Gemini-Training) | не указан | — |
| Googlebot | Google (KI-Übersichten) | не указан | 200 + содержимое |
| CCBot | Common Crawl (Trainingsdaten vieler LLMs) | не указан | 200 + содержимое |
| Bytespider | ByteDance (Doubao) | не указан | 200 + содержимое |
| Amazonbot | Amazon (Alexa/Rufus) | не указан | 200 + содержимое |
| Applebot-Extended | Apple (Intelligence-Training) | не указан | — |
| Meta-ExternalAgent | Meta (Llama/Meta AI) | не указан | 200 + содержимое |
Как складывается оценка?
| Очень мало текста в HTML | -10 |
| Нет структурированных данных (JSON-LD) | -8 |
| Заголовок страницы слишком короткий или слишком длинный | -6 |
| Meta description отсутствует или не подходит | -5 |
| Нет llms.txt | -5 |
| Нет сигнала автора или авторства | -4 |
| sitemap.xml не найден | -4 |
| Нет связей sameAs | -3 |
| Нет ссылки на правовую информацию / о нас / контакты | -3 |
| Нет видимой или размеченной даты | -3 |
| Нет canonical URL | -3 |
| robots.txt не найден | -2 |
| Результат | 44 / 100 |
Доступ для ИИ-краулеров
robots.txt не найден
По адресу /robots.txt не был доступен ни один действительный файл. Краулеры тогда исходят из «всё разрешено» — работает, но у вас нет управления и нет сигнала sitemap.
Что вам следует сделать: Создайте robots.txt в корневом каталоге, как минимум со ссылкой на sitemap и нужными правилами allow/disallow.
User-agent: * Allow: / Sitemap: https://ваш-домен.ru/sitemap.xml
Содержимое без JavaScript
Очень мало текста в HTML
Начальный HTML содержит лишь около 142 символов видимого текста. Этого едва хватает, чтобы ИИ-системы уверенно уловили тему страницы.
Что вам следует сделать: Убедитесь, что фактическое содержимое полностью в HTML, а не в изображениях, iframe или блоках, загружаемых через JavaScript.
Структура и машинная понятность
Нет структурированных данных (JSON-LD)
Страница не содержит JSON-LD. Структурированные данные помогают ИИ-системам однозначно распознавать сущности, автора, организацию, дату и тип страницы — без них всё приходится угадывать из текста.
Что вам следует сделать: Добавьте как минимум схему «Organization» и схему, подходящую к типу страницы (Article, Product, FAQPage …), как JSON-LD в <head>.
<script type="application/ld+json">
{"@context":"https://schema.org","@type":"Organization",
"name":"Ваша компания","url":"https://ваш-домен.ru",
"sameAs":["https://www.linkedin.com/company/…"]}
</script>Заголовок страницы слишком короткий или слишком длинный
<title> имеет длину 14 символов. Разумно около 30–60 символов: достаточно описательно, чтобы назвать тему, достаточно кратко, чтобы не обрезаться.
Что вам следует сделать: Напишите ёмкий заголовок, содержащий тему и при необходимости бренд.
Meta description отсутствует или не подходит
Meta description имеет длину 0 символов. Часто это первое, что ИИ-системы и поисковики читают как краткое описание страницы.
Что вам следует сделать: Напишите самостоятельное краткое описание страницы в одно-два предложения (около 120–200 символов), а не набор ключевых слов.
Нет llms.txt
По адресу /llms.txt нет файла. llms.txt — это краткий обзор вашего ключевого содержимого в Markdown, который некоторые ИИ-системы используют для ориентации.
Что вам следует сделать: Создайте /llms.txt: H1 с названием, короткий абзац о предложении и список ссылок на центральные страницы.
# Ваша компания > Описание в одном предложении. ## Важные страницы - [Продукт](https://ваш-домен.ru/product): … - [Цены](https://ваш-домен.ru/pricing): … - [О нас](https://ваш-домен.ru/about): …
Сигналы доверия и сущности (E-E-A-T)
Нет сигнала автора или авторства
Автор не распознаётся (ни meta-тег, ни rel=author, ни JSON-LD Person). Для «опыта» и «экспертизы» в смысле E-E-A-T важно названное, прослеживаемое авторство.
Что вам следует сделать: Для редакционного содержимого называйте автора по имени и связывайте страницу автора; размечайте его также как JSON-LD «Person».
Нет связей sameAs
В JSON-LD отсутствует «sameAs». С ним ИИ-системы чётко сопоставляют ваш бренд или человека с известными сущностями (Wikidata, LinkedIn, отраслевые каталоги).
Что вам следует сделать: Добавьте «sameAs» в Organization или Person с URL ваших официальных профилей и записей в каталогах.
Нет ссылки на правовую информацию / о нас / контакты
На проверенной странице не распознаётся ссылка на правовую информацию, страницу «О нас» или контакты. Такие страницы — сильный сигнал доверия и помогают сопоставлению сущностей.
Что вам следует сделать: Свяжите правовую информацию или «О нас» и контакты заметно, обычно в подвале каждой страницы.
Нет видимой или размеченной даты
Не распознаётся дата публикации или изменения (ни <time>, ни article:published_time, ни datePublished в JSON-LD). Для многих вопросов ИИ-системы предпочитают актуальные источники.
Что вам следует сделать: Для содержимого, привязанного ко времени, показывайте дату заметно и размечайте datePublished / dateModified в JSON-LD.
Техническая основа
sitemap.xml не найден
По адресу /sitemap.xml не был доступен действительный XML-sitemap, и robots.txt не называет ни одного. Sitemap помогает краулерам найти все релевантные URL.
Что вам следует сделать: Сгенерируйте sitemap.xml со всеми индексируемыми URL и сошлитесь на него в robots.txt.
Нет canonical URL
Страница не задаёт <link rel="canonical">. Без canonical может оставаться неясным, какая версия является определяющей, когда существует несколько вариантов URL.
Что вам следует сделать: Задавайте на каждой странице самоссылающийся <link rel="canonical"> с предпочтительным URL.
В порядке (2)
- Ровно один заголовок H1.
- Быстрое время ответа сервера.
Следующие шаги
- Очень мало текста в HTML. Убедитесь, что фактическое содержимое полностью в HTML, а не в изображениях, iframe или блоках, загружаемых через JavaScript.
- Нет структурированных данных (JSON-LD). Добавьте как минимум схему «Organization» и схему, подходящую к типу страницы (Article, Product, FAQPage …), как JSON-LD в <head>.
- Заголовок страницы слишком короткий или слишком длинный. Напишите ёмкий заголовок, содержащий тему и при необходимости бренд.
Еженедельное повторное сканирование с уведомлением по e-mail при каждом изменении. В подготовке — введите свой адрес.
Метод и границы
Проверено 04.09.2026. citeglass забирает example.com и связанные файлы (robots.txt, llms.txt, sitemap.xml) через HTTP — один раз как обычный браузер, один раз для каждого user-agent'а ИИ-краулера. JavaScript не выполняется. Время до первого байта: 12 мс.
Чем это не является: Никакого отслеживания позиций или цитирований, никакого утверждения о том, называет ли модель вас на самом деле, и никакой проверки содержимого, загружаемого через JavaScript. Снимок с точки зрения одного серверного IP.