Русский
citeglass · Проверка ИИ-видимости

Проверено 24.09.2026 · https://www.nytimes.com/

Для обнаруживаемости ИИ есть 2 критических препятствий — устраните их в первую очередь.

F
1 / 100
2 критических · 5 для проверки
С момента последнего сканирования: Оценка -37 · 2 исправлено · 8 новых

Матрица ИИ-краулеров

Для каждого бота: что разрешает ваш robots.txt — и что сервер на самом деле возвращает user-agent'у бота. Строки, выделенные красным: robots разрешает, но сервер блокирует (обычно правило WAF или защиты от ботов).

БотОператорrobots.txtОтвет сервера
GPTBotOpenAIзаблокированозаблокировано (403 / WAF)
OAI-SearchBotOpenAIзаблокированозаблокировано (403 / WAF)
ChatGPT-UserOpenAIзаблокированозаблокировано (403 / WAF)
ClaudeBotAnthropicзаблокированозаблокировано (403 / WAF)
Claude-SearchBotAnthropicзаблокированозаблокировано (403 / WAF)
Claude-UserAnthropicзаблокированозаблокировано (403 / WAF)
PerplexityBotPerplexityзаблокированозаблокировано (403 / WAF)
Perplexity-UserPerplexityзаблокированозаблокировано (403 / WAF)
Google-ExtendedGoogle (Gemini-Training)заблокировано—
GooglebotGoogle (KI-Übersichten)разрешенозаблокировано (403 / WAF)
CCBotCommon Crawl (Trainingsdaten vieler LLMs)заблокированозаблокировано (403 / WAF)
BytespiderByteDance (Doubao)заблокированозаблокировано (403 / WAF)
AmazonbotAmazon (Alexa/Rufus)разрешенозаблокировано (403 / WAF)
Applebot-ExtendedApple (Intelligence-Training)заблокировано—
Meta-ExternalAgentMeta (Llama/Meta AI)заблокированозаблокировано (403 / WAF)
Как складывается оценка?
Поисковые ИИ-боты заблокированы в robots.txt-32
Сервер блокирует ботов, хотя robots.txt их разрешает-12
Очень мало текста в HTML-10
Нет структурированных данных (JSON-LD)-8
Заголовок страницы слишком короткий или слишком длинный-6
Не ровно один заголовок H1-5
Meta description отсутствует или не подходит-5
Нет llms.txt-5
Нет сигнала автора или авторства-4
Нет связей sameAs-3
Нет ссылки на правовую информацию / о нас / контакты-3
Нет видимой или размеченной даты-3
Нет canonical URL-3
Результат1 / 100

Доступ для ИИ-краулеров

критично

Поисковые ИИ-боты заблокированы в robots.txt

Ваш robots.txt блокирует 6 ботов, которые загружают контент для ответов ИИ-ассистентов и поисковых систем: OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, PerplexityBot, Perplexity-User. Пока они заблокированы, ваш сайт не может появиться там как источник.

Что вам следует сделать: Проверьте для каждого бота, намеренна ли блокировка. Если вы хотите исключить только обучение ИИ, заблокируйте обучающих ботов (GPTBot, ClaudeBot, Google-Extended) и разрешите поисковых.

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Claude-User
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Perplexity-User
Allow: /
критично

Сервер блокирует ботов, хотя robots.txt их разрешает

Для 2 бота(ов) от Google (KI-Übersichten), Amazon (Alexa/Rufus) robots.txt говорит «разрешено», но сервер отвечает 403 или страницей защиты от ботов. Обычно правило WAF, брандмауэра или CDN закрывает доступ краулеру в обход robots.txt.

Что вам следует сделать: Добавьте user-agent'ы и/или диапазоны IP нужных ИИ-краулеров в список разрешённых в вашем WAF / Cloudflare / брандмауэре. Проверяйте их по обратному DNS, а не только по строке user-agent.

примечание

Обучение ИИ исключено

Ваш robots.txt блокирует краулеры, собирающие контент для обучения языковых моделей: GPTBot, ClaudeBot, Google-Extended, CCBot, Applebot-Extended. Это не мешает цитированию — поисковые и загружающие боты, такие как OAI-SearchBot, PerplexityBot и Googlebot для AI Overviews, работают отдельно.

Что вам следует сделать: Ничего делать не нужно, если исключение намеренное. Просто следите, чтобы поисковые боты оставались разрешены.

Содержимое без JavaScript

проверить

Очень мало текста в HTML

Начальный HTML содержит лишь около 55 символов видимого текста. Этого едва хватает, чтобы ИИ-системы уверенно уловили тему страницы.

Что вам следует сделать: Убедитесь, что фактическое содержимое полностью в HTML, а не в изображениях, iframe или блоках, загружаемых через JavaScript.

Структура и машинная понятность

проверить

Нет структурированных данных (JSON-LD)

Страница не содержит JSON-LD. Структурированные данные помогают ИИ-системам однозначно распознавать сущности, автора, организацию, дату и тип страницы — без них всё приходится угадывать из текста.

Что вам следует сделать: Добавьте как минимум схему «Organization» и схему, подходящую к типу страницы (Article, Product, FAQPage …), как JSON-LD в <head>.

<script type="application/ld+json">
{"@context":"https://schema.org","@type":"Organization",
 "name":"Ваша компания","url":"https://ваш-домен.ru",
 "sameAs":["https://www.linkedin.com/company/…"]}
</script>
проверить

Заголовок страницы слишком короткий или слишком длинный

<title> имеет длину 11 символов. Разумно около 30–60 символов: достаточно описательно, чтобы назвать тему, достаточно кратко, чтобы не обрезаться.

Что вам следует сделать: Напишите ёмкий заголовок, содержащий тему и при необходимости бренд.

проверить

Не ровно один заголовок H1

На странице 0 заголовков H1. Один однозначный H1 говорит людям и машинам, о чём страница прежде всего.

Что вам следует сделать: Установите ровно один H1, называющий основную тему страницы. Всё под ним начинается с H2.

проверить

Meta description отсутствует или не подходит

Meta description имеет длину 0 символов. Часто это первое, что ИИ-системы и поисковики читают как краткое описание страницы.

Что вам следует сделать: Напишите самостоятельное краткое описание страницы в одно-два предложения (около 120–200 символов), а не набор ключевых слов.

примечание

Нет llms.txt

По адресу /llms.txt нет файла. llms.txt — это краткий обзор вашего ключевого содержимого в Markdown, который некоторые ИИ-системы используют для ориентации.

Что вам следует сделать: Создайте /llms.txt: H1 с названием, короткий абзац о предложении и список ссылок на центральные страницы.

# Ваша компания

> Описание в одном предложении.

## Важные страницы
- [Продукт](https://ваш-домен.ru/product): …
- [Цены](https://ваш-домен.ru/pricing): …
- [О нас](https://ваш-домен.ru/about): …

Сигналы доверия и сущности (E-E-A-T)

примечание

Нет сигнала автора или авторства

Автор не распознаётся (ни meta-тег, ни rel=author, ни JSON-LD Person). Для «опыта» и «экспертизы» в смысле E-E-A-T важно названное, прослеживаемое авторство.

Что вам следует сделать: Для редакционного содержимого называйте автора по имени и связывайте страницу автора; размечайте его также как JSON-LD «Person».

примечание

Нет связей sameAs

В JSON-LD отсутствует «sameAs». С ним ИИ-системы чётко сопоставляют ваш бренд или человека с известными сущностями (Wikidata, LinkedIn, отраслевые каталоги).

Что вам следует сделать: Добавьте «sameAs» в Organization или Person с URL ваших официальных профилей и записей в каталогах.

примечание

Нет ссылки на правовую информацию / о нас / контакты

На проверенной странице не распознаётся ссылка на правовую информацию, страницу «О нас» или контакты. Такие страницы — сильный сигнал доверия и помогают сопоставлению сущностей.

Что вам следует сделать: Свяжите правовую информацию или «О нас» и контакты заметно, обычно в подвале каждой страницы.

примечание

Нет видимой или размеченной даты

Не распознаётся дата публикации или изменения (ни <time>, ни article:published_time, ни datePublished в JSON-LD). Для многих вопросов ИИ-системы предпочитают актуальные источники.

Что вам следует сделать: Для содержимого, привязанного ко времени, показывайте дату заметно и размечайте datePublished / dateModified в JSON-LD.

Техническая основа

примечание

Нет canonical URL

Страница не задаёт <link rel="canonical">. Без canonical может оставаться неясным, какая версия является определяющей, когда существует несколько вариантов URL.

Что вам следует сделать: Задавайте на каждой странице самоссылающийся <link rel="canonical"> с предпочтительным URL.

В порядке (3)
  • Sitemap доступен.
  • Быстрое время ответа сервера.
  • Нет noindex — страницу можно индексировать.

Следующие шаги

  1. Поисковые ИИ-боты заблокированы в robots.txt. Проверьте для каждого бота, намеренна ли блокировка. Если вы хотите исключить только обучение ИИ, заблокируйте обучающих ботов (GPTBot, ClaudeBot, Google-Extended) и разрешите поисковых.
  2. Сервер блокирует ботов, хотя robots.txt их разрешает. Добавьте user-agent'ы и/или диапазоны IP нужных ИИ-краулеров в список разрешённых в вашем WAF / Cloudflare / брандмауэре. Проверяйте их по обратному DNS, а не только по строке user-agent.
  3. Очень мало текста в HTML. Убедитесь, что фактическое содержимое полностью в HTML, а не в изображениях, iframe или блоках, загружаемых через JavaScript.
Мониторить эту страницу

Еженедельное повторное сканирование с уведомлением по e-mail при каждом изменении. В подготовке — введите свой адрес.

Метод и границы

Проверено 24.09.2026. citeglass забирает nytimes.com и связанные файлы (robots.txt, llms.txt, sitemap.xml) через HTTP — один раз как обычный браузер, один раз для каждого user-agent'а ИИ-краулера. JavaScript не выполняется. Время до первого байта: 99 мс.

Чем это не является: Никакого отслеживания позиций или цитирований, никакого утверждения о том, называет ли модель вас на самом деле, и никакой проверки содержимого, загружаемого через JavaScript. Снимок с точки зрения одного серверного IP.

Проверить другой сайт