Перевірено 24.09.2026 · https://www.nytimes.com/
Для виявлюваності ШІ є 2 критичних перешкод — усуньте їх насамперед.
Матриця ШІ-краулерів
Для кожного бота: що дозволяє ваш robots.txt — і що сервер насправді повертає user-agent’у бота. Рядки, виділені червоним: robots дозволяє, але сервер блокує (зазвичай правило WAF або захисту від ботів).
| Бот | Оператор | robots.txt | Відповідь сервера |
|---|---|---|---|
| GPTBot | OpenAI | заблоковано | заблоковано (403 / WAF) |
| OAI-SearchBot | OpenAI | заблоковано | заблоковано (403 / WAF) |
| ChatGPT-User | OpenAI | заблоковано | заблоковано (403 / WAF) |
| ClaudeBot | Anthropic | заблоковано | заблоковано (403 / WAF) |
| Claude-SearchBot | Anthropic | заблоковано | заблоковано (403 / WAF) |
| Claude-User | Anthropic | заблоковано | заблоковано (403 / WAF) |
| PerplexityBot | Perplexity | заблоковано | заблоковано (403 / WAF) |
| Perplexity-User | Perplexity | заблоковано | заблоковано (403 / WAF) |
| Google-Extended | Google (Gemini-Training) | заблоковано | — |
| Googlebot | Google (KI-Übersichten) | дозволено | заблоковано (403 / WAF) |
| CCBot | Common Crawl (Trainingsdaten vieler LLMs) | заблоковано | заблоковано (403 / WAF) |
| Bytespider | ByteDance (Doubao) | заблоковано | заблоковано (403 / WAF) |
| Amazonbot | Amazon (Alexa/Rufus) | дозволено | заблоковано (403 / WAF) |
| Applebot-Extended | Apple (Intelligence-Training) | заблоковано | — |
| Meta-ExternalAgent | Meta (Llama/Meta AI) | заблоковано | заблоковано (403 / WAF) |
Як складається оцінка?
| Пошукові ШІ-боти заблоковані в robots.txt | -32 |
| Сервер блокує ботів, хоча robots.txt їх дозволяє | -12 |
| Дуже мало тексту в HTML | -10 |
| Немає структурованих даних (JSON-LD) | -8 |
| Заголовок сторінки надто короткий або надто довгий | -6 |
| Не рівно один заголовок H1 | -5 |
| Meta description відсутній або не підходить | -5 |
| Немає llms.txt | -5 |
| Немає сигналу автора чи авторства | -4 |
| Немає зв’язків sameAs | -3 |
| Немає посилання на правову інформацію / про нас / контакти | -3 |
| Немає видимої або розміченої дати | -3 |
| Немає canonical URL | -3 |
| Результат | 1 / 100 |
Доступ для ШІ-краулерів
Пошукові ШІ-боти заблоковані в robots.txt
Ваш robots.txt блокує 6 ботів, які завантажують контент для відповідей ШІ-асистентів і пошукових систем: OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, PerplexityBot, Perplexity-User. Поки вони заблоковані, ваш сайт не може з’явитися там як джерело.
Що вам слід зробити: Перевірте для кожного бота, чи блокування навмисне. Якщо ви хочете виключити лише навчання ШІ, заблокуйте навчальних ботів (GPTBot, ClaudeBot, Google-Extended) і дозвольте пошукових.
User-agent: OAI-SearchBot Allow: / User-agent: ChatGPT-User Allow: / User-agent: Claude-SearchBot Allow: / User-agent: Claude-User Allow: / User-agent: PerplexityBot Allow: / User-agent: Perplexity-User Allow: /
Сервер блокує ботів, хоча robots.txt їх дозволяє
Для 2 бота(ів) від Google (KI-Übersichten), Amazon (Alexa/Rufus) robots.txt каже «дозволено», але сервер відповідає 403 або сторінкою захисту від ботів. Зазвичай правило WAF, брандмауера або CDN закриває доступ краулеру в обхід robots.txt.
Що вам слід зробити: Додайте user-agent’и та/або діапазони IP потрібних ШІ-краулерів до списку дозволених у вашому WAF / Cloudflare / брандмауері. Перевіряйте їх за зворотним DNS, а не лише за рядком user-agent.
Навчання ШІ виключено
Ваш robots.txt блокує краулери, що збирають контент для навчання мовних моделей: GPTBot, ClaudeBot, Google-Extended, CCBot, Applebot-Extended. Це не заважає цитуванню — пошукові й завантажувальні боти, як-от OAI-SearchBot, PerplexityBot і Googlebot для AI Overviews, працюють окремо.
Що вам слід зробити: Нічого робити не потрібно, якщо виключення навмисне. Лише стежте, щоб пошукові боти залишалися дозволеними.
Вміст без JavaScript
Дуже мало тексту в HTML
Початковий HTML містить лише близько 55 символів видимого тексту. Цього ледве вистачає, щоб ШІ-системи впевнено вловили тему сторінки.
Що вам слід зробити: Переконайтеся, що фактичний вміст повністю в HTML, а не в зображеннях, iframe чи блоках, що завантажуються через JavaScript.
Структура і машинна зрозумілість
Немає структурованих даних (JSON-LD)
Сторінка не містить JSON-LD. Структуровані дані допомагають ШІ-системам однозначно розпізнавати сутності, автора, організацію, дату й тип сторінки — без них усе доводиться вгадувати з тексту.
Що вам слід зробити: Додайте щонайменше схему «Organization» і схему, що відповідає типу сторінки (Article, Product, FAQPage …), як JSON-LD у <head>.
<script type="application/ld+json">
{"@context":"https://schema.org","@type":"Organization",
"name":"Ваша компанія","url":"https://ваш-домен.ua",
"sameAs":["https://www.linkedin.com/company/…"]}
</script>Заголовок сторінки надто короткий або надто довгий
<title> має довжину 11 символів. Розумно близько 30–60 символів: достатньо описово, щоб назвати тему, достатньо коротко, щоб не обрізатися.
Що вам слід зробити: Напишіть стислий заголовок, що містить тему й за потреби бренд.
Не рівно один заголовок H1
На сторінці 0 заголовків H1. Один однозначний H1 говорить людям і машинам, про що сторінка передусім.
Що вам слід зробити: Встановіть рівно один H1, що називає основну тему сторінки. Усе під ним починається з H2.
Meta description відсутній або не підходить
Meta description має довжину 0 символів. Часто це перше, що ШІ-системи й пошуковики читають як короткий опис сторінки.
Що вам слід зробити: Напишіть самостійний короткий опис сторінки в одне-два речення (близько 120–200 символів), а не набір ключових слів.
Немає llms.txt
За адресою /llms.txt немає файлу. llms.txt — це короткий огляд вашого ключового вмісту в Markdown, який деякі ШІ-системи використовують для орієнтації.
Що вам слід зробити: Створіть /llms.txt: H1 з назвою, короткий абзац про пропозицію й список посилань на центральні сторінки.
# Ваша компанія > Опис в одному реченні. ## Важливі сторінки - [Продукт](https://ваш-домен.ua/product): … - [Ціни](https://ваш-домен.ua/pricing): … - [Про нас](https://ваш-домен.ua/about): …
Сигнали довіри та сутності (E-E-A-T)
Немає сигналу автора чи авторства
Автор не розпізнається (ні meta-тег, ні rel=author, ні JSON-LD Person). Для «досвіду» та «експертизи» в сенсі E-E-A-T важливе назване, простежуване авторство.
Що вам слід зробити: Для редакційного вмісту називайте автора на ім’я й пов’язуйте сторінку автора; розмічайте його також як JSON-LD «Person».
Немає зв’язків sameAs
У JSON-LD відсутнє «sameAs». З ним ШІ-системи чітко зіставляють ваш бренд або особу з відомими сутностями (Wikidata, LinkedIn, галузеві каталоги).
Що вам слід зробити: Додайте «sameAs» в Organization або Person з URL ваших офіційних профілів і записів у каталогах.
Немає посилання на правову інформацію / про нас / контакти
На перевіреній сторінці не розпізнається посилання на правову інформацію, сторінку «Про нас» чи контакти. Такі сторінки — сильний сигнал довіри й допомагають зіставленню сутностей.
Що вам слід зробити: Пов’яжіть правову інформацію або «Про нас» і контакти помітно, зазвичай у підвалі кожної сторінки.
Немає видимої або розміченої дати
Не розпізнається дата публікації чи зміни (ні <time>, ні article:published_time, ні datePublished у JSON-LD). Для багатьох запитань ШІ-системи віддають перевагу актуальним джерелам.
Що вам слід зробити: Для вмісту, прив’язаного до часу, показуйте дату помітно й розмічайте datePublished / dateModified у JSON-LD.
Технічна основа
Немає canonical URL
Сторінка не задає <link rel="canonical">. Без canonical може лишатися незрозумілим, яка версія визначальна, коли існує кілька варіантів URL.
Що вам слід зробити: Задавайте на кожній сторінці самопосилальний <link rel="canonical"> із бажаним URL.
У порядку (3)
- Sitemap доступний.
- Швидкий час відповіді сервера.
- Немає noindex — сторінку можна індексувати.
Наступні кроки
- Пошукові ШІ-боти заблоковані в robots.txt. Перевірте для кожного бота, чи блокування навмисне. Якщо ви хочете виключити лише навчання ШІ, заблокуйте навчальних ботів (GPTBot, ClaudeBot, Google-Extended) і дозвольте пошукових.
- Сервер блокує ботів, хоча robots.txt їх дозволяє. Додайте user-agent’и та/або діапазони IP потрібних ШІ-краулерів до списку дозволених у вашому WAF / Cloudflare / брандмауері. Перевіряйте їх за зворотним DNS, а не лише за рядком user-agent.
- Дуже мало тексту в HTML. Переконайтеся, що фактичний вміст повністю в HTML, а не в зображеннях, iframe чи блоках, що завантажуються через JavaScript.
Щотижневе повторне сканування зі сповіщенням електронною поштою за кожної зміни. У підготовці — введіть свою адресу.
Метод і межі
Перевірено 24.09.2026. citeglass забирає nytimes.com і пов’язані файли (robots.txt, llms.txt, sitemap.xml) через HTTP — один раз як звичайний браузер, один раз для кожного user-agent’а ШІ-краулера. JavaScript не виконується. Час до першого байта: 99 мс.
Чим це не є: Жодного відстеження позицій чи цитувань, жодного твердження про те, чи називає модель вас насправді, і жодної перевірки вмісту, що завантажується через JavaScript. Знімок з погляду одного серверного IP.