Zkontrolováno 24. 9. 2026 · https://www.nytimes.com/
Existuje 2 kritických blokací pro dohledatelnost AI — vyřešte je nejdřív.
3 skenů tohoto webu, skóre -37 od prvního skenu. S monitoringem citeglass kontroluje web automaticky každý týden a upozorní, když se něco zhorší — přihlaste se a dáme vám vědět při spuštění.
Matice AI robotů
Pro každého robota: co povoluje váš robots.txt — a co váš server skutečně vrací user agentovi robota. Řádky zvýrazněné červeně: robots to povoluje, ale server to blokuje (obvykle pravidlo WAF nebo ochrany proti robotům).
| Robot | Provozovatel | robots.txt | Odpověď serveru |
|---|---|---|---|
| GPTBot | OpenAI | blokováno | blokováno (403 / WAF) |
| OAI-SearchBot | OpenAI | blokováno | blokováno (403 / WAF) |
| ChatGPT-User | OpenAI | blokováno | blokováno (403 / WAF) |
| ClaudeBot | Anthropic | blokováno | blokováno (403 / WAF) |
| Claude-SearchBot | Anthropic | blokováno | blokováno (403 / WAF) |
| Claude-User | Anthropic | blokováno | blokováno (403 / WAF) |
| PerplexityBot | Perplexity | blokováno | blokováno (403 / WAF) |
| Perplexity-User | Perplexity | blokováno | blokováno (403 / WAF) |
| Google-Extended | Google (Gemini-Training) | blokováno | — |
| Googlebot | Google (KI-Übersichten) | povoleno | blokováno (403 / WAF) |
| CCBot | Common Crawl (Trainingsdaten vieler LLMs) | blokováno | blokováno (403 / WAF) |
| Bytespider | ByteDance (Doubao) | blokováno | blokováno (403 / WAF) |
| Amazonbot | Amazon (Alexa/Rufus) | povoleno | blokováno (403 / WAF) |
| Applebot-Extended | Apple (Intelligence-Training) | blokováno | — |
| Meta-ExternalAgent | Meta (Llama/Meta AI) | blokováno | blokováno (403 / WAF) |
Jak vzniká skóre?
| Vyhledávací AI boti jsou v robots.txt zablokováni | -32 |
| Server blokuje roboty, ačkoli je robots.txt povoluje | -12 |
| Velmi málo textu v HTML | -10 |
| Žádná strukturovaná data (JSON-LD) | -8 |
| Titulek stránky příliš krátký nebo dlouhý | -6 |
| Ne přesně jeden nadpis H1 | -5 |
| Meta popis chybí nebo nesedí | -5 |
| Žádný llms.txt | -5 |
| Žádný signál autora ani autorství | -4 |
| Žádná propojení sameAs | -3 |
| Žádný odkaz na právní údaje / o nás / kontakt | -3 |
| Žádné viditelné ani označené datum | -3 |
| Žádná canonical URL | -3 |
| Výsledek | 1 / 100 |
Přístup pro AI roboty
Vyhledávací AI boti jsou v robots.txt zablokováni
Váš robots.txt blokuje 6 botů, kteří načítají obsah pro odpovědi AI asistentů a vyhledávačů: OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, PerplexityBot, Perplexity-User. Dokud jsou zablokováni, váš web se tam nemůže objevit jako zdroj.
Toto byste měli udělat: U každého bota ověřte, zda je blokace záměrná. Pokud chcete vyloučit jen trénování AI, zablokujte trénovací boty (GPTBot, ClaudeBot, Google-Extended) a vyhledávací boty povolte.
User-agent: OAI-SearchBot Allow: / User-agent: ChatGPT-User Allow: / User-agent: Claude-SearchBot Allow: / User-agent: Claude-User Allow: / User-agent: PerplexityBot Allow: / User-agent: Perplexity-User Allow: /
Server blokuje roboty, ačkoli je robots.txt povoluje
Pro 2 robota/ů z Google (KI-Übersichten), Amazon (Alexa/Rufus) říká robots.txt „povoleno“, ale server odpovídá kódem 403 nebo stránkou ochrany proti robotům. Obvykle pravidlo WAF, firewallu nebo CDN, které robota vylučuje mimo robots.txt.
Toto byste měli udělat: Přidejte user agenty a/nebo rozsahy IP požadovaných AI robotů na seznam povolených ve svém WAF / Cloudflare / firewallu. Ověřte je pomocí zpětného DNS, ne jen podle řetězce user agenta.
Obsah bez JavaScriptu
Velmi málo textu v HTML
Počáteční HTML obsahuje jen asi 55 znaků viditelného textu. To sotva stačí, aby AI systémy s jistotou pochopily téma stránky.
Toto byste měli udělat: Zajistěte, aby byl skutečný obsah celý v HTML a ne v obrázcích, iframech nebo blocích načítaných přes JavaScript.
Struktura a strojová srozumitelnost
Žádná strukturovaná data (JSON-LD)
Stránka neobsahuje žádné JSON-LD. Strukturovaná data pomáhají AI systémům jednoznačně rozpoznat entity, autora, organizaci, datum a typ stránky — bez nich se vše musí odhadovat z textu.
Toto byste měli udělat: Přidejte alespoň schéma „Organization“ a jedno odpovídající typu stránky (Article, Product, FAQPage …) jako JSON-LD v <head>.
<script type="application/ld+json">
{"@context":"https://schema.org","@type":"Organization",
"name":"Vaše firma","url":"https://vase-domena.cz",
"sameAs":["https://www.linkedin.com/company/…"]}
</script>Titulek stránky příliš krátký nebo dlouhý
<title> má 11 znaků. Rozumné je asi 30–60 znaků: dost popisný, aby pojmenoval téma, dost krátký, aby nebyl oříznut.
Toto byste měli udělat: Napište výstižný titulek obsahující téma a případně značku.
Ne přesně jeden nadpis H1
Stránka má 0 nadpisů H1. Jeden jednoznačný H1 říká lidem i strojům, o čem stránka primárně je.
Toto byste měli udělat: Nastavte přesně jeden H1, který pojmenuje hlavní téma stránky. Vše pod tím začíná od H2.
Meta popis chybí nebo nesedí
Meta popis má 0 znaků. Je to často první věc, kterou AI systémy a vyhledávače čtou jako shrnutí stránky.
Toto byste měli udělat: Napište samostatné shrnutí stránky v jedné nebo dvou větách (asi 120–200 znaků), ne řadu klíčových slov.
Žádný llms.txt
Na /llms.txt není žádný soubor. llms.txt je krátký přehled vašeho klíčového obsahu v Markdownu, který některé AI systémy používají k orientaci.
Toto byste měli udělat: Vytvořte /llms.txt: H1 s názvem, krátký odstavec o nabídce a seznam odkazů na hlavní stránky.
# Vaše firma > Popis v jedné větě. ## Důležité stránky - [Produkt](https://vase-domena.cz/produkt): … - [Ceník](https://vase-domena.cz/cenik): … - [O nás](https://vase-domena.cz/o-nas): …
Signály důvěry a entity (E-E-A-T)
Žádný signál autora ani autorství
Nelze rozpoznat žádného autora (ani meta tag, ani rel=author, ani JSON-LD Person). Pro „zkušenost“ a „odbornost“ ve smyslu E-E-A-T se počítá jmenované, dohledatelné autorství.
Toto byste měli udělat: U redakčního obsahu jmenujte autora jménem a odkažte na stránku autora; označte ho také jako JSON-LD „Person“.
Žádná propojení sameAs
V JSON-LD chybí „sameAs“. Umožňuje AI systémům jasně přiřadit vaši značku nebo osobu ke známým entitám (Wikidata, LinkedIn, oborové katalogy).
Toto byste měli udělat: Přidejte „sameAs“ v Organization nebo Person s URL vašich oficiálních profilů a katalogových záznamů.
Žádný odkaz na právní údaje / o nás / kontakt
Na kontrolované stránce nelze rozpoznat žádný odkaz na právní údaje, stránku „O nás“ ani kontakt. Takové stránky jsou silný signál důvěry a pomáhají s přiřazením entity.
Toto byste měli udělat: Odkažte právní údaje nebo „O nás“ a kontakt viditelně, obvykle v patičce každé stránky.
Žádné viditelné ani označené datum
Nelze rozpoznat datum publikace ani úpravy (ani <time>, ani article:published_time, ani datePublished v JSON-LD). U mnoha dotazů dávají AI systémy přednost aktuálním zdrojům.
Toto byste měli udělat: U obsahu s časovou vazbou zobrazujte datum viditelně a označte datePublished / dateModified v JSON-LD.
Technický základ
Žádná canonical URL
Stránka nenastavuje <link rel="canonical">. Bez canonical může zůstat nejasné, která verze je závazná, když existuje více variant URL.
Toto byste měli udělat: Nastavte na každé stránce sebeodkazující <link rel="canonical"> s preferovanou URL.
V pořádku (3)
- Sitemap je dostupný.
- Rychlá doba odezvy serveru.
- Žádný noindex — stránka může být indexována.
Další kroky
- Vyhledávací AI boti jsou v robots.txt zablokováni. U každého bota ověřte, zda je blokace záměrná. Pokud chcete vyloučit jen trénování AI, zablokujte trénovací boty (GPTBot, ClaudeBot, Google-Extended) a vyhledávací boty povolte.
- Server blokuje roboty, ačkoli je robots.txt povoluje. Přidejte user agenty a/nebo rozsahy IP požadovaných AI robotů na seznam povolených ve svém WAF / Cloudflare / firewallu. Ověřte je pomocí zpětného DNS, ne jen podle řetězce user agenta.
- Velmi málo textu v HTML. Zajistěte, aby byl skutečný obsah celý v HTML a ne v obrázcích, iframech nebo blocích načítaných přes JavaScript.
Metoda a hranice
Zkontrolováno 24. 9. 2026. citeglass načítá nytimes.com a související soubory (robots.txt, llms.txt, sitemap.xml) přes HTTP — jednou jako běžný prohlížeč, jednou za každý user agent AI robota. Nespouští se JavaScript. Doba do prvního bytu: 123 ms.
Co to není: Žádné sledování pozic ani citací, žádné tvrzení o tom, zda vás model skutečně jmenuje, a žádná kontrola obsahu načítaného přes JavaScript. Momentka z pohledu jedné serverové IP.