Čeština
citeglass · Kontrola viditelnosti pro AI

Zkontrolováno 24. 9. 2026 · https://www.nytimes.com/

Existuje 2 kritických blokací pro dohledatelnost AI — vyřešte je nejdřív.

F
1 / 100
2 kritických · 5 ke kontrole
Od posledního skenování: Skóre -37 · 2 opraveno · 8 nových

Matice AI robotů

Pro každého robota: co povoluje váš robots.txt — a co váš server skutečně vrací user agentovi robota. Řádky zvýrazněné červeně: robots to povoluje, ale server to blokuje (obvykle pravidlo WAF nebo ochrany proti robotům).

RobotProvozovatelrobots.txtOdpověď serveru
GPTBotOpenAIblokovánoblokováno (403 / WAF)
OAI-SearchBotOpenAIblokovánoblokováno (403 / WAF)
ChatGPT-UserOpenAIblokovánoblokováno (403 / WAF)
ClaudeBotAnthropicblokovánoblokováno (403 / WAF)
Claude-SearchBotAnthropicblokovánoblokováno (403 / WAF)
Claude-UserAnthropicblokovánoblokováno (403 / WAF)
PerplexityBotPerplexityblokovánoblokováno (403 / WAF)
Perplexity-UserPerplexityblokovánoblokováno (403 / WAF)
Google-ExtendedGoogle (Gemini-Training)blokováno—
GooglebotGoogle (KI-Übersichten)povolenoblokováno (403 / WAF)
CCBotCommon Crawl (Trainingsdaten vieler LLMs)blokovánoblokováno (403 / WAF)
BytespiderByteDance (Doubao)blokovánoblokováno (403 / WAF)
AmazonbotAmazon (Alexa/Rufus)povolenoblokováno (403 / WAF)
Applebot-ExtendedApple (Intelligence-Training)blokováno—
Meta-ExternalAgentMeta (Llama/Meta AI)blokovánoblokováno (403 / WAF)
Jak vzniká skóre?
Vyhledávací AI boti jsou v robots.txt zablokováni-32
Server blokuje roboty, ačkoli je robots.txt povoluje-12
Velmi málo textu v HTML-10
Žádná strukturovaná data (JSON-LD)-8
Titulek stránky příliš krátký nebo dlouhý-6
Ne přesně jeden nadpis H1-5
Meta popis chybí nebo nesedí-5
Žádný llms.txt-5
Žádný signál autora ani autorství-4
Žádná propojení sameAs-3
Žádný odkaz na právní údaje / o nás / kontakt-3
Žádné viditelné ani označené datum-3
Žádná canonical URL-3
Výsledek1 / 100

Přístup pro AI roboty

kritické

Vyhledávací AI boti jsou v robots.txt zablokováni

Váš robots.txt blokuje 6 botů, kteří načítají obsah pro odpovědi AI asistentů a vyhledávačů: OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, PerplexityBot, Perplexity-User. Dokud jsou zablokováni, váš web se tam nemůže objevit jako zdroj.

Toto byste měli udělat: U každého bota ověřte, zda je blokace záměrná. Pokud chcete vyloučit jen trénování AI, zablokujte trénovací boty (GPTBot, ClaudeBot, Google-Extended) a vyhledávací boty povolte.

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Claude-User
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Perplexity-User
Allow: /
kritické

Server blokuje roboty, ačkoli je robots.txt povoluje

Pro 2 robota/ů z Google (KI-Übersichten), Amazon (Alexa/Rufus) říká robots.txt „povoleno“, ale server odpovídá kódem 403 nebo stránkou ochrany proti robotům. Obvykle pravidlo WAF, firewallu nebo CDN, které robota vylučuje mimo robots.txt.

Toto byste měli udělat: Přidejte user agenty a/nebo rozsahy IP požadovaných AI robotů na seznam povolených ve svém WAF / Cloudflare / firewallu. Ověřte je pomocí zpětného DNS, ne jen podle řetězce user agenta.

poznámka

Trénování AI vyloučeno

Váš robots.txt blokuje crawlery, které sbírají obsah pro trénování jazykových modelů: GPTBot, ClaudeBot, Google-Extended, CCBot, Applebot-Extended. Citacím to nebrání — vyhledávací a načítací boti jako OAI-SearchBot, PerplexityBot a Googlebot pro AI přehledy jsou oddělení.

Toto byste měli udělat: Není co dělat, pokud je vyloučení záměrné. Jen dbejte, aby vyhledávací boti zůstali povoleni.

Obsah bez JavaScriptu

ke kontrole

Velmi málo textu v HTML

Počáteční HTML obsahuje jen asi 55 znaků viditelného textu. To sotva stačí, aby AI systémy s jistotou pochopily téma stránky.

Toto byste měli udělat: Zajistěte, aby byl skutečný obsah celý v HTML a ne v obrázcích, iframech nebo blocích načítaných přes JavaScript.

Struktura a strojová srozumitelnost

ke kontrole

Žádná strukturovaná data (JSON-LD)

Stránka neobsahuje žádné JSON-LD. Strukturovaná data pomáhají AI systémům jednoznačně rozpoznat entity, autora, organizaci, datum a typ stránky — bez nich se vše musí odhadovat z textu.

Toto byste měli udělat: Přidejte alespoň schéma „Organization“ a jedno odpovídající typu stránky (Article, Product, FAQPage …) jako JSON-LD v <head>.

<script type="application/ld+json">
{"@context":"https://schema.org","@type":"Organization",
 "name":"Vaše firma","url":"https://vase-domena.cz",
 "sameAs":["https://www.linkedin.com/company/…"]}
</script>
ke kontrole

Titulek stránky příliš krátký nebo dlouhý

<title> má 11 znaků. Rozumné je asi 30–60 znaků: dost popisný, aby pojmenoval téma, dost krátký, aby nebyl oříznut.

Toto byste měli udělat: Napište výstižný titulek obsahující téma a případně značku.

ke kontrole

Ne přesně jeden nadpis H1

Stránka má 0 nadpisů H1. Jeden jednoznačný H1 říká lidem i strojům, o čem stránka primárně je.

Toto byste měli udělat: Nastavte přesně jeden H1, který pojmenuje hlavní téma stránky. Vše pod tím začíná od H2.

ke kontrole

Meta popis chybí nebo nesedí

Meta popis má 0 znaků. Je to často první věc, kterou AI systémy a vyhledávače čtou jako shrnutí stránky.

Toto byste měli udělat: Napište samostatné shrnutí stránky v jedné nebo dvou větách (asi 120–200 znaků), ne řadu klíčových slov.

poznámka

Žádný llms.txt

Na /llms.txt není žádný soubor. llms.txt je krátký přehled vašeho klíčového obsahu v Markdownu, který některé AI systémy používají k orientaci.

Toto byste měli udělat: Vytvořte /llms.txt: H1 s názvem, krátký odstavec o nabídce a seznam odkazů na hlavní stránky.

# Vaše firma

> Popis v jedné větě.

## Důležité stránky
- [Produkt](https://vase-domena.cz/produkt): …
- [Ceník](https://vase-domena.cz/cenik): …
- [O nás](https://vase-domena.cz/o-nas): …

Signály důvěry a entity (E-E-A-T)

poznámka

Žádný signál autora ani autorství

Nelze rozpoznat žádného autora (ani meta tag, ani rel=author, ani JSON-LD Person). Pro „zkušenost“ a „odbornost“ ve smyslu E-E-A-T se počítá jmenované, dohledatelné autorství.

Toto byste měli udělat: U redakčního obsahu jmenujte autora jménem a odkažte na stránku autora; označte ho také jako JSON-LD „Person“.

poznámka

Žádná propojení sameAs

V JSON-LD chybí „sameAs“. Umožňuje AI systémům jasně přiřadit vaši značku nebo osobu ke známým entitám (Wikidata, LinkedIn, oborové katalogy).

Toto byste měli udělat: Přidejte „sameAs“ v Organization nebo Person s URL vašich oficiálních profilů a katalogových záznamů.

poznámka

Žádný odkaz na právní údaje / o nás / kontakt

Na kontrolované stránce nelze rozpoznat žádný odkaz na právní údaje, stránku „O nás“ ani kontakt. Takové stránky jsou silný signál důvěry a pomáhají s přiřazením entity.

Toto byste měli udělat: Odkažte právní údaje nebo „O nás“ a kontakt viditelně, obvykle v patičce každé stránky.

poznámka

Žádné viditelné ani označené datum

Nelze rozpoznat datum publikace ani úpravy (ani <time>, ani article:published_time, ani datePublished v JSON-LD). U mnoha dotazů dávají AI systémy přednost aktuálním zdrojům.

Toto byste měli udělat: U obsahu s časovou vazbou zobrazujte datum viditelně a označte datePublished / dateModified v JSON-LD.

Technický základ

poznámka

Žádná canonical URL

Stránka nenastavuje <link rel="canonical">. Bez canonical může zůstat nejasné, která verze je závazná, když existuje více variant URL.

Toto byste měli udělat: Nastavte na každé stránce sebeodkazující <link rel="canonical"> s preferovanou URL.

V pořádku (3)
  • Sitemap je dostupný.
  • Rychlá doba odezvy serveru.
  • Žádný noindex — stránka může být indexována.

Další kroky

  1. Vyhledávací AI boti jsou v robots.txt zablokováni. U každého bota ověřte, zda je blokace záměrná. Pokud chcete vyloučit jen trénování AI, zablokujte trénovací boty (GPTBot, ClaudeBot, Google-Extended) a vyhledávací boty povolte.
  2. Server blokuje roboty, ačkoli je robots.txt povoluje. Přidejte user agenty a/nebo rozsahy IP požadovaných AI robotů na seznam povolených ve svém WAF / Cloudflare / firewallu. Ověřte je pomocí zpětného DNS, ne jen podle řetězce user agenta.
  3. Velmi málo textu v HTML. Zajistěte, aby byl skutečný obsah celý v HTML a ne v obrázcích, iframech nebo blocích načítaných přes JavaScript.
Sledovat tuto stránku

Týdenní opětovné skenování s e-mailovým upozorněním při každé změně. V přípravě — zadejte svou adresu.

Metoda a hranice

Zkontrolováno 24. 9. 2026. citeglass načítá nytimes.com a související soubory (robots.txt, llms.txt, sitemap.xml) přes HTTP — jednou jako běžný prohlížeč, jednou za každý user agent AI robota. Nespouští se JavaScript. Doba do prvního bytu: 99 ms.

Co to není: Žádné sledování pozic ani citací, žádné tvrzení o tom, zda vás model skutečně jmenuje, a žádná kontrola obsahu načítaného přes JavaScript. Momentka z pohledu jedné serverové IP.

Zkontrolovat jiný web