Eesti
citeglass · Tehisintellekti nähtavuse kontroll

Kontrollitud 24.9.2026 · https://www.nytimes.com/

Tehisintellekti leitavusele on 2 kriitilist takistust — paranda need esimesena.

F
1 / 100
2 kriitilist · 5 kontrollida
Alates viimasest skannimisest: Hinne -37 · 2 parandatud · 8 uut

Tehisintellekti robotite maatriks

Iga roboti kohta: mida lubab sinu robots.txt — ja mida server roboti kasutajaagendile tegelikult tagastab. Punaselt esile tõstetud read: robots lubab, kuid server blokeerib (tavaliselt WAF-i või robotikaitse reegel).

RobotKäitajarobots.txtServeri vastus
GPTBotOpenAIblokeeritudblokeeritud (403 / WAF)
OAI-SearchBotOpenAIblokeeritudblokeeritud (403 / WAF)
ChatGPT-UserOpenAIblokeeritudblokeeritud (403 / WAF)
ClaudeBotAnthropicblokeeritudblokeeritud (403 / WAF)
Claude-SearchBotAnthropicblokeeritudblokeeritud (403 / WAF)
Claude-UserAnthropicblokeeritudblokeeritud (403 / WAF)
PerplexityBotPerplexityblokeeritudblokeeritud (403 / WAF)
Perplexity-UserPerplexityblokeeritudblokeeritud (403 / WAF)
Google-ExtendedGoogle (Gemini-Training)blokeeritud—
GooglebotGoogle (KI-Übersichten)lubatudblokeeritud (403 / WAF)
CCBotCommon Crawl (Trainingsdaten vieler LLMs)blokeeritudblokeeritud (403 / WAF)
BytespiderByteDance (Doubao)blokeeritudblokeeritud (403 / WAF)
AmazonbotAmazon (Alexa/Rufus)lubatudblokeeritud (403 / WAF)
Applebot-ExtendedApple (Intelligence-Training)blokeeritud—
Meta-ExternalAgentMeta (Llama/Meta AI)blokeeritudblokeeritud (403 / WAF)
Kuidas hinne kujuneb?
Tehisintellekti otsingubotid on robots.txt-s blokeeritud-32
Server blokeerib robotid, kuigi robots.txt lubab neid-12
HTML-is on väga vähe teksti-10
Struktureeritud andmed (JSON-LD) puuduvad-8
Lehe pealkiri liiga lühike või liiga pikk-6
Mitte täpselt üks H1-pealkiri-5
Meta-kirjeldus puudub või ei sobi-5
llms.txt puudub-5
Autori- või autorsuse signaal puudub-4
sameAs-ühendused puuduvad-3
Link õiguslikule teabele / meist / kontaktile puudub-3
Nähtav või märgistatud kuupäev puudub-3
Canonical URL puudub-3
Tulemus1 / 100

Juurdepääs tehisintellekti robotitele

kriitiline

Tehisintellekti otsingubotid on robots.txt-s blokeeritud

Sinu robots.txt blokeerib 6 botti, mis toovad sisu tehisintellekti assistentide ja otsingumootorite vastuste jaoks: OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, PerplexityBot, Perplexity-User. Kuni need on blokeeritud, ei saa su sait seal allikana ilmuda.

Seda peaksid tegema: Kontrolli iga boti puhul, kas blokeering on tahtlik. Kui soovid välistada ainult tehisintellekti treenimise, blokeeri treeningbotid (GPTBot, ClaudeBot, Google-Extended) ja luba otsingubotid.

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Claude-User
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Perplexity-User
Allow: /
kriitiline

Server blokeerib robotid, kuigi robots.txt lubab neid

2 roboti puhul allikast Google (KI-Übersichten), Amazon (Alexa/Rufus) ütleb robots.txt „lubatud“, kuid server vastab koodiga 403 või robotikaitse lehega. Tavaliselt WAF-i, tulemüüri või CDN-i reegel, mis välistab roboti robots.txt-st mööda minnes.

Seda peaksid tegema: Lisa soovitud tehisintellekti robotite kasutajaagendid ja/või IP-vahemikud oma WAF-i / Cloudflare'i / tulemüüri lubatute loendisse. Kontrolli neid pöörd-DNS-i abil, mitte ainult kasutajaagendi stringi järgi.

märkus

Tehisintellekti treenimine välistatud

Sinu robots.txt blokeerib roomajad, mis koguvad sisu keelemudelite treenimiseks: GPTBot, ClaudeBot, Google-Extended, CCBot, Applebot-Extended. See ei takista viitamist — otsingu- ja toomisbotid nagu OAI-SearchBot, PerplexityBot ja Googlebot AI-ülevaadete jaoks on eraldi.

Seda peaksid tegema: Midagi pole vaja teha, kui välistamine on tahtlik. Jälgi vaid, et otsingubotid jääksid lubatuks.

Sisu ilma JavaScriptita

kontrollida

HTML-is on väga vähe teksti

Esialgne HTML sisaldab vaid umbes 55 tähemärki nähtavat teksti. See jääb napiks, et tehisintellekti süsteemid mõistaksid kindlalt lehe teemat.

Seda peaksid tegema: Veendu, et tegelik sisu on täies mahus HTML-is, mitte piltides, iframe'ides ega JavaScriptiga laaditud plokkides.

Struktuur ja masinloetavus

kontrollida

Struktureeritud andmed (JSON-LD) puuduvad

Leht ei sisalda JSON-LD-d. Struktureeritud andmed aitavad tehisintellekti süsteemidel üheselt ära tunda olemid, autori, organisatsiooni, kuupäeva ja lehetüübi — ilma nendeta tuleb kõik tekstist ära arvata.

Seda peaksid tegema: Lisa vähemalt „Organization“ skeem ja lehetüübile sobiv (Article, Product, FAQPage …) JSON-LD-na <head>-i.

<script type="application/ld+json">
{"@context":"https://schema.org","@type":"Organization",
 "name":"Sinu ettevõte","url":"https://sinu-domeen.ee",
 "sameAs":["https://www.linkedin.com/company/…"]}
</script>
kontrollida

Lehe pealkiri liiga lühike või liiga pikk

<title> on 11 tähemärki pikk. Mõistlik on umbes 30–60 tähemärki: piisavalt kirjeldav, et nimetada teema, piisavalt lühike, et mitte ära lõikuda.

Seda peaksid tegema: Kirjuta kokkuvõtlik pealkiri, mis sisaldab teemat ja vajaduse korral kaubamärki.

kontrollida

Mitte täpselt üks H1-pealkiri

Lehel on 0 H1-pealkirja. Üks ühemõtteline H1 ütleb inimestele ja masinatele, millest leht eelkõige räägib.

Seda peaksid tegema: Sea täpselt üks H1, mis nimetab lehe põhiteema. Kõik selle all algab H2-st.

kontrollida

Meta-kirjeldus puudub või ei sobi

Meta-kirjeldus on 0 tähemärki pikk. See on sageli esimene, mida tehisintellekti süsteemid ja otsingumootorid loevad lehe kokkuvõttena.

Seda peaksid tegema: Kirjuta lehe iseseisev kokkuvõte ühe või kahe lausega (umbes 120–200 tähemärki), mitte märksõnade rida.

märkus

llms.txt puudub

Aadressil /llms.txt ei ole faili. llms.txt on sinu põhisisu lühike Markdown-ülevaade, mida mõned tehisintellekti süsteemid kasutavad orienteerumiseks.

Seda peaksid tegema: Loo /llms.txt: H1 nimega, lühike lõik pakkumise kohta ja linkide loend kesksetele lehtedele.

# Sinu ettevõte

> Kirjeldus ühe lausega.

## Olulised lehed
- [Toode](https://sinu-domeen.ee/toode): …
- [Hinnad](https://sinu-domeen.ee/hinnad): …
- [Meist](https://sinu-domeen.ee/meist): …

Usaldus- ja olemisignaalid (E-E-A-T)

märkus

Autori- või autorsuse signaal puudub

Autorit ei ole tuvastatav (ei meta-silti, rel=author ega JSON-LD Person). „Kogemuse“ ja „asjatundlikkuse“ jaoks E-E-A-T mõttes loeb nimetatud, jälgitav autorsus.

Seda peaksid tegema: Toimetusliku sisu puhul nimeta autor nimeliselt ja lingi autorileht; märgista ta ka JSON-LD-s kui „Person“.

märkus

sameAs-ühendused puuduvad

JSON-LD-st puudub „sameAs“. Sellega seovad tehisintellekti süsteemid sinu kaubamärgi või isiku selgelt tuntud olemitega (Wikidata, LinkedIn, valdkonna kataloogid).

Seda peaksid tegema: Lisa „sameAs“ Organizationi või Personi juurde oma ametlike profiilide ja kataloogikannete URL-idega.

märkus

Link õiguslikule teabele / meist / kontaktile puudub

Kontrollitud lehel ei ole tuvastatav linki õiguslikule teabele, lehele „Meist“ ega kontaktile. Sellised lehed on tugev usaldussignaal ja aitavad olemi sidumisel.

Seda peaksid tegema: Lingi õiguslik teave või „Meist“ ja kontakt nähtavalt, tavaliselt iga lehe jaluses.

märkus

Nähtav või märgistatud kuupäev puudub

Avaldamis- ega muutmiskuupäev ei ole tuvastatav (ei <time>, article:published_time ega datePublished JSON-LD-s). Paljude küsimuste puhul eelistavad tehisintellekti süsteemid ajakohaseid allikaid.

Seda peaksid tegema: Ajalise seosega sisu puhul kuva kuupäev nähtavalt ja märgista datePublished / dateModified JSON-LD-s.

Tehniline alus

märkus

Canonical URL puudub

Leht ei määra <link rel="canonical">. Ilma canonical-ita võib jääda ebaselgeks, milline versioon on määrav, kui URL-il on mitu varianti.

Seda peaksid tegema: Sea igal lehel isele viitav <link rel="canonical"> eelistatud URL-iga.

Korras (3)
  • Sitemap on kättesaadav.
  • Kiire serveri vastuseaeg.
  • Noindex puudub — lehte tohib indekseerida.

Järgmised sammud

  1. Tehisintellekti otsingubotid on robots.txt-s blokeeritud. Kontrolli iga boti puhul, kas blokeering on tahtlik. Kui soovid välistada ainult tehisintellekti treenimise, blokeeri treeningbotid (GPTBot, ClaudeBot, Google-Extended) ja luba otsingubotid.
  2. Server blokeerib robotid, kuigi robots.txt lubab neid. Lisa soovitud tehisintellekti robotite kasutajaagendid ja/või IP-vahemikud oma WAF-i / Cloudflare'i / tulemüüri lubatute loendisse. Kontrolli neid pöörd-DNS-i abil, mitte ainult kasutajaagendi stringi järgi.
  3. HTML-is on väga vähe teksti. Veendu, et tegelik sisu on täies mahus HTML-is, mitte piltides, iframe'ides ega JavaScriptiga laaditud plokkides.
Jälgi seda lehte

Iganädalane uuesti skannimine e-kirja hoiatusega iga muudatuse korral. Ettevalmistamisel — sisesta oma aadress.

Meetod ja piirid

Kontrollitud 24.9.2026. citeglass laadib nytimes.com ja sellega seotud failid (robots.txt, llms.txt, sitemap.xml) HTTP kaudu — üks kord tavalise brauserina, üks kord iga tehisintellekti roboti kasutajaagendi kohta. JavaScripti ei käivitata. Aeg esimese baidini: 99 ms.

Mis see ei ole: Ei jälgi positsioone ega tsiteeringuid, ei väida, kas mudel sind tegelikult nimetab, ega kontrolli JavaScriptiga laaditud sisu. Hetketõmmis ühe serveri IP vaatenurgast.

Kontrolli teist veebisaiti