Kontrollitud 4.9.2026 · https://www.nytimes.com/
Tehisintellekti leitavusele on 2 kriitilist takistust — paranda need esimesena.
Tehisintellekti robotite maatriks
Iga roboti kohta: mida lubab sinu robots.txt — ja mida server roboti kasutajaagendile tegelikult tagastab. Punaselt esile tõstetud read: robots lubab, kuid server blokeerib (tavaliselt WAF-i või robotikaitse reegel).
| Robot | Käitaja | robots.txt | Serveri vastus |
|---|---|---|---|
| GPTBot | OpenAI | blokeeritud | blokeeritud (403 / WAF) |
| OAI-SearchBot | OpenAI | blokeeritud | blokeeritud (403 / WAF) |
| ChatGPT-User | OpenAI | blokeeritud | blokeeritud (403 / WAF) |
| ClaudeBot | Anthropic | blokeeritud | blokeeritud (403 / WAF) |
| Claude-SearchBot | Anthropic | blokeeritud | blokeeritud (403 / WAF) |
| Claude-User | Anthropic | blokeeritud | blokeeritud (403 / WAF) |
| PerplexityBot | Perplexity | blokeeritud | blokeeritud (403 / WAF) |
| Perplexity-User | Perplexity | blokeeritud | blokeeritud (403 / WAF) |
| Google-Extended | Google (Gemini-Training) | blokeeritud | — |
| Googlebot | Google (KI-Übersichten) | lubatud | 200 + sisu |
| CCBot | Common Crawl (Trainingsdaten vieler LLMs) | blokeeritud | blokeeritud (403 / WAF) |
| Bytespider | ByteDance (Doubao) | blokeeritud | blokeeritud (403 / WAF) |
| Amazonbot | Amazon (Alexa/Rufus) | lubatud | blokeeritud (403 / WAF) |
| Applebot-Extended | Apple (Intelligence-Training) | blokeeritud | — |
| Meta-ExternalAgent | Meta (Llama/Meta AI) | blokeeritud | blokeeritud (403 / WAF) |
Kuidas hinne kujuneb?
| Olulised tehisintellekti robotid on robots.txt-s blokeeritud | -32 |
| Server blokeerib robotid, kuigi robots.txt lubab neid | -6 |
| Lehe pealkiri liiga lühike või liiga pikk | -6 |
| llms.txt puudub | -5 |
| Organization skeem puudub | -4 |
| Autori- või autorsuse signaal puudub | -4 |
| Nähtav või märgistatud kuupäev puudub | -3 |
| FAQ- või HowTo-märgistus puudub | -2 |
| Tulemus | 38 / 100 |
Juurdepääs tehisintellekti robotitele
Olulised tehisintellekti robotid on robots.txt-s blokeeritud
Sinu robots.txt keelab juurdepääsu 5 kesksele tehisintellekti robotile: GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended. Need süsteemid ei saa siis sinu sisu laadida ega seda allikana kasutada.
Seda peaksid tegema: Kontrolli iga roboti puhul, kas blokeering on tahtlik. Tehisintellekti nähtavuseks peaksid olema lubatud vähemalt GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot ja Google-Extended.
User-agent: GPTBot Allow: / User-agent: PerplexityBot Allow: /
Server blokeerib robotid, kuigi robots.txt lubab neid
1 roboti puhul allikast Amazon (Alexa/Rufus) ütleb robots.txt „lubatud“, kuid server vastab koodiga 403 või robotikaitse lehega. Tavaliselt WAF-i, tulemüüri või CDN-i reegel, mis välistab roboti robots.txt-st mööda minnes.
Seda peaksid tegema: Lisa soovitud tehisintellekti robotite kasutajaagendid ja/või IP-vahemikud oma WAF-i / Cloudflare'i / tulemüüri lubatute loendisse. Kontrolli neid pöörd-DNS-i abil, mitte ainult kasutajaagendi stringi järgi.
Struktuur ja masinloetavus
Lehe pealkiri liiga lühike või liiga pikk
<title> on 66 tähemärki pikk. Mõistlik on umbes 30–60 tähemärki: piisavalt kirjeldav, et nimetada teema, piisavalt lühike, et mitte ära lõikuda.
Seda peaksid tegema: Kirjuta kokkuvõtlik pealkiri, mis sisaldab teemat ja vajaduse korral kaubamärki.
llms.txt puudub
Aadressil /llms.txt ei ole faili. llms.txt on sinu põhisisu lühike Markdown-ülevaade, mida mõned tehisintellekti süsteemid kasutavad orienteerumiseks.
Seda peaksid tegema: Loo /llms.txt: H1 nimega, lühike lõik pakkumise kohta ja linkide loend kesksetele lehtedele.
# Sinu ettevõte > Kirjeldus ühe lausega. ## Olulised lehed - [Toode](https://sinu-domeen.ee/toode): … - [Hinnad](https://sinu-domeen.ee/hinnad): … - [Meist](https://sinu-domeen.ee/meist): …
Organization skeem puudub
JSON-LD on olemas, kuid „Organization“ kirje puudub. Tehisintellekti süsteemid paigutavad siis sinu kaubamärki halvemini eraldi olemina ja seovad seda halvemini väliste allikatega.
Seda peaksid tegema: Lisa „Organization“ skeem väljadega name, url, logo ja sameAs (lingid sinu ametlikele profiilidele).
FAQ- või HowTo-märgistus puudub
Küsimus-vastus ja samm-sammult sisu on tehisintellekti süsteemidel ilma FAQPage- või HowTo-märgistuseta raskem ära tunda otse tsiteeritava vastusena.
Seda peaksid tegema: Kus leht vastab tegelikele küsimustele või annab juhiseid, märgista see FAQPage-i või HowTo-na (märgistust ilma nähtavalt vastava sisuta ei tohi kasutada).
Usaldus- ja olemisignaalid (E-E-A-T)
Autori- või autorsuse signaal puudub
Autorit ei ole tuvastatav (ei meta-silti, rel=author ega JSON-LD Person). „Kogemuse“ ja „asjatundlikkuse“ jaoks E-E-A-T mõttes loeb nimetatud, jälgitav autorsus.
Seda peaksid tegema: Toimetusliku sisu puhul nimeta autor nimeliselt ja lingi autorileht; märgista ta ka JSON-LD-s kui „Person“.
Nähtav või märgistatud kuupäev puudub
Avaldamis- ega muutmiskuupäev ei ole tuvastatav (ei <time>, article:published_time ega datePublished JSON-LD-s). Paljude küsimuste puhul eelistavad tehisintellekti süsteemid ajakohaseid allikaid.
Seda peaksid tegema: Ajalise seosega sisu puhul kuva kuupäev nähtavalt ja märgista datePublished / dateModified JSON-LD-s.
Korras (7)
- Põhisisu on HTML-is ilma JavaScriptita.
- Struktureeritud andmed (JSON-LD) on olemas. — WebSite, NewsMediaOrganization
- Täpselt üks H1-pealkiri.
- Canonical URL on määratud.
- Sitemap on kättesaadav.
- Kiire serveri vastuseaeg.
- Noindex puudub — lehte tohib indekseerida.
Järgmised sammud
- Olulised tehisintellekti robotid on robots.txt-s blokeeritud. Kontrolli iga roboti puhul, kas blokeering on tahtlik. Tehisintellekti nähtavuseks peaksid olema lubatud vähemalt GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot ja Google-Extended.
- Server blokeerib robotid, kuigi robots.txt lubab neid. Lisa soovitud tehisintellekti robotite kasutajaagendid ja/või IP-vahemikud oma WAF-i / Cloudflare'i / tulemüüri lubatute loendisse. Kontrolli neid pöörd-DNS-i abil, mitte ainult kasutajaagendi stringi järgi.
- Lehe pealkiri liiga lühike või liiga pikk. Kirjuta kokkuvõtlik pealkiri, mis sisaldab teemat ja vajaduse korral kaubamärki.
Iganädalane uuesti skannimine e-kirja hoiatusega iga muudatuse korral. Ettevalmistamisel — sisesta oma aadress.
Meetod ja piirid
Kontrollitud 4.9.2026. citeglass laadib nytimes.com ja sellega seotud failid (robots.txt, llms.txt, sitemap.xml) HTTP kaudu — üks kord tavalise brauserina, üks kord iga tehisintellekti roboti kasutajaagendi kohta. JavaScripti ei käivitata. Aeg esimese baidini: 235 ms.
Mis see ei ole: Ei jälgi positsioone ega tsiteeringuid, ei väida, kas mudel sind tegelikult nimetab, ega kontrolli JavaScriptiga laaditud sisu. Hetketõmmis ühe serveri IP vaatenurgast.