Tarkistettu 24.9.2026 · https://www.nytimes.com/
Tekoälyllä löytymiselle on 2 kriittistä estettä — korjaa ne ensin.
Tekoälyrobottien matriisi
Kunkin robotin osalta: mitä robots.txt sallii — ja mitä palvelimesi tosiasiassa palauttaa robotin user agentille. Punaisella korostetut rivit: robots sallii sen, mutta palvelin estää (yleensä WAF- tai bottisuojaussääntö).
| Robotti | Ylläpitäjä | robots.txt | Palvelimen vastaus |
|---|---|---|---|
| GPTBot | OpenAI | estetty | estetty (403 / WAF) |
| OAI-SearchBot | OpenAI | estetty | estetty (403 / WAF) |
| ChatGPT-User | OpenAI | estetty | estetty (403 / WAF) |
| ClaudeBot | Anthropic | estetty | estetty (403 / WAF) |
| Claude-SearchBot | Anthropic | estetty | estetty (403 / WAF) |
| Claude-User | Anthropic | estetty | estetty (403 / WAF) |
| PerplexityBot | Perplexity | estetty | estetty (403 / WAF) |
| Perplexity-User | Perplexity | estetty | estetty (403 / WAF) |
| Google-Extended | Google (Gemini-Training) | estetty | — |
| Googlebot | Google (KI-Übersichten) | sallittu | estetty (403 / WAF) |
| CCBot | Common Crawl (Trainingsdaten vieler LLMs) | estetty | estetty (403 / WAF) |
| Bytespider | ByteDance (Doubao) | estetty | estetty (403 / WAF) |
| Amazonbot | Amazon (Alexa/Rufus) | sallittu | estetty (403 / WAF) |
| Applebot-Extended | Apple (Intelligence-Training) | estetty | — |
| Meta-ExternalAgent | Meta (Llama/Meta AI) | estetty | estetty (403 / WAF) |
Miten pistemäärä muodostuu?
| Tekoälyn hakubotit on estetty robots.txt-tiedostossa | -32 |
| Palvelin estää robotteja, vaikka robots.txt sallii ne | -12 |
| Hyvin vähän tekstiä HTML:ssä | -10 |
| Ei jäsenneltyjä tietoja (JSON-LD) | -8 |
| Sivun otsikko liian lyhyt tai liian pitkä | -6 |
| Ei tasan yhtä H1-otsikkoa | -5 |
| Meta-kuvaus puuttuu tai ei sovi | -5 |
| Ei llms.txt:ää | -5 |
| Ei tekijä- tai tekijyyssignaalia | -4 |
| Ei sameAs-yhdistelyjä | -3 |
| Ei linkkiä oikeudellisiin tietoihin / tietoa meistä / yhteystietoihin | -3 |
| Ei näkyvää tai merkittyä päivämäärää | -3 |
| Ei canonical-URL:ää | -3 |
| Tulos | 1 / 100 |
Tekoälyrobottien pääsy
Tekoälyn hakubotit on estetty robots.txt-tiedostossa
robots.txt estää 6 bottia, jotka hakevat sisältöä tekoälyavustajien ja hakukoneiden vastauksiin: OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, PerplexityBot, Perplexity-User. Niin kauan kuin ne on estetty, sivustosi ei voi näkyä niissä lähteenä.
Tämä sinun tulisi tehdä: Tarkista jokaisen botin kohdalla, onko esto tarkoituksellinen. Jos haluat kieltää vain tekoälykoulutuksen, estä koulutusbotit (GPTBot, ClaudeBot, Google-Extended) ja salli hakubotit.
User-agent: OAI-SearchBot Allow: / User-agent: ChatGPT-User Allow: / User-agent: Claude-SearchBot Allow: / User-agent: Claude-User Allow: / User-agent: PerplexityBot Allow: / User-agent: Perplexity-User Allow: /
Palvelin estää robotteja, vaikka robots.txt sallii ne
2 robotille lähteestä Google (KI-Übersichten), Amazon (Alexa/Rufus) robots.txt sanoo ”sallittu”, mutta palvelin vastaa 403:lla tai bottisuojaussivulla. Yleensä WAF-, palomuuri- tai CDN-sääntö, joka sulkee robotin ulos robots.txt:n ohi.
Tämä sinun tulisi tehdä: Lisää haluttujen tekoälyrobottien user agentit ja/tai IP-alueet sallittujen listalle WAF:ssa / Cloudflaressa / palomuurissa. Varmenna ne käänteisellä DNS:llä, älä pelkän user agent -merkkijonon perusteella.
Tekoälykoulutus kielletty
robots.txt estää crawlerit, jotka keräävät sisältöä kielimallien koulutukseen: GPTBot, ClaudeBot, Google-Extended, CCBot, Applebot-Extended. Tämä ei estä lainauksia — haku- ja noutobotit, kuten OAI-SearchBot, PerplexityBot ja Googlebot tekoälykatsauksia varten, ovat niistä erillään.
Tämä sinun tulisi tehdä: Ei toimenpiteitä, jos kielto on tarkoituksellinen. Varmista vain, että hakubotit pysyvät sallittuina.
Sisältö ilman JavaScriptiä
Hyvin vähän tekstiä HTML:ssä
Alkuperäinen HTML sisältää vain noin 55 merkkiä näkyvää tekstiä. Se riittää tuskin siihen, että tekoälyjärjestelmät hahmottaisivat sivun aiheen varmasti.
Tämä sinun tulisi tehdä: Varmista, että varsinainen sisältö on kokonaan HTML:ssä eikä kuvissa, iframeissa tai JavaScriptillä ladattavissa lohkoissa.
Rakenne ja koneellinen ymmärrettävyys
Ei jäsenneltyjä tietoja (JSON-LD)
Sivu ei sisällä JSON-LD:tä. Jäsennellyt tiedot auttavat tekoälyjärjestelmiä tunnistamaan yksiselitteisesti entiteetit, tekijän, organisaation, päivämäärän ja sivutyypin — ilman niitä kaikki on arvattava leipätekstistä.
Tämä sinun tulisi tehdä: Lisää vähintään ”Organization”-skeema ja sivutyyppiin sopiva (Article, Product, FAQPage …) JSON-LD:nä <head>-osaan.
<script type="application/ld+json">
{"@context":"https://schema.org","@type":"Organization",
"name":"Yrityksesi","url":"https://oma-verkkotunnuksesi.fi",
"sameAs":["https://www.linkedin.com/company/…"]}
</script>Sivun otsikko liian lyhyt tai liian pitkä
<title> on 11 merkkiä pitkä. Noin 30–60 merkkiä on järkevä: riittävän kuvaava aiheen nimeämiseen, riittävän lyhyt jäämättä katkeamatta.
Tämä sinun tulisi tehdä: Kirjoita ytimekäs otsikko, joka sisältää aiheen ja tarvittaessa brändin.
Ei tasan yhtä H1-otsikkoa
Sivulla on 0 H1-otsikkoa. Yksi yksiselitteinen H1 kertoo ihmisille ja koneille, mistä sivulla ensisijaisesti on kyse.
Tämä sinun tulisi tehdä: Aseta tasan yksi H1, joka nimeää sivun pääaiheen. Kaikki sen alla alkaa H2:sta.
Meta-kuvaus puuttuu tai ei sovi
Meta-kuvaus on 0 merkkiä pitkä. Se on usein ensimmäinen asia, jonka tekoälyjärjestelmät ja hakukoneet lukevat sivun tiivistelmänä.
Tämä sinun tulisi tehdä: Kirjoita sivusta itsenäinen tiivistelmä yhdellä tai kahdella lauseella (noin 120–200 merkkiä), ei avainsanajonoa.
Ei llms.txt:ää
Osoitteessa /llms.txt ei ole tiedostoa. llms.txt on lyhyt Markdown-yleiskatsaus keskeiseen sisältöösi, jota jotkin tekoälyjärjestelmät käyttävät suunnistamiseen.
Tämä sinun tulisi tehdä: Luo /llms.txt: H1 nimellä, lyhyt kappale tarjonnasta ja linkkiluettelo keskeisille sivuille.
# Yrityksesi > Kuvaus yhdellä lauseella. ## Tärkeät sivut - [Tuote](https://oma-verkkotunnuksesi.fi/tuote): … - [Hinnat](https://oma-verkkotunnuksesi.fi/hinnat): … - [Tietoa meistä](https://oma-verkkotunnuksesi.fi/tietoa): …
Luottamus- ja entiteettisignaalit (E-E-A-T)
Ei tekijä- tai tekijyyssignaalia
Tekijää ei ole tunnistettavissa (ei meta-tagia, rel=author- eikä JSON-LD Person -merkintää). ”Kokemuksen” ja ”asiantuntemuksen” kannalta E-E-A-T-mielessä nimetty, jäljitettävä tekijyys on tärkeää.
Tämä sinun tulisi tehdä: Toimituksellisessa sisällössä nimeä tekijä ja linkitä tekijäsivu; merkitse hänet myös JSON-LD:n ”Person”-tyypiksi.
Ei sameAs-yhdistelyjä
JSON-LD:stä puuttuu ”sameAs”. Sen avulla tekoälyjärjestelmät yhdistävät brändisi tai henkilösi selkeästi tunnettuihin entiteetteihin (Wikidata, LinkedIn, toimialahakemistot).
Tämä sinun tulisi tehdä: Lisää ”sameAs” Organization- tai Person-kohtaan virallisten profiiliesi ja hakemistomerkintöjesi URL-osoitteilla.
Ei linkkiä oikeudellisiin tietoihin / tietoa meistä / yhteystietoihin
Tarkistetulla sivulla ei ole tunnistettavissa linkkiä oikeudellisiin tietoihin, ”Tietoa meistä” -sivulle tai yhteystietoihin. Tällaiset sivut ovat vahva luottamussignaali ja auttavat entiteetin yhdistämisessä.
Tämä sinun tulisi tehdä: Linkitä oikeudelliset tiedot tai ”Tietoa meistä” ja yhteystiedot näkyvästi, yleensä jokaisen sivun alatunnisteessa.
Ei näkyvää tai merkittyä päivämäärää
Julkaisu- tai muokkauspäivämäärää ei ole tunnistettavissa (ei <time>, article:published_time eikä datePublished JSON-LD:ssä). Monissa kysymyksissä tekoälyjärjestelmät suosivat ajantasaisia lähteitä.
Tämä sinun tulisi tehdä: Aikaan sidotussa sisällössä näytä päivämäärä näkyvästi ja merkitse datePublished / dateModified JSON-LD:hen.
Tekninen perusta
Ei canonical-URL:ää
Sivu ei aseta <link rel="canonical"> -elementtiä. Ilman canonicalia voi jäädä epäselväksi, mikä versio on määräävä, kun URL-variantteja on useita.
Tämä sinun tulisi tehdä: Aseta jokaiselle sivulle itseensä viittaava <link rel="canonical"> ensisijaisella URL:lla.
Kunnossa (3)
- Sivukartta on saavutettavissa.
- Palvelimen nopea vasteaika.
- Ei noindexiä — sivu saa olla indeksoitu.
Seuraavat vaiheet
- Tekoälyn hakubotit on estetty robots.txt-tiedostossa. Tarkista jokaisen botin kohdalla, onko esto tarkoituksellinen. Jos haluat kieltää vain tekoälykoulutuksen, estä koulutusbotit (GPTBot, ClaudeBot, Google-Extended) ja salli hakubotit.
- Palvelin estää robotteja, vaikka robots.txt sallii ne. Lisää haluttujen tekoälyrobottien user agentit ja/tai IP-alueet sallittujen listalle WAF:ssa / Cloudflaressa / palomuurissa. Varmenna ne käänteisellä DNS:llä, älä pelkän user agent -merkkijonon perusteella.
- Hyvin vähän tekstiä HTML:ssä. Varmista, että varsinainen sisältö on kokonaan HTML:ssä eikä kuvissa, iframeissa tai JavaScriptillä ladattavissa lohkoissa.
Viikoittainen uudelleenskannaus sähköpostihälytyksellä jokaisesta muutoksesta. Valmisteilla — anna osoitteesi.
Menetelmä ja rajat
Tarkistettu 24.9.2026. citeglass noutaa sivun nytimes.com ja siihen liittyvät tiedostot (robots.txt, llms.txt, sitemap.xml) HTTP:llä — kerran tavallisena selaimena, kerran kutakin tekoälyrobotin user agentia kohti. JavaScriptiä ei suoriteta. Aika ensimmäiseen tavuun: 99 ms.
Mitä tämä ei ole: Ei sijoitusten tai lainausten seurantaa, ei väitettä siitä, nimeääkö malli sinut tosiasiassa, eikä JavaScriptillä ladattavan sisällön tarkistusta. Tilannekuva yhden palvelin-IP:n näkökulmasta.