Verificat pe 24.09.2026 · https://www.nytimes.com/
Există 2 blocaje critice pentru descoperirea prin AI — rezolvă-le mai întâi.
3 scanări ale acestui site, scor -37 de la prima scanare. Cu monitorizarea, citeglass verifică site-ul automat în fiecare săptămână și te anunță dacă ceva se strică — înscrie-te ca să afli la lansare.
Matricea roboților AI
Pentru fiecare robot: ce permite robots.txt-ul tău — și ce returnează serverul tău de fapt agentului de utilizator al robotului. Rânduri marcate cu roșu: robots permite, dar serverul blochează (de obicei o regulă WAF sau de protecție anti-roboți).
| Robot | Operator | robots.txt | Răspunsul serverului |
|---|---|---|---|
| GPTBot | OpenAI | blocat | blocat (403 / WAF) |
| OAI-SearchBot | OpenAI | blocat | blocat (403 / WAF) |
| ChatGPT-User | OpenAI | blocat | blocat (403 / WAF) |
| ClaudeBot | Anthropic | blocat | blocat (403 / WAF) |
| Claude-SearchBot | Anthropic | blocat | blocat (403 / WAF) |
| Claude-User | Anthropic | blocat | blocat (403 / WAF) |
| PerplexityBot | Perplexity | blocat | blocat (403 / WAF) |
| Perplexity-User | Perplexity | blocat | blocat (403 / WAF) |
| Google-Extended | Google (Gemini-Training) | blocat | — |
| Googlebot | Google (KI-Übersichten) | permis | blocat (403 / WAF) |
| CCBot | Common Crawl (Trainingsdaten vieler LLMs) | blocat | blocat (403 / WAF) |
| Bytespider | ByteDance (Doubao) | blocat | blocat (403 / WAF) |
| Amazonbot | Amazon (Alexa/Rufus) | permis | blocat (403 / WAF) |
| Applebot-Extended | Apple (Intelligence-Training) | blocat | — |
| Meta-ExternalAgent | Meta (Llama/Meta AI) | blocat | blocat (403 / WAF) |
Cum se formează scorul?
| Boți de căutare AI blocați în robots.txt | -32 |
| Serverul blochează roboți deși robots.txt îi permite | -12 |
| Foarte puțin text în HTML | -10 |
| Fără date structurate (JSON-LD) | -8 |
| Titlul paginii prea scurt sau prea lung | -6 |
| Nu exact un titlu H1 | -5 |
| Meta descrierea lipsește sau nu se potrivește | -5 |
| Fără llms.txt | -5 |
| Fără semnal de autor sau de autorat | -4 |
| Fără legături sameAs | -3 |
| Fără link către informații legale / despre noi / contact | -3 |
| Fără dată vizibilă sau marcată | -3 |
| Fără URL canonic | -3 |
| Rezultat | 1 / 100 |
Acces pentru roboții AI
Boți de căutare AI blocați în robots.txt
robots.txt blochează 6 boți care preiau conținut pentru răspunsurile asistenților AI și ale motoarelor de căutare: OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, PerplexityBot, Perplexity-User. Cât timp sunt blocați, site-ul tău nu poate apărea acolo ca sursă.
Iată ce ar trebui să faci: Verifică pentru fiecare bot dacă blocarea este intenționată. Dacă vrei să excluzi doar antrenarea AI, blochează boții de antrenare (GPTBot, ClaudeBot, Google-Extended) și permite boții de căutare.
User-agent: OAI-SearchBot Allow: / User-agent: ChatGPT-User Allow: / User-agent: Claude-SearchBot Allow: / User-agent: Claude-User Allow: / User-agent: PerplexityBot Allow: / User-agent: Perplexity-User Allow: /
Serverul blochează roboți deși robots.txt îi permite
Pentru 2 robot(i) din Google (KI-Übersichten), Amazon (Alexa/Rufus), robots.txt spune „permis”, dar serverul răspunde cu 403 sau cu o pagină de protecție anti-roboți. De obicei o regulă WAF, de firewall sau de CDN care exclude robotul ocolind robots.txt.
Iată ce ar trebui să faci: Adaugă agenții de utilizator și/sau intervalele IP ale roboților AI doriți pe o listă de permise în WAF / Cloudflare / firewall. Verifică-i prin DNS invers, nu doar după șirul agentului de utilizator.
Conținut fără JavaScript
Foarte puțin text în HTML
HTML-ul inițial conține doar circa 55 caractere de text vizibil. Este abia suficient pentru ca sistemele AI să prindă cu certitudine tema paginii.
Iată ce ar trebui să faci: Asigură-te că textul propriu-zis este integral în HTML și nu în imagini, iframe-uri sau blocuri încărcate prin JavaScript.
Structură și înțelegere de către mașină
Fără date structurate (JSON-LD)
Pagina nu conține JSON-LD. Datele structurate ajută sistemele AI să recunoască fără ambiguitate entități, autor, organizație, dată și tip de pagină — fără ele, totul trebuie ghicit din text.
Iată ce ar trebui să faci: Adaugă cel puțin o schemă „Organization” și una potrivită tipului de pagină (Article, Product, FAQPage …) ca JSON-LD în <head>.
<script type="application/ld+json">
{"@context":"https://schema.org","@type":"Organization",
"name":"Firma ta","url":"https://domeniul-tau.ro",
"sameAs":["https://www.linkedin.com/company/…"]}
</script>Titlul paginii prea scurt sau prea lung
<title> are 11 caractere. Rezonabil este circa 30–60 de caractere: suficient de descriptiv pentru a numi tema, suficient de scurt pentru a nu fi tăiat.
Iată ce ar trebui să faci: Scrie un titlu concis care conține tema și, dacă e cazul, marca.
Nu exact un titlu H1
Pagina are 0 titluri H1. Un H1 unic și clar le spune oamenilor și mașinilor despre ce este pagina în principal.
Iată ce ar trebui să faci: Setează exact un H1 care numește tema principală a paginii. Tot ce e dedesubt începe de la H2.
Meta descrierea lipsește sau nu se potrivește
Meta descrierea are 0 caractere. Este adesea primul lucru pe care sistemele AI și motoarele de căutare îl citesc drept rezumat al paginii.
Iată ce ar trebui să faci: Scrie un rezumat de sine stătător al paginii în una sau două propoziții (circa 120–200 de caractere), nu un șir de cuvinte-cheie.
Fără llms.txt
La /llms.txt nu există niciun fișier. llms.txt este o scurtă prezentare în Markdown a conținutului tău cheie, pe care unele sisteme AI o folosesc pentru orientare.
Iată ce ar trebui să faci: Creează un /llms.txt: un H1 cu numele, un paragraf scurt despre ofertă și o listă de linkuri către paginile centrale.
# Firma ta > Descriere într-o propoziție. ## Pagini cheie - [Produs](https://domeniul-tau.ro/produs): … - [Prețuri](https://domeniul-tau.ro/preturi): … - [Despre noi](https://domeniul-tau.ro/despre-noi): …
Semnale de încredere și de entitate (E-E-A-T)
Fără semnal de autor sau de autorat
Nu se poate recunoaște niciun autor (nici meta tag, nici rel=author, nici JSON-LD Person). Pentru „experiență” și „expertiză” în sensul E-E-A-T contează un autorat numit și verificabil.
Iată ce ar trebui să faci: La conținut editorial, numește un autor și leagă o pagină de autor; marcheaz-o și ca JSON-LD „Person”.
Fără legături sameAs
În JSON-LD lipsește „sameAs”. Cu el, sistemele AI îți asociază clar marca sau persoana cu entități cunoscute (Wikidata, LinkedIn, directoare de branșă).
Iată ce ar trebui să faci: Adaugă un „sameAs” în Organization sau Person cu URL-urile profilurilor tale oficiale și ale intrărilor din directoare.
Fără link către informații legale / despre noi / contact
Pe pagina verificată nu se poate recunoaște niciun link către informații legale, o pagină „Despre noi” sau contact. Astfel de pagini sunt un semnal puternic de încredere și ajută la asocierea entității.
Iată ce ar trebui să faci: Leagă informațiile legale sau „Despre noi” și contactul vizibil, de obicei în subsolul fiecărei pagini.
Fără dată vizibilă sau marcată
Nu se poate recunoaște o dată de publicare sau de modificare (nici <time>, nici article:published_time, nici datePublished în JSON-LD). La multe întrebări, sistemele AI preferă surse actuale.
Iată ce ar trebui să faci: La conținut cu referință temporală, afișează o dată vizibil și marchează datePublished / dateModified în JSON-LD.
Bază tehnică
Fără URL canonic
Pagina nu setează un <link rel="canonical">. Fără canonical poate rămâne neclar ce versiune este cea de referință când există mai multe variante de URL.
Iată ce ar trebui să faci: Setează pe fiecare pagină un <link rel="canonical"> autoreferențial cu URL-ul preferat.
În regulă (3)
- Sitemap-ul este accesibil.
- Timp de răspuns rapid al serverului.
- Fără noindex — pagina poate fi indexată.
Pașii următori
- Boți de căutare AI blocați în robots.txt. Verifică pentru fiecare bot dacă blocarea este intenționată. Dacă vrei să excluzi doar antrenarea AI, blochează boții de antrenare (GPTBot, ClaudeBot, Google-Extended) și permite boții de căutare.
- Serverul blochează roboți deși robots.txt îi permite. Adaugă agenții de utilizator și/sau intervalele IP ale roboților AI doriți pe o listă de permise în WAF / Cloudflare / firewall. Verifică-i prin DNS invers, nu doar după șirul agentului de utilizator.
- Foarte puțin text în HTML. Asigură-te că textul propriu-zis este integral în HTML și nu în imagini, iframe-uri sau blocuri încărcate prin JavaScript.
Metodă și limite
Verificat pe 24.09.2026. citeglass preia nytimes.com și fișierele asociate (robots.txt, llms.txt, sitemap.xml) prin HTTP — o dată ca browser normal, o dată pentru fiecare agent de utilizator de robot AI. Nu se execută JavaScript. Timp până la primul octet: 123 ms.
Ce nu este: Fără urmărirea pozițiilor sau a citărilor, fără vreo afirmație despre faptul dacă un model te numește cu adevărat și fără verificarea conținutului încărcat prin JavaScript. Un instantaneu din perspectiva unui IP de server.