Sprawdzono 4.09.2026 · https://www.nytimes.com/
Istnieje 2 krytycznych blokad dla wykrywalności przez AI — usuń je najpierw.
Macierz robotów AI
Dla każdego bota: co pozwala Twój robots.txt — i co Twój serwer faktycznie zwraca do user agenta bota. Wiersze zaznaczone na czerwono: robots pozwala, ale serwer blokuje (zwykle reguła WAF lub ochrony przed botami).
| Bot | Operator | robots.txt | Odpowiedź serwera |
|---|---|---|---|
| GPTBot | OpenAI | zablokowane | zablokowane (403 / WAF) |
| OAI-SearchBot | OpenAI | zablokowane | zablokowane (403 / WAF) |
| ChatGPT-User | OpenAI | zablokowane | zablokowane (403 / WAF) |
| ClaudeBot | Anthropic | zablokowane | zablokowane (403 / WAF) |
| Claude-SearchBot | Anthropic | zablokowane | zablokowane (403 / WAF) |
| Claude-User | Anthropic | zablokowane | zablokowane (403 / WAF) |
| PerplexityBot | Perplexity | zablokowane | zablokowane (403 / WAF) |
| Perplexity-User | Perplexity | zablokowane | zablokowane (403 / WAF) |
| Google-Extended | Google (Gemini-Training) | zablokowane | — |
| Googlebot | Google (KI-Übersichten) | dozwolone | 200 + treść |
| CCBot | Common Crawl (Trainingsdaten vieler LLMs) | zablokowane | zablokowane (403 / WAF) |
| Bytespider | ByteDance (Doubao) | zablokowane | zablokowane (403 / WAF) |
| Amazonbot | Amazon (Alexa/Rufus) | dozwolone | zablokowane (403 / WAF) |
| Applebot-Extended | Apple (Intelligence-Training) | zablokowane | — |
| Meta-ExternalAgent | Meta (Llama/Meta AI) | zablokowane | zablokowane (403 / WAF) |
Jak powstaje wynik?
| Ważne roboty AI są zablokowane w robots.txt | -32 |
| Serwer blokuje boty, mimo że robots.txt je dopuszcza | -6 |
| Tytuł strony za krótki lub za długi | -6 |
| Brak llms.txt | -5 |
| Brak schematu Organization | -4 |
| Brak sygnału autora lub autorstwa | -4 |
| Brak widocznej lub oznaczonej daty | -3 |
| Brak znaczników FAQ lub HowTo | -2 |
| Wynik | 38 / 100 |
Dostęp dla robotów AI
Ważne roboty AI są zablokowane w robots.txt
Twój robots.txt zabrania dostępu 5 kluczowym robotom AI: GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended. Systemy te nie mogą wtedy wczytać Twojej treści ani użyć jej jako źródła.
Oto co należy zrobić: Sprawdź dla każdego bota, czy blokada jest zamierzona. Dla widoczności w AI powinny być dozwolone co najmniej GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot i Google-Extended.
User-agent: GPTBot Allow: / User-agent: PerplexityBot Allow: /
Serwer blokuje boty, mimo że robots.txt je dopuszcza
Dla 1 bot(ów) z Amazon (Alexa/Rufus) robots.txt mówi „dozwolone”, ale serwer odpowiada kodem 403 lub stroną ochrony przed botami. Zwykle reguła WAF, zapory lub CDN, która wyklucza robota z pominięciem robots.txt.
Oto co należy zrobić: Dodaj user agenty i/lub zakresy IP pożądanych robotów AI do listy dozwolonych w swoim WAF / Cloudflare / zaporze. Weryfikuj je przez odwrotny DNS, nie tylko przez ciąg user agenta.
Struktura i zrozumienie maszynowe
Tytuł strony za krótki lub za długi
<title> ma 66 znaków. Sensowne jest około 30–60 znaków: dość opisowy, by nazwać temat, dość krótki, by nie został ucięty.
Oto co należy zrobić: Napisz zwięzły tytuł zawierający temat i, jeśli trzeba, markę.
Brak llms.txt
Pod /llms.txt nie ma żadnego pliku. llms.txt to krótki przegląd w Markdown Twoich kluczowych treści, którego niektóre systemy AI używają do orientacji.
Oto co należy zrobić: Utwórz /llms.txt: H1 z nazwą, krótki akapit o ofercie i listę linków do centralnych stron.
# Twoja firma > Opis w jednym zdaniu. ## Ważne strony - [Produkt](https://twoja-domena.pl/produkt): … - [Cennik](https://twoja-domena.pl/cennik): … - [O nas](https://twoja-domena.pl/o-nas): …
Brak schematu Organization
Jest JSON-LD, ale brak wpisu „Organization”. Systemy AI gorzej wtedy umieszczają Twoją markę jako odrębną encję i słabiej łączą ją ze źródłami zewnętrznymi.
Oto co należy zrobić: Dodaj schemat „Organization” z name, url, logo i sameAs (linki do Twoich oficjalnych profili).
Brak znaczników FAQ lub HowTo
Treści typu pytanie-odpowiedź i krok po kroku są dla systemów AI trudniejsze do rozpoznania jako bezpośrednio cytowalna odpowiedź bez znaczników FAQPage lub HowTo.
Oto co należy zrobić: Tam, gdzie strona odpowiada na prawdziwe pytania lub podaje instrukcje, oznacz ją jako FAQPage lub HowTo (bez znaczników bez widocznie odpowiadającej treści).
Sygnały zaufania i encji (E-E-A-T)
Brak sygnału autora lub autorstwa
Nie da się rozpoznać autora (ani metatagu, ani rel=author, ani JSON-LD Person). Dla „doświadczenia” i „wiedzy” w sensie E-E-A-T liczy się nazwane, weryfikowalne autorstwo.
Oto co należy zrobić: Przy treściach redakcyjnych podaj autora z imienia i nazwiska oraz link do strony autora; oznacz go też jako JSON-LD „Person”.
Brak widocznej lub oznaczonej daty
Nie da się rozpoznać daty publikacji ani modyfikacji (ani <time>, ani article:published_time, ani datePublished w JSON-LD). Przy wielu pytaniach systemy AI preferują aktualne źródła.
Oto co należy zrobić: Przy treściach powiązanych z czasem pokazuj datę w widoczny sposób i oznacz datePublished / dateModified w JSON-LD.
W porządku (7)
- Główna treść jest w HTML bez JavaScriptu.
- Są dane strukturalne (JSON-LD). — WebSite, NewsMediaOrganization
- Dokładnie jeden nagłówek H1.
- Ustawiono adres URL canonical.
- Sitemap jest dostępny.
- Szybki czas odpowiedzi serwera.
- Brak noindex — strona może być indeksowana.
Następne kroki
- Ważne roboty AI są zablokowane w robots.txt. Sprawdź dla każdego bota, czy blokada jest zamierzona. Dla widoczności w AI powinny być dozwolone co najmniej GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot i Google-Extended.
- Serwer blokuje boty, mimo że robots.txt je dopuszcza. Dodaj user agenty i/lub zakresy IP pożądanych robotów AI do listy dozwolonych w swoim WAF / Cloudflare / zaporze. Weryfikuj je przez odwrotny DNS, nie tylko przez ciąg user agenta.
- Tytuł strony za krótki lub za długi. Napisz zwięzły tytuł zawierający temat i, jeśli trzeba, markę.
Cotygodniowe ponowne skanowanie z alertem e-mail przy każdej zmianie. W przygotowaniu — podaj swój adres.
Metoda i granice
Sprawdzono 4.09.2026. citeglass pobiera nytimes.com i powiązane pliki (robots.txt, llms.txt, sitemap.xml) przez HTTP — raz jako zwykła przeglądarka, raz na każdy user agent robota AI. Nie jest wykonywany JavaScript. Czas do pierwszego bajtu: 235 ms.
Czym to nie jest: Brak śledzenia pozycji ani cytowań, brak stwierdzenia, czy model faktycznie Cię wymienia, i brak kontroli treści ładowanej przez JavaScript. Migawka z perspektywy jednego IP serwera.