Gecontroleerd op 4-9-2026 · https://www.nytimes.com/
Er zijn 2 kritieke blokkades voor AI-vindbaarheid — los die eerst op.
AI-crawlermatrix
Per bot: wat je robots.txt toestaat — en wat je server daadwerkelijk teruggeeft aan de user agent van de bot. Rood gemarkeerde rijen: robots staat het toe, maar de server blokkeert het (meestal een WAF- of botbeschermingsregel).
| Bot | Beheerder | robots.txt | Serverreactie |
|---|---|---|---|
| GPTBot | OpenAI | geblokkeerd | geblokkeerd (403 / WAF) |
| OAI-SearchBot | OpenAI | geblokkeerd | geblokkeerd (403 / WAF) |
| ChatGPT-User | OpenAI | geblokkeerd | geblokkeerd (403 / WAF) |
| ClaudeBot | Anthropic | geblokkeerd | geblokkeerd (403 / WAF) |
| Claude-SearchBot | Anthropic | geblokkeerd | geblokkeerd (403 / WAF) |
| Claude-User | Anthropic | geblokkeerd | geblokkeerd (403 / WAF) |
| PerplexityBot | Perplexity | geblokkeerd | geblokkeerd (403 / WAF) |
| Perplexity-User | Perplexity | geblokkeerd | geblokkeerd (403 / WAF) |
| Google-Extended | Google (Gemini-Training) | geblokkeerd | — |
| Googlebot | Google (KI-Übersichten) | toegestaan | 200 + inhoud |
| CCBot | Common Crawl (Trainingsdaten vieler LLMs) | geblokkeerd | geblokkeerd (403 / WAF) |
| Bytespider | ByteDance (Doubao) | geblokkeerd | geblokkeerd (403 / WAF) |
| Amazonbot | Amazon (Alexa/Rufus) | toegestaan | geblokkeerd (403 / WAF) |
| Applebot-Extended | Apple (Intelligence-Training) | geblokkeerd | — |
| Meta-ExternalAgent | Meta (Llama/Meta AI) | geblokkeerd | geblokkeerd (403 / WAF) |
Hoe komt de score tot stand?
| Belangrijke AI-crawlers zijn geblokkeerd in robots.txt | -32 |
| Server blokkeert bots hoewel robots.txt ze toestaat | -6 |
| Paginatitel te kort of te lang | -6 |
| Geen llms.txt | -5 |
| Geen Organization-schema | -4 |
| Geen auteurs- of auteurschapssignaal | -4 |
| Geen zichtbare of gemarkeerde datum | -3 |
| Geen FAQ- of HowTo-markup | -2 |
| Resultaat | 38 / 100 |
Toegang voor AI-crawlers
Belangrijke AI-crawlers zijn geblokkeerd in robots.txt
Je robots.txt verbiedt toegang aan 5 centrale AI-crawlers: GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended. Die systemen kunnen je inhoud dan niet laden of als bron gebruiken.
Dit zou je moeten doen: Controleer per bot of de blokkade bedoeld is. Voor AI-zichtbaarheid moeten ten minste GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot en Google-Extended zijn toegestaan.
User-agent: GPTBot Allow: / User-agent: PerplexityBot Allow: /
Server blokkeert bots hoewel robots.txt ze toestaat
Voor 1 bot(s) van Amazon (Alexa/Rufus) zegt robots.txt 'toegestaan', maar de server antwoordt met een 403 of een botbeschermingspagina. Meestal een WAF-, firewall- of CDN-regel die de crawler buiten robots.txt om buitensluit.
Dit zou je moeten doen: Zet de user agents en/of IP-bereiken van de gewenste AI-crawlers op een toelatingslijst in je WAF / Cloudflare / firewall. Verifieer ze via reverse-DNS, niet alleen via de user-agentstring.
Structuur en machinaal begrip
Paginatitel te kort of te lang
De <title> is 66 tekens lang. Ongeveer 30–60 tekens is zinvol: beschrijvend genoeg om het onderwerp te benoemen, kort genoeg om niet afgekapt te worden.
Dit zou je moeten doen: Schrijf een bondige titel met het onderwerp en, indien relevant, het merk.
Geen llms.txt
Er staat geen bestand op /llms.txt. llms.txt is een kort Markdown-overzicht van je belangrijkste inhoud dat sommige AI-systemen gebruiken om zich te oriënteren.
Dit zou je moeten doen: Maak een /llms.txt: een H1 met de naam, een korte alinea over het aanbod en een lijst met links naar de centrale pagina's.
# Jouw bedrijf > Beschrijving in één zin. ## Belangrijke pagina's - [Product](https://jouw-domein.nl/product): … - [Prijzen](https://jouw-domein.nl/prijzen): … - [Over ons](https://jouw-domein.nl/over-ons): …
Geen Organization-schema
Er is JSON-LD, maar geen 'Organization'-vermelding. AI-systemen plaatsen je merk dan minder goed als eigen entiteit en koppelen het minder goed aan externe bronnen.
Dit zou je moeten doen: Voeg een 'Organization'-schema toe met name, url, logo en sameAs (links naar je officiële profielen).
Geen FAQ- of HowTo-markup
Vraag-antwoord- en stapsgewijze inhoud is voor AI-systemen zonder FAQPage- of HowTo-markup lastiger te herkennen als direct citeerbaar antwoord.
Dit zou je moeten doen: Waar de pagina echte vragen beantwoordt of instructies geeft, markeer die als FAQPage of HowTo (geen markup zonder zichtbaar passende inhoud).
Vertrouwens- en entiteitssignalen (E-E-A-T)
Geen auteurs- of auteurschapssignaal
Er is geen auteur herkenbaar (geen metatag, geen rel=author, geen JSON-LD Person). Voor 'ervaring' en 'expertise' in E-E-A-T-zin telt een genoemd, navolgbaar auteurschap.
Dit zou je moeten doen: Noem bij redactionele inhoud een auteur met naam en link een auteurspagina; markeer die ook als JSON-LD 'Person'.
Geen zichtbare of gemarkeerde datum
Er is geen publicatie- of wijzigingsdatum herkenbaar (geen <time>, geen article:published_time, geen datePublished in de JSON-LD). Bij veel vragen geven AI-systemen de voorkeur aan actuele bronnen.
Dit zou je moeten doen: Toon bij inhoud met een tijdsaspect een datum zichtbaar en markeer datePublished / dateModified in de JSON-LD.
In orde (7)
- De hoofdinhoud staat in de HTML zonder JavaScript.
- Er is gestructureerde data (JSON-LD). — WebSite, NewsMediaOrganization
- Precies één H1-kop.
- Er is een canonieke URL ingesteld.
- De sitemap is bereikbaar.
- Snelle reactietijd van de server.
- Geen noindex — de pagina mag geïndexeerd worden.
Volgende stappen
- Belangrijke AI-crawlers zijn geblokkeerd in robots.txt. Controleer per bot of de blokkade bedoeld is. Voor AI-zichtbaarheid moeten ten minste GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot en Google-Extended zijn toegestaan.
- Server blokkeert bots hoewel robots.txt ze toestaat. Zet de user agents en/of IP-bereiken van de gewenste AI-crawlers op een toelatingslijst in je WAF / Cloudflare / firewall. Verifieer ze via reverse-DNS, niet alleen via de user-agentstring.
- Paginatitel te kort of te lang. Schrijf een bondige titel met het onderwerp en, indien relevant, het merk.
Wekelijkse herscan met e-mailwaarschuwing bij elke wijziging. In voorbereiding — vul je adres in.
Methode en grenzen
Gecontroleerd op 4-9-2026. citeglass haalt nytimes.com en de bijbehorende bestanden (robots.txt, llms.txt, sitemap.xml) via HTTP op — één keer als gewone browser, één keer per user agent van een AI-crawler. Er wordt geen JavaScript uitgevoerd. Tijd tot eerste byte: 235 ms.
Wat dit niet is: Geen positie- of citatiemonitoring, geen uitspraak of een model je daadwerkelijk noemt, en geen controle van inhoud die via JavaScript wordt geladen. Een momentopname vanuit het perspectief van één server-IP.