Diperiksa pada 24/9/2026 · https://www.nytimes.com/
Ada 2 penghalang kritis untuk keterjangkauan AI — perbaiki dulu itu.
Matriks perayap AI
Untuk setiap bot: apa yang diizinkan robots.txt Anda — dan apa yang sebenarnya dikembalikan server Anda ke agen pengguna bot. Baris yang disorot merah: robots mengizinkan, tetapi server memblokir (biasanya aturan WAF atau perlindungan bot).
| Bot | Operator | robots.txt | Respons server |
|---|---|---|---|
| GPTBot | OpenAI | diblokir | diblokir (403 / WAF) |
| OAI-SearchBot | OpenAI | diblokir | diblokir (403 / WAF) |
| ChatGPT-User | OpenAI | diblokir | diblokir (403 / WAF) |
| ClaudeBot | Anthropic | diblokir | diblokir (403 / WAF) |
| Claude-SearchBot | Anthropic | diblokir | diblokir (403 / WAF) |
| Claude-User | Anthropic | diblokir | diblokir (403 / WAF) |
| PerplexityBot | Perplexity | diblokir | diblokir (403 / WAF) |
| Perplexity-User | Perplexity | diblokir | diblokir (403 / WAF) |
| Google-Extended | Google (Gemini-Training) | diblokir | — |
| Googlebot | Google (KI-Übersichten) | diizinkan | diblokir (403 / WAF) |
| CCBot | Common Crawl (Trainingsdaten vieler LLMs) | diblokir | diblokir (403 / WAF) |
| Bytespider | ByteDance (Doubao) | diblokir | diblokir (403 / WAF) |
| Amazonbot | Amazon (Alexa/Rufus) | diizinkan | diblokir (403 / WAF) |
| Applebot-Extended | Apple (Intelligence-Training) | diblokir | — |
| Meta-ExternalAgent | Meta (Llama/Meta AI) | diblokir | diblokir (403 / WAF) |
Bagaimana skor terbentuk?
| Bot pencarian AI diblokir di robots.txt | -32 |
| Server memblokir bot meskipun robots.txt mengizinkannya | -12 |
| Sangat sedikit teks di HTML | -10 |
| Tidak ada data terstruktur (JSON-LD) | -8 |
| Judul halaman terlalu pendek atau terlalu panjang | -6 |
| Tidak tepat satu judul H1 | -5 |
| Meta description hilang atau tidak sesuai | -5 |
| Tidak ada llms.txt | -5 |
| Tidak ada sinyal penulis atau kepenulisan | -4 |
| Tidak ada koneksi sameAs | -3 |
| Tidak ada tautan ke informasi hukum / tentang kami / kontak | -3 |
| Tidak ada tanggal yang terlihat atau ditandai | -3 |
| Tidak ada URL canonical | -3 |
| Hasil | 1 / 100 |
Akses untuk perayap AI
Bot pencarian AI diblokir di robots.txt
robots.txt Anda memblokir 6 bot yang mengambil konten untuk jawaban asisten AI dan mesin pencari: OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, PerplexityBot, Perplexity-User. Selama diblokir, situs Anda tidak dapat muncul di sana sebagai sumber.
Yang sebaiknya Anda lakukan: Periksa untuk setiap bot apakah pemblokiran disengaja. Jika hanya ingin menolak pelatihan AI, blokir bot pelatihan (GPTBot, ClaudeBot, Google-Extended) dan izinkan bot pencarian.
User-agent: OAI-SearchBot Allow: / User-agent: ChatGPT-User Allow: / User-agent: Claude-SearchBot Allow: / User-agent: Claude-User Allow: / User-agent: PerplexityBot Allow: / User-agent: Perplexity-User Allow: /
Server memblokir bot meskipun robots.txt mengizinkannya
Untuk 2 bot dari Google (KI-Übersichten), Amazon (Alexa/Rufus), robots.txt berkata «diizinkan», tetapi server merespons dengan 403 atau halaman perlindungan bot. Biasanya aturan WAF, firewall, atau CDN yang mengunci perayap melewati robots.txt.
Yang sebaiknya Anda lakukan: Tambahkan agen pengguna dan/atau rentang IP perayap AI yang diinginkan ke daftar izin di WAF / Cloudflare / firewall Anda. Verifikasi melalui DNS terbalik, bukan hanya berdasarkan string agen pengguna.
Pelatihan AI ditolak
robots.txt Anda memblokir crawler yang mengumpulkan konten untuk melatih model bahasa: GPTBot, ClaudeBot, Google-Extended, CCBot, Applebot-Extended. Ini tidak mencegah kutipan — bot pencarian dan pengambilan seperti OAI-SearchBot, PerplexityBot, dan Googlebot untuk AI Overviews terpisah.
Yang sebaiknya Anda lakukan: Tidak perlu tindakan jika penolakan disengaja. Pastikan saja bot pencarian tetap diizinkan.
Konten tanpa JavaScript
Sangat sedikit teks di HTML
HTML awal hanya berisi sekitar 55 karakter teks yang terlihat. Itu nyaris tidak cukup bagi sistem AI untuk memahami topik halaman dengan pasti.
Yang sebaiknya Anda lakukan: Pastikan konten sebenarnya sepenuhnya ada di HTML dan bukan di gambar, iframe, atau blok yang dimuat melalui JavaScript.
Struktur dan keterpahaman mesin
Tidak ada data terstruktur (JSON-LD)
Halaman tidak berisi JSON-LD. Data terstruktur membantu sistem AI mengenali entitas, penulis, organisasi, tanggal, dan jenis halaman secara jelas — tanpa itu, semua harus ditebak dari teks isi.
Yang sebaiknya Anda lakukan: Tambahkan setidaknya skema «Organization» dan skema yang sesuai dengan jenis halaman (Article, Product, FAQPage …) sebagai JSON-LD di <head>.
<script type="application/ld+json">
{"@context":"https://schema.org","@type":"Organization",
"name":"Perusahaan Anda","url":"https://domain-anda.id",
"sameAs":["https://www.linkedin.com/company/…"]}
</script>Judul halaman terlalu pendek atau terlalu panjang
<title> panjangnya 11 karakter. Sekitar 30–60 karakter itu wajar: cukup deskriptif untuk menamai topik, cukup pendek agar tidak terpotong.
Yang sebaiknya Anda lakukan: Tulis judul ringkas yang berisi topik dan bila perlu merek.
Tidak tepat satu judul H1
Halaman memiliki 0 judul H1. Satu H1 yang jelas memberi tahu manusia dan mesin tentang apa halaman itu secara utama.
Yang sebaiknya Anda lakukan: Setel tepat satu H1 yang menamai topik utama halaman. Semua di bawahnya dimulai dari H2.
Meta description hilang atau tidak sesuai
Meta description panjangnya 0 karakter. Ini sering menjadi hal pertama yang dibaca sistem AI dan mesin pencari sebagai ringkasan halaman.
Yang sebaiknya Anda lakukan: Tulis ringkasan mandiri halaman dalam satu atau dua kalimat (sekitar 120–200 karakter), bukan deretan kata kunci.
Tidak ada llms.txt
Di /llms.txt tidak ada berkas. llms.txt adalah ikhtisar Markdown singkat dari konten inti Anda yang digunakan sebagian sistem AI untuk orientasi.
Yang sebaiknya Anda lakukan: Buat /llms.txt: sebuah H1 dengan nama, satu paragraf singkat tentang penawaran, dan daftar tautan ke halaman inti.
# Perusahaan Anda > Deskripsi dalam satu kalimat. ## Halaman penting - [Produk](https://domain-anda.id/produk): … - [Harga](https://domain-anda.id/harga): … - [Tentang kami](https://domain-anda.id/tentang): …
Sinyal kepercayaan dan entitas (E-E-A-T)
Tidak ada sinyal penulis atau kepenulisan
Tidak ada penulis yang dapat dikenali (baik meta tag, rel=author, maupun JSON-LD Person). Untuk «pengalaman» dan «keahlian» dalam arti E-E-A-T, kepenulisan yang disebutkan namanya dan dapat ditelusuri itu penting.
Yang sebaiknya Anda lakukan: Untuk konten editorial, sebutkan nama penulis dan tautkan halaman penulis; tandai juga sebagai JSON-LD «Person».
Tidak ada koneksi sameAs
Di JSON-LD tidak ada «sameAs». Dengannya sistem AI memetakan merek atau orang Anda secara jelas ke entitas yang dikenal (Wikidata, LinkedIn, direktori industri).
Yang sebaiknya Anda lakukan: Tambahkan «sameAs» di Organization atau Person dengan URL profil resmi dan entri direktori Anda.
Tidak ada tautan ke informasi hukum / tentang kami / kontak
Pada halaman yang diperiksa, tidak ada tautan ke informasi hukum, halaman «Tentang kami», atau kontak yang dapat dikenali. Halaman semacam itu adalah sinyal kepercayaan yang kuat dan membantu pemetaan entitas.
Yang sebaiknya Anda lakukan: Tautkan informasi hukum atau «Tentang kami» dan kontak secara terlihat, biasanya di footer setiap halaman.
Tidak ada tanggal yang terlihat atau ditandai
Tidak ada tanggal publikasi atau perubahan yang dapat dikenali (baik <time>, article:published_time, maupun datePublished di JSON-LD). Untuk banyak pertanyaan, sistem AI lebih menyukai sumber terkini.
Yang sebaiknya Anda lakukan: Untuk konten yang terkait waktu, tampilkan tanggal secara terlihat dan tandai datePublished / dateModified di JSON-LD.
Dasar teknis
Tidak ada URL canonical
Halaman tidak menyetel <link rel="canonical">. Tanpa canonical, bisa tetap tidak jelas versi mana yang berwenang ketika ada beberapa varian URL.
Yang sebaiknya Anda lakukan: Setel di setiap halaman sebuah <link rel="canonical"> yang merujuk dirinya sendiri dengan URL pilihan.
Baik (3)
- Sitemap dapat dijangkau.
- Waktu respons server cepat.
- Tidak ada noindex — halaman boleh diindeks.
Langkah berikutnya
- Bot pencarian AI diblokir di robots.txt. Periksa untuk setiap bot apakah pemblokiran disengaja. Jika hanya ingin menolak pelatihan AI, blokir bot pelatihan (GPTBot, ClaudeBot, Google-Extended) dan izinkan bot pencarian.
- Server memblokir bot meskipun robots.txt mengizinkannya. Tambahkan agen pengguna dan/atau rentang IP perayap AI yang diinginkan ke daftar izin di WAF / Cloudflare / firewall Anda. Verifikasi melalui DNS terbalik, bukan hanya berdasarkan string agen pengguna.
- Sangat sedikit teks di HTML. Pastikan konten sebenarnya sepenuhnya ada di HTML dan bukan di gambar, iframe, atau blok yang dimuat melalui JavaScript.
Pemindaian ulang mingguan dengan peringatan email pada setiap perubahan. Sedang disiapkan — masukkan alamat Anda.
Metode dan batasan
Diperiksa pada 24/9/2026. citeglass mengambil nytimes.com dan berkas terkait (robots.txt, llms.txt, sitemap.xml) melalui HTTP — sekali sebagai peramban biasa, sekali per agen pengguna perayap AI. JavaScript tidak dijalankan. Waktu hingga bita pertama: 99 ms.
Yang bukan merupakan hal ini: Tidak ada pelacakan peringkat atau kutipan, tidak ada pernyataan apakah suatu model benar-benar menyebut Anda, dan tidak ada pemeriksaan konten yang dimuat melalui JavaScript. Sebuah cuplikan dari sudut pandang satu IP server.