2026. 9. 4.에 점검함 · https://www.nytimes.com/
AI 발견 가능성에 대한 심각한 차단 요소가 2건 있습니다 — 이것들을 먼저 해결하세요.
AI 크롤러 매트릭스
각 봇에 대해: 귀하의 robots.txt가 무엇을 허용하는지 — 그리고 서버가 봇의 사용자 에이전트에 실제로 무엇을 반환하는지. 빨간색으로 강조된 행: robots는 허용하지만 서버가 차단합니다(대개 WAF 또는 봇 보호 규칙).
| 봇 | 운영자 | robots.txt | 서버 응답 |
|---|---|---|---|
| GPTBot | OpenAI | 차단 | 차단(403 / WAF) |
| OAI-SearchBot | OpenAI | 차단 | 차단(403 / WAF) |
| ChatGPT-User | OpenAI | 차단 | 차단(403 / WAF) |
| ClaudeBot | Anthropic | 차단 | 차단(403 / WAF) |
| Claude-SearchBot | Anthropic | 차단 | 차단(403 / WAF) |
| Claude-User | Anthropic | 차단 | 차단(403 / WAF) |
| PerplexityBot | Perplexity | 차단 | 차단(403 / WAF) |
| Perplexity-User | Perplexity | 차단 | 차단(403 / WAF) |
| Google-Extended | Google (Gemini-Training) | 차단 | — |
| Googlebot | Google (KI-Übersichten) | 허용 | 200 + 콘텐츠 |
| CCBot | Common Crawl (Trainingsdaten vieler LLMs) | 차단 | 차단(403 / WAF) |
| Bytespider | ByteDance (Doubao) | 차단 | 차단(403 / WAF) |
| Amazonbot | Amazon (Alexa/Rufus) | 허용 | 차단(403 / WAF) |
| Applebot-Extended | Apple (Intelligence-Training) | 차단 | — |
| Meta-ExternalAgent | Meta (Llama/Meta AI) | 차단 | 차단(403 / WAF) |
점수는 어떻게 산출되나요?
| 주요 AI 크롤러가 robots.txt에서 차단되어 있습니다 | -32 |
| robots.txt는 허용하는데 서버가 봇을 차단합니다 | -6 |
| 페이지 제목이 너무 짧거나 너무 깁니다 | -6 |
| llms.txt가 없습니다 | -5 |
| Organization 스키마가 없습니다 | -4 |
| 작성자 또는 저작 신호가 없습니다 | -4 |
| 눈에 보이거나 마크업된 날짜가 없습니다 | -3 |
| FAQ 또는 HowTo 마크업이 없습니다 | -2 |
| 결과 | 38 / 100 |
AI 크롤러의 접근
주요 AI 크롤러가 robots.txt에서 차단되어 있습니다
귀하의 robots.txt는 5개의 핵심 AI 크롤러의 접근을 금지합니다: GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended. 이 시스템들은 그러면 콘텐츠를 로드할 수도, 출처로 사용할 수도 없습니다.
해야 할 일: 봇별로 차단이 의도된 것인지 확인하세요. AI 가시성을 위해서는 최소한 GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended를 허용해야 합니다.
User-agent: GPTBot Allow: / User-agent: PerplexityBot Allow: /
robots.txt는 허용하는데 서버가 봇을 차단합니다
Amazon (Alexa/Rufus)의 1개 봇에 대해 robots.txt는 「허용」이라고 하지만 서버는 403 또는 봇 보호 페이지로 응답합니다. 대개 WAF, 방화벽, CDN 규칙이 robots.txt를 우회해 크롤러를 차단합니다.
해야 할 일: 원하는 AI 크롤러의 사용자 에이전트 및/또는 IP 범위를 WAF / Cloudflare / 방화벽의 허용 목록에 추가하세요. 사용자 에이전트 문자열만이 아니라 역방향 DNS로 확인합니다.
구조와 기계 이해 가능성
페이지 제목이 너무 짧거나 너무 깁니다
<title>은 66자입니다. 대략 30~60자가 적절합니다: 주제를 명명하기에 충분히 설명적이고, 잘리지 않을 만큼 충분히 짧게.
해야 할 일: 주제와 필요 시 브랜드를 포함한 간결한 제목을 작성하세요.
llms.txt가 없습니다
/llms.txt에 파일이 없습니다. llms.txt는 핵심 콘텐츠의 짧은 Markdown 개요로, 일부 AI 시스템이 방향 설정에 사용합니다.
해야 할 일: /llms.txt를 생성하세요: 이름을 포함한 H1, 제공 내용에 대한 짧은 단락, 핵심 페이지로의 링크 목록.
# 귀하의 회사 > 한 문장 설명. ## 중요한 페이지 - [제품](https://your-domain.kr/product): … - [가격](https://your-domain.kr/pricing): … - [회사 소개](https://your-domain.kr/about): …
Organization 스키마가 없습니다
JSON-LD는 있지만 「Organization」 항목이 없습니다. 그러면 AI 시스템은 귀하의 브랜드를 별개의 엔터티로 배치하기 어렵고 외부 출처와의 연결도 약해집니다.
해야 할 일: name, url, logo, sameAs(귀하의 공식 프로필 링크)를 포함한 「Organization」 스키마를 추가하세요.
FAQ 또는 HowTo 마크업이 없습니다
질문-답변 및 단계별 콘텐츠는 FAQPage 또는 HowTo 마크업이 없으면 AI 시스템이 직접 인용 가능한 답변으로 인식하기 더 어렵습니다.
해야 할 일: 페이지가 실제 질문에 답하거나 지침을 제공하는 경우 FAQPage 또는 HowTo로 마크업하세요(눈에 보이는 해당 콘텐츠 없이 마크업 금지).
신뢰 및 엔터티 신호(E-E-A-T)
작성자 또는 저작 신호가 없습니다
작성자를 인식할 수 없습니다(메타 태그, rel=author, JSON-LD Person 모두 없음). E-E-A-T 의미의 「경험」과 「전문성」에는 명명되고 추적 가능한 저작이 중요합니다.
해야 할 일: 편집 콘텐츠에서는 작성자를 이름으로 명시하고 작성자 페이지를 링크하세요. JSON-LD 「Person」으로도 마크업합니다.
눈에 보이거나 마크업된 날짜가 없습니다
게시 날짜나 수정 날짜를 인식할 수 없습니다(<time>, article:published_time, JSON-LD의 datePublished 모두 없음). 많은 질문에서 AI 시스템은 최신 출처를 선호합니다.
해야 할 일: 시간과 관련된 콘텐츠에서는 날짜를 눈에 띄게 표시하고 JSON-LD에서 datePublished / dateModified를 마크업하세요.
정상(7)
- 주요 콘텐츠가 JavaScript 없이 HTML에 있습니다.
- 구조화 데이터(JSON-LD)가 존재합니다. — WebSite, NewsMediaOrganization
- H1 제목이 정확히 하나입니다.
- canonical URL이 설정되어 있습니다.
- 사이트맵에 접근할 수 있습니다.
- 서버 응답 시간이 빠릅니다.
- noindex 없음 — 페이지를 색인할 수 있습니다.
다음 단계
- 주요 AI 크롤러가 robots.txt에서 차단되어 있습니다. 봇별로 차단이 의도된 것인지 확인하세요. AI 가시성을 위해서는 최소한 GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended를 허용해야 합니다.
- robots.txt는 허용하는데 서버가 봇을 차단합니다. 원하는 AI 크롤러의 사용자 에이전트 및/또는 IP 범위를 WAF / Cloudflare / 방화벽의 허용 목록에 추가하세요. 사용자 에이전트 문자열만이 아니라 역방향 DNS로 확인합니다.
- 페이지 제목이 너무 짧거나 너무 깁니다. 주제와 필요 시 브랜드를 포함한 간결한 제목을 작성하세요.
변경이 있을 때마다 이메일 알림이 있는 주간 재스캔. 준비 중 — 주소를 입력하세요.
방법과 한계
2026. 9. 4.에 점검함. citeglass는 nytimes.com와 관련 파일(robots.txt, llms.txt, sitemap.xml)을 HTTP로 가져옵니다 — 한 번은 일반 브라우저로, 한 번은 각 AI 크롤러 사용자 에이전트로. JavaScript는 실행되지 않습니다. 첫 바이트까지의 시간: 235 ms.
이것이 아닌 것: 순위나 인용 추적이 없고, 모델이 실제로 귀하를 언급하는지에 대한 진술도 없으며, JavaScript로 로드되는 콘텐츠에 대한 점검도 없습니다. 하나의 서버 IP 관점에서의 스냅숏입니다.