한국어
citeglass · AI 가시성 점검

2026. 9. 4.에 점검함 · https://www.nytimes.com/

AI 발견 가능성에 대한 심각한 차단 요소가 2건 있습니다 — 이것들을 먼저 해결하세요.

F
38 / 100
심각 2건 · 확인 필요 1건

AI 크롤러 매트릭스

각 봇에 대해: 귀하의 robots.txt가 무엇을 허용하는지 — 그리고 서버가 봇의 사용자 에이전트에 실제로 무엇을 반환하는지. 빨간색으로 강조된 행: robots는 허용하지만 서버가 차단합니다(대개 WAF 또는 봇 보호 규칙).

운영자robots.txt서버 응답
GPTBotOpenAI차단차단(403 / WAF)
OAI-SearchBotOpenAI차단차단(403 / WAF)
ChatGPT-UserOpenAI차단차단(403 / WAF)
ClaudeBotAnthropic차단차단(403 / WAF)
Claude-SearchBotAnthropic차단차단(403 / WAF)
Claude-UserAnthropic차단차단(403 / WAF)
PerplexityBotPerplexity차단차단(403 / WAF)
Perplexity-UserPerplexity차단차단(403 / WAF)
Google-ExtendedGoogle (Gemini-Training)차단
GooglebotGoogle (KI-Übersichten)허용200 + 콘텐츠
CCBotCommon Crawl (Trainingsdaten vieler LLMs)차단차단(403 / WAF)
BytespiderByteDance (Doubao)차단차단(403 / WAF)
AmazonbotAmazon (Alexa/Rufus)허용차단(403 / WAF)
Applebot-ExtendedApple (Intelligence-Training)차단
Meta-ExternalAgentMeta (Llama/Meta AI)차단차단(403 / WAF)
점수는 어떻게 산출되나요?
주요 AI 크롤러가 robots.txt에서 차단되어 있습니다-32
robots.txt는 허용하는데 서버가 봇을 차단합니다-6
페이지 제목이 너무 짧거나 너무 깁니다-6
llms.txt가 없습니다-5
Organization 스키마가 없습니다-4
작성자 또는 저작 신호가 없습니다-4
눈에 보이거나 마크업된 날짜가 없습니다-3
FAQ 또는 HowTo 마크업이 없습니다-2
결과38 / 100

AI 크롤러의 접근

심각

주요 AI 크롤러가 robots.txt에서 차단되어 있습니다

귀하의 robots.txt는 5개의 핵심 AI 크롤러의 접근을 금지합니다: GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended. 이 시스템들은 그러면 콘텐츠를 로드할 수도, 출처로 사용할 수도 없습니다.

해야 할 일: 봇별로 차단이 의도된 것인지 확인하세요. AI 가시성을 위해서는 최소한 GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended를 허용해야 합니다.

User-agent: GPTBot
Allow: /

User-agent: PerplexityBot
Allow: /
심각

robots.txt는 허용하는데 서버가 봇을 차단합니다

Amazon (Alexa/Rufus)의 1개 봇에 대해 robots.txt는 「허용」이라고 하지만 서버는 403 또는 봇 보호 페이지로 응답합니다. 대개 WAF, 방화벽, CDN 규칙이 robots.txt를 우회해 크롤러를 차단합니다.

해야 할 일: 원하는 AI 크롤러의 사용자 에이전트 및/또는 IP 범위를 WAF / Cloudflare / 방화벽의 허용 목록에 추가하세요. 사용자 에이전트 문자열만이 아니라 역방향 DNS로 확인합니다.

구조와 기계 이해 가능성

확인 필요

페이지 제목이 너무 짧거나 너무 깁니다

<title>은 66자입니다. 대략 30~60자가 적절합니다: 주제를 명명하기에 충분히 설명적이고, 잘리지 않을 만큼 충분히 짧게.

해야 할 일: 주제와 필요 시 브랜드를 포함한 간결한 제목을 작성하세요.

참고

llms.txt가 없습니다

/llms.txt에 파일이 없습니다. llms.txt는 핵심 콘텐츠의 짧은 Markdown 개요로, 일부 AI 시스템이 방향 설정에 사용합니다.

해야 할 일: /llms.txt를 생성하세요: 이름을 포함한 H1, 제공 내용에 대한 짧은 단락, 핵심 페이지로의 링크 목록.

# 귀하의 회사

> 한 문장 설명.

## 중요한 페이지
- [제품](https://your-domain.kr/product): …
- [가격](https://your-domain.kr/pricing): …
- [회사 소개](https://your-domain.kr/about): …
참고

Organization 스키마가 없습니다

JSON-LD는 있지만 「Organization」 항목이 없습니다. 그러면 AI 시스템은 귀하의 브랜드를 별개의 엔터티로 배치하기 어렵고 외부 출처와의 연결도 약해집니다.

해야 할 일: name, url, logo, sameAs(귀하의 공식 프로필 링크)를 포함한 「Organization」 스키마를 추가하세요.

참고

FAQ 또는 HowTo 마크업이 없습니다

질문-답변 및 단계별 콘텐츠는 FAQPage 또는 HowTo 마크업이 없으면 AI 시스템이 직접 인용 가능한 답변으로 인식하기 더 어렵습니다.

해야 할 일: 페이지가 실제 질문에 답하거나 지침을 제공하는 경우 FAQPage 또는 HowTo로 마크업하세요(눈에 보이는 해당 콘텐츠 없이 마크업 금지).

신뢰 및 엔터티 신호(E-E-A-T)

참고

작성자 또는 저작 신호가 없습니다

작성자를 인식할 수 없습니다(메타 태그, rel=author, JSON-LD Person 모두 없음). E-E-A-T 의미의 「경험」과 「전문성」에는 명명되고 추적 가능한 저작이 중요합니다.

해야 할 일: 편집 콘텐츠에서는 작성자를 이름으로 명시하고 작성자 페이지를 링크하세요. JSON-LD 「Person」으로도 마크업합니다.

참고

눈에 보이거나 마크업된 날짜가 없습니다

게시 날짜나 수정 날짜를 인식할 수 없습니다(<time>, article:published_time, JSON-LD의 datePublished 모두 없음). 많은 질문에서 AI 시스템은 최신 출처를 선호합니다.

해야 할 일: 시간과 관련된 콘텐츠에서는 날짜를 눈에 띄게 표시하고 JSON-LD에서 datePublished / dateModified를 마크업하세요.

정상(7)
  • 주요 콘텐츠가 JavaScript 없이 HTML에 있습니다.
  • 구조화 데이터(JSON-LD)가 존재합니다. — WebSite, NewsMediaOrganization
  • H1 제목이 정확히 하나입니다.
  • canonical URL이 설정되어 있습니다.
  • 사이트맵에 접근할 수 있습니다.
  • 서버 응답 시간이 빠릅니다.
  • noindex 없음 — 페이지를 색인할 수 있습니다.

다음 단계

  1. 주요 AI 크롤러가 robots.txt에서 차단되어 있습니다. 봇별로 차단이 의도된 것인지 확인하세요. AI 가시성을 위해서는 최소한 GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended를 허용해야 합니다.
  2. robots.txt는 허용하는데 서버가 봇을 차단합니다. 원하는 AI 크롤러의 사용자 에이전트 및/또는 IP 범위를 WAF / Cloudflare / 방화벽의 허용 목록에 추가하세요. 사용자 에이전트 문자열만이 아니라 역방향 DNS로 확인합니다.
  3. 페이지 제목이 너무 짧거나 너무 깁니다. 주제와 필요 시 브랜드를 포함한 간결한 제목을 작성하세요.
이 페이지 모니터링

변경이 있을 때마다 이메일 알림이 있는 주간 재스캔. 준비 중 — 주소를 입력하세요.

방법과 한계

2026. 9. 4.에 점검함. citeglass는 nytimes.com와 관련 파일(robots.txt, llms.txt, sitemap.xml)을 HTTP로 가져옵니다 — 한 번은 일반 브라우저로, 한 번은 각 AI 크롤러 사용자 에이전트로. JavaScript는 실행되지 않습니다. 첫 바이트까지의 시간: 235 ms.

이것이 아닌 것: 순위나 인용 추적이 없고, 모델이 실제로 귀하를 언급하는지에 대한 진술도 없으며, JavaScript로 로드되는 콘텐츠에 대한 점검도 없습니다. 하나의 서버 IP 관점에서의 스냅숏입니다.

다른 사이트 점검