한국어
citeglass · AI 가시성 점검

2026. 9. 24.에 점검함 · https://www.nytimes.com/

AI 발견 가능성에 대한 심각한 차단 요소가 2건 있습니다 — 이것들을 먼저 해결하세요.

F
1 / 100
심각 2건 · 확인 필요 5건
사이트를 개선하고 계시네요 — 매주 점검해 드릴까요?

이 사이트 스캔 3회, 첫 스캔 이후 점수 -37. 모니터링을 사용하면 citeglass가 매주 자동으로 사이트를 점검하고 문제가 생기면 알려 드립니다. 출시 알림을 받으려면 등록하세요.

마지막 스캔 이후: 1건 수정됨

AI 크롤러 매트릭스

각 봇에 대해: 귀하의 robots.txt가 무엇을 허용하는지 — 그리고 서버가 봇의 사용자 에이전트에 실제로 무엇을 반환하는지. 빨간색으로 강조된 행: robots는 허용하지만 서버가 차단합니다(대개 WAF 또는 봇 보호 규칙).

봇운영자robots.txt서버 응답
GPTBotOpenAI차단차단(403 / WAF)
OAI-SearchBotOpenAI차단차단(403 / WAF)
ChatGPT-UserOpenAI차단차단(403 / WAF)
ClaudeBotAnthropic차단차단(403 / WAF)
Claude-SearchBotAnthropic차단차단(403 / WAF)
Claude-UserAnthropic차단차단(403 / WAF)
PerplexityBotPerplexity차단차단(403 / WAF)
Perplexity-UserPerplexity차단차단(403 / WAF)
Google-ExtendedGoogle (Gemini-Training)차단—
GooglebotGoogle (KI-Übersichten)허용차단(403 / WAF)
CCBotCommon Crawl (Trainingsdaten vieler LLMs)차단차단(403 / WAF)
BytespiderByteDance (Doubao)차단차단(403 / WAF)
AmazonbotAmazon (Alexa/Rufus)허용차단(403 / WAF)
Applebot-ExtendedApple (Intelligence-Training)차단—
Meta-ExternalAgentMeta (Llama/Meta AI)차단차단(403 / WAF)
점수는 어떻게 산출되나요?
AI 검색 봇이 robots.txt에서 차단되어 있습니다-32
robots.txt는 허용하는데 서버가 봇을 차단합니다-12
HTML에 텍스트가 매우 적습니다-10
구조화 데이터(JSON-LD)가 없습니다-8
페이지 제목이 너무 짧거나 너무 깁니다-6
H1 제목이 정확히 하나가 아닙니다-5
메타 설명이 없거나 적절하지 않습니다-5
llms.txt가 없습니다-5
작성자 또는 저작 신호가 없습니다-4
sameAs 연결이 없습니다-3
법적 고지 / 회사 소개 / 연락처 링크가 없습니다-3
눈에 보이거나 마크업된 날짜가 없습니다-3
canonical URL이 없습니다-3
결과1 / 100

AI 크롤러의 접근

심각

AI 검색 봇이 robots.txt에서 차단되어 있습니다

robots.txt가 AI 어시스턴트와 검색 엔진 답변용 콘텐츠를 가져오는 봇 6개를 차단하고 있습니다: OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, PerplexityBot, Perplexity-User. 차단되어 있는 동안에는 사이트가 그곳에 출처로 나타날 수 없습니다.

해야 할 일: 봇마다 차단이 의도된 것인지 확인하세요. AI 학습만 거부하려면 학습용 봇(GPTBot, ClaudeBot, Google-Extended)을 차단하고 검색 봇은 허용하세요.

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Claude-User
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Perplexity-User
Allow: /
심각

robots.txt는 허용하는데 서버가 봇을 차단합니다

Google (KI-Übersichten), Amazon (Alexa/Rufus)의 2개 봇에 대해 robots.txt는 「허용」이라고 하지만 서버는 403 또는 봇 보호 페이지로 응답합니다. 대개 WAF, 방화벽, CDN 규칙이 robots.txt를 우회해 크롤러를 차단합니다.

해야 할 일: 원하는 AI 크롤러의 사용자 에이전트 및/또는 IP 범위를 WAF / Cloudflare / 방화벽의 허용 목록에 추가하세요. 사용자 에이전트 문자열만이 아니라 역방향 DNS로 확인합니다.

JavaScript 없는 콘텐츠

확인 필요

HTML에 텍스트가 매우 적습니다

초기 HTML에는 보이는 텍스트가 약 55자밖에 없습니다. AI 시스템이 페이지의 주제를 확실히 파악하기에는 거의 부족합니다.

해야 할 일: 실제 콘텐츠가 이미지, iframe, JavaScript로 로드되는 블록이 아니라 완전히 HTML에 있는지 확인하세요.

구조와 기계 이해 가능성

확인 필요

구조화 데이터(JSON-LD)가 없습니다

페이지에 JSON-LD가 없습니다. 구조화 데이터는 AI 시스템이 엔터티, 작성자, 조직, 날짜, 페이지 유형을 명확히 인식하도록 돕습니다 — 그것이 없으면 모든 것을 본문에서 추측해야 합니다.

해야 할 일: 최소한 「Organization」 스키마와 페이지 유형에 맞는 스키마(Article, Product, FAQPage 등)를 JSON-LD로 <head>에 추가하세요.

<script type="application/ld+json">
{"@context":"https://schema.org","@type":"Organization",
 "name":"귀하의 회사","url":"https://your-domain.kr",
 "sameAs":["https://www.linkedin.com/company/…"]}
</script>
확인 필요

페이지 제목이 너무 짧거나 너무 깁니다

<title>은 11자입니다. 대략 30~60자가 적절합니다: 주제를 명명하기에 충분히 설명적이고, 잘리지 않을 만큼 충분히 짧게.

해야 할 일: 주제와 필요 시 브랜드를 포함한 간결한 제목을 작성하세요.

확인 필요

H1 제목이 정확히 하나가 아닙니다

페이지에 H1 제목이 0개 있습니다. 명확한 H1 하나는 페이지가 주로 무엇에 관한 것인지를 사람과 기계에 알려줍니다.

해야 할 일: 페이지의 주제를 명명하는 H1을 정확히 하나 설정하세요. 그 아래는 모두 H2에서 시작합니다.

확인 필요

메타 설명이 없거나 적절하지 않습니다

메타 설명은 0자입니다. 이는 AI 시스템과 검색 엔진이 페이지 요약으로 가장 먼저 읽는 경우가 많습니다.

해야 할 일: 키워드 나열이 아니라 페이지의 독립적인 요약을 한두 문장(약 120~200자)으로 작성하세요.

참고

llms.txt가 없습니다

/llms.txt에 파일이 없습니다. llms.txt는 핵심 콘텐츠의 짧은 Markdown 개요로, 일부 AI 시스템이 방향 설정에 사용합니다.

해야 할 일: /llms.txt를 생성하세요: 이름을 포함한 H1, 제공 내용에 대한 짧은 단락, 핵심 페이지로의 링크 목록.

# 귀하의 회사

> 한 문장 설명.

## 중요한 페이지
- [제품](https://your-domain.kr/product): …
- [가격](https://your-domain.kr/pricing): …
- [회사 소개](https://your-domain.kr/about): …

신뢰 및 엔터티 신호(E-E-A-T)

참고

작성자 또는 저작 신호가 없습니다

작성자를 인식할 수 없습니다(메타 태그, rel=author, JSON-LD Person 모두 없음). E-E-A-T 의미의 「경험」과 「전문성」에는 명명되고 추적 가능한 저작이 중요합니다.

해야 할 일: 편집 콘텐츠에서는 작성자를 이름으로 명시하고 작성자 페이지를 링크하세요. JSON-LD 「Person」으로도 마크업합니다.

참고

sameAs 연결이 없습니다

JSON-LD에 「sameAs」가 없습니다. 이를 통해 AI 시스템은 귀하의 브랜드나 인물을 알려진 엔터티(Wikidata, LinkedIn, 업계 디렉터리)에 명확히 매핑합니다.

해야 할 일: Organization 또는 Person에 귀하의 공식 프로필 및 디렉터리 등록의 URL을 포함한 「sameAs」를 추가하세요.

참고

법적 고지 / 회사 소개 / 연락처 링크가 없습니다

점검한 페이지에서 법적 고지, 「회사 소개」 페이지, 연락처로의 링크를 인식할 수 없습니다. 이러한 페이지는 강한 신뢰 신호이며 엔터티 매핑에도 도움이 됩니다.

해야 할 일: 법적 고지 또는 「회사 소개」와 연락처를 눈에 띄게, 보통 각 페이지의 푸터에 링크하세요.

참고

눈에 보이거나 마크업된 날짜가 없습니다

게시 날짜나 수정 날짜를 인식할 수 없습니다(<time>, article:published_time, JSON-LD의 datePublished 모두 없음). 많은 질문에서 AI 시스템은 최신 출처를 선호합니다.

해야 할 일: 시간과 관련된 콘텐츠에서는 날짜를 눈에 띄게 표시하고 JSON-LD에서 datePublished / dateModified를 마크업하세요.

기술적 기반

참고

canonical URL이 없습니다

페이지가 <link rel="canonical">을 설정하지 않습니다. canonical이 없으면 여러 URL 변형이 있을 때 어느 버전이 기준인지 불분명하게 남을 수 있습니다.

해야 할 일: 각 페이지에 선호하는 URL을 가리키는 자기 참조 <link rel="canonical">을 설정하세요.

정상(3)
  • 사이트맵에 접근할 수 있습니다.
  • 서버 응답 시간이 빠릅니다.
  • noindex 없음 — 페이지를 색인할 수 있습니다.

다음 단계

  1. AI 검색 봇이 robots.txt에서 차단되어 있습니다. 봇마다 차단이 의도된 것인지 확인하세요. AI 학습만 거부하려면 학습용 봇(GPTBot, ClaudeBot, Google-Extended)을 차단하고 검색 봇은 허용하세요.
  2. robots.txt는 허용하는데 서버가 봇을 차단합니다. 원하는 AI 크롤러의 사용자 에이전트 및/또는 IP 범위를 WAF / Cloudflare / 방화벽의 허용 목록에 추가하세요. 사용자 에이전트 문자열만이 아니라 역방향 DNS로 확인합니다.
  3. HTML에 텍스트가 매우 적습니다. 실제 콘텐츠가 이미지, iframe, JavaScript로 로드되는 블록이 아니라 완전히 HTML에 있는지 확인하세요.

방법과 한계

2026. 9. 24.에 점검함. citeglass는 nytimes.com와 관련 파일(robots.txt, llms.txt, sitemap.xml)을 HTTP로 가져옵니다 — 한 번은 일반 브라우저로, 한 번은 각 AI 크롤러 사용자 에이전트로. JavaScript는 실행되지 않습니다. 첫 바이트까지의 시간: 123 ms.

이것이 아닌 것: 순위나 인용 추적이 없고, 모델이 실제로 귀하를 언급하는지에 대한 진술도 없으며, JavaScript로 로드되는 콘텐츠에 대한 점검도 없습니다. 하나의 서버 IP 관점에서의 스냅숏입니다.

다른 사이트 점검