한국어
citeglass · AI 가시성 점검

지식 베이스 › 기초

robots.txt에서 AI 크롤러 제어하기

대형 AI 제공업체는 각각 자체 사용자 에이전트 이름으로 자체 크롤러를 운영합니다. robots.txt를 통해 봇별로 귀하의 콘텐츠를 로드할 수 있는지 결정합니다.

가장 중요한 AI 크롤러

OpenAI: GPTBot(학습), OAI-SearchBot(ChatGPT 검색), ChatGPT-User(사용자 요청 시 가져오기). Anthropic: ClaudeBot, Claude-SearchBot, Claude-User. Perplexity: PerplexityBot, Perplexity-User. Google: Google-Extended(Gemini 학습) — AI 개요를 위한 실제 가져오기는 일반 Googlebot을 통해 이루어집니다. 이 외에 Common Crawl(CCBot), Amazonbot, Bytespider, Applebot-Extended, Meta-ExternalAgent.

표적화해 허용하기

최대 AI 가시성을 위해 관련 봇에 「Allow: /」가 있는 전용 블록을 부여합니다. 중요: 봇별 블록은 해당 봇에 대해 「User-agent: *」 블록을 완전히 대체합니다 — 필요한 disallow 규칙을 거기서 반복하세요.

표적화해 제외하기

학습은 거부하되 AI 검색에서 계속 노출되고 싶다면 GPTBot과 Google-Extended를 차단하고 OAI-SearchBot과 Googlebot을 허용할 수 있습니다. 이는 순수하게 기술적인 것이 아니라 내용에 관한 결정입니다.

왜 robots.txt만으로는 흔히 충분하지 않은가

많은 사이트가 robots.txt에서 봇을 허용하면서 서버 수준에서 차단합니다: WAF 규칙, Cloudflare의 「Bot Fight Mode」, 방화벽이 크롤러를 403으로 거부합니다. 봇은 robots.txt를 따르지만 그래도 들어오지 못합니다. citeglass는 이 불일치를 가시화합니다.

검증하기

허용 목록에는 검증된 봇을 넣어야 합니다. OpenAI, Anthropic, Perplexity, Google은 크롤러의 IP 범위를 공개합니다. 사용자 에이전트 문자열에만 의존하지 말고 역방향 DNS로도 확인하세요.

귀하의 사이트를 점검하세요

citeglass는 약 30초 만에 귀하의 웹사이트가 AI 시스템에 읽히지 않는 곳을 보여줍니다 — 무료, 로그인 불필요.

계속 읽기

일반 정보이며 법률 자문이 아닙니다. GEO는 새로운 분야입니다 — 권장 사항은 바뀔 수 있습니다.