在 robots.txt 中控制 AI 爬虫
每家大型 AI 提供方都用各自的用户代理名称运营自己的爬虫。通过 robots.txt,你逐个机器人决定它是否可加载你的内容。
最重要的 AI 爬虫
OpenAI:GPTBot(训练)、OAI-SearchBot(ChatGPT 搜索)、ChatGPT-User(应用户请求抓取)。Anthropic:ClaudeBot、Claude-SearchBot、Claude-User。Perplexity:PerplexityBot、Perplexity-User。Google:Google-Extended(Gemini 训练)— 为 AI 概览进行的实际抓取通过普通的 Googlebot 完成。此外还有 Common Crawl(CCBot)、Amazonbot、Bytespider、Applebot-Extended 和 Meta-ExternalAgent。
有针对性地允许
为获得最大的 AI 可见性,为相关机器人提供一个带「Allow: /」的专属块。重要:针对某个机器人的专属块会为该机器人完全替代「User-agent: *」块 — 请在那里重复必要的 disallow 规则。
有针对性地排除
如果你拒绝训练但想在 AI 搜索中保持可见,可以拦截 GPTBot 和 Google-Extended,同时允许 OAI-SearchBot 和 Googlebot。这是一个内容层面的决定,而非纯技术决定。
为何仅靠 robots.txt 常常不够
许多站点在 robots.txt 中允许机器人,却在服务器层面拦截它们:一条 WAF 规则、Cloudflare 的「Bot Fight Mode」或防火墙以 403 拒绝爬虫。机器人遵守 robots.txt 却仍进不去。citeglass 让这种不一致可见。
验证
允许列表中应放置已验证的机器人。OpenAI、Anthropic、Perplexity 和 Google 公布其爬虫的 IP 段;请额外通过反向 DNS 核实,而不仅依赖用户代理字符串。
检查你自己的网站
citeglass 约 30 秒内显示你的网站在哪里对 AI 系统不可读 — 免费且无需登录。
继续阅读
一般信息,不构成法律建议。GEO 是一个新兴领域 — 建议可能会变化。