简体中文
citeglass · AI 可见性检查

检查于 2026/9/24 · https://www.nytimes.com/

对 AI 可发现性存在 2 个严重障碍 — 请先修复它们。

F
1 / 100
2 项严重 · 5 项待检查
自上次扫描以来: 分数 -37 · 修复 2 项 · 新增 8 项

AI 爬虫矩阵

对每个机器人:你的 robots.txt 允许什么 — 以及你的服务器实际向该机器人的用户代理返回什么。以红色标出的行:robots 允许,但服务器拦截(通常是 WAF 或防机器人规则)。

机器人运营方robots.txt服务器响应
GPTBotOpenAI拦截拦截(403 / WAF)
OAI-SearchBotOpenAI拦截拦截(403 / WAF)
ChatGPT-UserOpenAI拦截拦截(403 / WAF)
ClaudeBotAnthropic拦截拦截(403 / WAF)
Claude-SearchBotAnthropic拦截拦截(403 / WAF)
Claude-UserAnthropic拦截拦截(403 / WAF)
PerplexityBotPerplexity拦截拦截(403 / WAF)
Perplexity-UserPerplexity拦截拦截(403 / WAF)
Google-ExtendedGoogle (Gemini-Training)拦截—
GooglebotGoogle (KI-Übersichten)允许拦截(403 / WAF)
CCBotCommon Crawl (Trainingsdaten vieler LLMs)拦截拦截(403 / WAF)
BytespiderByteDance (Doubao)拦截拦截(403 / WAF)
AmazonbotAmazon (Alexa/Rufus)允许拦截(403 / WAF)
Applebot-ExtendedApple (Intelligence-Training)拦截—
Meta-ExternalAgentMeta (Llama/Meta AI)拦截拦截(403 / WAF)
分数是如何得出的?
robots.txt 屏蔽了 AI 搜索机器人-32
尽管 robots.txt 允许,服务器仍拦截机器人-12
HTML 中文本非常少-10
没有结构化数据(JSON-LD)-8
页面标题过短或过长-6
不是恰好一个 H1 标题-5
meta description 缺失或不合适-5
没有 llms.txt-5
没有作者或署名信号-4
没有 sameAs 关联-3
没有指向法律信息 / 关于我们 / 联系方式的链接-3
没有可见或已标记的日期-3
没有 canonical URL-3
结果1 / 100

AI 爬虫的访问

严重

robots.txt 屏蔽了 AI 搜索机器人

你的 robots.txt 屏蔽了 6 个为 AI 助手和搜索引擎的回答抓取内容的机器人:OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, PerplexityBot, Perplexity-User。在被屏蔽期间,你的网站无法作为来源出现在那里。

你应当做的: 逐个检查屏蔽是否有意为之。如果只想拒绝 AI 训练,请屏蔽训练机器人(GPTBot、ClaudeBot、Google-Extended),并允许搜索机器人。

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Claude-User
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Perplexity-User
Allow: /
严重

尽管 robots.txt 允许,服务器仍拦截机器人

对来自 Google (KI-Übersichten), Amazon (Alexa/Rufus) 的 2 个机器人,robots.txt 说「允许」,但服务器以 403 或防机器人页面响应。通常是 WAF、防火墙或 CDN 规则绕过 robots.txt 将爬虫挡在外面。

你应当做的: 把所需 AI 爬虫的用户代理和/或 IP 段加入你的 WAF / Cloudflare / 防火墙的允许列表。通过反向 DNS 验证,而不仅依据用户代理字符串。

提示

已拒绝 AI 训练

你的 robots.txt 屏蔽了为训练语言模型收集内容的爬虫:GPTBot, ClaudeBot, Google-Extended, CCBot, Applebot-Extended。这不会妨碍被引用——OAI-SearchBot、PerplexityBot 以及用于 AI 概览的 Googlebot 等搜索和获取机器人是分开的。

你应当做的: 如果是有意拒绝,则无需操作。只需确保搜索机器人仍被允许。

不含 JavaScript 的内容

待检查

HTML 中文本非常少

初始 HTML 仅含约 55 个字符的可见文本。这几乎不足以让 AI 系统可靠地把握页面主题。

你应当做的: 确保实际内容完整地在 HTML 中,而不是在图片、iframe 或通过 JavaScript 加载的区块里。

结构与机器可理解性

待检查

没有结构化数据(JSON-LD)

页面不含 JSON-LD。结构化数据帮助 AI 系统明确识别实体、作者、组织、日期和页面类型 — 没有它,一切都得从正文中猜测。

你应当做的: 至少添加一个「Organization」架构和一个与页面类型匹配的架构(Article、Product、FAQPage 等),作为 JSON-LD 放入 <head>。

<script type="application/ld+json">
{"@context":"https://schema.org","@type":"Organization",
 "name":"你的公司","url":"https://你的域名.cn",
 "sameAs":["https://www.linkedin.com/company/…"]}
</script>
待检查

页面标题过短或过长

<title> 长 11 个字符。大约 30–60 个字符较合理:足够描述以指明主题,足够简短以不被截断。

你应当做的: 写一个简洁的标题,包含主题以及在需要时包含品牌。

待检查

不是恰好一个 H1 标题

页面有 0 个 H1 标题。一个明确的 H1 告诉人和机器,页面主要是关于什么的。

你应当做的: 设置恰好一个 H1,指明页面的主要主题。其下的一切从 H2 开始。

待检查

meta description 缺失或不合适

meta description 长 0 个字符。它常是 AI 系统和搜索引擎作为页面摘要最先读取的内容。

你应当做的: 用一两句话(大约 120–200 个字符)写一段页面的独立摘要,而不是一串关键词。

提示

没有 llms.txt

/llms.txt 处没有文件。llms.txt 是你核心内容的一份简短 Markdown 概览,一些 AI 系统用它来定位。

你应当做的: 创建 /llms.txt:一个含名称的 H1、一段关于产品的简短说明,以及指向核心页面的链接列表。

# 你的公司

> 一句话描述。

## 重要页面
- [产品](https://你的域名.cn/product):…
- [价格](https://你的域名.cn/pricing):…
- [关于我们](https://你的域名.cn/about):…

信任与实体信号(E-E-A-T)

提示

没有作者或署名信号

无法识别作者(既无 meta 标签,也无 rel=author,也无 JSON-LD Person)。在 E-E-A-T 意义上的「经验」和「专业」需要具名且可追溯的署名。

你应当做的: 对编辑类内容,具名标注作者并链接作者页面;同时将其标记为 JSON-LD「Person」。

提示

没有 sameAs 关联

JSON-LD 中缺少「sameAs」。借助它,AI 系统能明确地把你的品牌或人物映射到已知实体(Wikidata、LinkedIn、行业目录)。

你应当做的: 在 Organization 或 Person 中添加「sameAs」,填入你官方资料页和目录条目的 URL。

提示

没有指向法律信息 / 关于我们 / 联系方式的链接

在被检查的页面上,无法识别指向法律信息、「关于我们」页面或联系方式的链接。这类页面是强信任信号,也有助于实体映射。

你应当做的: 把法律信息或「关于我们」以及联系方式醒目地链接出来,通常放在每个页面的页脚。

提示

没有可见或已标记的日期

无法识别发布或修改日期(既无 <time>,也无 article:published_time,也无 JSON-LD 中的 datePublished)。对许多问题,AI 系统偏好较新的来源。

你应当做的: 对与时间相关的内容,醒目地显示日期,并在 JSON-LD 中标记 datePublished / dateModified。

技术基础

提示

没有 canonical URL

页面没有设置 <link rel="canonical">。没有 canonical,当存在多个 URL 变体时,哪个版本是权威可能仍不清楚。

你应当做的: 在每个页面上设置一个自引用的 <link rel="canonical">,指向首选 URL。

正常(3)
  • 站点地图可访问。
  • 服务器响应时间快。
  • 没有 noindex — 页面可被索引。

下一步

  1. robots.txt 屏蔽了 AI 搜索机器人. 逐个检查屏蔽是否有意为之。如果只想拒绝 AI 训练,请屏蔽训练机器人(GPTBot、ClaudeBot、Google-Extended),并允许搜索机器人。
  2. 尽管 robots.txt 允许,服务器仍拦截机器人. 把所需 AI 爬虫的用户代理和/或 IP 段加入你的 WAF / Cloudflare / 防火墙的允许列表。通过反向 DNS 验证,而不仅依据用户代理字符串。
  3. HTML 中文本非常少. 确保实际内容完整地在 HTML 中,而不是在图片、iframe 或通过 JavaScript 加载的区块里。
监测该页面

每次变更都带电子邮件提醒的每周重扫。筹备中 — 请输入你的地址。

方法与局限

检查于 2026/9/24。citeglass 通过 HTTP 抓取 nytimes.com 及其相关文件(robots.txt、llms.txt、sitemap.xml)— 一次作为普通浏览器,一次针对每个 AI 爬虫用户代理。不执行 JavaScript。 首字节时间:99 毫秒。

它不是什么: 不追踪排名或引用,不就模型是否真的点名你作出任何声明,也不检查通过 JavaScript 加载的内容。这是从单个服务器 IP 视角的一次快照。

检查其他网站