检查于 2026/9/4 · https://example.com/
没有硬性障碍,但 4 项会削弱 AI 可发现性。
AI 爬虫矩阵
对每个机器人:你的 robots.txt 允许什么 — 以及你的服务器实际向该机器人的用户代理返回什么。以红色标出的行:robots 允许,但服务器拦截(通常是 WAF 或防机器人规则)。
| 机器人 | 运营方 | robots.txt | 服务器响应 |
|---|---|---|---|
| GPTBot | OpenAI | 未提及 | 200 + 内容 |
| OAI-SearchBot | OpenAI | 未提及 | 200 + 内容 |
| ChatGPT-User | OpenAI | 未提及 | 200 + 内容 |
| ClaudeBot | Anthropic | 未提及 | 200 + 内容 |
| Claude-SearchBot | Anthropic | 未提及 | 200 + 内容 |
| Claude-User | Anthropic | 未提及 | 200 + 内容 |
| PerplexityBot | Perplexity | 未提及 | 200 + 内容 |
| Perplexity-User | Perplexity | 未提及 | 200 + 内容 |
| Google-Extended | Google (Gemini-Training) | 未提及 | — |
| Googlebot | Google (KI-Übersichten) | 未提及 | 200 + 内容 |
| CCBot | Common Crawl (Trainingsdaten vieler LLMs) | 未提及 | 200 + 内容 |
| Bytespider | ByteDance (Doubao) | 未提及 | 200 + 内容 |
| Amazonbot | Amazon (Alexa/Rufus) | 未提及 | 200 + 内容 |
| Applebot-Extended | Apple (Intelligence-Training) | 未提及 | — |
| Meta-ExternalAgent | Meta (Llama/Meta AI) | 未提及 | 200 + 内容 |
分数是如何得出的?
| HTML 中文本非常少 | -10 |
| 没有结构化数据(JSON-LD) | -8 |
| 页面标题过短或过长 | -6 |
| meta description 缺失或不合适 | -5 |
| 没有 llms.txt | -5 |
| 没有作者或署名信号 | -4 |
| 未找到 sitemap.xml | -4 |
| 没有 sameAs 关联 | -3 |
| 没有指向法律信息 / 关于我们 / 联系方式的链接 | -3 |
| 没有可见或已标记的日期 | -3 |
| 没有 canonical URL | -3 |
| 未找到 robots.txt | -2 |
| 结果 | 44 / 100 |
AI 爬虫的访问
未找到 robots.txt
在 /robots.txt 处没有可访问的有效文件。爬虫于是假定「全部允许」— 可以工作,但你没有控制,也没有站点地图信号。
你应当做的: 在根目录创建 robots.txt,至少包含站点地图引用和你所需的 allow/disallow 规则。
User-agent: * Allow: / Sitemap: https://你的域名.cn/sitemap.xml
不含 JavaScript 的内容
HTML 中文本非常少
初始 HTML 仅含约 142 个字符的可见文本。这几乎不足以让 AI 系统可靠地把握页面主题。
你应当做的: 确保实际内容完整地在 HTML 中,而不是在图片、iframe 或通过 JavaScript 加载的区块里。
结构与机器可理解性
没有结构化数据(JSON-LD)
页面不含 JSON-LD。结构化数据帮助 AI 系统明确识别实体、作者、组织、日期和页面类型 — 没有它,一切都得从正文中猜测。
你应当做的: 至少添加一个「Organization」架构和一个与页面类型匹配的架构(Article、Product、FAQPage 等),作为 JSON-LD 放入 <head>。
<script type="application/ld+json">
{"@context":"https://schema.org","@type":"Organization",
"name":"你的公司","url":"https://你的域名.cn",
"sameAs":["https://www.linkedin.com/company/…"]}
</script>页面标题过短或过长
<title> 长 14 个字符。大约 30–60 个字符较合理:足够描述以指明主题,足够简短以不被截断。
你应当做的: 写一个简洁的标题,包含主题以及在需要时包含品牌。
meta description 缺失或不合适
meta description 长 0 个字符。它常是 AI 系统和搜索引擎作为页面摘要最先读取的内容。
你应当做的: 用一两句话(大约 120–200 个字符)写一段页面的独立摘要,而不是一串关键词。
没有 llms.txt
/llms.txt 处没有文件。llms.txt 是你核心内容的一份简短 Markdown 概览,一些 AI 系统用它来定位。
你应当做的: 创建 /llms.txt:一个含名称的 H1、一段关于产品的简短说明,以及指向核心页面的链接列表。
# 你的公司 > 一句话描述。 ## 重要页面 - [产品](https://你的域名.cn/product):… - [价格](https://你的域名.cn/pricing):… - [关于我们](https://你的域名.cn/about):…
信任与实体信号(E-E-A-T)
没有作者或署名信号
无法识别作者(既无 meta 标签,也无 rel=author,也无 JSON-LD Person)。在 E-E-A-T 意义上的「经验」和「专业」需要具名且可追溯的署名。
你应当做的: 对编辑类内容,具名标注作者并链接作者页面;同时将其标记为 JSON-LD「Person」。
没有 sameAs 关联
JSON-LD 中缺少「sameAs」。借助它,AI 系统能明确地把你的品牌或人物映射到已知实体(Wikidata、LinkedIn、行业目录)。
你应当做的: 在 Organization 或 Person 中添加「sameAs」,填入你官方资料页和目录条目的 URL。
没有指向法律信息 / 关于我们 / 联系方式的链接
在被检查的页面上,无法识别指向法律信息、「关于我们」页面或联系方式的链接。这类页面是强信任信号,也有助于实体映射。
你应当做的: 把法律信息或「关于我们」以及联系方式醒目地链接出来,通常放在每个页面的页脚。
没有可见或已标记的日期
无法识别发布或修改日期(既无 <time>,也无 article:published_time,也无 JSON-LD 中的 datePublished)。对许多问题,AI 系统偏好较新的来源。
你应当做的: 对与时间相关的内容,醒目地显示日期,并在 JSON-LD 中标记 datePublished / dateModified。
技术基础
未找到 sitemap.xml
在 /sitemap.xml 处没有可访问的有效 XML 站点地图,robots.txt 也没有指名任何一个。站点地图帮助爬虫找到所有相关 URL。
你应当做的: 生成一个包含所有可索引 URL 的 sitemap.xml,并在 robots.txt 中引用它。
没有 canonical URL
页面没有设置 <link rel="canonical">。没有 canonical,当存在多个 URL 变体时,哪个版本是权威可能仍不清楚。
你应当做的: 在每个页面上设置一个自引用的 <link rel="canonical">,指向首选 URL。
正常(2)
- 恰好一个 H1 标题。
- 服务器响应时间快。
下一步
- HTML 中文本非常少. 确保实际内容完整地在 HTML 中,而不是在图片、iframe 或通过 JavaScript 加载的区块里。
- 没有结构化数据(JSON-LD). 至少添加一个「Organization」架构和一个与页面类型匹配的架构(Article、Product、FAQPage 等),作为 JSON-LD 放入 <head>。
- 页面标题过短或过长. 写一个简洁的标题,包含主题以及在需要时包含品牌。
每次变更都带电子邮件提醒的每周重扫。筹备中 — 请输入你的地址。
方法与局限
检查于 2026/9/4。citeglass 通过 HTTP 抓取 example.com 及其相关文件(robots.txt、llms.txt、sitemap.xml)— 一次作为普通浏览器,一次针对每个 AI 爬虫用户代理。不执行 JavaScript。 首字节时间:12 毫秒。
它不是什么: 不追踪排名或引用,不就模型是否真的点名你作出任何声明,也不检查通过 JavaScript 加载的内容。这是从单个服务器 IP 视角的一次快照。