检查于 2026/9/23 · https://rehau-termopane.ro/
对 AI 可发现性存在 1 个严重障碍 — 请先修复它们。
AI 爬虫矩阵
对每个机器人:你的 robots.txt 允许什么 — 以及你的服务器实际向该机器人的用户代理返回什么。以红色标出的行:robots 允许,但服务器拦截(通常是 WAF 或防机器人规则)。
| 机器人 | 运营方 | robots.txt | 服务器响应 |
|---|---|---|---|
| GPTBot | OpenAI | 未提及 | 拦截(403 / WAF) |
| OAI-SearchBot | OpenAI | 未提及 | 200 + 内容 |
| ChatGPT-User | OpenAI | 未提及 | 200 + 内容 |
| ClaudeBot | Anthropic | 未提及 | 200 + 内容 |
| Claude-SearchBot | Anthropic | 未提及 | 错误 / 超时 |
| Claude-User | Anthropic | 未提及 | 200 + 内容 |
| PerplexityBot | Perplexity | 未提及 | 错误 / 超时 |
| Perplexity-User | Perplexity | 未提及 | 错误 / 超时 |
| Google-Extended | Google (Gemini-Training) | 未提及 | — |
| Googlebot | Google (KI-Übersichten) | 未提及 | 200 + 内容 |
| CCBot | Common Crawl (Trainingsdaten vieler LLMs) | 未提及 | 200 + 内容 |
| Bytespider | ByteDance (Doubao) | 未提及 | 200 + 内容 |
| Amazonbot | Amazon (Alexa/Rufus) | 未提及 | 200 + 内容 |
| Applebot-Extended | Apple (Intelligence-Training) | 未提及 | — |
| Meta-ExternalAgent | Meta (Llama/Meta AI) | 未提及 | 拦截(403 / WAF) |
分数是如何得出的?
| 尽管 robots.txt 允许,服务器仍拦截机器人 | -12 |
| 没有 llms.txt | -5 |
| 未找到 sitemap.xml | -4 |
| 标题层级被跳过 | -3 |
| 没有 sameAs 关联 | -3 |
| 未找到 robots.txt | -2 |
| 没有 FAQ 或 HowTo 标记 | -2 |
| 结果 | 69 / 100 |
AI 爬虫的访问
尽管 robots.txt 允许,服务器仍拦截机器人
对来自 OpenAI, Meta (Llama/Meta AI) 的 2 个机器人,robots.txt 说「允许」,但服务器以 403 或防机器人页面响应。通常是 WAF、防火墙或 CDN 规则绕过 robots.txt 将爬虫挡在外面。
你应当做的: 把所需 AI 爬虫的用户代理和/或 IP 段加入你的 WAF / Cloudflare / 防火墙的允许列表。通过反向 DNS 验证,而不仅依据用户代理字符串。
未找到 robots.txt
在 /robots.txt 处没有可访问的有效文件。爬虫于是假定「全部允许」— 可以工作,但你没有控制,也没有站点地图信号。
你应当做的: 在根目录创建 robots.txt,至少包含站点地图引用和你所需的 allow/disallow 规则。
User-agent: * Allow: / Sitemap: https://你的域名.cn/sitemap.xml
结构与机器可理解性
没有 llms.txt
/llms.txt 处没有文件。llms.txt 是你核心内容的一份简短 Markdown 概览,一些 AI 系统用它来定位。
你应当做的: 创建 /llms.txt:一个含名称的 H1、一段关于产品的简短说明,以及指向核心页面的链接列表。
# 你的公司 > 一句话描述。 ## 重要页面 - [产品](https://你的域名.cn/product):… - [价格](https://你的域名.cn/pricing):… - [关于我们](https://你的域名.cn/about):…
标题层级被跳过
标题顺序至少跳过一个层级(例如从 H2 直接到 H4)。这使得自动重建内容结构更困难。
你应当做的: 无间断且按顺序使用标题层级(H1 → H2 → H3 …)。
没有 FAQ 或 HowTo 标记
没有 FAQPage 或 HowTo 标记时,问答式和分步式内容对 AI 系统而言更难被识别为可直接引用的答案。
你应当做的: 在页面回答真实问题或给出操作说明的地方,将其标记为 FAQPage 或 HowTo(没有可见对应内容则不要加标记)。
信任与实体信号(E-E-A-T)
没有 sameAs 关联
JSON-LD 中缺少「sameAs」。借助它,AI 系统能明确地把你的品牌或人物映射到已知实体(Wikidata、LinkedIn、行业目录)。
你应当做的: 在 Organization 或 Person 中添加「sameAs」,填入你官方资料页和目录条目的 URL。
技术基础
未找到 sitemap.xml
在 /sitemap.xml 处没有可访问的有效 XML 站点地图,robots.txt 也没有指名任何一个。站点地图帮助爬虫找到所有相关 URL。
你应当做的: 生成一个包含所有可索引 URL 的 sitemap.xml,并在 robots.txt 中引用它。
正常(8)
- 主要内容在不含 JavaScript 的 HTML 中。
- 存在结构化数据(JSON-LD)。 — HomeAndConstructionBusiness, Organization, WebSite, ImageObject, WebPage, Person, Article, VideoObject
- 组织已标注为 JSON-LD。
- 恰好一个 H1 标题。
- 已设置 canonical URL。
- 页面标题长度合理。
- 存在作者信号。
- 服务器响应时间快。
下一步
- 尽管 robots.txt 允许,服务器仍拦截机器人. 把所需 AI 爬虫的用户代理和/或 IP 段加入你的 WAF / Cloudflare / 防火墙的允许列表。通过反向 DNS 验证,而不仅依据用户代理字符串。
- 没有 llms.txt. 创建 /llms.txt:一个含名称的 H1、一段关于产品的简短说明,以及指向核心页面的链接列表。
- 未找到 sitemap.xml. 生成一个包含所有可索引 URL 的 sitemap.xml,并在 robots.txt 中引用它。
每次变更都带电子邮件提醒的每周重扫。筹备中 — 请输入你的地址。
方法与局限
检查于 2026/9/23。citeglass 通过 HTTP 抓取 rehau-termopane.ro 及其相关文件(robots.txt、llms.txt、sitemap.xml)— 一次作为普通浏览器,一次针对每个 AI 爬虫用户代理。不执行 JavaScript。 首字节时间:774 毫秒。
它不是什么: 不追踪排名或引用,不就模型是否真的点名你作出任何声明,也不检查通过 JavaScript 加载的内容。这是从单个服务器 IP 视角的一次快照。