檢查於 2026/9/24 · https://www.heise.de/
對 AI 可發現性存在 1 個嚴重障礙 — 請先修正它們。
AI 爬蟲矩陣
對每個機器人:你的 robots.txt 允許什麼 — 以及你的伺服器實際向該機器人的使用者代理回傳什麼。以紅色標出的列:robots 允許,但伺服器封鎖(通常是 WAF 或防機器人規則)。
| 機器人 | 營運方 | robots.txt | 伺服器回應 |
|---|---|---|---|
| GPTBot | OpenAI | 允許 | 200 + 內容 |
| OAI-SearchBot | OpenAI | 允許 | 200 + 內容 |
| ChatGPT-User | OpenAI | 允許 | 200 + 內容 |
| ClaudeBot | Anthropic | 允許 | 200 + 內容 |
| Claude-SearchBot | Anthropic | 允許 | 200 + 內容 |
| Claude-User | Anthropic | 允許 | 200 + 內容 |
| PerplexityBot | Perplexity | 允許 | 200 + 內容 |
| Perplexity-User | Perplexity | 允許 | 200 + 內容 |
| Google-Extended | Google (Gemini-Training) | 封鎖 | — |
| Googlebot | Google (KI-Übersichten) | 允許 (透過 User-agent: *) | 200 + 內容 |
| CCBot | Common Crawl (Trainingsdaten vieler LLMs) | 封鎖 | 200 + 內容 |
| Bytespider | ByteDance (Doubao) | 封鎖 | 200 + 內容 |
| Amazonbot | Amazon (Alexa/Rufus) | 封鎖 | 200 + 內容 |
| Applebot-Extended | Apple (Intelligence-Training) | 封鎖 | — |
| Meta-ExternalAgent | Meta (Llama/Meta AI) | 封鎖 | 200 + 內容 |
分數是如何得出的?
| robots.txt 封鎖了 AI 搜尋機器人 | -8 |
| 頁面標題過短或過長 | -6 |
| 不是恰好一個 H1 標題 | -5 |
| 沒有 llms.txt | -5 |
| 沒有 Organization 結構描述 | -4 |
| 沒有作者或署名訊號 | -4 |
| 沒有 sameAs 關聯 | -3 |
| 沒有 FAQ 或 HowTo 標記 | -2 |
| 結果 | 63 / 100 |
AI 爬蟲的存取
robots.txt 封鎖了 AI 搜尋機器人
你的 robots.txt 封鎖了 1 個為 AI 助理與搜尋引擎的回答擷取內容的機器人:Google-Extended。在被封鎖期間,你的網站無法作為來源出現在那裡。
你應當做的: 逐一檢查封鎖是否為刻意。如果只想拒絕 AI 訓練,請封鎖訓練機器人(GPTBot、ClaudeBot、Google-Extended),並允許搜尋機器人。
結構與機器可理解性
頁面標題過短或過長
<title> 長 67 個字元。大約 30–60 個字元較合理:足夠描述以指明主題,足夠簡短以不被截斷。
你應當做的: 寫一個簡潔的標題,包含主題以及在需要時包含品牌。
不是恰好一個 H1 標題
頁面有 0 個 H1 標題。一個明確的 H1 告訴人與機器,頁面主要是關於什麼的。
你應當做的: 設定恰好一個 H1,指明頁面的主要主題。其下的一切從 H2 開始。
沒有 llms.txt
/llms.txt 處沒有檔案。llms.txt 是你核心內容的一份簡短 Markdown 概覽,一些 AI 系統用它來定位。
你應當做的: 建立 /llms.txt:一個含名稱的 H1、一段關於產品的簡短說明,以及指向核心頁面的連結清單。
# 你的公司 > 一句話描述。 ## 重要頁面 - [產品](https://你的網域.tw/product):… - [價格](https://你的網域.tw/pricing):… - [關於我們](https://你的網域.tw/about):…
沒有 Organization 結構描述
存在 JSON-LD,但沒有「Organization」條目。AI 系統於是較難把你的品牌定位為獨立實體,也較難將其與外部來源關聯。
你應當做的: 新增一個含 name、url、logo 與 sameAs(指向你官方資料頁的連結)的「Organization」結構描述。
沒有 FAQ 或 HowTo 標記
沒有 FAQPage 或 HowTo 標記時,問答式與逐步式內容對 AI 系統而言更難被辨識為可直接引用的答案。
你應當做的: 在頁面回答真實問題或給出操作說明的地方,將其標記為 FAQPage 或 HowTo(沒有可見對應內容則不要加標記)。
信任與實體訊號(E-E-A-T)
沒有作者或署名訊號
無法辨識作者(既無 meta 標籤,也無 rel=author,也無 JSON-LD Person)。在 E-E-A-T 意義上的「經驗」與「專業」需要具名且可追溯的署名。
你應當做的: 對編輯類內容,具名標註作者並連結作者頁面;同時將其標記為 JSON-LD「Person」。
沒有 sameAs 關聯
JSON-LD 中缺少「sameAs」。藉助它,AI 系統能明確地把你的品牌或人物對應到已知實體(Wikidata、LinkedIn、產業目錄)。
你應當做的: 在 Organization 或 Person 中新增「sameAs」,填入你官方資料頁與目錄條目的 URL。
正常(6)
- 主要內容在不含 JavaScript 的 HTML 中。
- 存在結構化資料(JSON-LD)。 — ItemList, Thing
- 已設定 canonical URL。
- 網站地圖可存取。
- 伺服器回應時間快。
- 沒有 noindex — 頁面可被索引。
下一步
- robots.txt 封鎖了 AI 搜尋機器人. 逐一檢查封鎖是否為刻意。如果只想拒絕 AI 訓練,請封鎖訓練機器人(GPTBot、ClaudeBot、Google-Extended),並允許搜尋機器人。
- 頁面標題過短或過長. 寫一個簡潔的標題,包含主題以及在需要時包含品牌。
- 不是恰好一個 H1 標題. 設定恰好一個 H1,指明頁面的主要主題。其下的一切從 H2 開始。
每次變更都帶電子郵件提醒的每週重掃。籌備中 — 請輸入你的地址。
方法與限制
檢查於 2026/9/24。citeglass 透過 HTTP 抓取 heise.de 及其相關檔案(robots.txt、llms.txt、sitemap.xml)— 一次作為一般瀏覽器,一次針對每個 AI 爬蟲使用者代理。不執行 JavaScript。 首位元組時間:65 毫秒。
它不是什麼: 不追蹤排名或引用,不就模型是否真的點名你作出任何聲明,也不檢查透過 JavaScript 載入的內容。這是從單一伺服器 IP 視角的一次快照。