檢查於 2026/9/4 · https://example.org/
沒有硬性障礙,但 4 項會削弱 AI 可發現性。
AI 爬蟲矩陣
對每個機器人:你的 robots.txt 允許什麼 — 以及你的伺服器實際向該機器人的使用者代理回傳什麼。以紅色標出的列:robots 允許,但伺服器封鎖(通常是 WAF 或防機器人規則)。
| 機器人 | 營運方 | robots.txt | 伺服器回應 |
|---|---|---|---|
| GPTBot | OpenAI | 未提及 | 200 + 內容 |
| OAI-SearchBot | OpenAI | 未提及 | 200 + 內容 |
| ChatGPT-User | OpenAI | 未提及 | 200 + 內容 |
| ClaudeBot | Anthropic | 未提及 | 200 + 內容 |
| Claude-SearchBot | Anthropic | 未提及 | 200 + 內容 |
| Claude-User | Anthropic | 未提及 | 200 + 內容 |
| PerplexityBot | Perplexity | 未提及 | 200 + 內容 |
| Perplexity-User | Perplexity | 未提及 | 200 + 內容 |
| Google-Extended | Google (Gemini-Training) | 未提及 | — |
| Googlebot | Google (KI-Übersichten) | 未提及 | 200 + 內容 |
| CCBot | Common Crawl (Trainingsdaten vieler LLMs) | 未提及 | 200 + 內容 |
| Bytespider | ByteDance (Doubao) | 未提及 | 200 + 內容 |
| Amazonbot | Amazon (Alexa/Rufus) | 未提及 | 200 + 內容 |
| Applebot-Extended | Apple (Intelligence-Training) | 未提及 | — |
| Meta-ExternalAgent | Meta (Llama/Meta AI) | 未提及 | 200 + 內容 |
分數是如何得出的?
| HTML 中文字非常少 | -10 |
| 沒有結構化資料(JSON-LD) | -8 |
| 頁面標題過短或過長 | -6 |
| meta description 缺失或不合適 | -5 |
| 沒有 llms.txt | -5 |
| 沒有作者或署名訊號 | -4 |
| 未找到 sitemap.xml | -4 |
| 沒有 sameAs 關聯 | -3 |
| 沒有指向法律資訊 / 關於我們 / 聯絡方式的連結 | -3 |
| 沒有可見或已標記的日期 | -3 |
| 沒有 canonical URL | -3 |
| 未找到 robots.txt | -2 |
| 結果 | 44 / 100 |
AI 爬蟲的存取
未找到 robots.txt
在 /robots.txt 處沒有可存取的有效檔案。爬蟲於是假定「全部允許」— 可以運作,但你沒有控制,也沒有網站地圖訊號。
你應當做的: 在根目錄建立 robots.txt,至少包含網站地圖引用與你所需的 allow/disallow 規則。
User-agent: * Allow: / Sitemap: https://你的網域.tw/sitemap.xml
不含 JavaScript 的內容
HTML 中文字非常少
初始 HTML 僅含約 142 個字元的可見文字。這幾乎不足以讓 AI 系統可靠地掌握頁面主題。
你應當做的: 確保實際內容完整地在 HTML 中,而不是在圖片、iframe 或透過 JavaScript 載入的區塊裡。
結構與機器可理解性
沒有結構化資料(JSON-LD)
頁面不含 JSON-LD。結構化資料幫助 AI 系統明確辨識實體、作者、組織、日期與頁面類型 — 沒有它,一切都得從內文中猜測。
你應當做的: 至少新增一個「Organization」結構描述與一個與頁面類型相符的結構描述(Article、Product、FAQPage 等),作為 JSON-LD 放入 <head>。
<script type="application/ld+json">
{"@context":"https://schema.org","@type":"Organization",
"name":"你的公司","url":"https://你的網域.tw",
"sameAs":["https://www.linkedin.com/company/…"]}
</script>頁面標題過短或過長
<title> 長 14 個字元。大約 30–60 個字元較合理:足夠描述以指明主題,足夠簡短以不被截斷。
你應當做的: 寫一個簡潔的標題,包含主題以及在需要時包含品牌。
meta description 缺失或不合適
meta description 長 0 個字元。它常是 AI 系統與搜尋引擎作為頁面摘要最先讀取的內容。
你應當做的: 用一兩句話(大約 120–200 個字元)寫一段頁面的獨立摘要,而不是一串關鍵字。
沒有 llms.txt
/llms.txt 處沒有檔案。llms.txt 是你核心內容的一份簡短 Markdown 概覽,一些 AI 系統用它來定位。
你應當做的: 建立 /llms.txt:一個含名稱的 H1、一段關於產品的簡短說明,以及指向核心頁面的連結清單。
# 你的公司 > 一句話描述。 ## 重要頁面 - [產品](https://你的網域.tw/product):… - [價格](https://你的網域.tw/pricing):… - [關於我們](https://你的網域.tw/about):…
信任與實體訊號(E-E-A-T)
沒有作者或署名訊號
無法辨識作者(既無 meta 標籤,也無 rel=author,也無 JSON-LD Person)。在 E-E-A-T 意義上的「經驗」與「專業」需要具名且可追溯的署名。
你應當做的: 對編輯類內容,具名標註作者並連結作者頁面;同時將其標記為 JSON-LD「Person」。
沒有 sameAs 關聯
JSON-LD 中缺少「sameAs」。藉助它,AI 系統能明確地把你的品牌或人物對應到已知實體(Wikidata、LinkedIn、產業目錄)。
你應當做的: 在 Organization 或 Person 中新增「sameAs」,填入你官方資料頁與目錄條目的 URL。
沒有指向法律資訊 / 關於我們 / 聯絡方式的連結
在被檢查的頁面上,無法辨識指向法律資訊、「關於我們」頁面或聯絡方式的連結。這類頁面是強信任訊號,也有助於實體對應。
你應當做的: 把法律資訊或「關於我們」以及聯絡方式醒目地連結出來,通常放在每個頁面的頁尾。
沒有可見或已標記的日期
無法辨識發佈或修改日期(既無 <time>,也無 article:published_time,也無 JSON-LD 中的 datePublished)。對許多問題,AI 系統偏好較新的來源。
你應當做的: 對與時間相關的內容,醒目地顯示日期,並在 JSON-LD 中標記 datePublished / dateModified。
技術基礎
未找到 sitemap.xml
在 /sitemap.xml 處沒有可存取的有效 XML 網站地圖,robots.txt 也沒有指名任何一個。網站地圖幫助爬蟲找到所有相關 URL。
你應當做的: 產生一個包含所有可索引 URL 的 sitemap.xml,並在 robots.txt 中引用它。
沒有 canonical URL
頁面沒有設定 <link rel="canonical">。沒有 canonical,當存在多個 URL 變體時,哪個版本是權威可能仍不清楚。
你應當做的: 在每個頁面上設定一個自我引用的 <link rel="canonical">,指向偏好的 URL。
正常(2)
- 恰好一個 H1 標題。
- 伺服器回應時間快。
下一步
- HTML 中文字非常少. 確保實際內容完整地在 HTML 中,而不是在圖片、iframe 或透過 JavaScript 載入的區塊裡。
- 沒有結構化資料(JSON-LD). 至少新增一個「Organization」結構描述與一個與頁面類型相符的結構描述(Article、Product、FAQPage 等),作為 JSON-LD 放入 <head>。
- 頁面標題過短或過長. 寫一個簡潔的標題,包含主題以及在需要時包含品牌。
每次變更都帶電子郵件提醒的每週重掃。籌備中 — 請輸入你的地址。
方法與限制
檢查於 2026/9/4。citeglass 透過 HTTP 抓取 example.org 及其相關檔案(robots.txt、llms.txt、sitemap.xml)— 一次作為一般瀏覽器,一次針對每個 AI 爬蟲使用者代理。不執行 JavaScript。 首位元組時間:21 毫秒。
它不是什麼: 不追蹤排名或引用,不就模型是否真的點名你作出任何聲明,也不檢查透過 JavaScript 載入的內容。這是從單一伺服器 IP 視角的一次快照。