繁體中文
citeglass · AI 可見性檢查

檢查於 2026/9/24 · https://www.nytimes.com/

對 AI 可發現性存在 2 個嚴重障礙 — 請先修正它們。

F
1 / 100
2 項嚴重 · 5 項待檢查
自上次掃描以來: 分數 -37 · 修正 2 項 · 新增 8 項

AI 爬蟲矩陣

對每個機器人:你的 robots.txt 允許什麼 — 以及你的伺服器實際向該機器人的使用者代理回傳什麼。以紅色標出的列:robots 允許,但伺服器封鎖(通常是 WAF 或防機器人規則)。

機器人營運方robots.txt伺服器回應
GPTBotOpenAI封鎖封鎖(403 / WAF)
OAI-SearchBotOpenAI封鎖封鎖(403 / WAF)
ChatGPT-UserOpenAI封鎖封鎖(403 / WAF)
ClaudeBotAnthropic封鎖封鎖(403 / WAF)
Claude-SearchBotAnthropic封鎖封鎖(403 / WAF)
Claude-UserAnthropic封鎖封鎖(403 / WAF)
PerplexityBotPerplexity封鎖封鎖(403 / WAF)
Perplexity-UserPerplexity封鎖封鎖(403 / WAF)
Google-ExtendedGoogle (Gemini-Training)封鎖—
GooglebotGoogle (KI-Übersichten)允許封鎖(403 / WAF)
CCBotCommon Crawl (Trainingsdaten vieler LLMs)封鎖封鎖(403 / WAF)
BytespiderByteDance (Doubao)封鎖封鎖(403 / WAF)
AmazonbotAmazon (Alexa/Rufus)允許封鎖(403 / WAF)
Applebot-ExtendedApple (Intelligence-Training)封鎖—
Meta-ExternalAgentMeta (Llama/Meta AI)封鎖封鎖(403 / WAF)
分數是如何得出的?
robots.txt 封鎖了 AI 搜尋機器人-32
儘管 robots.txt 允許,伺服器仍封鎖機器人-12
HTML 中文字非常少-10
沒有結構化資料(JSON-LD)-8
頁面標題過短或過長-6
不是恰好一個 H1 標題-5
meta description 缺失或不合適-5
沒有 llms.txt-5
沒有作者或署名訊號-4
沒有 sameAs 關聯-3
沒有指向法律資訊 / 關於我們 / 聯絡方式的連結-3
沒有可見或已標記的日期-3
沒有 canonical URL-3
結果1 / 100

AI 爬蟲的存取

嚴重

robots.txt 封鎖了 AI 搜尋機器人

你的 robots.txt 封鎖了 6 個為 AI 助理與搜尋引擎的回答擷取內容的機器人:OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, PerplexityBot, Perplexity-User。在被封鎖期間,你的網站無法作為來源出現在那裡。

你應當做的: 逐一檢查封鎖是否為刻意。如果只想拒絕 AI 訓練,請封鎖訓練機器人(GPTBot、ClaudeBot、Google-Extended),並允許搜尋機器人。

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Claude-User
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Perplexity-User
Allow: /
嚴重

儘管 robots.txt 允許,伺服器仍封鎖機器人

對來自 Google (KI-Übersichten), Amazon (Alexa/Rufus) 的 2 個機器人,robots.txt 說「允許」,但伺服器以 403 或防機器人頁面回應。通常是 WAF、防火牆或 CDN 規則繞過 robots.txt 將爬蟲擋在外面。

你應當做的: 把所需 AI 爬蟲的使用者代理和/或 IP 段加入你的 WAF / Cloudflare / 防火牆的允許清單。透過反向 DNS 驗證,而不僅依據使用者代理字串。

提示

已拒絕 AI 訓練

你的 robots.txt 封鎖了為訓練語言模型收集內容的爬蟲:GPTBot, ClaudeBot, Google-Extended, CCBot, Applebot-Extended。這不會妨礙被引用——OAI-SearchBot、PerplexityBot 以及用於 AI 摘要的 Googlebot 等搜尋與擷取機器人是分開的。

你應當做的: 如果是刻意拒絕,則無需處理。只需確認搜尋機器人仍被允許。

不含 JavaScript 的內容

待檢查

HTML 中文字非常少

初始 HTML 僅含約 55 個字元的可見文字。這幾乎不足以讓 AI 系統可靠地掌握頁面主題。

你應當做的: 確保實際內容完整地在 HTML 中,而不是在圖片、iframe 或透過 JavaScript 載入的區塊裡。

結構與機器可理解性

待檢查

沒有結構化資料(JSON-LD)

頁面不含 JSON-LD。結構化資料幫助 AI 系統明確辨識實體、作者、組織、日期與頁面類型 — 沒有它,一切都得從內文中猜測。

你應當做的: 至少新增一個「Organization」結構描述與一個與頁面類型相符的結構描述(Article、Product、FAQPage 等),作為 JSON-LD 放入 <head>。

<script type="application/ld+json">
{"@context":"https://schema.org","@type":"Organization",
 "name":"你的公司","url":"https://你的網域.tw",
 "sameAs":["https://www.linkedin.com/company/…"]}
</script>
待檢查

頁面標題過短或過長

<title> 長 11 個字元。大約 30–60 個字元較合理:足夠描述以指明主題,足夠簡短以不被截斷。

你應當做的: 寫一個簡潔的標題,包含主題以及在需要時包含品牌。

待檢查

不是恰好一個 H1 標題

頁面有 0 個 H1 標題。一個明確的 H1 告訴人與機器,頁面主要是關於什麼的。

你應當做的: 設定恰好一個 H1,指明頁面的主要主題。其下的一切從 H2 開始。

待檢查

meta description 缺失或不合適

meta description 長 0 個字元。它常是 AI 系統與搜尋引擎作為頁面摘要最先讀取的內容。

你應當做的: 用一兩句話(大約 120–200 個字元)寫一段頁面的獨立摘要,而不是一串關鍵字。

提示

沒有 llms.txt

/llms.txt 處沒有檔案。llms.txt 是你核心內容的一份簡短 Markdown 概覽,一些 AI 系統用它來定位。

你應當做的: 建立 /llms.txt:一個含名稱的 H1、一段關於產品的簡短說明,以及指向核心頁面的連結清單。

# 你的公司

> 一句話描述。

## 重要頁面
- [產品](https://你的網域.tw/product):…
- [價格](https://你的網域.tw/pricing):…
- [關於我們](https://你的網域.tw/about):…

信任與實體訊號(E-E-A-T)

提示

沒有作者或署名訊號

無法辨識作者(既無 meta 標籤,也無 rel=author,也無 JSON-LD Person)。在 E-E-A-T 意義上的「經驗」與「專業」需要具名且可追溯的署名。

你應當做的: 對編輯類內容,具名標註作者並連結作者頁面;同時將其標記為 JSON-LD「Person」。

提示

沒有 sameAs 關聯

JSON-LD 中缺少「sameAs」。藉助它,AI 系統能明確地把你的品牌或人物對應到已知實體(Wikidata、LinkedIn、產業目錄)。

你應當做的: 在 Organization 或 Person 中新增「sameAs」,填入你官方資料頁與目錄條目的 URL。

提示

沒有指向法律資訊 / 關於我們 / 聯絡方式的連結

在被檢查的頁面上,無法辨識指向法律資訊、「關於我們」頁面或聯絡方式的連結。這類頁面是強信任訊號,也有助於實體對應。

你應當做的: 把法律資訊或「關於我們」以及聯絡方式醒目地連結出來,通常放在每個頁面的頁尾。

提示

沒有可見或已標記的日期

無法辨識發佈或修改日期(既無 <time>,也無 article:published_time,也無 JSON-LD 中的 datePublished)。對許多問題,AI 系統偏好較新的來源。

你應當做的: 對與時間相關的內容,醒目地顯示日期,並在 JSON-LD 中標記 datePublished / dateModified。

技術基礎

提示

沒有 canonical URL

頁面沒有設定 <link rel="canonical">。沒有 canonical,當存在多個 URL 變體時,哪個版本是權威可能仍不清楚。

你應當做的: 在每個頁面上設定一個自我引用的 <link rel="canonical">,指向偏好的 URL。

正常(3)
  • 網站地圖可存取。
  • 伺服器回應時間快。
  • 沒有 noindex — 頁面可被索引。

下一步

  1. robots.txt 封鎖了 AI 搜尋機器人. 逐一檢查封鎖是否為刻意。如果只想拒絕 AI 訓練,請封鎖訓練機器人(GPTBot、ClaudeBot、Google-Extended),並允許搜尋機器人。
  2. 儘管 robots.txt 允許,伺服器仍封鎖機器人. 把所需 AI 爬蟲的使用者代理和/或 IP 段加入你的 WAF / Cloudflare / 防火牆的允許清單。透過反向 DNS 驗證,而不僅依據使用者代理字串。
  3. HTML 中文字非常少. 確保實際內容完整地在 HTML 中,而不是在圖片、iframe 或透過 JavaScript 載入的區塊裡。
監測該頁面

每次變更都帶電子郵件提醒的每週重掃。籌備中 — 請輸入你的地址。

方法與限制

檢查於 2026/9/24。citeglass 透過 HTTP 抓取 nytimes.com 及其相關檔案(robots.txt、llms.txt、sitemap.xml)— 一次作為一般瀏覽器,一次針對每個 AI 爬蟲使用者代理。不執行 JavaScript。 首位元組時間:99 毫秒。

它不是什麼: 不追蹤排名或引用,不就模型是否真的點名你作出任何聲明,也不檢查透過 JavaScript 載入的內容。這是從單一伺服器 IP 視角的一次快照。

檢查其他網站