繁體中文
citeglass · AI 可見性檢查

檢查於 2026/9/4 · https://www.nytimes.com/

對 AI 可發現性存在 2 個嚴重障礙 — 請先修正它們。

F
38 / 100
2 項嚴重 · 1 項待檢查

AI 爬蟲矩陣

對每個機器人:你的 robots.txt 允許什麼 — 以及你的伺服器實際向該機器人的使用者代理回傳什麼。以紅色標出的列:robots 允許,但伺服器封鎖(通常是 WAF 或防機器人規則)。

機器人營運方robots.txt伺服器回應
GPTBotOpenAI封鎖封鎖(403 / WAF)
OAI-SearchBotOpenAI封鎖封鎖(403 / WAF)
ChatGPT-UserOpenAI封鎖封鎖(403 / WAF)
ClaudeBotAnthropic封鎖封鎖(403 / WAF)
Claude-SearchBotAnthropic封鎖封鎖(403 / WAF)
Claude-UserAnthropic封鎖封鎖(403 / WAF)
PerplexityBotPerplexity封鎖封鎖(403 / WAF)
Perplexity-UserPerplexity封鎖封鎖(403 / WAF)
Google-ExtendedGoogle (Gemini-Training)封鎖
GooglebotGoogle (KI-Übersichten)允許200 + 內容
CCBotCommon Crawl (Trainingsdaten vieler LLMs)封鎖封鎖(403 / WAF)
BytespiderByteDance (Doubao)封鎖封鎖(403 / WAF)
AmazonbotAmazon (Alexa/Rufus)允許封鎖(403 / WAF)
Applebot-ExtendedApple (Intelligence-Training)封鎖
Meta-ExternalAgentMeta (Llama/Meta AI)封鎖封鎖(403 / WAF)
分數是如何得出的?
重要的 AI 爬蟲在 robots.txt 中被封鎖-32
儘管 robots.txt 允許,伺服器仍封鎖機器人-6
頁面標題過短或過長-6
沒有 llms.txt-5
沒有 Organization 結構描述-4
沒有作者或署名訊號-4
沒有可見或已標記的日期-3
沒有 FAQ 或 HowTo 標記-2
結果38 / 100

AI 爬蟲的存取

嚴重

重要的 AI 爬蟲在 robots.txt 中被封鎖

你的 robots.txt 禁止 5 個核心 AI 爬蟲存取:GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended。這些系統於是無法載入你的內容,也無法將其作為來源使用。

你應當做的: 逐個機器人檢查封鎖是否有意為之。為了 AI 可見性,至少應允許 GPTBot、OAI-SearchBot、ClaudeBot、PerplexityBot 與 Google-Extended。

User-agent: GPTBot
Allow: /

User-agent: PerplexityBot
Allow: /
嚴重

儘管 robots.txt 允許,伺服器仍封鎖機器人

對來自 Amazon (Alexa/Rufus) 的 1 個機器人,robots.txt 說「允許」,但伺服器以 403 或防機器人頁面回應。通常是 WAF、防火牆或 CDN 規則繞過 robots.txt 將爬蟲擋在外面。

你應當做的: 把所需 AI 爬蟲的使用者代理和/或 IP 段加入你的 WAF / Cloudflare / 防火牆的允許清單。透過反向 DNS 驗證,而不僅依據使用者代理字串。

結構與機器可理解性

待檢查

頁面標題過短或過長

<title> 長 66 個字元。大約 30–60 個字元較合理:足夠描述以指明主題,足夠簡短以不被截斷。

你應當做的: 寫一個簡潔的標題,包含主題以及在需要時包含品牌。

提示

沒有 llms.txt

/llms.txt 處沒有檔案。llms.txt 是你核心內容的一份簡短 Markdown 概覽,一些 AI 系統用它來定位。

你應當做的: 建立 /llms.txt:一個含名稱的 H1、一段關於產品的簡短說明,以及指向核心頁面的連結清單。

# 你的公司

> 一句話描述。

## 重要頁面
- [產品](https://你的網域.tw/product):…
- [價格](https://你的網域.tw/pricing):…
- [關於我們](https://你的網域.tw/about):…
提示

沒有 Organization 結構描述

存在 JSON-LD,但沒有「Organization」條目。AI 系統於是較難把你的品牌定位為獨立實體,也較難將其與外部來源關聯。

你應當做的: 新增一個含 name、url、logo 與 sameAs(指向你官方資料頁的連結)的「Organization」結構描述。

提示

沒有 FAQ 或 HowTo 標記

沒有 FAQPage 或 HowTo 標記時,問答式與逐步式內容對 AI 系統而言更難被辨識為可直接引用的答案。

你應當做的: 在頁面回答真實問題或給出操作說明的地方,將其標記為 FAQPage 或 HowTo(沒有可見對應內容則不要加標記)。

信任與實體訊號(E-E-A-T)

提示

沒有作者或署名訊號

無法辨識作者(既無 meta 標籤,也無 rel=author,也無 JSON-LD Person)。在 E-E-A-T 意義上的「經驗」與「專業」需要具名且可追溯的署名。

你應當做的: 對編輯類內容,具名標註作者並連結作者頁面;同時將其標記為 JSON-LD「Person」。

提示

沒有可見或已標記的日期

無法辨識發佈或修改日期(既無 <time>,也無 article:published_time,也無 JSON-LD 中的 datePublished)。對許多問題,AI 系統偏好較新的來源。

你應當做的: 對與時間相關的內容,醒目地顯示日期,並在 JSON-LD 中標記 datePublished / dateModified。

正常(7)
  • 主要內容在不含 JavaScript 的 HTML 中。
  • 存在結構化資料(JSON-LD)。 — WebSite, NewsMediaOrganization
  • 恰好一個 H1 標題。
  • 已設定 canonical URL。
  • 網站地圖可存取。
  • 伺服器回應時間快。
  • 沒有 noindex — 頁面可被索引。

下一步

  1. 重要的 AI 爬蟲在 robots.txt 中被封鎖. 逐個機器人檢查封鎖是否有意為之。為了 AI 可見性,至少應允許 GPTBot、OAI-SearchBot、ClaudeBot、PerplexityBot 與 Google-Extended。
  2. 儘管 robots.txt 允許,伺服器仍封鎖機器人. 把所需 AI 爬蟲的使用者代理和/或 IP 段加入你的 WAF / Cloudflare / 防火牆的允許清單。透過反向 DNS 驗證,而不僅依據使用者代理字串。
  3. 頁面標題過短或過長. 寫一個簡潔的標題,包含主題以及在需要時包含品牌。
監測該頁面

每次變更都帶電子郵件提醒的每週重掃。籌備中 — 請輸入你的地址。

方法與限制

檢查於 2026/9/4。citeglass 透過 HTTP 抓取 nytimes.com 及其相關檔案(robots.txt、llms.txt、sitemap.xml)— 一次作為一般瀏覽器,一次針對每個 AI 爬蟲使用者代理。不執行 JavaScript。 首位元組時間:235 毫秒。

它不是什麼: 不追蹤排名或引用,不就模型是否真的點名你作出任何聲明,也不檢查透過 JavaScript 載入的內容。這是從單一伺服器 IP 視角的一次快照。

檢查其他網站