在 robots.txt 中控制 AI 爬蟲
每家大型 AI 提供方都用各自的使用者代理名稱營運自己的爬蟲。透過 robots.txt,你逐個機器人決定它是否可載入你的內容。
最重要的 AI 爬蟲
OpenAI:GPTBot(訓練)、OAI-SearchBot(ChatGPT 搜尋)、ChatGPT-User(應使用者請求抓取)。Anthropic:ClaudeBot、Claude-SearchBot、Claude-User。Perplexity:PerplexityBot、Perplexity-User。Google:Google-Extended(Gemini 訓練)— 為 AI 概覽進行的實際抓取透過一般的 Googlebot 完成。此外還有 Common Crawl(CCBot)、Amazonbot、Bytespider、Applebot-Extended 與 Meta-ExternalAgent。
有針對性地允許
為獲得最大的 AI 可見性,為相關機器人提供一個帶「Allow: /」的專屬區塊。重要:針對某個機器人的專屬區塊會為該機器人完全取代「User-agent: *」區塊 — 請在那裡重複必要的 disallow 規則。
有針對性地排除
如果你拒絕訓練但想在 AI 搜尋中保持可見,可以封鎖 GPTBot 與 Google-Extended,同時允許 OAI-SearchBot 與 Googlebot。這是一個內容層面的決定,而非純技術決定。
為何僅靠 robots.txt 常常不夠
許多網站在 robots.txt 中允許機器人,卻在伺服器層面封鎖它們:一條 WAF 規則、Cloudflare 的「Bot Fight Mode」或防火牆以 403 拒絕爬蟲。機器人遵守 robots.txt 卻仍進不去。citeglass 讓這種不一致可見。
驗證
允許清單中應放置已驗證的機器人。OpenAI、Anthropic、Perplexity 與 Google 公佈其爬蟲的 IP 段;請額外透過反向 DNS 核實,而不僅依賴使用者代理字串。
檢查你自己的網站
citeglass 約 30 秒內顯示你的網站在哪裡對 AI 系統不可讀 — 免費且無需登入。
繼續閱讀
一般資訊,不構成法律建議。GEO 是一個新興領域 — 建議可能會變化。