AI 爬蟲設定的核心不是「全部允許」或「全部封鎖」,而是把搜尋收錄、AI 聯網答案、模型訓練及用戶即時存取分開決策。品牌如希望保留 Google、ChatGPT Search 與 Perplexity 的發現及引用機會,同時拒絕部分訓練用途,便要按官方 user-agent 文件逐項設定 robots.txt,再以 CDN/WAF 與 server logs 驗證。
同一間 AI 公司可以營運多個用途完全不同的機械人。只寫 User-agent: *,或看到名稱包含 GPT、AI、Bot 便全部封鎖,很容易把「拒絕訓練」錯誤變成「退出搜尋」。相反,單純在 robots.txt 寫 Allow,也不代表 CDN、WAF、Bot Management、登入牆及來源伺服器真的讓請求通過。這是一項政策、技術及監察三者並行的工作。
本文處理一個具體決策:香港品牌如何允許公開內容用於搜尋與聯網答案,同時限制模型訓練及敏感路徑。若需要先理解 AI 引用與一般 SEO 的關係,可參閱 AIO 101;若要把爬蟲政策納入整體網站能見度,可配合 GEO/AI Search 服務及SEO 搜尋優化規劃。
AI 爬蟲設定 常見問題
AI 爬蟲設定最重要的第一步是什麼?
先把商業目標拆成搜尋收錄、AI 聯網引用、模型訓練及用戶即時存取四類,再逐一核對官方 user-agent 文件。不要只看機械人名稱,也不要用一條 User-agent: * 規則代替用途判斷。
可以允許 ChatGPT 搜尋引用,但禁止 OpenAI 訓練嗎?
可以表達這項選擇:在 robots.txt 允許 OAI-SearchBot,並對 GPTBot 設定 Disallow: /。OpenAI 官方說明兩項設定彼此獨立;更新後仍應以 server logs 及實際搜尋測試核對。
封鎖 GPTBot 會否自動令網站退出 ChatGPT Search?
不會自動等同退出。GPTBot 對應基礎模型訓練用途,OAI-SearchBot 才是管理 ChatGPT 搜尋收錄及顯示的主要 robots.txt token。兩者必須分開設定。
ChatGPT-User 為什麼不能當作一般爬蟲處理?
ChatGPT-User 是由 ChatGPT 或 Custom GPT 的特定用戶動作觸發,不是自動遍歷網站的搜尋爬蟲。OpenAI 指出 robots.txt 規則未必適用,因此如內容必須受到強制保護,應使用認證、授權或 WAF,而不是只依賴 robots.txt。
PerplexityBot 是否用於訓練基礎模型?
Perplexity 官方文件表示,PerplexityBot 用於讓網站在 Perplexity 搜尋結果中被顯示及連結,不用於抓取基礎模型訓練內容。網站仍應定期核對官方文件,因產品與 user-agent 可能更新。
允許 Googlebot 是否等同同意 Google 訓練所有 AI 模型?
不能作此簡化。Googlebot 管理 Google Search 的抓取,亦關乎頁面能否成為 AI Overviews 或 AI Mode 的支援連結;Google-Extended 是針對 Google 某些其他生成式 AI 系統訓練與 grounding 的獨立控制。應按官方定義分開設定。
robots.txt 能否保護付費內容或個人資料?
不能。robots.txt 是機械人可自願遵守的存取偏好,不是保安邊界,而且檔案本身公開可見。付費內容、客戶資料、內部文件及測試環境應使用登入、伺服器授權、網絡限制或其他強制控制。
CDN 或 WAF 已允許爬蟲,為什麼仍然抓取失敗?
常見原因包括規則優先次序、Bot Management、速率限制、JavaScript challenge、地區封鎖、來源 IP 未更新或 origin 另有攔截。應同時檢查 edge logs、origin logs、HTTP 狀態及官方 IP 清單。
網站是否需要建立 llms.txt?
不是必需。若網站有大量文件、產品規格或清晰的權威頁面,建立簡短而可維護的 llms.txt 可作內容導覽;但它是社群提出的非標準慣例,主要平台沒有保證讀取或採用。
llms.txt 是否是 Google 或 AI 搜尋排名因子?
沒有可靠官方證據顯示它是排名因子。Google 明確表示 AI Overviews 與 AI Mode 沒有額外機器可讀檔案要求。llms.txt 應被視為可選導覽層,不能取代可抓取內容、內部連結、網站品質及可核實來源。
