SEO

AI 爬蟲設定:robots.txt、llms.txt 與搜尋/訓練權限

AI 爬蟲設定應先區分搜尋引用、模型訓練與用戶即時存取,再用 robots.txt 表達政策,並以 CDN/WAF 及 server logs 驗證執行結果;llms.txt 只是非標準內容導覽,不是排名因子。

  • #AI 爬蟲設定
  • #ChatGPT-User
  • #Googlebot
  • #GPTBot
  • #llms.txt
  • #OAI-SearchBot
  • #PerplexityBot
  • #robots.txt

快速閱讀:AI 爬蟲設定不應一刀切封鎖所有機械人。希望保留搜尋及 AI 答案引用、但不希望內容用於模型訓練,可允許 OAI-SearchBot、PerplexityBot、Googlebot,封鎖 GPTBot,另按政策處理 Google-Extended;ChatGPT-User 是用戶觸發的存取,robots.txt 未必適用。llms.txt 只可作內容導覽,不能取代存取控制,也不是排名因子。

AI 爬蟲設定的核心不是「全部允許」或「全部封鎖」,而是把搜尋收錄、AI 聯網答案、模型訓練及用戶即時存取分開決策。品牌如希望保留 Google、ChatGPT Search 與 Perplexity 的發現及引用機會,同時拒絕部分訓練用途,便要按官方 user-agent 文件逐項設定 robots.txt,再以 CDN/WAF 與 server logs 驗證。

同一間 AI 公司可以營運多個用途完全不同的機械人。只寫 User-agent: *,或看到名稱包含 GPT、AI、Bot 便全部封鎖,很容易把「拒絕訓練」錯誤變成「退出搜尋」。相反,單純在 robots.txt 寫 Allow,也不代表 CDN、WAF、Bot Management、登入牆及來源伺服器真的讓請求通過。這是一項政策、技術及監察三者並行的工作。

本文處理一個具體決策:香港品牌如何允許公開內容用於搜尋與聯網答案,同時限制模型訓練及敏感路徑。若需要先理解 AI 引用與一般 SEO 的關是,可參閱 AIO 101;若要把爬蟲政策納入整體網站能見度,可配合 GEO/AI Search 服務SEO 搜尋優化規劃。

AI 爬蟲設定應先按搜尋、訓練與用戶存取分類

正確的 AI 爬蟲設定先問「這次抓取為了什麼」,再問「由哪個 user-agent 執行」。搜尋機械人建立或更新可供搜尋產品使用的索引;訓練機械人收集可用於改善基礎模型的內容;用戶代理則因某位用戶要求開啟網址、取得頁面或執行動作而發出請求。三者的商業價值、風險及控制方式不同。

品牌被模型「提及」、被聯網答案「引用來源」、被推薦為供應商,以及在 Google AI Overviews 顯示,是四種不同結果。允許搜尋機械人只代表頁面具備被抓取的技術條件,不保證任何一種結果;是否出現仍涉及查詢相關性、內容品質、來源可信度、索引狀態及平台系統判斷。robots.txt 是入口政策,不是推薦指令。

制定政策時,建議把網站內容再分成公開市場資訊、可公開但不希望訓練的原創內容、需要登入的客戶內容,以及絕不可公開的個人或機密資料。前兩類可以透過特定 user-agent 規則表達偏好;後兩類必須由認證與伺服器權限保護。robots.txt 公開可見,而且守規則與否取決於抓取者,因此不能用作資料防洩漏措施。

另一個常見誤解是把「抓取」與「索引」視為同一件事。以 Google 為例,官方說明 robots.txt 主要管理抓取流量,不是可靠的移除索引工具;禁止抓取的網址仍可能因外部連結而以有限資料出現在搜尋結果。真正需要防止索引時,要按平台支援使用 noindex、X-Robots-Tag、移除工具或存取保護,並確保機械人能先讀到相關指令。

AI 爬蟲設定比較 OAI-SearchBotGPTBotChatGPT-UserPerplexityBotGooglebot

這五個名稱不能互換。根據各營運商現行官方文件,OAI-SearchBot 與 Googlebot 關乎搜尋發現,GPTBot 關乎 OpenAI 基礎模型訓練,ChatGPT-User 屬用戶觸發存取,而 PerplexityBot 用於 Perplexity 搜尋結果的顯示與連結。以下比較可作初步政策表,但每次上線前仍應重看官方頁面。

user-agent token 官方描述的主要角色 希望保留搜尋/引用時 限制與核對重點
OAI-SearchBot 讓網站內容可在 ChatGPT 搜尋結果中出現及連結 允許公開、可引用路徑 與 GPTBot 獨立;OpenAI 表示 robots.txt 更新反映可能約需 24 小時
GPTBot 抓取可能用於訓練 OpenAI 生成式 AI 基礎模型的內容 不希望訓練時可封鎖 封鎖 GPTBot 不等同封鎖 OAI-SearchBot,兩段規則要分開
ChatGPT-User 由 ChatGPT、Custom GPT 或相關用戶動作觸發的頁面存取 按功能及風險決定是否讓 edge 通過 不是自動搜尋爬蟲;OpenAI 指 robots.txt 規則未必適用,不應用它管理 Search opt-out
PerplexityBot 讓網站在 Perplexity 搜尋結果中被顯示及連結 允許公開、可引用路徑 Perplexity 表示不用於基礎模型訓練;WAF 應同時核對官方 IP 範圍
Googlebot Google Search 的智能手機與桌面抓取器 要保留自然搜尋及 Google AI 功能支援連結資格便應允許 robots.txt 的 Googlebot token 不能分別控制 Smartphone 與 Desktop;禁止抓取不等同可靠移除索引

OpenAI 在官方爬蟲說明明確把 OAI-SearchBot 與 GPTBot 視為獨立設定,並列出各自的完整 user-agent 及已公布 IP 範圍。文件亦指出,即使兩者都獲允許,OpenAI 可能為避免重複而以一次抓取支援兩種用途;這不改變網站管理員可分開表達搜尋與訓練選擇的原則。

Perplexity 的官方 crawler 文件同樣區分 PerplexityBot 與 Perplexity-User。本文決策表聚焦題目指定的 PerplexityBot,但技術人員在 logs 看見 Perplexity-User 時,不應誤判為 PerplexityBot 違反規則;前者是用戶觸發 fetch,而且官方說明它一般會忽略 robots.txt。真正敏感內容仍要由身份驗證阻止。

Google 的Googlebot 官方說明指出,Smartphone 與 Desktop 兩種 crawler 在 robots.txt 使用相同 product token。若品牌希望 Google Search 可抓取公開頁面,不應因為反對某些 AI 訓練用途而誤封 Googlebot;應另行評估 Google-Extended 及其他官方控制。

AI 爬蟲設定範例:允許搜尋並禁止部分模型訓練

希望保留主要搜尋入口、同時拒絕 OpenAI 與 Google 某些訓練用途,可從以下 robots.txt 概念範例開始。它不是可以直接複製到所有網站的萬用答案;正式部署前要加入網站既有的 sitemap、後台路徑、參數頁及媒體政策,並在 staging 測試規則配對。

User-agent: OAI-SearchBot
Allow: /

User-agent: GPTBot
Disallow: /

User-agent: PerplexityBot
Allow: /

User-agent: Googlebot
Allow: /

User-agent: Google-Extended
Disallow: /

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

Sitemap: https://www.example.com/sitemap.xml

這個範例表達的選擇是:OAI-SearchBot 可以抓取公開內容以支援 ChatGPT 搜尋;GPTBot 不可抓取;PerplexityBot 可以抓取以支援 Perplexity 搜尋結果;Googlebot 可以抓取以支援 Google Search;Google-Extended 被拒絕。Google 說明 Google-Extended 可管理 Gemini 模型訓練,以及部分生成式 AI 系統的 grounding,但不影響網站在 Google Search 的收錄或排名,也不控制 Google Search 內的 AI Overviews 與 AI Mode。

因此,「允許搜尋、禁止訓練」不是靠單一通用 token 達成,而是每個營運商分開處理。OpenAI 的 GPTBot 與 OAI-SearchBot 分開;Google 的 Googlebot 與 Google-Extended 分開;PerplexityBot 的官方用途本身已說明不是基礎模型訓練。其他供應商亦可能有自己的 token,不可由上述規則推論。

ChatGPT-User 不宜被當作 Search 開關。OpenAI 表示這類請求源於用戶動作,robots.txt 規則未必適用,而且 ChatGPT-User 不用於判斷內容可否出現在 Search。若網站容許一般訪客閱讀公開文章,卻希望阻止自動化工具大量取得資料,可以在 WAF 實施速率限制、驗證官方來源、限制敏感 endpoint 及保留人類可用的合理路徑,而不是期望一段 robots.txt 同時解決所有問題。

路徑層級亦要按內容價值設計。例如公開服務頁、知識庫及新聞稿可讓搜尋型 crawler 存取;購物車、站內搜尋結果、預覽頁、測試網址及無限參數組合則可限制。會員頁即使寫了 Disallow,也仍應要求登入。每一條規則都要回答一個明確風險,不應為了讓檔案看似完整而大量封鎖 CSS、JavaScript 或渲染所需資源。

AI 爬蟲設定不能只靠 robots.txtCDNWAF 與來源伺服器同樣重要

robots.txt 只是政策訊號;請求能否成功,還取決於 DNS、CDN、WAF、Bot Management、速率限制、地區規則、JavaScript challenge、CAPTCHA、伺服器防火牆及應用程式授權。常見故障是 robots.txt 明確 Allow,但 crawler 得到 403、429、503 或 challenge HTML,最終仍無法讀取頁面。

WAF 不應只以可偽造的 User-Agent header 作白名單依據。OpenAI 與 Perplexity 都公布相關 IP JSON;應從官方 endpoint 定期更新,並在供應商支援時使用 verified bot 身份或簽署訊號。UA 與來源網絡資料交叉核對,可降低冒充知名 crawler 繞過保安規則的風險。固定手動抄寫 IP 清單則容易在供應商更新後失效。

規則優先次序也會改變結果。Cloudflare 的AI Crawl Control 與 WAF 官方文件指出,上游 custom rules 可能先封鎖已設定為 Allow 的 crawler;Skip、Redirect 或 Transform rules 亦可能讓本來要封鎖的流量繞過 AI Crawl Control。完成 crawler 選擇後,要逐條檢查 rule order,而不是只看控制台最後顯示的 Allow 或 Block。

以下測試矩陣比單看 robots.txt 更可靠:

  • 政策層:直接開啟 /robots.txt,確認狀態為 200、內容沒有被快取舊版本,並以 robots parser 測試指定 URL。
  • 邊緣層:在 CDN/WAF logs 查 UA、來源 IP、bot verification、matched rule、action、edge status 與 challenge 結果。
  • 來源層:在 origin access logs 查請求是否到達、回應狀態、回應大小、處理時間及 cache status。
  • 內容層:確認 crawler 取得的是完整 200 HTML,而不是登入頁、錯誤模板、空白 JavaScript shell 或地區限制提示。
  • 產品層:在合理等待與重抓時間後,以固定查詢測試搜尋顯示及引用;沒有出現不代表規則失效,也可能是索引、品質或相關性問題。

若網站使用多層代理,edge logs 顯示 200 而 origin 沒有紀錄,可能是 CDN cache 正常回應;這不必然是錯誤。相反,edge 顯示 403 而 origin 沒有紀錄,代表請求在到達伺服器前已被阻擋。把這兩種情況分開,可避免內容團隊反覆修改 robots.txt,卻沒有處理真正的 WAF 問題。

AI 爬蟲設定與 llms.txt:非標準內容導覽不能取代權限控制

llms.txt 是一項社群提出的 Markdown 發布慣例,不是 robots.txt 的替代品,也不是具強制力的 Web 存取標準。提案建議網站在 /llms.txt 提供簡介及重要 Markdown 資源連結,讓語言模型或 agent 在有限 context window 內較快找到核心資料;提案本身沒有規定各應用必須如何處理該檔案。

llms.txt 原始提案明確把它定位為可與 robots.txt 及 sitemap 共存的內容導覽:robots.txt 表達可接受的自動存取,sitemap 列出可索引頁面,而 llms.txt 提供經整理的背景與重點連結。這個定位代表 llms.txt 不能授予被 robots.txt、WAF 或登入系統拒絕的權限,也不能阻止任何抓取者讀取原本公開的頁面。

採用限制主要有四項。第一,它不是 IETF 或 W3C 制定的正式網絡標準;第二,各主要搜尋與答案平台沒有共同承諾一定發現、讀取或採用;第三,網站要持續維護連結、摘要與 Markdown 版本,過時內容反而會造成資訊不一致;第四,任何可公開讀取的導覽檔都可能被未知工具使用,因此不應放入機密網址、內部指令、API key 或未公開政策。

最重要的是,不能把 llms.txt 寫成排名因子。Google 在AI features and your website 官方文件指出,頁面要成為 AI Overviews 或 AI Mode 的支援連結,須已被索引並符合在 Google Search 顯示 snippet 的資格,沒有額外技術要求。官方建議仍是允許 robots.txt 與 CDN 抓取、建立內部連結、提供文字內容、維持頁面體驗,以及令結構化資料與可見內容一致。

若建立 llms.txt 的成本很低,而且網站有大量產品文件、API 說明、政策頁或研究資料,可以把它當作可選的導覽層。檔案應短而清晰,只連到權威 canonical URL,標明頁面用途與更新責任,並加入版本控制。若網站只有數十個結構清楚的頁面,資源通常更應先投放在可抓取 HTML、準確 sitemap、內部連結、伺服器效能及內容品質。

也不要把 llms.txt、Schema 或開放 crawler 等同「一定被 AI 引用」。這些措施最多降低發現與理解的技術摩擦。真正的引用仍需要頁面直接回答問題、提供可核實資料、維持品牌實體一致,並與查詢意圖吻合。相關內容設計可參閱ChatGPT 與 Perplexity 品牌推薦文章

AI 爬蟲設定要用 server logs 建立可重複核對流程

沒有 logs 的 AI 爬蟲設定只是一份意向文件。server logs 能回答哪些 crawler 實際到訪、要求哪些路徑、取得什麼狀態、是否被限速,以及規則更新前後有何變化。它不能直接證明內容已進入某個索引或訓練集,但可以驗證網站端是否成功提供或拒絕存取。

建議最少記錄時間(UTC 及香港時區)、hostname、request path、query string、HTTP method、完整 User-Agent、來源 IP、verified bot 結果、edge/origin status、response bytes、cache status、matched WAF rule、處理時間及 request ID。IP 屬可能涉及個人或網絡識別的資料,應按私隱政策設定保留期、權限及遮罩方式,不要為了爬蟲分析無限期保存所有原始紀錄。

每月可用同一流程覆核:

  1. 保存當期 robots.txt 版本、發布時間、負責人及變更原因。
  2. 從官方文件重新核對 token、完整 UA、IP endpoint 及用途描述。
  3. 按 crawler 與路徑彙總 2xx、3xx、403、404、429、5xx,不只統計總請求。
  4. 抽查高價值頁是否回傳 canonical 內容,並檢查重要 CSS、JavaScript 與圖片是否被誤封。
  5. 抽查遭封鎖 crawler 是否仍到達 origin;若有,檢查規則優先次序、代理 header 與冒充 UA。
  6. 以固定查詢組記錄 Google、ChatGPT Search 與 Perplexity 的顯示、引用網址及日期,但不要由單次結果推論排名因果。

推薦使用一張變更紀錄表,欄位包括:政策目標、受影響 crawler、受影響路徑、robots 規則、WAF 規則 ID、部署時間、預期結果、24 小時/7 日 log 結果、搜尋測試、異常及回復方案。若沒有實測成效資料,這套紀錄本身就是可重複的驗證方法,不需要虛構「開放後引用上升多少」的數字。

robots.txt 的快取及平台重新處理需要時間。OpenAI 表示搜尋相關更新可能約需 24 小時;其他平台及 Google 重抓時間會因網站而異。部署後應先確認實際請求與狀態,再等待合理週期觀察產品結果。立即看不到引用,不應急於反覆切換 Allow/Disallow,否則很難把任何變化與一次明確設定連結。

AI 爬蟲設定的決策框架:允許搜尋、禁止訓練如何落地

對多數以公開內容取得客戶的香港品牌,合理起點是保留傳統搜尋與聯網答案的抓取入口,拒絕沒有商業需要的訓練 crawler,並用強制控制保護非公開資料。出版商、付費資料庫、研究機構與用戶生成內容平台則可能需要更細的授權、授權費及內容分區,不能直接套用一般企業網站策略。

商業選擇 robots.txt 方向 CDN/WAF 方向 主要代價
最大化公開搜尋與 AI 引用機會 允許搜尋型 crawler,限制低價值及敏感路徑 驗證官方 bot 後放行,設定合理速率 公開內容可被更多系統讀取及摘要
允許搜尋、禁止部分訓練 分開允許 OAI-SearchBot/Googlebot/PerplexityBot,封鎖 GPTBot,按需要封鎖 Google-Extended 不要讓通用 bot block 誤傷搜尋型 crawler 只能對遵守政策的 crawler 表達及執行選擇,不能撤回既有資料
封鎖所有指定 AI crawler 逐項 Disallow,並保留 Googlebot 與一般搜尋政策的獨立決定 以 verified bot、IP、速率及路徑規則執行 可能減少聯網答案引用與 AI 產品導流
保護非公開/付費內容 可作輔助提示,但不視為保安 登入、授權、token、網絡限制及 WAF 強制執行 需要帳戶、權限、監察及客戶體驗設計

作決定前可用五條問題:內容是否本來就希望被公眾找到?AI 搜尋引用可否帶來合資格流量或品牌曝光?內容是否涉及付費授權、個人資料或合約限制?公司是否願意讓指定供應商用於訓練?團隊是否有能力監察 crawler、更新 IP 與處理誤封?答案會直接決定每個 user-agent 的 Allow、Disallow 及 WAF action。

同一網站也可以分區。例如品牌介紹、產品資料、服務 FAQ 與公開研究摘要可允許搜尋型 crawler;原始付費報告、客戶 portal、草稿、內部搜尋與匯出 endpoint 則由認證保護。這種設計比全站一刀切更接近實際價值,也方便日後與內容授權政策對齊。

政策文件應寫明「允許搜尋不代表授權訓練」、「robots.txt 不構成保密措施」、「llms.txt 不承諾排名或引用」,並列出負責人與覆核週期。法律或授權條款仍需由合資格專業人士按司法管轄區與合約處理;技術設定只能落實部分政策,不能代替法律意見。

AI 爬蟲設定下一步:先審計,再小範圍部署與觀察

落地次序應是先盤點內容與 crawler,再修改規則,最後用 logs 驗證。第一週匯出現有 robots.txt、CDN/WAF 規則與近 30 日 bot logs;第二週按搜尋、訓練、用戶觸發及未知 crawler 分類,確認高價值與敏感路徑;第三週在測試環境建立規則及回復方案;正式發布後分別在 24 小時、7 日及 30 日覆核。

若目標是「允許搜尋、禁止訓練」,最低可行版本通常包括:允許 OAI-SearchBot、PerplexityBot 與 Googlebot;封鎖 GPTBot;按公司政策決定 Google-Extended;把 ChatGPT-User 視為用戶觸發流量,改由 WAF、認證及速率規則管理;每次只引用官方 UA 與 IP 文件。其後才決定是否建立 llms.txt,且在內部明確標註它不是排名因子。

技術健康只是被發現的前提,不是被提及、引用或推薦的保證。完成 AI 爬蟲設定後,仍要改善可引用答案、原始證據、作者與更新資料、內部連結及品牌實體一致性。需要把 crawler、內容與量度整合,可由 GEO/AI Search 審計開始;自行執行則應先建立上述變更紀錄表,確保每次調整都有政策理由、技術證據及可回復方案。

AI 爬蟲設定:相關搜尋問句(長尾覆蓋)

除了主關鍵詞,這些同義/相關問句亦常見於搜尋同 AI 摘要場景——文章內文同 FAQ 已對應回答,方便擴大覆蓋而不必硬塞主詞。

內容審閱:2026年7月|作者:trafficholic 實務團隊(香港中小企品牌網站、社媒同 SEO 落地經驗)。觀點來自真實合作流程同渠道數據觀察;數字會隨平台演算法更新,請以當期後台為準。

AI 爬蟲設定 常見問題

AI 爬蟲設定最重要的第一步是什麼?

先把商業目標拆成搜尋收錄、AI 聯網引用、模型訓練及用戶即時存取四類,再逐一核對官方 user-agent 文件。不要只看機械人名稱,也不要用一條 User-agent: * 規則代替用途判斷。

可以允許 ChatGPT 搜尋引用,但禁止 OpenAI 訓練嗎?

可以表達這項選擇:在 robots.txt 允許 OAI-SearchBot,並對 GPTBot 設定 Disallow: /。OpenAI 官方說明兩項設定彼此獨立;更新後仍應以 server logs 及實際搜尋測試核對。

封鎖 GPTBot 會否自動令網站退出 ChatGPT Search?

不會自動等同退出。GPTBot 對應基礎模型訓練用途,OAI-SearchBot 才是管理 ChatGPT 搜尋收錄及顯示的主要 robots.txt token。兩者必須分開設定。

ChatGPT-User 為什麼不能當作一般爬蟲處理?

ChatGPT-User 是由 ChatGPT 或 Custom GPT 的特定用戶動作觸發,不是自動遍歷網站的搜尋爬蟲。OpenAI 指出 robots.txt 規則未必適用,因此如內容必須受到強制保護,應使用認證、授權或 WAF,而不是只依賴 robots.txt。

PerplexityBot 是否用於訓練基礎模型?

Perplexity 官方文件表示,PerplexityBot 用於讓網站在 Perplexity 搜尋結果中被顯示及連結,不用於抓取基礎模型訓練內容。網站仍應定期核對官方文件,因產品與 user-agent 可能更新。

允許 Googlebot 是否等同同意 Google 訓練所有 AI 模型?

不能作此簡化。Googlebot 管理 Google Search 的抓取,亦關乎頁面能否成為 AI Overviews 或 AI Mode 的支援連結;Google-Extended 是針對 Google 某些其他生成式 AI 系統訓練與 grounding 的獨立控制。應按官方定義分開設定。

robots.txt 能否保護付費內容或個人資料?

不能。robots.txt 是機械人可自願遵守的存取偏好,不是保安邊界,而且檔案本身公開可見。付費內容、客戶資料、內部文件及測試環境應使用登入、伺服器授權、網絡限制或其他強制控制。

CDN 或 WAF 已允許爬蟲,為什麼仍然抓取失敗?

常見原因包括規則優先次序、Bot Management、速率限制、JavaScript challenge、地區封鎖、來源 IP 未更新或 origin 另有攔截。應同時檢查 edge logs、origin logs、HTTP 狀態及官方 IP 清單。

網站是否需要建立 llms.txt?

不是必需。若網站有大量文件、產品規格或清晰的權威頁面,建立簡短而可維護的 llms.txt 可作內容導覽;但它是社群提出的非標準慣例,主要平台沒有保證讀取或採用。

llms.txt 是否是 Google 或 AI 搜尋排名因子?

沒有可靠官方證據顯示它是排名因子。Google 明確表示 AI Overviews 與 AI Mode 沒有額外機器可讀檔案要求。llms.txt 應被視為可選導覽層,不能取代可抓取內容、內部連結、網站品質及可核實來源。

想增加查詢? 由一次對話開始

告訴我們行業與目標,我們會指出流量卡在哪裡,以及最值得先做的一步。通常一個工作天內回覆。

WhatsApp 直接對話通常一個工作天內回覆