Cloudflare 在 2026 年 9 月 15 日推出 Disallow AI Training(禁止 AI 訓練),令網站營運者毋須再在「保住搜尋曝光」與「拒絕 AI 訓練」之間二揀一。只要相關混合用途爬蟲符合資格,網站可以讓它繼續為搜尋引擎收錄頁面,但不可把內容拿去訓練或微調 AI 模型。
配套的 Accountable(可問責) 標示,則用來識別已經遵守、或已作出具體承諾會遵守這項偏好的爬蟲營運商。Cloudflare 指 Apple、Google 及 Microsoft 已遵守或承諾按其指定時間表遵守。
5
關鍵不再是「邊個 bot」,而是「為咩用途」
Cloudflare 把爬蟲流量拆成三個可獨立設定的用途:
- Search(搜尋):為搜尋結果建立索引。
- Training(訓練):擷取內容來訓練或微調 AI 模型。
- Agent(代理):AI 按用戶要求執行任務時,即時擷取網站內容。
10
這個分法的重點在於:同一套爬蟲基建可以有多重用途。以往若網站封鎖一個與 AI 有關的爬蟲,也可能連一般搜尋收錄一併影響。如今啟用「禁止 AI 訓練」後,網站可作更精準的選擇:容許搜尋,拒絕訓練。
5
「Accountable」到底代表甚麼?
Cloudflare 設立 Accountable 標示,是為了識別那些能夠把搜尋收錄與模型訓練用途分開、並尊重網站偏好的 bot 營運商。Apple、Google 和 Microsoft 已經遵守新設定,或承諾會在 Cloudflare 指定的時間內做到。
5
對內容出版者而言,這尤其重要:即使某營運商同時有 AI 訓練業務,其搜尋爬蟲亦毋須因此被一刀切封鎖。換言之,只要屬合資格的混合用途營運商,網站禁止訓練後,對方仍可繼續為搜尋用途收錄網頁。
5
不過,現有公告只交代了制度的高層原則,未足以逐一核實每間公司的實施日期、個別爬蟲的行為及完整技術承諾。網站營運者不應假定各家做法完全相同,仍應自行檢查 bot 設定及實際爬取紀錄。
哪些流量可以保留,哪些會被擋?
新設定的設計目標,是讓 Accountable 混合用途營運商繼續進行 搜尋收錄,但拒絕同一內容被用於 模型訓練。Cloudflare 明確表示,網站可保持被搜尋引擎收錄,同時拒絕該爬蟲作訓練用途。
5
目前提供的資料沒有列出完整、逐一爬蟲對應的公開准許/封鎖名單;但可得出以下實務結論:
- 合資格 Accountable 營運商的搜尋存取,在網站禁止訓練後仍可保留。
5
- Training 與 Agent 可各自獨立於 Search 之外封鎖。
10
- 網站仍可選擇較廣泛的「封鎖所有 AI bots」設定,適合想先暫停或全面限制的營運者;但它不及按用途控制般精準。
7
對依賴自然搜尋流量的網站來說,這次更新的意義正是減低兩難:拒絕訓練內容,未必等於放棄搜尋曝光。
有廣告頁面的 9 月預設安排
Cloudflare 早前宣布,自 2026 年 9 月 15 日起,新加入 Cloudflare 的網域,如頁面展示廣告,Training 和 Agent 類爬蟲預設會被封鎖。
10
這個政策反映 Cloudflare 的出版者取向:以廣告變現的內容,對 AI 使用應有較嚴格的預設保護。但舊有做法亦帶來風險——如果某爬蟲有多重用途,較嚴格的類別封鎖有機會連搜尋爬取都受影響。
Disallow AI Training 與 Accountable 機制正是為處理這個衝突而設:出版者可保護廣告支持的內容不被用作訓練,同時在營運商能尊重用途區分的情況下,維持搜尋收錄。
5
現有資料未完整說明所有既有網域如何遷移,亦未涵蓋每種帳戶類型的預設規則。已存在的網域應直接檢視本身政策,而非從新網域預設推斷自身設定。
Google-Extended、Applebot-Extended 與 Bing 的做法
按用途管理,所要解決的是出版者一直面對的問題:如何讓搜尋引擎索引內容,卻不容許同一營運商把內容用於 AI。
Cloudflare 曾討論 Google 的專有退出機制,包括 Google-Extended 和 nosnippet;公司表示曾收到出版者反映,這些機制未能阻止所有他們希望控制的內容用途。
22
就本報道所提供的材料而言,未能獨立確認 Google-Extended、Applebot-Extended 或 Bing 的 NOARCHIVE 指令在現時的準確適用範圍及實際行為。
不過大方向很清楚:專門的退出指令,或營運商作出的 Accountable 承諾,才有機會落實「可以搜尋收錄,但不可訓練」這個要求;粗略地封鎖整個爬蟲,則難以穩妥地做到兩者分開。
點解而家更需要細緻控制?
Cloudflare 的流量分析顯示,在之前 12 個月的 AI 爬取活動中,80% 被歸類為訓練用途,18% 為搜尋,僅 2% 為替用戶執行操作。公司表示,分類依據包括營運商披露及業界資料。
16
這組數字說明,單一「准許/封鎖 AI」開關未必足夠。網站可以接受搜尋索引,但拒絕內容被永久吸納至模型、用來提升模型能力;至於 AI 代理即時存取內容,亦可另作決定。
Cloudflare 又指,至 2025 年已有超過 250 萬個網站,透過其受管理 robots.txt 功能或 AI 爬蟲封鎖規則,選擇完全禁止 AI 訓練。
13 今次的 9 月更新,則為同時重視搜尋能見度的網站提供更細緻的做法。
下一步:控制 AI 生成摘要
Cloudflare 表示,目標是在 2027 年初讓出版者可更細緻地控制 AI 生成摘要。
2 現有公告確認了這個方向,但最終產品設計、執行方式及出版者可選設定仍未公布。
目前最實際的做法,是把 Search、Training 和 Agent 視為三個獨立決定。若自然搜尋曝光對網站重要,毋須再假定限制 AI 必然會犧牲搜尋——尤其當相關爬蟲營運商獲列為 Accountable 時。
5