Cloudflare 在 2026 年 9 月 15 日推出的 “禁止 AI 训练”(Disallow AI Training),改变了内容发布者过去常见的两难:不必为了拒绝模型训练,就连正常的搜索收录也一并放弃。
只要某个兼具搜索与 AI 用途的爬虫运营方符合 Cloudflare 的 **“Accountable”(可问责)**标准,网站就能允许其用于搜索索引,同时明确拒绝其将内容用于训练模型。该标准用于识别已经遵守、或已作出具体承诺将遵守这一偏好的运营方。
5
核心变化:按“用途”管理,而不只看“爬虫是谁”
Cloudflare 现在将爬虫流量分为三种可独立设置的用途:
- 搜索(Search):抓取内容以建立搜索结果索引。
- 训练(Training):获取内容以训练或微调 AI 模型。
- 智能体(Agent):AI 在执行用户请求的任务时,实时获取内容。
10
这一区分很关键。一套爬虫基础设施可能同时服务于多种用途;过去,屏蔽一个与 AI 有关联的爬虫,往往也可能影响网站在传统搜索中的发现和收录。
现在,站长可以作出更细的选择:允许搜索抓取,但不允许模型训练。
5
“可问责”到底意味着什么?
Cloudflare 为能够区分搜索索引与模型训练、并尊重站长偏好的爬虫运营方设立了“Accountable”标识。苹果、谷歌和微软要么已经遵守这一设置,要么已承诺会在 Cloudflare 所说明的时间范围内遵守。
5
这对发布者的意义在于:如果一个运营方的爬虫同时承担搜索和 AI 训练相关用途,网站启用“禁止 AI 训练”后,不应仅因该运营方也涉及训练用途,就把其搜索抓取完全挡在门外。符合条件的混合用途运营方,仍可继续为搜索目的抓取和索引页面。
5
不过,现有公告仅概述了该标准,尚不足以逐一核实每家运营方的上线日期、具体爬虫行为及完整技术承诺。网站运营者不宜假定所有运营方的实际表现完全一致,仍应查看自身机器人设置和抓取日志。
哪些访问可以保留,哪些会被拦截?
这项设置的设计目标很明确:对于符合“可问责”标准的混合用途运营方,保留其搜索索引访问,但拒绝其将同一内容用于训练。Cloudflare 明确将其描述为:网站仍能被搜索收录,同时拒绝该爬虫用于 AI 训练。
5
所提供资料并未给出一份完整、逐个爬虫对应的公开放行/拦截名单,但可以得出以下结论:
- 符合“可问责”标准的运营方可继续进行搜索抓取和索引,即使网站已禁止训练。
5
- 训练与智能体访问可分别独立于搜索访问进行拦截。
10
- “拦截所有 AI 机器人”仍是可选的更严格方案,适合希望暂停或全面限制 AI 抓取的网站;但它不如按用途控制那样精确。
7
对于依赖自然搜索流量的内容网站而言,这意味着“拒绝训练”不再必然等于“放弃搜索曝光”。
广告页面与 9 月启用的默认规则
Cloudflare 此前宣布,自 2026 年 9 月 15 日起,新接入 Cloudflare 的域名中,展示广告的页面默认会拦截训练和智能体爬虫。
10
该政策体现了一项面向发布者的考虑:依赖广告变现的内容,对 AI 训练和智能体访问可能需要更严格的默认保护。
但先前的做法也有一个风险:若同一爬虫承担多种用途,按类别进行的严格拦截可能连带影响搜索抓取。新的“禁止 AI 训练”与“可问责”机制正是为解决这一冲突而设——发布者可保护广告支持的内容不被用于训练,同时在运营方能够尊重用途区分时保留搜索收录。
5
现有资料没有完整说明所有既有域名如何迁移,也无法确认每类账户的全部默认规则。因此,已运营多年的网站应直接核查自身已配置的策略,而不要仅凭新域名的默认值推断。
Google-Extended、Applebot-Extended 与 Bing 的相关做法
按用途控制,解决的是发布者长期希望解决的问题:将同一运营方的搜索活动与 AI 使用分开处理。
Cloudflare 曾讨论过谷歌的专有退出机制,包括 Google-Extended 和 nosnippet,同时提到有发布者反馈,这些机制未能阻止他们希望控制的所有内容使用方式。
22
本次提供的资料不足以独立确认 Google-Extended、Applebot-Extended,或 Bing 的 NOARCHIVE 指令目前的精确适用范围和实际效果。
但更广泛的结论很清楚:专门的退出机制,或“可问责”运营方作出的承诺,可以支持这样的指令——“可以为了搜索收录而索引此页,但不得用于训练。” 单纯封禁某个爬虫,通常无法可靠实现这种区分。
为什么更细粒度的控制越来越重要?
Cloudflare 的流量分析显示,在此前 12 个月的 AI 爬虫活动中,80% 被归类为训练用途,18% 为搜索用途,只有 2% 与用户操作有关。该公司称,这项分类依据运营方披露信息和行业资料得出。
16
这组数据说明,发布者需要的并非一个简单的“允许/禁止 AI”开关。一个网站可能愿意接受搜索索引,却不愿内容被永久吸收到模型架构中用于训练;对于实时智能体访问,也可能另有独立判断。
Cloudflare 在 2025 年还表示,已有超过 250 万个网站通过其托管 robots.txt 功能或托管 AI 爬虫拦截规则,选择完全禁止 AI 训练。
13 对这些网站来说,9 月的新控制项提供了更细的路径:在保护训练权益的同时,也可兼顾搜索可见性。
下一步:控制 AI 生成摘要
Cloudflare 表示,计划在 2027 年初让发布者对 AI 生成摘要拥有更细粒度的控制能力。
2
现有公告确认了这一方向,但尚未披露最终产品形态、执行方式或具体可选项。眼下的实际建议很直接:将搜索、训练和智能体视为三项独立决策来检查。若自然搜索发现对网站重要,就不要默认认为限制 AI 必然要限制搜索,尤其当爬虫运营方已获“可问责”认定时。
5