公开报道显示,Anthropic、OpenAI与Google DeepMind确实正朝一个核心原则靠拢:能力最强的AI模型在公开发布前,不应只接受开发商自身的内部检查,还应接受外部审查。但现有公开信息并不能证明三家公司已经成立新的联合监管机构,更不能证明它们已就具有约束力的测试、审计访问权限、发布门槛或违规处罚达成一致。
8
11
这一区别至关重要。认同“需要评估”,并不等于已经建立一个有权执行规则的机构。
用大白话说:这项提议是什么
报道称,三家公司自2026年7月起举行工作层面的讨论,目标是设立一个由行业推动的前沿AI标准机构。其设想中的重点,是在模型向公众部署前,对危险能力进行统一评估,尤其涉及网络攻击、生物风险、欺骗行为及其他可能造成重大影响的滥用场景。
8
11
Google DeepMind首席执行官德米斯·哈萨比斯提出了目前最清晰的制度构想:建立一个由美国主导的“前沿AI标准机构”,参考美国金融业自律组织FINRA的模式。FINRA即金融业监管局,是由行业出资、受联邦监督的自律机构。哈萨比斯的方案设想,由类似机构在模型发布前进行测试;初期由实验室自愿提交模型,待评估流程被验证有效后,未来才可能转为强制要求。
9
不过,公开记录仍未显示这些实验室已就决定该体系能否真正运转的细节达成共识,包括:
- 哪些模型必须接受审查;
- 哪些技术评估必须完成;
- 外部评估者能获得多大范围的系统访问权限;
- 哪些结果会导致发布被阻止、延期或附加条件;
- 机构由谁出资、如何治理;
- 评估者如何避免受被评估公司影响;
- 政府监督与法律保障如何设置。
在这些问题得到回答前,把该倡议称为已经投入运行的“联合监管机构”,都超出了现有证据所能支持的范围。
三家公司目前真正一致的部分
最明确的共同点是:前沿模型应在公开前接受独立测试。Axios在7月报道称,阿莫代伊、OpenAI首席执行官萨姆·奥尔特曼与哈萨比斯大体支持让外部机构在模型面向公众前进行审查,而不再主要依赖公司自报。
8
这一转变的意义在于,前沿模型安全不只取决于开发商有没有做评估,也取决于独立方能否复现、质疑和挑战这些结论。一个可信的机制需要明确的测试项目、可靠的系统访问条件,以及模型越过风险阈值后相应的处理后果。
三家公司也都把问题置于国际竞争与协调的框架中。它们承认一个现实张力:如果美国单方面施加限制,而其他国家的竞争对手不受类似约束,国内政治上很难推动更严格的限制。哈萨比斯的方案明确以美国主导为前提;阿莫代伊则认为,只靠一国的保障措施无法管理可在全球部署的系统。
9
1
分歧不在口号,而在谁拥有权力
三家实验室都使用“安全”语言,但背后有一个根本分歧:这究竟应是自愿性的行业框架、政府支持的制度,还是一个具有实权的监管机构?
DeepMind的模式是行业出资、联邦监督:先从自愿参与开始,之后有可能让通过审查成为部署模型的前提条件。
9
阿莫代伊的方案则强调,在前沿AI实验室内部设置拥有类似员工权限的独立评估员;他还主张民主国家的企业协调标准,并在必要时获得政府支持。
1
2
有关工作组讨论的报道将OpenAI描述为更愿意先采取行业行动,而非等待政府建立完整体系。
11 奥尔特曼也在阿莫代伊发表文章后公开支持让独立评估员获得类似员工的访问权限。
这些不是措辞上的小差别。自愿安排可以更快落地,也便于形成共同的技术做法;但若缺乏独立治理与公共权力,它未必能强制企业开放访问、解决争议、避免利益冲突,或阻止一家公司发布未通过安全审查的模型。
Frontier Model Forum并不等于新监管机构
Frontier Model Forum(前沿模型论坛)已经存在,是由多家主要AI公司参与的行业组织。其公开目标包括推进安全研究、发展评估方法和最佳实践,以及与政策制定者和产业界分享信息。
这使它成为一个可能的协调平台,但不能据此推断新的独立机构已经成立,也不能证明跨公司的审计体系具有约束力。关键在于:这些公司最终成立的实体,是只编写指导意见,还是能够独立评估模型并施加实质性发布条件。
阿莫代伊的文章为何改变了公开讨论
9月12日,Anthropic首席执行官达里奥·阿莫代伊发表约3800字文章《我们必须放缓前沿步伐》(We Must Pace the Frontier),主张放慢AI能力提升速度,为安全实践追赶争取时间。
5
2
他警告称,在未来6至12个月内,能力更强的自动化AI智能体群可能具备“接管互联网”的能力。应将此理解为风险预测和警示,而非已被证实的技术结论。
5
13
他的路径包含三部分:
- 在前沿AI实验室内嵌入独立评估员,给予类似员工的访问权限,用于测试系统、识别安全失效并评估合规情况。
1
2
- 推动民主国家中的AI公司协调共同安全标准与限制,必要时由政府提供支持。
2
16
- 寻求更广泛的国际协调,包括与威权政府协调,因为先进模型及其风险可以跨国部署。
1
15
Anthropic表示,将给予第三方评估员长期、类似员工级别的系统访问权限。这比一次性的外部测试承诺更进一步;但其可信度仍取决于评估员由谁挑选、能查看什么、是否可公开发现,以及发现不可接受风险后会发生什么。
12
2
最终检验:问责是否独立
批评者的核心担忧很直接:正在竞相开发最强大系统的公司,可能同时参与制定、管理和解释约束这些系统的规则。
一个安全机构若要具备公信力,需要独立的技术领导层、透明的评估方法、抵御公司影响的制度安排、有意义的政府监督,以及在评估不通过时采取行动的明确权力。缺少这些要素,共同标准或许能改善行业实践,却仍达不到独立问责的程度。
生命未来研究所(Future of Life Institute)发布的2026年夏季《AI安全指数》也说明了为何外界仍抱有疑虑:Anthropic获C+,OpenAI获C,Google DeepMind获C;没有一家被评估实验室高于C+。
17
美国参议员伯尼·桑德斯认为“放慢”还不够,呼吁暂停先进AI开发并禁止人工超级智能。 这比几家实验室的提议严格得多,但也凸显出自愿放缓与可强制执行的限制之间的差距。
接下来该看什么
真正有意义的进展,不会只是又一份原则声明,而应是可核查的制度承诺:
- 公开的治理章程;
- 已被点名、且独立的评估员;
- 标准化的能力与滥用风险测试;
- 审计访问及信息披露规则;
- 发布门槛和整改要求;
- 对一个关键问题的明确回答:安全评估结论能否延迟或阻止部署?
目前,证据支持的结论应保持克制:主要前沿AI实验室正在讨论共同的安全基础设施,也日益支持外部测试。至于这些讨论最终会形成独立、可执行的标准机构,还是一个自愿性的行业论坛,仍没有定论。
8
9
11