OpenAI表示,将支持独立机构在训练、评估和部署阶段对前沿AI模型进行技术安全评估,而不是等到临近发布才让外部人员参与。公司称,此举是为了让评估者有足够的访问条件,检验安全主张、发现盲区,并确认风险缓解措施是否真的有效。
5
这比常见的“发布前红队测试”更早一步,但目前公开的仍是一套自愿性框架,并非由外部监管机构执行的许可制度,也没有规定发现问题后必须暂停部署。因此,它最终能带来多大改变,取决于评估者能看到什么、能否独立工作,以及发现严重风险后是否会产生实质后果。
外部评估者将审查什么?
OpenAI将第三方评估定位为:独立检验企业对前沿模型能力、风险与防护措施所提出的证据。其表述强调,评估应在训练、评估和部署的全过程获得较深层次的访问。
5
据对该框架的报道,重点之一是独立审查实验室的“安全论证”(safety case),范围覆盖训练、评估、内部部署和外部部署。框架还列出四个评估领域与七项运作原则;实验室可在报告发布前获得修复问题的时间,也可以请求删节部分内容。
2
较早介入的意义在于:如果评估只发生在开发末期,重大的技术路线和商业决策往往已经很难回头。不过,早期访问也可能涉及敏感的模型权重、能力信息和测试材料,因此安全保密本身也是评估机制必须处理的现实约束。
OpenAI提出的四项可信条件
OpenAI认为,有效的第三方评估需要四项基础条件:强有力的独立性机制、科学严谨性、稳健的安全实践,以及清晰的责任划分。
5
独立性:不能由被评估方“遥控”
如果模型开发者可以指定测试方法、在结果不利时缩减访问范围,或因不满意结论而终止资助,那么“独立评估”便名不副实。独立性不只是评估机构是否隶属公司外部,也涉及治理结构、资金来源、审查范围和对外沟通权。
一个评估者联盟也提出,可信评估应具备实质性独立:评估机构不受被评估企业控制,并有权公布主要发现,删节仅限于边界明确的必要情形。
17
34
科学严谨:方法与证据经得起检验
评估需要合格的专业人员、有效的方法,以及可供核查或复现的证据。未来生命研究所的《AI安全指数》指出,评估方法和独立性仍需加强,不应停留在零散、有效性不足的任务型测试,而应引入可信的外部评估者。
8
12
安全保密:开放审查不等于无边界泄露
让外部人员更早接触前沿系统,也会增加安全风险。OpenAI表示,实验室需要在保护敏感信息的同时,提供有意义的审查条件。
5 合理的安全控制应减少不必要的暴露,但不能成为阻止评估或掩盖关键发现的笼统理由。
责任与问责:发现问题后,谁来决定、谁来负责?
可信流程还必须说清楚:谁提供访问权限、谁确定方法、谁接收结论、谁判断缓解措施是否足够,以及严重风险未解决时将如何处置。若没有明确的报告和升级路径,评估很可能只是一份可被管理层悄然搁置的建议书。
它与“对齐”和递归自我改进风险是什么关系?
第三方评估是一种监督与验证机制,不是解决AI对齐问题的技术方案。它的作用是检验企业关于风险和缓解措施的说法,是否有足够证据支撑。
OpenAI在另一份联邦政策蓝图中提出,前沿AI开发者应评估并缓解网络能力、化学/生物/放射性与核风险(CBRN)、失控、错位(misalignment)以及向递归自我改进(RSI)发展的风险;同时发布安全框架和透明度报告,并可为安全与商业机密作适当删节。
7
在这个框架下,外部评估者可以帮助验证企业的测试与防护是否可信,但仅靠评估本身,无法解决失控、错位或RSI相关风险。
与Anthropic“驻场评估者”方案有何不同?
Anthropic首席执行官达里奥·阿莫代伊(Dario Amodei)提出了更持续的模式:让第三方评估者以近似员工的访问权限长期进入前沿AI实验室。他们审查的不只是完成后的模型,还包括训练流程、部署做法、内部防护措施和重要安全事件。
18
21
Anthropic已宣布安排埃森哲(Accenture)人员进驻,对模型和公司实践进行审查,并正与其他机构讨论试点。Anthropic也承认,评估者的访问权限和沟通方式目前尚无既定标准。
19
22
OpenAI此次框架与这一思路的共同点,是都希望将外部审查前移并加深。但其公开说明目前更聚焦于贯穿开发阶段的技术评估。它是否会提供“驻场式监督”所要求的持续访问,仍取决于尚未完全公开的执行细节。
5
为什么行业标准也成为焦点?
报道称,Anthropic、OpenAI和Google DeepMind曾讨论建立共享的、自愿性的AI安全标准机构。
20 如果形成共同标准,行业或许更容易比较评估方法、界定风险阈值,并统一事故报告预期。
但标准机构本身并不会自动消除利益冲突,也不会天然拥有执法权。自愿标准要发挥作用,仍需透明的衡量方式、独立核验和对不遵守者的实际后果。
批评者为何依然不买账?
批评者并非一定反对外部测试;他们质疑的是,由企业主导的安排能否构成真正的外部监督。问题在于,开发者仍可能挑选评估者、决定可访问范围、拖延评估、要求删节,甚至在负面结论出现后仍推进部署。
主要担忧包括:
- 资金与机构独立性: 评估者应受到保护,不能因得出不利结论而面临资金压力或被终止合作。
17
34
- 及时且充分的访问: 测试必须及早触及相关模型、系统与关键开发决策,才能影响结果。
- 披露结论的自由: 因安全原因进行删节可以合理,但范围应当有限,并受规则约束,不能让企业压下不利结论的核心内容。
2
17
- 升级机制与后果: 当风险超过阈值,评估需要直达决策层的路径,以及预先明确的响应措施。
前OpenAI研究员丹尼尔·科科塔伊洛(Daniel Kokotajlo)曾批评主要实验室为争夺市场份额而“快速行动、打破常规”,这反映了一个更广泛的担忧:竞争和财务压力会使自愿放缓变得代价高昂。
36
40 问题具有结构性——如果企业仍单方面控制访问、发布和部署决定,第三方审查或许能改善证据质量,却未必能成为真正独立的监督。
结论:早评估是进步,能否约束行动才是检验
将安全评估前移到训练和部署过程,意味着发现的问题理论上更有机会影响模型开发与上线决策。OpenAI提出的独立性、严谨性、安全保密与明确责任四项原则,也确实是合理标尺。
5
但真正的考验在于,这些原则能否变成可执行的工作条件:评估者是否拥有稳定而充分的访问权、方法自主权和受保护的报告权;删节如何透明处理;一旦发现重大风险,是否存在可信的应对程序。缺少这些保障,早期外部评估仍可能是有价值的红队测试,却难以达到批评者所期待的独立监督。