前沿 AI 安全工作正在形成一种特殊的高压处境:负责评估先进模型的人,可能相信这些系统会带来严重危害,却未必拥有推迟发布或要求整改的权力。
报道称,英国 AI 安全研究所(UK AI Safety Institute,AISI)有数名员工请病假或寻求心理咨询;未发布模型的紧凑测试周期、低落的士气,以及对技术快速部署的担忧,被认为是相关因素。
2 这并不意味着该机构,或 Anthropic、OpenAI、Google DeepMind 的所有员工都处于同样状态;但它确实提示了高风险技术竞赛给一线人员带来的心理负荷。
为什么这类工作格外难熬
安全研究人员评估的不是遥远的假想技术,而是可能很快进入现实使用场景的模型。于是,职业责任与组织推进速度之间可能产生冲突:发现漏洞,并不等于有权阻止产品上线。
围绕英国 AISI 的报道,重点在于未发布系统的评估时间被压缩,以及商业化部署和能力提升速度很快。
2 当研究人员认为一次疏漏的后果可能很大、个人却无法独自解决风险时,疲惫感还会叠加无力感与道德压力。
这首先是制度问题,而不是说某位员工“想太多”,也不构成灾难必然发生的证据。高后果、快节奏,以及独立干预机制不清晰,才是压力形成的组合条件。
他们担心的风险是什么
担忧既包括较近的滥用风险,也包括更具推测性的长期“失去控制”情景。
网络安全与生物滥用
能力更强的模型可能降低实施有害行为所需的技能、时间或成本。曾任职于 OpenAI、后在 Anthropic 工作的研究人员 Jacob Coxon 提到,AI 辅助的生物威胁和网络武器,可能成为造成严重伤害的路径。
15
这并不是说某个特定模型已经造成了此类事件。它说明了为何安全团队强调:对于具备更强推理能力或更强自主执行能力的系统,在广泛部署前应进行评估、设置访问控制并持续监测。
系统进步速度超过监督能力
另一层担忧是,AI 可能自动化越来越多的科研和工程环节,进而加速技术自身的迭代。乔治城大学 CSET 的一份报告提出,高度自动化的 AI 研发可能加快能力进展,同时使人类更难理解和控制系统;这是一种可能的风险情景,不是已经被证实的结果。
48
现有证据也划出了重要边界。一项近期研究发现,智能体能够在无人协助下完成大量科研工程工作,但在测试所涉及的开放式研究问题上,未能取得实质进展。
49 因而,完全的递归自我改进尚未得到证实。真正令人担心的是方向与速度:即使只是部分自动化,也可能压缩评估、治理和纠错的时间窗口。
Jacob Coxon 的辞职为何引发共鸣
Coxon 的公开辞职,让原本常留在实验室内部的焦虑有了具体的人物与声音。他表示,自己曾在 OpenAI 和 Anthropic 从事预训练研究,认为两家公司正朝着“自我改进的超级智能”竞速,却没有采取负责任的做法。他也对 BBC 表示,从业者对技术进展速度及其潜在影响“确实感到害怕”。
1
一名研究人员辞职,并不能自动证明其所有预测都正确;但它把一个现实的职场两难摆到台前:留在实验室内部是否更有机会推动防护措施,还是当内部渠道不足时,离开并公开发声才是必要选择。
为什么单个实验室很难独自减速
核心治理难题是集体行动。任何一家实验室若单独放慢能力研发,都可能担心被竞争对手甩开;而实验室内部员工对整个行业竞赛的影响力则更有限。
斯坦福大学以人为本人工智能研究院(Stanford HAI)就“AI 能否放慢”进行的讨论认为,广泛放缓 AI 能力发展很难实现。但与会者仍强调,政府或具备资质的第三方应开展独立评估,并加大对安全、安保和监测的投入。
18
这一思路比要求个别研究人员独自承担责任更具操作性。问题应转向共同规则:谁来测试?触及风险阈值后会发生什么?谁能核验机构是否遵守承诺?
业界的“放慢”呼吁可信吗
Anthropic 的 Dario Amodei、OpenAI 的 Sam Altman,以及 Google DeepMind 的 Demis Hassabis,都曾以不同程度公开支持放慢或“调节节奏”前沿 AI 的发展。
32 公开讨论过的方案包括:允许独立外部评估者持续进入前沿实验室开展工作。
36
但公开承诺不等于可执行的约束。批评者指出,如果由主导市场的大公司设计 AI 冻结或减速规则,可能巩固其优势、挤压规模较小的竞争者。
34 两种判断可以同时成立:一些行业领袖可能真心担忧安全风险,而现有巨头也可能从提高准入门槛的规则中获益。
因此,与其猜测动机,不如看承诺能否被验证。一项严肃的安全承诺,应至少体现为:
- 不完全由开发者控制的独立评估;
- 清晰的风险阈值,以及越过阈值后的实际后果;
- 透明的事故报告和安全实践;
- 有实质权力的外部监督;
- 对提出安全疑虑员工的有效保护。
这些报道说明了什么,又没有说明什么
这些报道并不能证明人类灭绝迫在眉睫,也不能证明所有前沿实验室员工都处于心理困扰中,更不能证明现有 AI 已能无限制地自主改进。
但它们说明,为什么一些最接近这项技术的人会感到伦理上难以承受:强大系统在时间压力下接受测试;担忧横跨网络安全、生物滥用及失控风险;而负责约束发布的制度,可能尚未具备足够的独立性和权威性。
2
15
18
对 AI 安全研究人员来说,这种组合会让一份技术工作变成有关个人责任的难题。更持久的应对方式,不是把责任继续压在个体身上,而是建立可信、可独立核验的评估与问责体系,使治理速度能够跟上技术速度。