“AI杀手开关”的争论,已不只是实验室能否关闭一个模型。更棘手的问题是:当强大的AI部署在庞大、分散的基础设施中,甚至拥有较高自主性并扩散到原有环境之外时,关停机制还能否真正奏效?
Coxon的警告:现在或许能关,未来未必
前Anthropic、OpenAI研究员Jacob Coxon在NBC新闻节目《Meet the Press》中表示,对目前不少AI系统而言,紧急关停机制“很可能”有效。但这不是按一个按钮那么简单:大型数据中心和已部署的系统包含大量组件,需要执行多项关停操作。只要系统仍被限制在某个物理地点内,这虽然不容易,但仍可做到。
8
他担心的是下一阶段。如果AI变成分布式、具备自主行动能力的“群体(swarm)”,集中式关停指令可能在技术上失效。关键在于覆盖范围:只有当控制机制能触及系统的每一个活跃实例,它才称得上有效。
Coxon离开Anthropic后更广泛的警告是,领先实验室正在竞相开发可自我改进的AI系统,而这类系统可能最终超出人类控制能力。
1
50
从实验室的“关机键”,到可验证的安全措施
Anthropic联合创始人Jack Clark提出,未来关闭危险AI系统的能力或许应成为法律要求,而不只是开发公司自愿作出的承诺。他对BBC表示,包括Anthropic在内的大多数大型实验室已有关闭系统的办法;但问题在于,这种“杀手开关”是否应接受独立第三方核验。
33
两者差别很大。公司声称自己有应急关停程序,不等于外部评估机构已经确认:该程序确实存在、设计充分,并且能在紧急事件中实际启用。
Amodei的主张:让安全能力跟上前沿能力
Anthropic首席执行官Dario Amodei提出“为前沿发展控速”(pacing the frontier)的框架,核心是让前沿AI能力的进展速度不超过安全措施的完善速度,包含三项安排:
- 嵌入式独立评估员: 前沿AI企业应让外部评估员持续获得类似员工的访问权限,以核验相关系统和安全实践,并报告疑虑。
- 民主国家间的共同标准: 主要开发者协调制定共同安全标准,并限制不受约束的能力扩张。
- 国际协调: 各国政府跨境协作,应对任何一家企业或任何一个国家都难以可靠控制的风险。
17
这并不是要求全面停止AI研究,而是主张将持续推进与可接受外部审查的安全控制措施绑定。
谁支持这一方向?
路透社报道,OpenAI首席执行官Sam Altman与xAI负责人Elon Musk都公开支持Amodei的大方向。Altman表示,OpenAI将采纳让独立评估员获得类似员工访问权限的做法;Musk则称:“Dario是对的。”
17
相关报道也称,Google DeepMind首席执行官Demis Hassabis支持这一提案的方向。
30 至于微软首席执行官Satya Nadella,现有材料没有提供其针对该方案的具体、可归属回应,因此不宜推断其立场。
美国拟议《AI Kill Switch Act》意味着什么
美国众议院法案H.R. 9917,即拟议中的**《AI Kill Switch Act》**,拟修订《国土安全法》,要求特定受监管实体保有技术能力,以停止推理服务、终止用户访问,并关闭适用范围内的AI技术。
49
不过,这项措施仍是提案,并非已经验证可解决所有AI控制问题的方案。它的实际价值取决于:严重事件发生时,开发者是否仍能识别、接触并关闭相关系统——这正是Coxon针对未来分布式系统提出的难题。
“灭绝风险”是判断,不是预测结果
Anthropic研究员Evan Hubinger表示,他个人评估未来十年内AI导致人类灭绝的风险超过10%。计算机科学家、诺贝尔奖得主Geoffrey Hinton则对BBC表示,10%的可能性“并非不合理”。
57
这些是专家对不确定未来的判断,不是经过测量的概率,也不代表科学界共识。但它们说明,为何关停机制的讨论已超出一般产品安全范畴:倡导强化控制的人士认为,即使不可逆灾难的概率不高,其后果也足以要求建立更强的防护措施。
为什么一些政府不愿强制关停或放缓发展
英国政府已拒绝建立全国性AI“杀手开关”的提议,理由是英国“无法简单地把AI关掉”。其实际考量是:即便在英国境内阻断模型访问,也无法阻止模型在其他地方被开发或滥用。
51
这反映出问题的地缘属性。单一国家可以监管其辖区内的公司和基础设施,但AI开发本身是跨国进行的。担心竞争力的政府可能认为,单边限制会让投资、技术能力和战略优势流向约束较少的竞争者。
与此同时,主张更强治理的一方认为,这恰恰说明仅靠企业自愿承诺或单一国家的规则并不够。若风险会跨越国界,监督和安全承诺也必须具备国际层面的可信度。
真正的分歧:速度与控制权
这场争论并非简单划分为“支持AI”和“反对AI”两派。
- 安全倡导者希望看到可独立检查的安全措施、真正有效的关停能力,以及防止模型能力跑在评估与控制之前的限制。
- 质疑严格限制者认为,全球范围的暂停难以执行,且可能在无法阻止境外发展的同时拖慢有价值的创新。
- 条件式发展路径则由Coxon、Clark和Amodei等人代表:AI可以继续进步,但安全保障必须能够被测试和核验,而不是只停留在公司的承诺上。
8
33
17
因此,“杀手开关”更适合被看作更完整安全体系中的一层,而不是替代所有治理手段的万能按钮。若未来先进系统过于分布式,以至于单一开关无法触及,部署前监督、独立评估和国际协调的重要性只会更高。