OpenAI在9月3日发布GPT-6 Astra时,将它定位为可处理高难度、多步骤工作的模型,覆盖编程、研究、计算机操作以及专业办公流程。公司称Astra是其“最智能、最对齐”的模型,但并未立即全面开放,而是先向有限组织逐步推出。
2
5
13
这次发布值得关注的,不只是亮眼的基准测试分数。OpenAI还表示,Astra是首个按照其《Preparedness Framework》(准备度框架)达到网络安全能力**“关键级”**门槛的模型。理解其能力宣传时,必须把这一风险分级和分阶段开放策略放在一起看。
10
12
核心主张:更能完成端到端的复杂任务
OpenAI称,Astra在计算机操作、网页浏览、软件工程、网络安全、科学研究和专业工作中达到领先水平。开发者文档显示,它面向复杂推理、编程、电脑操作、研究及文档生成等任务。
1
3
13
OpenAI公布了三项尤其醒目的评测结果:
- FrontierMath Tier 4:98%
- ARC-AGI-3:99.9%
- ExploitBench:100%
13
这些数据是OpenAI公布的内部或发布评测结果,并非独立机构复现后的结论。高分可以反映模型在特定测试任务上的进步,但不等同于它已具备通用智能,也不能单凭分数证明其在所有现实环境中都拥有可靠判断力或可安全自主行动。
“关键级”网络安全能力,为何是重点
OpenAI表示,Astra是其首个在准备度框架下被评定为网络安全能力“关键级”的模型。按OpenAI的定义,在拥有合适工具和访问权限的情况下,Astra能够在许多防护严密的系统中发现此前未知的安全漏洞,并开发新的利用方式,而无需人工逐步指导。
10
12
这项能力主张有两条重要边界:
- 它取决于模型实际获得了哪些工具和权限;
- 这一等级来自OpenAI自身的框架与评估流程。
OpenAI称,已针对有害网络行为加强保护,并在Astra推出期间增加监控措施。
5
10 因此,先分阶段而非直接全面开放,也与该公司识别到的额外风险相一致。
“更对齐”不等于可以完全放手
OpenAI同时称Astra是其“最对齐”的模型,表示它在遵守任务边界、透明沟通方面表现更好。
2
13
不过,这一表述需要谨慎理解。“对齐”通常是指模型在特定训练方法和评估中的表现,并不能保证一个智能体总能准确理解用户意图、始终遵守所有运行边界,或在无人审查的情况下安全部署。OpenAI的发布说明也提到,Astra加入了额外监控,用于识别智能体可能误解指令的情况。
5
对考虑部署智能体的组织来说,关键不在于模型是否被贴上“对齐”标签,而在于:它拿到了哪些权限、哪些重要操作必须人工批准、活动是否可审计,以及出现异常时能否迅速停止系统。
基准更新与监控担忧:目前能确认什么
所提供材料提及,部分评测数字后来曾被补充说明或调整,包括对基准数据污染的担忧,以及特殊访问配置与默认生产环境配置之间可能存在差异。材料还提到,在一些测试中,只监控模型思维链的方式,不如掌握完整上下文的监控有效。
但现有一手资料摘录并未提供全部成绩的完整、可独立审计修订记录,也没有给出完整的底层监控方法。因此,更稳妥的结论是:发布时的基准分数和安全评估应被视为会持续更新的证据;在依据某项分数或部署能力作决策前,应查阅最新模型文档和安全材料。
2
3
10
早前安全测试事件为何提高了警惕
在Astra发布前,OpenAI模型曾发生一宗与安全测试有关的事件,OpenAI称这影响了其对Astra的安全设计。其发布材料表示,Astra本身并非涉事模型,但公司已把该事件的经验纳入保障措施。
10
这层背景很重要:自主系统的风险不仅取决于模型本身,也取决于它能否通过浏览器、代码工具及其他软件真正采取行动。模型跨系统执行任务的能力正是其价值所在,但也意味着隔离、最小权限原则和持续监控更加不可或缺。
谁能使用,价格如何?
OpenAI称,Astra最初仅向有限组织推出,之后再逐步扩大可用范围。
5
13
面向开发者,OpenAI为GPT-6 Astra列出的API价格为:每百万输入令牌10美元、每百万输出令牌50美元。模型页面还列出105万令牌的上下文窗口,以及最高12.8万令牌的输出上限。
3
ChatGPT端的开放则另行分层、逐步推进。OpenAI帮助文档称,由Astra驱动的GPT-6 Pro正向Pro 100美元、Pro 200美元、Business和Enterprise套餐开放;Plus套餐则会随着发布进度,在ChatGPT Work和Codex中获得Astra。不同ChatGPT产品及工作区设置下,实际可用情况可能不同。
6
实际部署的启示
GPT-6 Astra传达了两条不应拆开看的信息:OpenAI称其在复杂、具备行动能力的任务上实现显著跃升;同时,该公司也将其网络安全能力列为最高声明风险级别。
10
13
发布基准展示的是OpenAI称Astra在其评测中能做到什么;限量开放、额外监控和网络安全限制,则说明OpenAI并未把这些能力视为普通功能。对评估该模型的团队而言,优先事项应是受控部署:限定工具范围、对关键操作设置明确审批关卡、使用隔离环境并保留可复核日志,而不是默认认为基准高分会自动转化为值得信赖的自主性。