开权重模型(即模型权重可获取、可在一定许可条件下部署的模型)已不再只是处理简单任务的低价替代品。头部产品与专有前沿模型的能力距离正在缩小,企业因此可以按具体工作负载的质量门槛、成本和控制需求选模型,而不是默认把所有请求发送给能力最强、价格也最高的 API。
榜单差距在收窄,但分数必须结合语境看
有报道称,在 2026 年 9 月的 Artificial Analysis 快照中,月之暗面(Moonshot AI)的 Kimi K3 得分为 59.7,Anthropic 的 Claude Fable 5.1 为 65.7,相差 6 分;而一年前的报告差距为 13 分。
3 这说明开权重模型与最前沿专有模型之间的距离确实显著压缩。
但这些数字不能被视为永久不变、也不能跨版本直接对照。Artificial Analysis 当前的对比页面采用 v4.2 方法,列出的 Kimi K3(max)为 50 分、Claude Fable 5.1 为 56 分。
52 Kimi K3 页面还显示,v4.2 的 Intelligence Index 纳入了 10 项评测,这也说明评测集、模型配置或计分方法一旦调整,分数就可能变化。
1
更稳妥的结论是:顶尖开权重模型在广义能力指数上已比过去更接近最佳专有替代方案。但这不代表它们在每项任务上完全等效。综合榜单无法证明模型在可靠性、安全行为、工具调用、响应时延、多模态能力,或企业自身业务流程中具有同等表现。
差距变小,改变的是采购逻辑
对生产团队而言,问题通常不是“哪一个模型总分最高”,而是:哪一个模型能以可接受的风险和最低的总成本,完成这项任务?
如果较低成本的模型已经达到摘要、信息抽取、内部知识检索、常规编程辅助或分类任务的质量门槛,那么让每个请求都使用顶级前沿模型就未必划算。反过来,在高难度推理、高风险决策、复杂智能体任务,以及微小质量改善会明显影响收入、安全或合规的场景中,专有模型的能力优势仍可能值得付费。
价格正是这种变化的一部分。Artificial Analysis 当前页面显示,Kimi K3(max)每百万 token 的价格为 2.31 美元,而 Claude Fable 5.1 为 7.17 美元;同一页面也显示后者在当前 Intelligence Index 和输出速度上领先。
52 token 单价并不能覆盖全部成本,但它解释了为何模型选择已成为一项运营优化问题。
AT&T 的实践:不是“二选一”,而是按任务路由
AT&T 提供了从单一模型策略转向模型组合策略的具体案例。该公司表示,开模型在其 AI 使用中的占比已从 5 月的 20% 升至 40%,未来数月可能达到 60%;同时,相比年初,其 AI 成本最高可节省 80%。
26
早前报道还称,AT&T 最终希望让开模型承担其总 AI 使用量的 70% 至 80%,同时保留专有模型作为组合的一部分。
17 这并不是说开模型适合一切任务,而是一种路由策略:
- 将高频、标准化任务交给成本较低的模型;
- 仅在确实需要额外能力时调用高端模型;
- 在具体工作负载上衡量质量、速度与成本,而非只盯着单一榜单。
这种做法的重要性超过任何一张排行榜。随着模型能力逐渐趋近,企业的竞争力更多来自评测体系、模型路由、可观测性,以及在不影响应用的情况下切换供应商的能力。
开权重不等于天然便宜,也不等于天然私密
开权重模型的吸引力在于,组织可能可以在自己可控的环境中运行它们,针对特定用途进行调优,并减少对单一 API 供应商的依赖。但“开放”并不自动意味着私密、低价或低风险。
自行部署会将更多责任转移给采用者。严肃的生产部署需计入基础设施、推理优化、工程投入、补丁更新、监控、访问控制、模型许可和事件响应等成本。处理敏感信息的组织还应审查模型来源、软件供应链、数据驻留要求、出口管制义务,以及所有周边服务的安全性。
因此,正确的比较不是“API 价格”对“零成本”,而是每次成功完成业务任务的总成本,其中也要包括错误答案造成的代价、运营责任和必要的安全防护。
中国模型的表现带来竞争,也带来治理问题
Kimi K3 出自月之暗面。围绕近期榜单的报道显示,中国实验室在开权重领域占据了突出位置。
3 这扩大了高能力模型的供给,并对专有模型供应商形成竞争压力。
对企业采购方而言,模型的来源地不应被简化为营销标签,更不能替代尽职调查。更合适的做法是采用一致的供应商与模型审查流程:核验许可条款、权重和依赖项,评估安全实践,在内部数据上测试性能,并确认部署架构是否满足适用的隐私与监管要求。
英伟达收购 Hugging Face,凸显开模型基础设施的战略价值
据报道及随后公司声明,英伟达已同意以约 129 亿美元收购 Hugging Face。
34
36 Hugging Face 是开发者发现、共享和测试 AI 模型及工具的重要平台。这笔交易表明,模型分发、开发者工作流和工具链已成为战略性基础设施,而不只是研究者的边缘生态。
这项交易并不能决定开放 AI 的最终走向,但它清楚显示:围绕开模型形成的仓库、工具、硬件支持与开发者社区,与模型本身一样具有可观的战略价值。
更可能的终局:按任务选择的混合式 AI
基准差距缩小,使混合架构更具现实性:
- 前沿专有模型:用于最困难的任务、托管服务需求强的场景,以及顶级能力或供应商支持具有决定性价值的工作;
- 开权重模型:用于高吞吐、可定制、成本敏感或需要更强环境控制的工作负载,前提是其质量达到要求;
- 路由与评测层:持续检查质量、时延、成本和政策合规性。
重点并不是开权重 AI 已让专有模型过时,而是两者的能力差距在越来越多场景中已小到足以让企业做出真正的经济选择。更好的策略不是站队“开放”或“闭源”,而是严谨衡量哪种模型能以合适的总成本,安全、可靠地解决每一项业务任务。