彭博行业研究(Bloomberg Intelligence,简称BI)称,DeepSeek于2026年9月推出V4.1 Flash后,中美顶尖AI模型的基准性能差距缩小至约3%。BI此前估计,这一差距在5月约为9%,年初则约为15%。这显示头部模型之间的追赶速度很快,但并不能据此认定中国已在整个AI产业上超过美国。
LiveBench成绩:差距有多近?
DeepSeek V4.1 Flash在LiveBench获得81.1分,在相关全球排名中位列第六;Anthropic的领先模型得分为83.4分。两者相差2.3分,与BI所说的约3%性能差距相符。
12
不过,这只是特定模型在一个基准测试上的表现,不是对所有AI能力或整个中美科技竞争的全面评判。它说明这两款模型在LiveBench上的得分接近,不能证明所有模型、任务和AI业务领域的差距都同样小。
差距持续收窄,但还谈不上全面反超
追赶并非一朝一夕发生。BI称,中国模型与美国同行的性能差距在6月已缩至6%,低于5月的9%;当时,中国模型在LiveBench全球榜单中占据两个席位。此后差距进一步缩小至约3%。
2
榜单也显示,“逼近”比“超越”更准确。在报道这一新估计时引用的LiveBench排名中,前15名只有3款中国模型。头部两款模型的分差很小,不代表中国已经拥有与美国相同数量的高排名模型。
8
对芯片管制与美国AI领先地位意味着什么?
中国实验室在先进芯片获取受限的背景下取得进展,让外界重新审视出口管制能在多大程度上维持美国在模型性能上的领先。不过,基准成绩本身并不能证明这些限制毫无作用。BI也指出,中国AI企业在资金实力上不及美国对手,而且无法获得最尖端芯片。
1
17
更稳妥的结论是:美国在这一项性能衡量上的领先幅度已明显收窄。至于这是否会改变更广泛的AI竞争格局,还要看企业可调动的资源,以及它们能否把模型转化为广泛使用、能够盈利的产品;单看一张排行榜,无法回答这些问题。
模型够强,不代表生意就能赚钱
模型性能只是商业竞争的一部分。彭博的报道将中国模型描述为有竞争力的低成本选择,同时也提到该行业仍面临变现障碍。DeepSeek的低价策略可能加大同行的竞争压力,但低价吸引用户,并不等于企业已经找到可持续盈利的办法。
3
18
**归根结底:**BI的估计显示,2026年中美顶尖模型的基准性能差距已从年初约15%缩至DeepSeek V4.1 Flash发布后的约3%。这让“美国将长期保持模型性能优势”的判断面临挑战,但并不证明中国已全面领先;从有竞争力的模型走向稳定、可持续的利润,仍有一段距离。
3