Bloomberg Intelligence(BI)表示,DeepSeek 於 2026 年 9 月推出 V4.1 Flash 後,中國頂尖 AI 模型與美國對手的基準測試差距縮至約 3%。BI 今年 5 月估計差距約為 9%,年初則約 15%。這反映模型表現的競逐正在加速,卻不等於中國已在整體 AI 產業超越美國。
DeepSeek V4.1 Flash 的 LiveBench 成績代表什麼?
DeepSeek V4.1 Flash 在 LiveBench 得分 81.1,在相關報導引用的全球排名中位居第六;Anthropic 領先模型得分為 83.4。兩者相差 2.3 分,與 BI 所估算的約 3% 差距相符。
12
LiveBench 是比較 AI 模型表現的基準測試之一,但單一排行榜無法涵蓋所有能力或整場美中科技競爭。這組成績說明的是這些模型在 LiveBench 上的相對表現,不能據此推論所有模型、任務或 AI 產業環節都同樣接近。
差距快速收窄,但還談不上全面領先
追趕並非只發生在最近一次排名。BI 指出,中國模型與美國對手的差距在 6 月已縮至 6%,低於 5 月的 9%;當時中國模型也在 LiveBench 全球排名中取得兩個席次。最新約 3% 的估計,顯示這段追趕仍在延續。
2
不過,「逼近」比「超車」更符合目前數據。後續 LiveBench 排名中,前 15 名只有 3 個模型來自中國。頂尖模型分數差距縮小,不代表中國在高排名模型的數量與整體實力上已經追平。
8
晶片管制與美國 AI 領先地位受到檢視
中國 AI 實驗室在取得先進晶片受限的情況下仍持續進步,讓外界重新檢視美國晶片出口管制能否維持其模型表現優勢。但這些基準測試本身,並不能證明出口管制毫無效果。BI 也指出,中國 AI 公司可動用的資金不如美國競爭者,且無法取得最尖端晶片。
1
17
較審慎的結論是:美國在這項模型表現指標上的領先幅度已大幅縮小。至於這是否改變更廣泛的 AI 領導版圖,還要看企業資源,以及能否把模型轉化為廣泛使用且能持續獲利的產品,而不只是排行榜上的分數。
模型夠強,不代表生意就能獲利
模型能力只是商業競爭的一環。彭博報導指出,中國模型正成為具競爭力的低成本選項,但這個產業仍面臨商業化與變現障礙。DeepSeek 的低價策略可能加大競爭壓力;然而,以低價吸引用戶,並不等於公司已找到可長期維持的獲利模式。
3
18
重點是: BI 估計,中美頂尖模型的基準測試差距從 2026 年初約 15% 縮至 DeepSeek V4.1 Flash 推出後約 3%。這項變化挑戰了美國在模型表現上能長期保持明顯領先的假設,但不是中國已全面領先的證明;從模型競爭力走到可持續獲利,仍有不少關卡。
3