彭博行業研究(Bloomberg Intelligence,BI)表示,DeepSeek 於 2026 年 9 月推出 V4.1 Flash 後,中國頂尖 AI 模型與美國對手在基準測試上的表現差距收窄至約 3%。BI 今年 5 月估算差距約為 9%,年初則約為 15%。這反映模型表現競賽正在加速,但不代表中國已在整個 AI 產業全面超越美國。
LiveBench 分數反映甚麼?
DeepSeek V4.1 Flash 在 LiveBench 得 81.1 分,在相關排名中位列全球第六。Anthropic 的領先模型得 83.4 分,兩者相差 2.3 分,與 BI 所估計約 3% 的表現差距相符。
12
不過,這只是兩個模型在一項基準測試上的比較,並非 AI 能力或中美科技競賽的全面評估。它顯示兩款領先模型在 LiveBench 上的分數相當接近,不能推論所有模型、任務或 AI 業務範疇都同樣接近。
差距收窄得快,距離全面領先仍有一段路
追趕並非一朝一夕。BI 指,中國模型與美國對手的表現差距在 6 月收窄至 6%,低於 5 月的 9%;當時中國模型亦佔據 LiveBench 全球排名中的兩個席位。最新約 3% 的估算,顯示這段時間的進步仍在延續。
2
但「追近」比「超越」更貼切。與最新估算一同報道的 LiveBench 排名中,中國模型只佔頭 15 位的三席。即使最高分模型之間的差距很小,也不代表中國在高排名模型的整體數量上已與美國看齊。
8
對晶片限制與美國 AI 優勢有何啟示?
中國 AI 實驗室在面對先進晶片取得限制之際仍持續進步,令外界關注美國的晶片出口管制能否長期維持其模型表現優勢。但單憑基準測試分數,並不能證明限制完全無效。BI 亦指出,中國 AI 公司可動用的資金較美國對手少,亦無法取得最尖端晶片。
1
17
較審慎的結論是:美國在這項表現指標上的領先幅度已顯著收窄。這是否會改變更廣泛的 AI 領導格局,還要看排行榜以外的因素,包括企業資源,以及能否把模型轉化成廣泛採用、並可持續賺錢的產品。
模型夠強,不等於生意一定賺錢
模型表現只是商業競爭的一部分。彭博的報道形容,中國模型是具競爭力的低成本選擇,同時指出業界仍面對變現障礙。DeepSeek 大幅壓低價格會加劇市場競爭,但低價吸引用戶,並不等於公司已證明可以持續盈利。
3
18
簡單講: BI 估算,DeepSeek V4.1 Flash 推出後,中國頂尖模型與美國對手的表現差距,已由 2026 年初約 15% 收窄至約 3%。這對「美國在模型表現上會長期領先」的假設構成挑戰,但並非中國已全面領先的證明;由模型夠競爭力,到建立可持續盈利的生意,仍有不少關卡。
3