5月28號,阿里巴巴通義實驗室嘅 Fun-Realtime-TTS-Preview 以 1,190 嘅Elo分數登上Artificial Analysis Speech Arena排行榜全球第五位。佢係唯一打入全球五強嘅中國語音系統,仲喺ASR(語音識別)、Chat(端到端對話語音)同TTS(文字轉語音)三條核心賽道全部攞晒中國第一——被形容為語音交互領域嘅「大滿貫」。
呢啲成績係Qwen語音實驗室持續發力嘅成果。之前Fun-Realtime-ASR同Fun-Realtime-AudioChat模型已經喺同一個平台攞過榜首位置,而Qwen2.5-Omni-7B亦都以0.741分數帶領VoiceBench Avg排行榜 。
阿里巴巴嘅語音模型仲喺方言同口音基準測試入面打低咗包括OpenAI同xAI在內嘅西方對手,特別係處理複雜中文方言嗰陣優勢好明顯 。
另外,2026年3月發布嘅Qwen3.5-Omni-Plus,聲稱喺音頻同音視頻理解任務創下215項最先進成果。喺獨立音頻基準測試入面,佢喺通用音頻理解、推理同翻譯方面都跑贏咗Google嘅Gemini 3.1 Pro,不過喺全面音視頻理解就只係打個平手 。一份審慎嘅技術評論指出,音頻方面嘅勝利係實至名歸——Fleurs ASR基準測試嘅詞錯率得6.55%,對比Gemini嘅7.32%——但喺OmniGAIA智能體基準測試就落後Gemini大約12個百分點 。
阿里巴巴喺2026年5月19號推出Qwen3.7-Max,唔夠一個禮拜就喺Code Arena嘅WebDev排行榜以 1,541 Elo登上 第四位,僅以一分落後Claude Opus 4.6 Thinking,仲爬過晒OpenAI同Google嘅所有模型 。喺React編程賽道,佢更加升到 第三位,攞到1,536 Elo,僅僅畀兩個Claude Opus版本領先 。有啲消息仲話佢曾經短暫升到Code Arena某啲子排行榜嘅第二位 。
Anthropic嘅Claude Opus 4.7/4.6系列霸住WebDev頭三甲,意味住阿里巴巴係Anthropic以外唯一——亦係美國以外唯一——打入編程前五嘅開發者 。Qwen3.7-Max喺評分多步驟編程工作流程真人偏好嘅智能體網頁開發任務入面,排喺GPT-5.5、Gemini 3.5 Flash同GLM-5.1前面 。
除咗Code Arena,Qwen模型喺其他編程同推理基準測試都攞到唔錯嘅成績:
史丹福2026 AI指數截至2026年3月嘅Arena Elo快照顯示,頂尖實驗室逼到好貼 :
| 實驗室 | Arena Elo |
|---|---|
| Anthropic | 1,503 |
| xAI | 1,495 |
| 1,494 | |
| OpenAI | 1,481 |
| 阿里巴巴 | 1,449 |
| DeepSeek | 1,424 |
阿里巴巴排第五,同榜首差大約50到55分。呢個差距細到報告作者形容競爭壓力已經轉向成本、可靠性同領域特定表現,而唔係純粹嘅原始能力 。
呢啲基準測試成績出爐嗰年,最強美國同中國AI模型嘅性能差距幾乎消失晒。史丹福2026 AI指數發現,差距由2023年5月嘅17.5至31.6個百分點,跌到2026年3月得返 2.7%。兩國而家「喺基準測試排行榜頂端反覆交換位置」——同2024年前美國獨大嘅局面好大分別 。
呢個情況仲要發生喺美國私人AI投資多過中國大約 23倍嘅背景下——最近追蹤嘅時期,美國使咗2,859億美元,中國就得124億美元 。
分析師指出幾個推動追趕嘅力量:
值得留意嘅係,有其他評估睇到比較大嘅差距。布魯金斯學會一份2026年分析認為,美國前沿模型仍然領先中國模型「幾個月甚至更長時間」,而且美國實驗室喺計算規模同長周期智能體任務方面仲保持優勢 。同期國會證詞都有類似觀點 。
儘管如此,對企業同開發者嚟講,實際意義好清楚:更多競爭、更快迭代、更低價格,同埋來自美國同中國供應商更多可行選擇 。