騰訊 Hy4 Preview 是 Hunyuan 系列的新一代開源大型語言模型,採用「混合專家」(Mixture of Experts,MoE)架構,定位不只是聊天問答,而是協助用戶完成一連串工作:寫程式、搜尋及整理研究資料、辦公室自動化、數據分析,以及需要多步規劃和調用工具的 AI Agent 任務。414
不過,Hy4 目前仍是 Preview 預覽版。騰訊公布的部分比較結果相當亮眼,但由於不少數據來自公司自家測試或發布材料,暫時不宜單憑這些數字就斷言它已經全面超越 DeepSeek、Qwen、GLM、Kimi 或 MiniMax 等模型。513
Hy4 同 Hy3 有甚麼分別?
| 指標 |
Hy3 Preview |
Hy4 Preview |
實際意思 |
| 總參數 |
295B |
770B |
MoE 整體容量約增至 2.6 倍。24 |
| 激活參數 |
約 21B/Token |
約 49B/次請求 |
每次推理使用的計算量約增 2.3 倍,潛在能力更高,但服務成本亦會上升。24 |
| 上下文窗口 |
256K Token |
逾 1M Token |
名義容量約為四倍,適合大型程式碼庫、長篇文件及長流程 Agent。214 |
| 主要用途 |
推理、編程、RAG/IDE Agent |
Agent、編程、研究、辦公室工作、複雜工具操作 |
Hy4 更明確瞄準生產力及企業工作流程。24 |
| 發布狀態 |
開放權重模型;據報採用 Apache 2.0 條款 |
開源預覽版 |
商業部署前,應先查閱官方模型庫的最新授權及自建部署條款。214 |
簡單講,Hy3 已經用「大模型、少量激活」的方式壓低每次推理的計算負擔:它有 295B 總參數,但每個 Token 約只經過 21B 參數,並在 192 個專家中採用 Top-8 路由;模型亦支援可調校的推理深度,騰訊曾報告其 SWE-bench Verified 成績為 74.4%。23
Hy4 延續這套稀疏 MoE 思路,但將總容量和每次實際啟用的計算量一併推高。要留意的是,「49B 激活」不等於只需準備一個 49B 模型:自建服務仍要儲存及管理整個 770B 模型,對記憶體、GPU 數量及分佈式部署要求都相當高。24
對比中國競爭對手,Hy4 到底有幾強?
編程及 Agent 測試
騰訊表示,Hy4 在 Terminal-Bench 2.1 取得 85.4 分,比 Hy3 高 14.6 分;按騰訊公布的比較,這個成績高過 DeepSeek V4 Pro,並與 Claude Opus 5 看齊。13
這個結果值得留意,但仍要保留一點戒心:它目前主要是騰訊相關的發布數據,未必已經由外部團隊用完全相同的工具設定、提示詞、模型版本及測試流程重現。因此,較穩妥的說法是:Hy4 在終端機編程及 Agent 工作流方面,看起來已具備頂級開源模型的競爭力,而不是已獲獨立排行榜確認為全面第一。13
騰訊另外組織了涉及 163 名工程專家、203 項工程任務的盲測,Hy4 平均得分 2.99/4,略高於 Z.ai 的 GLM-5.3(2.92)及 Moonshot 的 Kimi K3(約 2.91 至 2.94,視乎所引用版本及報道)。5
這個差距其實很窄,而且是騰訊內部設計的測試,不能直接當成所有使用情境的通用排行榜。不同模型的 benchmark 版本、工具權限、Agent 外層程式、測試資料污染控制及輸出評分方式,都可能影響結果。
參數規模比較
以總參數計算,Hy4 的 770B:
- 少於報道中的 DeepSeek V4 Pro(約 1.6T);
- 少於 Kimi K3(約 2.8T);
- 接近 GLM-5.3(約 744B)。
Hy4 的 49B 激活參數,據報與 DeepSeek V4 Pro 大致相若。4
換句話說,Hy4 並不是參數最多的模型,但它嘗試在大型總容量、較高激活計算量及超長上下文之間取得平衡。至於模型「大」是否一定代表實際工作表現更好,就要看推理效率、工具調用可靠性及不同任務的實測結果。
作為參考,較早期的 GLM-5 曾被報告在 SWE-bench Verified 取得 77.8%。但跨模型比較時,不能只將百分比直接排隊,因為測試版本、工具設定及 Agent 框架未必一致。1
現階段較合理的結論: Hy4 在編程及 Agent 工作流中,已經看似站上中國前沿開源模型的競爭圈;但獨立、可重複的外部評測仍然不足,未足以宣稱它整體領先 DeepSeek、Qwen、GLM、Kimi 或 MiniMax。
使用方式、整合產品及 API 價格
Hy4 Preview 的優勢之一,是它不只停留在模型庫,而是同步放進騰訊自家產品及 API 渠道:
- WorkBuddy、CodeBuddy: 已在中國版及國際版提供 Hy4 Preview,分別面向辦公室生產力及編程 Agent。14
- Yuanbao、ima: 騰訊亦表示可在相關產品中體驗 Hy4。22
- Tencent Cloud TokenHub: 提供 API 入口,並可透過一個 API 接入不同模型。
- OpenRouter: 亦提供模型接入渠道。19
- 開源模型庫: 模型已同步至 Hugging Face、GitHub、ModelScope 及 GitCode 等平台。19
騰訊官方資料顯示,Hy4 推出初期會在 WorkBuddy 及 CodeBuddy 提供限時免費使用;實際配額及優惠期則可能按地區和產品政策變更。
據報中國內地 API 價格為:
- 輸入:每百萬 Token 人民幣 6 元;
- 輸出:每百萬 Token 人民幣 18 元;
- 命中快取的輸入:每百萬 Token 人民幣 0.3 元。4
不同聚合平台的報價並不一致。有第三方比較網站列出 Hy4 為每百萬輸入 0.85 美元、輸出 0.62 美元,既與上述人民幣價目不符,輸出價亦顯得不太合理。84 因此,如要正式使用,最好以騰訊雲控制台當時顯示的價格、地區、配額及服務條款為準。
Hy4 Preview 有甚麼限制?
1. 預覽版仍可能大幅變動
模型質素、API 行為、速率限制、價格、安全設定及部署文件,都可能在預覽期間快速調整。14
2. 最亮眼的比較尚未完全獨立驗證
Terminal-Bench 及內部盲測等結果,主要來自騰訊自家測試或與發布相關的報道。外部團隊需要用公開模型、相同提示及相同工具配置重做測試,才較容易判斷 Hy4 的真實排名。513
3. 自建部署門檻很高
MoE 的稀疏激活可以減少每個 Token 的計算量,但服務端仍要處理 770B 模型的權重、記憶體及分佈式推理。Hy4 每次激活約 49B,亦明顯高於 Hy3 的約 21B,因此不能把它當成普通 40B 至 50B 模型般輕鬆部署。24
4. 1M Token 不等於一定能可靠處理 1M Token
超過 100 萬 Token 的上下文窗口,對大型程式碼庫、長篇合約及多輪研究工作很有吸引力,但實際使用仍要測試:
- 模型能否準確找回上下文內的關鍵資料;
- 輸入變長後的延遲;
- 長上下文下的推理穩定性;
- 實際 Token 成本及快取效果。
下一步最值得觀察甚麼?
如果 Hy4 繼續發展,市場大概會期待以下幾方面改善:
- 推出正式穩定版,而不是 Preview;
- 提升 Agent 執行長流程及調用工具的可靠性;
- 改善推理速度、顯存效率及量化方案;
- 由獨立團隊進行可重複 benchmark;
- 擴大雲端、API 及第三方開發工具整合。
這些是合理的產品期望,並不是騰訊已經公布的承諾。
Hy4 背後,其實是騰訊一場更大的 AI 基建押注
Hy4 並非一個孤立的模型發布。騰訊正把模型、雲端算力及 WorkBuddy、CodeBuddy 等應用綁在一起,形成由底層 GPU 到最終辦公室工具的完整 AI 生態。
騰訊在 2026 年第二季表示,經營資本開支達 人民幣 518 億元,按年增加 190%;同期自由現金流為 負人民幣 138 億元,管理層將大幅增加的支出歸因於 AI 基建投資。7
在應用層面,騰訊稱 WorkBuddy 是中國最廣泛使用的生產力 AI Agent 服務;彭博亦形容它在 3 月推出後不久,已成為中國最受歡迎的 AI 辦公室助理之一。不過,這些屬於市場地位描述,並不是經審計的收入或用戶數據。31
第三方桌面網站流量估算顯示,WorkBuddy 在 2026 年 6 月錄得 2,097 萬次訪問,高於 3 月推出時的 885 萬次。但資料來源特別提醒,這些是電腦端網站訪問量,不等於每日活躍用戶、付費企業數、收入或手機使用量。12
騰訊管理層亦表示,WorkBuddy 和 CodeBuddy 都在快速吸納用戶。6
最後判斷:Hy4 是模型升級,也是騰訊 AI 商業化測試
對開發者而言,Hy4 Preview 的吸引力在於:總容量大、激活參數增加、上下文窗口逾 1M Token,而且已經可以透過產品、雲端 API 及開源渠道接觸。對企業而言,真正關鍵則不是參數數字本身,而是它能否穩定完成長流程編程、文件處理及工具操作,並在可接受成本下運行。
對騰訊而言,Hy4 更像是一項基建和應用的整合測試:GPU 和雲端投入可以分攤到 WorkBuddy、CodeBuddy、自家 AI 產品及 Tencent Cloud 客戶身上,而不是只靠單獨出售一個模型回本。615
短期代價是資本開支大幅上升,而 AI 產品的收入及盈利模式仍在建立。Hy4 的真正成績,最終要看三件事:獨立評測能否支持騰訊的性能說法、WorkBuddy 和 CodeBuddy 能否把使用量轉成付費需求,以及騰訊能否把 770B 模型以足夠低的成本大規模服務。