腾讯 Hy4 Preview 是其 Hunyuan(混元)系列的新一代旗舰大语言模型,采用**混合专家(Mixture-of-Experts,MoE)**架构,重点服务于软件工程、科学研究、办公自动化、数据分析和复杂工具调用等“代理式”生产力场景。17
它的核心变化很直接:相比 Hy3,Hy4 不仅拥有更大的参数容量,还显著提高了每次推理实际调用的参数量,并把上下文窗口扩展到超过 100 万 tokens。不过,Hy4 目前仍是 Preview 预览版。腾讯公布的最亮眼成绩主要来自公司自测或发布材料,距离形成稳定、可复现的公开结论还有一段距离。414
Hy4 Preview 与 Hy3:主要规格对比
| 指标 |
Hy3 Preview |
Hy4 Preview |
这意味着什么 |
| 总参数量 |
2950 亿 |
7700 亿 |
Hy4 的 MoE 总容量约为 Hy3 的 2.6 倍。24 |
| 激活参数量 |
每个 token 约 210 亿 |
每次请求约 490 亿 |
Hy4 的活跃计算量约为 Hy3 的 2.3 倍,能力可能更强,但服务成本也更高。24 |
| 上下文窗口 |
256K tokens |
超过 100 万 tokens |
更适合大型代码库、长文档和多步骤代理任务。214 |
| 主要定位 |
推理、编程、RAG 和 IDE 代理 |
代理、编程、研究、办公流程和复杂工具调用 |
Hy4 更明确地瞄准生产力代理与实际工作流。24 |
| 发布状态 |
开放权重模型,据报道采用 Apache 2.0 条款 |
开源预览版 |
商业部署前仍应核对官方仓库中的具体许可证与自托管条款。214 |
Hy3 本身已经是一款强调计算效率的超大规模 MoE 模型:它在约 2950 亿总参数中,每个 token 大约路由 210 亿参数,使用 192 个专家并采用 top-8 路由;腾讯及相关模型资料还显示,Hy3 支持可调节的推理深度,并曾报告 74.4% 的 SWE-bench Verified 成绩。23
Hy4 延续了“总参数很大、单次只激活一部分”的稀疏 MoE 思路,但把总容量和实际推理计算同时推高。换句话说,它不是简单地把模型“做大”,而是试图用更大的专家池和更高的活跃参数量,提升长流程任务中的规划、执行和工具使用能力。414
性能:已经领先,还是仍需观望?
腾讯目前公布的结果显示,Hy4 在编程和代理任务上取得了明显进步:
- 在 Terminal-Bench 2.1 中,Hy4 得分为 85.4,比 Hy3 高 14.6 分。腾讯称,该成绩超过 DeepSeek V4 Pro,并与 Claude Opus 5 持平。13
- 在面向软件工程实战的 DeepSWE 测试中,腾讯披露 Hy4 从 Hy3 的 28.0 分提升至 64.3 分。
- 腾讯组织的内部盲测涉及 163 名专家和 203 项工程任务。Hy4 平均得分为 2.99/4,高于 Z.ai 的 GLM-5.3(2.92)和 Moonshot 的 Kimi K3(2.91)。5
这些数字说明 Hy4 的目标并非传统聊天问答,而是更长链路的工程任务:理解需求、规划步骤、调用工具、运行代码,再根据结果继续修正。不过,内部盲测和厂商自报成绩不能直接等同于独立排行榜。不同模型的测试版本、工具权限、提示词、代理脚手架、采样设置和数据污染控制都可能影响结果。513
从总参数量看,Hy4 的 7700 亿参数小于报告中的 DeepSeek V4 Pro(1.6 万亿)和 Kimi K3(2.8 万亿),与 GLM-5.3 的约 7440 亿接近;Hy4 的 490 亿激活参数则据报道与 DeepSeek V4 Pro 大致相当。4
作为参照,较早公布的 GLM-5 曾报告 77.8% 的 SWE-bench Verified 成绩。但不同模型之间的横向比较必须谨慎,单个基准分数并不能代表模型在所有办公、研究、编程和代理任务中的综合表现。1
**目前更稳妥的结论是:**Hy4 已进入中国头部开放权重模型的竞争区间,在编程和生产力代理方面看起来很有竞争力;但现阶段还不足以据此断言它全面领先 DeepSeek、Qwen、GLM、Kimi 或 MiniMax。413
如何使用:开源、自托管与产品集成
Hy4 Preview 的可用方式大致分为三类:
- 直接使用腾讯产品:Hy4 已接入 WorkBuddy 和 CodeBuddy 的中国版及国际版,分别对应办公生产力代理和编程代理。14 腾讯同时表示,用户也可以在 Yuanbao、ima 等产品中体验该模型。22
- 通过 API 调用:开发者可以通过腾讯云 TokenHub 或 OpenRouter 接入 Hy4。1922
- 下载模型并自行部署:Hy4 已以开源模型形式发布,相关模型权重和模型卡可在 Hugging Face 等平台查看。1719
“开放权重”或“开源”并不意味着部署门槛很低。虽然 MoE 模型每次推理只激活约 490 亿参数,但服务器仍需要保存和管理规模达 7700 亿参数的完整模型,并承担显存、带宽、分布式推理、故障恢复和运维等成本。414
价格:API 便宜,但要注意版本差异
目前流传的中国区 API 价格为:
- 输入:每百万 tokens 6 元人民币;
- 输出:每百万 tokens 18 元人民币;
- 缓存输入:每百万 tokens 0.3 元人民币。4
腾讯云 TokenHub 的美元价目页面则显示,Hy4 Preview 的价格约为输入每百万 tokens 0.834 美元、输出每百万 tokens 2.501 美元、缓存命中每百万 tokens 0.042 美元。 两组价格可能对应不同地区、渠道或计费版本,因此企业用户应以当前控制台显示的价格、配额、区域和限流规则为准。
部分第三方聚合平台给出的价格与腾讯官方页面并不一致,甚至存在输入和输出价格关系异常的情况。818 在预览阶段,直接参考腾讯云当前价目表,比依赖聚合网站的静态报价更稳妥。
腾讯还表示,Hy4 上线初期将在 WorkBuddy 和 CodeBuddy 中提供为期两周的免费体验。
Hy4 Preview 的现实局限
1. 预览版仍可能频繁变化
模型质量、API 行为、调用额度、价格、安全策略和部署文档都可能在正式版前调整。对企业来说,预览版更适合试点和评估,不宜未经验证就成为关键业务流程的唯一模型。14
2. 独立验证还不充分
Hy4 最具吸引力的横向比较,主要来自腾讯的发布材料、内部测试或相关报道。要判断它是否稳定领先,还需要不同机构使用统一数据、统一工具和统一代理设置进行可复现测试。513
3. 总体部署规模很高
稀疏激活可以降低单 token 的计算量,但不能消除 7700 亿参数模型的存储和分布式部署压力。与 Hy3 相比,Hy4 的每次活跃参数量也明显增加,因此实际推理成本、延迟和硬件需求都可能上升。24
4. 百万级上下文不等于百万级可靠性
超过 100 万 tokens 的上下文窗口,对大型代码库、长篇研究资料和企业知识库很有吸引力。但在实际使用中,仍需测试模型对远距离信息的检索准确率、长上下文下的指令遵循、响应延迟以及真实成本。能“装下”更多内容,不代表模型能同样可靠地使用这些内容。
下一步可能改进什么?
如果 Hy4 继续迭代,用户最可能期待的方向包括:
- 从 Preview 过渡到更稳定的正式版本;
- 提高代理在多轮规划、工具调用和错误恢复方面的可靠性;
- 改进推理效率、量化方案和吞吐能力;
- 获得更多独立、可复现的基准测试结果;
- 扩大云服务、开发工具和第三方 API 集成范围。
这些是基于产品形态的合理预期,并非腾讯已经公布的明确承诺。
Hy4 背后:腾讯正在押注“模型—应用—云”闭环
Hy4 并不是腾讯孤立发布的一款模型。它更像是腾讯 AI 战略中的底层引擎,与 WorkBuddy、CodeBuddy、腾讯云以及其他产品共同组成“模型—应用—基础设施”的闭环。
在 2026 年第二季度,腾讯的经营性资本开支达到 518 亿元人民币,同比增长 190%;同期自由现金流为 -138 亿元人民币。管理层将这轮支出激增主要归因于 AI 基础设施投入。27
WorkBuddy 也成为这项投入能否转化为真实使用量的重要观察窗口:
- 腾讯称,WorkBuddy 是中国使用最广泛的生产力 AI 代理服务;彭博社则在其报道中称其为中国最受欢迎的 AI 办公助手。这些属于市场地位表述,并不是经过审计的收入或用户数据。31
- 第三方 PC 端网页流量估算显示,WorkBuddy 在 2026 年 6 月访问量为 2097 万次,高于 3 月上线时的 885 万次。但该统计不等同于日活用户、付费企业数、收入或移动端使用量。12
- 腾讯管理层表示,WorkBuddy 和 CodeBuddy 的用户都在快速增长。6
这套战略的逻辑在于:腾讯可以把 GPU、数据中心和云计算投入分摊到自有办公助手、编程工具、腾讯云客户以及更广泛的业务生态中,而不是只靠单独出售一个大模型来回收成本。615
代价也同样明显:在应用仍处于快速扩张期时,资本开支会先行增加,而商业化速度、企业付费意愿和最终投资回报仍存在不确定性。对腾讯而言,Hy4 的真正考验或许不只是 benchmark 分数,而是它能否稳定驱动 WorkBuddy、CodeBuddy 和腾讯云形成持续使用与收入增长。