云知声于2026年9月15日发布U2 Flash,采用稀疏混合专家(MoE)架构:总参数约2660亿,单次推理激活约100亿。 云知声报告其在DeepSWE v1.1、TerminalBench 3.0和SWE Bench Pro上分别为64.6、24.3和61.6分,并称相较U2,智能体任务执行周期缩短35%。
发布者使用 GPT-5.6 Terra 编辑图片由 GPT Image 2 生成
研究答案

Create a landscape editorial hero image for this Studio Global article: What is Unisound’s U2-Flash, launched on September 15, 2026, and how does its roughly 266-billion-parameter sparse MoE architecture with abo. Article summary: Unisound’s U2-Flash is a September 15, 2026 release positioned as a “high-density” production model: a sparse Mixture-of-Experts successor to U2 intended to combine coding, agent execution, mathematical reasoning, and in. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
云知声在2026年9月15日发布U2-Flash。这不是一款单纯强调“快”的轻量模型,而是以编程、工具调用型智能体、数学推理和指令遵循为目标的生产工作流模型。它最醒目的卖点是:总参数约2660亿,但每次推理只激活约100亿参数。 5
对开发者和企业而言,真正值得关注的不只是参数规模,而是它是否能在多步任务中少走弯路、以更低的推理开销完成代码与工具操作;同时,也要把宣传数据与可独立复现的结论区分开来。
U2-Flash使用稀疏混合专家(MoE)架构。与每个输入都调用全部参数的稠密模型不同,MoE会通过路由机制,为不同输入选择部分专门的“专家”组件参与计算。云知声称,U2-Flash总参数约2660亿,单次推理激活约100亿,不到总参数的4%。 5
这也是其“高密度”定位的基础:公司希望以相对较小的活跃计算规模,提供接近更大稠密模型的任务完成能力。不过,现有材料没有给出统一任务、统一硬件条件下的独立成本、功耗或质量对照,因此这一价值主张仍应视为厂商定位,而非已经被全面验证的结论。 5
据云知声介绍,U2-Flash将编程、智能体、数学推理和指令遵循整合在同一套权重中,目标场景包括工程代码、终端任务、办公工作、知识推理及其他生产流程。 5
模型还提供“隐式思考”与连续状态推理,并将推理强度设置为四档可控接口。云知声称,在最高强度档位,模型可输出可读的推理过程,以便检查与追溯。 5
需要注意的是,可见推理过程有助于人工审查,但不能单独证明答案正确、系统安全,或适合在高风险场景中完全自主运行。
云知声称,U2-Flash是在U2通用基座模型上经过强化后训练得到。其训练体系包含递归自我改进(RSI)循环:系统协助生成任务、分析执行轨迹、识别错误,并在人为设定的沙箱和验证约束下,对修正后的数据重新采样。 5
面向软件工程和智能体任务,公司列举了几项关键方法:
云知声进一步称,该体系能带来约60%更多的有效训练轨迹,并让模型达到相近能力所需训练步数减少约55%。这些是公司披露的数据;目前提供的材料中没有实验设置、匹配基线、原始运行记录或可复现训练产物,因而无法独立评估这些数字。 5
从机制上理解,这套方案意在优化多步骤任务:模型尝试执行、检查工具调用或执行路径、定位错误,再用修正样本改进后续行为。但这只能说明其训练设计的意图,不能据此证明每一项机制都分别造成了所报告的提升。 5
云知声称,U2-Flash相较上一代U2,在多项软件工程和终端任务评测中有明显提升:
| 基准测试 | 云知声报告的U2-Flash成绩 | 公司给出的对比说法 |
|---|---|---|
| DeepSWE v1.1 | 64.6 | 较上一代约翻倍;公司称在其对比中超过GLM5.3-Flash和DeepSeek-V4-Pro-0813。 |
| TerminalBench 3.0 | 24.3 | 公司称超过K3等万亿参数级模型。 |
| SWE-Bench Pro | 61.6 | 较上一代高10.5分。 |
公司还称,和U2相比,U2-Flash可使智能体任务迭代步数减少20%至30%,任务执行周期缩短35%,Token消耗降低20%至30%。 5
这些指标可作为评估其产品方向的参考,尤其对关注智能体编程的开发者有一定价值;但它们不应被直接当作独立排行榜结果。现有资料没有完整说明模型端点、提示词、采样参数、智能体脚手架、工具集、运行环境、评测框架配置或原始结果。 5
云知声称,U2-Flash平均首Token响应时间控制在3秒以内,峰值输出吞吐最高可达300 Token/秒。要将这一数字与其他模型作横向比较,仍需要硬件型号、并发量、上下文长度、计算精度和延迟分位数等信息;公告中未提供这些关键条件。 5
公司及相关推广报道还称,U2-Flash已围绕主流国产算力平台,在模型架构、核心算子、推理框架和集群调度等层面进行适配优化;部分部署场景的表现已接近NVIDIA GPU方案。其瞄准的需求包括大规模推理、高并发与长上下文负载,行业则覆盖政企、金融、制造和能源等。 17
不过,“接近”并不等于硬件性能对等。若没有匹配的芯片、软件版本、工作负载、批处理配置、功耗、成本和延迟测量数据,尚不能据此确认与NVIDIA GPU方案的性能等价。 17
据推广报道,U2-Flash已上线云知声MaaS(模型即服务)平台。2026年9月15日至9月30日,平台曾推出六折限时活动:
这属于有明确期限的促销信息。计划接入的用户应直接向云知声核实当前模型可用性、实际价格、额度、限流规则及其他使用条件。 17
U2-Flash瞄准的是生产级代码与智能体工作流:约2660亿总参数、约100亿活跃参数的MoE架构,配合任务生成、执行反馈导向的后训练,以及可调的推理模式。云知声报告的工程类基准成绩显示,它相较前代U2可能有显著进展。 5
但证据边界同样明确:基准成绩、训练效率、时延吞吐、Token节省和国产算力表现,主要来自公司公告或推广报道。只有在第三方以匹配的模型版本、工具环境、硬件与测试条件发布可复现结果后,才能更可靠地判断它在编程和智能体模型中的真实位置。在此之前,更合适的定位是:一款参数设计和产品目标都颇具吸引力、但核心性能仍以厂商报告为主的模型发布。 5
17
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
云知声于2026年9月15日发布U2 Flash,采用稀疏混合专家(MoE)架构:总参数约2660亿,单次推理激活约100亿。
云知声于2026年9月15日发布U2 Flash,采用稀疏混合专家(MoE)架构:总参数约2660亿,单次推理激活约100亿。 云知声报告其在DeepSWE v1.1、TerminalBench 3.0和SWE Bench Pro上分别为64.6、24.3和61.6分,并称相较U2,智能体任务执行周期缩短35%。
这些基准、训练效率、时延吞吐及国产算力接近NVIDIA GPU的说法,尚缺少可复现实验配置与独立对比验证。