小米推出 MiMo-V2.6,为企业评估开放权重模型提供了一个很有竞争力的新选项:旗舰版 Pro 采用超大规模稀疏混合专家(MoE)架构,公开 API 定价很低;Flash 则进一步面向高吞吐、成本敏感型场景。
但企业选型不能只看能力、许可证和单价。Anthropic 对小米涉嫌未经授权使用 Claude 输出进行蒸馏的指控,带来了尚未消除的训练数据来源、法律责任和评测可信度问题。对企业而言,这些问题与跑分同样重要。
小米发布了什么
小米公开了可下载的 MiMo-V2.6-Pro-RL 与 MiMo-V2.6-Flash-RL 检查点,相关仓库均标注为 MIT 许可证。公司还发布了 MiMo-V2.6-Distill-Qwen-9B:这是一款 90 亿参数的智能体模型,据介绍由 Qwen3.5-9B 基于 MiMo 生成的数据进行监督微调得到。
2
4
5
两款大型模型均被定位为全模态系统,可接收文本、图像、视频和音频输入,宣称支持最长 100 万 Token 的上下文窗口。Pro 是稀疏 MoE 模型,总参数量为 1.02 万亿,每个 Token 激活 420 亿参数;Flash 总参数量约 3090 亿,每个 Token 激活 150 亿参数。
3
MIT 许可证意味着使用者通常拥有广泛的使用和修改权利,但这并不自动证明上游训练输入或合成输出的完整来源,也不能消除第三方知识产权或合规索赔风险。
性能:有积极信号,但要区分独立指标与厂商数据
报道称,MiMo-V2.6-Pro 在 Artificial Analysis 的 Intelligence Index v4.3 中获得 46.32 分,与该比较中的 Grok 4.7 持平,并位列所引述的开放权重模型榜首。这个外部指标具有参考价值,但它是综合指数,并不能证明模型一定适合企业自身的数据、中文及其他语言需求、时延约束、安全策略或超长上下文任务。
23
24
小米自己的技术材料也给出了较强的编程和智能体成绩。在技术报告的 DeepSWE v1.1 强化学习结果中,Pro 的 average@3 从 58.4 提升至 72.6,Flash 则从 48.7 提升至 65.7。DeepSWE v1.1 包含 113 个代码仓库工程任务,通过功能验证器评估;average@3 指三次采样尝试的平均通过率。
10
这些结果可作为评估线索,但在被独立复现前,仍应视为厂商披露的数据。生产部署决策应建立在针对私有留出集和贴近真实生产任务的盲测上,而不是单一排行榜。
Pro 与 Flash:能力和价格如何取舍
| 模型 |
架构规模 |
公布的 API 输入价格(每百万 Token) |
公布的 API 输出价格(每百万 Token) |
更适合的角色 |
| MiMo-V2.6-Pro |
1.02 万亿总参数/420 亿激活参数 |
0.435 美元 |
0.87 美元 |
面向高难度智能体、软件工程和能力上限评测 |
| MiMo-V2.6-Flash |
约 3090 亿总参数/150 亿激活参数 |
0.14 美元 |
0.28 美元 |
面向高量级试验及成本敏感型工作负载 |
按公布价格计算,Flash 的新输入和输出 Token 单价约为 Pro 的三分之一。
20 因而,当业务量比追求排行榜上的最后一点能力提升更重要时,Flash 往往是更实际的首测对象。
不过,自托管会改变成本账。开放权重可带来更好的可迁移性和更严的数据控制,但企业也要自行承担 GPU 容量、存储、推理运维、监控、补丁和技术支持成本。最低 Token 单价,未必等于最低总拥有成本。
小米披露的强化学习成本意味着什么
此次发布包含公开检查点和技术报告。有关小米所披露强化学习运行的信息显示,两款大型模型都完成了 30 个 RL 步骤,覆盖约 75 万条轨迹。小米报告称,Pro 的 RL 运行成本约为 262 万美元,Flash 约为 85 万美元,合计约 347 万美元。
18
29
这些数字不应被理解为完整模型研发成本。相关报道指出,它们仅覆盖强化学习阶段,预训练成本尚未披露。
29 因此,这更适合用于观察后训练阶段的效率,而不是衡量打造整个模型所需的全部投入。
为什么 Claude 蒸馏指控值得企业重视
Anthropic 于 9 月 10 日表示,已识别并阻断其所称针对 Claude 的未经授权蒸馏活动,并将其中七家位于中国的实验室归因于相关行动,其中包括小米。Anthropic 将“非法蒸馏”定义为:大规模、隐蔽地提取模型能力并在未经授权的情况下进行复制。
47
关于该指控的报道称,小米记录了涉及其 MiMo 模型的对话,再将其提交给 Claude 以生成训练数据。另一份对 Anthropic 报告的二手梳理称,小米相关活动超过 40 万次请求、涉及 1500 多个账户;同时,Anthropic 未观察到 Claude 的回答被直接提供给实时用户。
44 Anthropic 所描述的更广泛活动,通常被报道为数个涉嫌行动合计约 1.9 亿或近 2 亿次交互。
33
38
这些是 Anthropic 提出的指控,不是司法裁决,也不是独立法证审计结论。现有材料并未证明某一特定 MiMo-V2.6 检查点含有 Claude 派生内容,也未证明任何具体客户数据被传出,或已发布的某项基准测试受到污染。必须区分这些层次。
但指控仍引出了企业必须尽调的问题:
- 训练数据链路与保管记录: 企业采购方可能需要确认,外部模型输出、用户交互或合成轨迹是否参与了某个发布检查点的训练。
- 数据处理风险: 若客户或用户对话曾被转发至外部服务,问题就不止于模型知识产权,还涉及同意授权、保密义务、保存期限、跨境处理及合同约定的数据处置。
- 基准评测可信度: 若训练过程接触过基准题目、答案或与其高度相似的教师模型生成变体,公开成绩可能被抬高。所审阅来源并没有证明 MiMo-V2.6 存在基准污染,但在相关指控背景下,独立污染评估的重要性明显上升。
- 商业风险分配: 开放许可证通常不会自动提供赔偿、保证、事件通知义务,或在第三方索赔发生时让企业获得充分的法律救济。
企业采用:更适合“受控试点”,而非直接押注
在溯源问题仍未充分澄清时,MiMo-V2.6 更适合被视为一项试点评估候选,而不是自动成为企业长期战略底座。
当前相对合理的使用场景
- 使用非敏感数据的内部研究与评估
- 重视可迁移性、且环境隔离的自托管原型
- 成本敏感的编程、检索、文档处理和多模态实验
- 有能力自行完成红队测试、可靠性测试和安全评估的团队
应等待更强保障后再推进的场景
- 受监管或后果严重的决策流程
- 涉及高度机密的客户、医疗、金融、政府或国防数据的工作负载
- 没有人工审核和回滚控制的高风险代码生成
- 必须要求训练数据保证、赔偿条款、审计权或明确事件响应承诺的部署
上生产前的最低尽调清单
- 索取书面溯源披露。 询问 Claude 派生输出、被转发的用户交互或其他外部模型输出,是否被用于该模型的训练或后训练流程。
- 建立合同保护。 明确赔偿责任、泄露通知、数据留存、分包处理方、数据驻留,以及特定版本模型制品的可追溯性。
- 进行独立评估。 使用私有留出集和抗污染任务,测试长上下文检索、多语言表现、工具调用、幻觉率、提示注入抵抗能力及记忆化行为。
- 采用受控部署架构。 自托管时限制出站网络访问,实施严格的身份和权限控制,记录模型使用情况,并保留切换至另一经过审查模型的回滚路径。
- 不要把敏感数据发送到未批准的 API。 在数据处理条款和技术控制满足内部要求前,不应向外部端点提交客户数据。
结论
MiMo-V2.6 的组合确实颇具吸引力:可下载的 MIT 许可权重、宣称支持 100 万 Token 的多模态上下文、强劲的已报告基准成绩,以及很低的推理定价。若目标是能力上限,Pro 值得评测;若希望大规模、低成本试验,Flash 更具经济性。
3
20
23
但“可开放获取”不等于“已具备企业级生产就绪性”。在小米能够提供令人满意的训练数据溯源、治理和风险分配证明前,企业应将 MiMo-V2.6 定位为潜力很高、但必须受控使用的模型家族;只有完成独立验证后,才应将其用于敏感或关键业务工作负载。