MiniMax M2.1于2025年12月23日发布,定位从M2的成本与可访问性进一步扩展到多语言软件工程、全栈应用和复杂自动化任务;MiniMax称其在SWE bench Multilingual中取得72.5%的成绩。[3][4] 模型重点加强了Rust、Java、Go、C++、Kotlin、Objective C、TypeScript、JavaScript和Python等语言,并将原生Android、iOS开发、视觉交互与多步骤工具调用纳入核心场景。[3][4][7] 开发者既可通过MiniMax API使用M2.1,也可从Hugging Face获取开放权重,并借助SGLang或vLLM自行部署;不过实际成本仍取决于G...
研究答案

Create a landscape editorial hero image for this Studio Global article: What is MiniMax M2.1, released by the Chinese AI startup on December 23, 2025, and how does this major open-source model update differ from. Article summary: MiniMax M2.1 is MiniMax’s December 23, 2025 open-weight coding-and-agent model update: where M2 emphasized lower cost and broad access, M2.1 is positioned for production-grade multilingual software work, full-stack appli. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
MiniMax M2.1是中国人工智能公司MiniMax于2025年12月23日发布的开放权重模型更新,重点面向编程和AI智能体任务。与此前更强调低成本和广泛可用性的M2相比,M2.1的定位更接近真实的软件工程:多语言开发、全栈应用、原生移动端、项目级工具调用,以及文档和办公自动化。3
4
不过,读者需要先注意一个关键前提:目前最亮眼的性能数据主要来自MiniMax自测。它们可以说明产品的发力方向,却不能直接等同于经过独立机构复现的跨模型排行榜。
M2.1采用混合专家(Mixture-of-Experts,MoE)架构,总参数量为2300亿,每个Token约激活100亿参数。稀疏激活的设计,目标是在不调用全部参数的情况下提高推理效率。1
MiniMax的核心思路是,真正的软件项目很少只涉及一段Python代码。一个生产级任务往往还包括多种语言、已有代码仓库、移动平台、视觉界面、项目规范、工具调用,以及前后相互依赖的多个步骤。M2.1正是围绕这类更完整的工作流进行设计。
MiniMax将这次更新描述为一次重点转移:从M2偏重成本和可访问性,转向更复杂、更接近生产环境的任务执行,尤其强调跨语言编程和日常办公、智能体场景。4
主要变化包括:
换句话说,M2.1并不只是一个“参数更多”或“价格更低”的编程模型。按照MiniMax的产品叙事,它试图解决的是更完整的问题:如何根据需求、界面、工具和交付要求,最终产出可用的软件,而不只是看起来合理的代码。
MiniMax表示,M2.1对Rust、Java、Golang、C++、Kotlin、Objective-C、TypeScript、JavaScript等语言进行了系统性增强。第三方分析还提到,模型的专家能力覆盖Java、Go、Rust、C++、TypeScript、JavaScript、Kotlin和Python等技术栈。3
7
这对使用混合技术栈的团队尤其重要。一个只在Python任务上表现出色的模型,未必能很好地处理这样的真实仓库:后端服务使用Java或Go,系统组件使用Rust或C++,前端采用TypeScript或JavaScript,移动端则使用Kotlin或Objective-C。
MiniMax称,M2.1在多语言软件工程场景中超过Claude Sonnet 4.5,并接近Claude Opus 4.5;公司公布的SWE-bench Multilingual成绩为72.5%。3
16
这些数字需要谨慎解读。现有材料并不能证明这是经过中立机构独立复现的统一排行榜。最终结果可能受到提示词、智能体框架、模型版本和评测流程等因素影响。较晚发布的第三方分析指出,M2.1在SWE-bench Verified上较M2有所提升,但在其比较中仍落后于若干强大的闭源系统。7
因此,更稳妥的结论是:MiniMax把多语言、代码仓库级的软件工程作为M2.1的主要优势,公开成绩也显示它较上一代有明显进步。但这些成绩并不能证明M2.1会在所有项目或工作流中都击败Claude。
VIBE是Visual & Interactive Benchmark for Execution的缩写,中文可理解为“视觉与交互执行基准”。这是MiniMax推出的评测,用来检验模型能否从零开始构建完整、可用的应用,而不仅是生成一段在文本窗口中看起来合理的代码。3
4
VIBE包括五个方向:
该评测围绕已部署的应用,以及交互和视觉层面的验证展开。因此,它试图回答传统代码补全或漏洞修复基准不一定能回答的问题:应用实际运行时是否可用,交互是否正确,界面是否符合视觉预期。4
MiniMax公布的VIBE综合成绩为88.6分,其中VIBE-Web为91.5分,VIBE-Android为89.7分。4
8
这些成绩之所以受到关注,是因为它们把评测范围从代码生成和问题修复扩展到了完整应用交付。但VIBE由MiniMax设计,已公布的跨模型比较也采用了MiniMax的评测设置。因此,这些分数更适合作为公司对模型优势的自报证据,而不是已经被独立确认的行业总排名。4
8
MiniMax将M2.1定位为更适合原生Android和iOS开发的模型,而不只是用于浏览器应用。公司还表示,模型增强了对视觉设计和美学、复杂交互、3D科学仿真以及高质量可视化的理解。4
这推动了更“完整”的Vibe Coding:用户用自然语言描述应用,智能体负责组织代码、文件和工具,最终组装出可运行的产品。MiniMax想强调的并非仅仅是做出一个令人印象深刻的演示,而是生成更容易维护、能够交付、面向生产环境的应用。4
但真实项目仍需要大量人工验证。移动端构建系统、依赖冲突、平台规范、无障碍设计、安全审查和长期维护,都是基准测试无法替代的实际检查。
MiniMax将Interleaved Thinking(交错思考)描述为一种执行任务时的系统化问题解决方式。其目标是让模型在工作过程中同时保留多项约束,包括系统指令、用户要求、记忆、工具接口规范和项目指令文件。4
对于AI智能体而言,这一点很关键。一个成功的结果不应只满足“代码能运行”,还可能需要智能体完成以下步骤:
MiniMax将这一能力与技术文档、结构化写作、数据处理和持续办公自动化联系起来。它们目前仍属于产品定位和公司声明,并不意味着每个多步骤流程都能稳定完成,但这解释了为什么M2.1被包装成“编程与智能体模型”,而不只是代码生成器。4
开发者主要有两种使用方式:
MiniMax的部署指南推荐使用SGLang,同时vLLM也得到相关部署生态的支持。14
1相较于只能使用API的闭源模型,自托管可以让企业更直接地控制基础设施、数据处理、模型服务、系统集成和扩缩容。
但“可自行部署”并不自动等于“总成本更低”。自托管还需要足够的GPU资源、工程人员、监控、维护和运营支持。最终经济性取决于使用率和基础设施方案,而不只是模型的激活参数数量。1
2
M2.1相较M2最值得关注的变化,是产品重点发生了变化:它不再主要讲述如何降低成本、扩大访问范围,而是试图证明开放权重模型也能处理多语言、全栈和智能体驱动的软件任务。MiniMax公布的SWE-bench Multilingual成绩为72.5%,VIBE综合成绩为88.6分,Web和Android子项分别为91.5分和89.7分,显示其希望同时衡量传统编程能力和完整应用构建能力。3
4
8
对开发者而言,M2.1的主要吸引力在于更广的语言覆盖、开放权重、API访问和SGLang或vLLM带来的部署选择。对企业而言,它的价值在于:在更可控的数据和服务环境中运行复杂的编程与自动化工作流。
但限制同样明确:最强的对比结论和VIBE成绩主要来自MiniMax自身。团队在把它用于生产之前,仍应使用自己的代码仓库、移动端构建流程、文档要求、安全控制和自动化任务进行实测。 benchmark分数可以帮助筛选模型,却不能替代真实环境中的验收。
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
MiniMax M2.1于2025年12月23日发布,定位从M2的成本与可访问性进一步扩展到多语言软件工程、全栈应用和复杂自动化任务;MiniMax称其在SWE bench Multilingual中取得72.5%的成绩。[3][4]
MiniMax M2.1于2025年12月23日发布,定位从M2的成本与可访问性进一步扩展到多语言软件工程、全栈应用和复杂自动化任务;MiniMax称其在SWE bench Multilingual中取得72.5%的成绩。[3][4] 模型重点加强了Rust、Java、Go、C++、Kotlin、Objective C、TypeScript、JavaScript和Python等语言,并将原生Android、iOS开发、视觉交互与多步骤工具调用纳入核心场景。[3][4][7]
开发者既可通过MiniMax API使用M2.1,也可从Hugging Face获取开放权重,并借助SGLang或vLLM自行部署;不过实际成本仍取决于GPU、利用率和运维投入。[1][4][6][14]