微软于 2026 年 10 月 9 日发布 Microsoft-Decision-1。这是一款专门处理“从给定选项中做判断”的模型:它不负责写一段解释或展开聊天,而是为应用提供的固定答案选项分别打分。
1
这个定位适合软件流程中的许多小决定——例如把请求分到哪个类别、任务应交给哪个模型,或某个回答是否符合要求。对 AI 智能体来说,模型返回的分数也可以作为后续动作的参考:继续执行、重试,或转交人工审核。它的重点不是替代通用聊天模型,而是处理范围明确、结果可直接交给程序使用的判断任务。
它怎样为选项打分?
应用先提供上下文和一组候选答案,Microsoft-Decision-1 再通过一次评分过程,为每个选项返回一个概率分数,而不是生成一段自由文本。
14这些分数可以帮助程序比较选项,但不等于正确性保证:分数较高的答案仍可能出错。
据报道,模型面向的任务形式包括是非判断、多项选择、评分、分类,以及按评分标准为回答打分。
6
22具体接入时,开发者仍需按照当前产品文档确认输入和输出格式是否适合自己的应用。
举例来说,客服系统可以先设定若干处理类别,再依据模型分数选择工单去向。智能体也可以用类似方式,在“采取行动”“再试一次”和“请人工复核”之间做选择。这些是可能的工作流设计,并不能单独证明某个应用端到端一定会提速。
为什么不用通用聊天模型?
不少软件环节需要的不是一段写得流畅的文字,而是一个结构化结果。让专为有限选项评分的模型完成这一步,应用通常可以更直接地使用返回结果。微软将 Decision-1 定位于决策和分类工作负载,包括路由与评估。
1
这种专注也意味着它有适用边界:如果任务需要解释理由、起草内容,或处理开放式对话,通用文本生成模型仍更合适。实际系统可以把两者搭配使用——由生成模型负责内容,再由决策模型执行一个边界清楚的步骤,例如选择类别或评估候选回答。
模型基础、可用情况与价格
微软表示,Decision-1 基于阿里巴巴的 Qwen3.5-9B,并在此基础上针对决策评分进一步训练。
1微软发布信息称,该模型已进入 Microsoft Foundry 模型目录,并以公开预览形式提供。
1Microsoft Foundry 是微软面向开发者的 AI 平台。
公布的价格为每百万个输入 token 0.042 美元,输出 token 不收费。
11这项价格是否划算,仍取决于应用发送的上下文长度、调用频率,以及模型在实际任务中的效果。
性能数据怎么看?
微软称,Decision-1 在涵盖近 15 万道问题的 36 项基准测试中排名第一;公司还报告称,该模型的延迟比 Quyet-1.0-Large 低 4.5 倍,比 GPT-6 Sol 低 35 倍。
12
5
这些是微软公布的测试结果,并不等于独立验证,也不能保证它在所有应用里都更快或更准确。基准成绩可能受到测试任务、比较对象和实验设置影响。团队在把模型接入工作流前,仍应使用自己的数据进行评估,并关注判断质量、延迟,以及错误决策可能造成的后果。
核心思路很直接:当任务是从有限选项中作出结构化判断时,可以考虑使用专为选项评分设计的模型。它是否真正有价值,最终取决于它能否在具体应用所需的判断任务中稳定工作。