在2026年10月7日于旧金山举行的Windows与Surface发布会上,微软勾勒了一个本地与云端协同工作的AI路线。Windows负责人帕万·达武里(Pavan Davuluri)将其称为“混合智能”:AI智能体在合适时可直接在电脑上运行,需要更多能力时则转向云端,同时遵循Windows的安全和管理控制。
19
这次发布的重点,并不是所有AI任务都要搬进笔记本,而是微软希望Windows能把本地模型和云端模型作为同一套系统中的不同选项来协调使用。
Windows所说的“混合智能”是什么
按照微软的设想,一些任务可以交给电脑上的本地模型处理;需要时,系统仍可调用云端模型。这种组合被微软视为Windows智能体和AI功能的基础,而不是云服务的替代品。
19
为了让开发者更容易在Windows上运行本地模型,微软表示将为Windows ML增加对llama.cpp的支持。Windows ML是微软的模型运行环境;这项支持有望让开发者通过Windows所支持的硬件,更方便地运行更多开源模型。
39
43
DeepSeek、Nemotron与微软自研代码模型
微软展示了几款面向本地运行的模型,包括DeepSeek V4 Flash、英伟达即将推出的Nemotron模型,以及微软的代码模型MAI Code 1.1 Flash。
33
据报道,DeepSeek V4 Flash共有2840亿个参数,并通过1.6位量化压缩,使其能在约60GB内存中运行。微软称其具备“接近前沿水平”的智能表现;但这属于性能主张,现有材料并未提供独立基准测试来证实这一说法。
26
英伟达即将推出的Nemotron模型据称拥有超过700亿个参数,并采用2位量化,内存占用略高于20GB。相关报道提到其目标发布时间为10月15日;这应理解为计划日期,而不是模型已正式发布的确认。
26
33
这些内存数字也说明了压缩为何重要。仅存储2840亿个参数的权重,若按每个参数4位计算,就约需142GB内存,尚未计入运行时开销。报道中的60GB版本采用了更激进的量化压缩。现有来源没有说明这个特定压缩版本在独立测试中的表现,因此微软对其能力的描述仍需要更多验证。
26
按任务分配模型,并限制智能体权限
微软还介绍了用于连接模型与任务的软件。GitHub的HydraFusion方案可以根据任务选择合适的模型,本地模型也将成为可选项之一。
39
对于能够操作电脑的AI智能体,微软宣布了Execution Containers(执行容器),作为限制智能体可访问内容和可执行操作的一层隔离机制。微软将这类控制纳入Windows智能体方案之中:电脑上的AI能力越强,明确划定其访问边界也越重要。
34
RTX Spark硬件把本地AI带到个人电脑
微软已开放Surface Laptop Ultra预订。这款笔记本搭载英伟达RTX Spark硬件,起售价为2599美元;微软列出的配置最高提供128GB统一内存。
18
31
这类硬件旨在让规模更大的本地模型更容易运行,但价格和内存需求也凸显了一个现实限制:在个人电脑上运行大型模型,可能需要价格不菲、内存充足的设备。英伟达另一款DGX Spark设备的价格也反映出这类成本压力:报道显示,128GB版本售价为6950美元,新推出的64GB版本售价为4999美元。
3
这次发布说明了什么,又没有说明什么
微软的方向已经相当清楚:Windows将尝试协调本地AI与云端AI,为更多开放模型提供运行路径,并为智能体增加控制措施。但这次发布并不能证明本地模型在所有任务上都能达到云端服务的水平,也不能证明相关性能主张已获独立验证,更不意味着设备端AI会让云计算变得多余。最终效果仍取决于实际测试、软件能否落地,以及用户拥有的硬件。
因此,眼下更适合把“混合智能”理解为一种平台策略:Windows会在适合的场景调用电脑本地算力,同时继续把云端模型纳入选择范围。