斯坦福大学2025年11月的一项大规模预印本研究显示,参数不超过200亿的小型本地语言模型(运行在消费级笔记本或台式机上)已能准确回答88.7%的单轮对话和推理查询。 这项覆盖100万条真实世界查询的研究引入新指标“智能每瓦特”(IPW),发现从2023年到2025年,本地AI的效率提升了5.3倍,可本地服务的查询比例从23.2%跃升至71.3%。
研究答案

Create a landscape editorial hero image for this Studio Global article: What did the Stanford University study published as a preprint in November 2025 find about the performance, accuracy, "intelligence per watt. Article summary: ## Key Findings from the Stanford "Intelligence Per Watt" Study (November 2025 Preprint). Topic tags: general, academic, education, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layouts. Make it useful as an illustrative visual,
人工智能的经济学可能正站在一场重大转变的边缘。斯坦福大学2025年11月发布的一项全面预印本研究显示,运行在消费级台式机和笔记本电脑上的小型语言模型,如今已经能够胜任那些此前需要昂贵云端AI系统处理的绝大多数任务。
这项由斯坦福Hazy Research实验室和Together AI的Jon Saad-Falcon、Avanika Narayan等人领导的研究,引入了一个名为**智能每瓦特(Intelligence Per Watt,简称IPW)**的新指标——定义为平均任务准确率除以推理期间的平均功耗——以此来提供一个统一的框架,比较本地和云端AI系统。
这项研究的实证工作非常深入:它在8种不同的加速器(包括来自苹果、AMD和英伟达的产品)上对超过20个本地语言模型进行了基准测试,使用了100万条真实世界的单轮对话和推理查询。 结果令人瞩目:
IPW的定义简洁而优雅:它用模型在给定任务上达到的准确率除以推理时消耗的功率。 这与常见的、孤立评估AI模型却忽略能耗和硬件要求的做法形成了鲜明对比。
该指标捕捉到了一个关键洞见:能力最强的模型不一定是最实用或最高效的。在笔记本上运行的一个小型模型,或许能用一个零头的能耗,达到一个巨型云模型95%的准确率。
这项研究在财务上最重大的发现之一,是关于当你并非在本地和云端之间二选一,而是智能地同时使用两者时会发生什么。
最优路由(Oracle routing),一个假设中的完美系统,能将每个查询分配给能胜任的最小模型,理论上相比纯云部署可以减少80.4%的能耗、77.3%的计算量和73.8%的成本。
一项相关研究中测试的实际路由器取得了类似成果:它在真实世界流量分布下减少了77.1%的能耗、67.1%的计算量和60.2%的成本,同时保持了可比的任务准确率。
这并不是一个未来主义的可能性。该研究表明,混合本地-云端架构已经可行,并且可以显著降低提供AI推理服务的成本。
斯坦福的研究并未对任何公司做出明确的财务预测。然而,它所记录的轨迹对依赖云API的AI公司具有清晰的结构性影响。
本地模型已经能以极低的成本覆盖大约89%的单轮查询。 IPW在短短两年内提升了5.3倍,并且还在加速。
智能路由可以将剩余发送到云端的查询的推理成本削减60%或更多。
如果这一趋势在大规模运营中得以实现,客户可以用近乎零成本的本地推理取代大部分云API查询,仅将云端调用保留给本地模型尚无法处理的最难的约11%的任务。
解读该研究的评论指出,AI的未来可能是“小型、廉价且无利可图”的前沿AI公司模型。 经济激励正转向能够削弱云API定价的本地开源替代方案——这一动态可能重塑OpenAI、Anthropic和xAI等公司的商业模式。
这项研究是更大趋势中的一个数据点。斯坦福HAI发布的2025年AI指数报告发现,一个性能达到GPT-3.5级别的系统的推理成本,在2022年11月至2024年10月期间下降了超过280倍。 在硬件层面,成本以每年30%的速度下降,而能效每年提升40%。
开源模型也在缩小与闭源模型的差距,在一年内将某些基准测试上的性能差异从8%缩小到了仅1.7%。
尽管结果令人印象深刻,但需要注意的是其范围。该研究仅测试了单轮查询——即简单的聊天回复和自包含的推理任务。它没有评估本地模型在多轮对话、长上下文推理或复杂的智能体工作流方面的表现,而所有这些领域,云端模型仍然保持着显著优势。
所测试的本地模型(≤200亿参数)在最难的问题上也无法与最好的云端模型匹敌。该研究的作者对此非常明确:准确率因领域而异很大,88.7%这个数字掩盖了在技术和科学领域较弱的表现。
斯坦福的“智能每瓦特”研究提供了强有力的实证证据,表明本地AI已经跨越了一个关键门槛。对于大多数日常查询——创意任务、管理、销售、娱乐——一个笔记本上的小型模型已经足够。 快速的改进步伐表明,这种覆盖范围只会不断扩大。
对于企业而言,其含义是明确的:最具成本效益的AI基础设施越来越趋向于混合模式,将简单查询路由到本地模型,而将云容量保留给最困难的任务。将每个查询都发送给一个巨型云端模型并按token付费的时代,可能正在走向终结。
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
斯坦福大学2025年11月的一项大规模预印本研究显示,参数不超过200亿的小型本地语言模型(运行在消费级笔记本或台式机上)已能准确回答88.7%的单轮对话和推理查询。
斯坦福大学2025年11月的一项大规模预印本研究显示,参数不超过200亿的小型本地语言模型(运行在消费级笔记本或台式机上)已能准确回答88.7%的单轮对话和推理查询。 这项覆盖100万条真实世界查询的研究引入新指标“智能每瓦特”(IPW),发现从2023年到2025年,本地AI的效率提升了5.3倍,可本地服务的查询比例从23.2%跃升至71.3%。
研究提出的“最优路由”系统——将每个查询分配给能胜任的最小模型——理论上可将云推理的能耗降低80.4%、成本降低73.8%;一个实用的路由器在真实流量分布下也能实现60.2%的成本削减。