Pipette 于 2026 年 8 月 24 日发布,测量的是完整的端侧 AI 部署,而不是脱离运行环境的模型权重。[3][1] 首批公开数据覆盖 1,000 多种模型、量化、运行时、设备和上下文配置,包含 30 多个模型,以及 macOS、iOS、Windows 和 Android 上的 llama.cpp 构建。[3] 在上下文长度限制为 16K 的移动端智能评测中,Nanbeige4.2 3B 与 LFM2.5 2.6B 以 63 分并列第一;iPhone 17 Pro 上 4 位量化 Gemma 4 E2B 使用 Apple MLX 时,报告解码速度为每秒 48.37 个 token。[33][4][5]
研究答案

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open-source on-device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open-source benchmark suite for measuring an actual on-device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload. Released August 24 wi. Topic tags: general, general web, user generated, academic, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wa
如果只看模型排行榜,往往会忽略一个决定实际体验的事实:同一个模型,换一种量化格式、运行时或硬件,表现可能完全不同。
Liquid AI 与 Artificial Analysis 于 2026 年 8 月 24 日发布的 Pipette,正是为解决这个问题而设计的开源端侧 AI 基准套件。它把模型、量化、运行时、设备和工作负载组成的完整配置作为测量单位,关注 AI 模型在手机、笔记本电脑、PC 等实际设备上运行时的表现。31
许多 AI 排行榜主要比较能力分数,或者只给出一个推理速度数字。Pipette 试图把视线从“模型本身”扩展到完整的软件与硬件栈:
因此,即使模型权重完全不变,只要更换量化方式、运行时、后端、设备内存状态或硬件,测试结果就可能发生变化。
首批公开数据包含由实验室验证的 1,000 多种配置,覆盖 30 多个模型、多种量化格式,以及面向 macOS、iOS、Windows 和 Android 的 llama.cpp 构建。标准化性能数据的上下文长度从 256 token 延伸至 8,192 token。3
与此同时,Artificial Analysis 负责移动端模型智能水平的评测,Liquid AI 负责推理性能测量。两者结合后,Pipette 不只回答“模型有多聪明”,也回答“这个具体部署运行得有多快、占用多少资源”。33
Pipette 提供原生 iOS 和 Android 客户端,用户需要先把模型下载到设备,再进行本地测试。这意味着它测量的是设备端推理,而不是访问云端 API 时的网络延迟。4150
更广泛的基准覆盖还包括 macOS 和 Windows 上的受支持运行时构建。公开发布材料列出的参考硬件包括 iPhone 17 Pro、Galaxy S26 Ultra,以及搭载 M5 Max 芯片的 MacBook Pro。338
这种设计对端侧 AI 尤其重要:模型不需要把提示词上传到服务器,测试结果也不会被网络状况直接左右。不过,本地运行同时意味着设备温度、内存余量和持续功耗都会成为结果的一部分。
排行榜同时收录 Liquid AI 自家的 LFM2.5 系列与第三方模型。公开列表中的例子包括 Gemma、Nanbeige、Granite、Qwen,以及其他小型或压缩模型变体。941
Pipette 支持多种量化格式。移动端智能评测重点关注的是:模型经过 4 位量化后,大小能够控制在 8 GB 以内的模型。这一条件更贴近内存有限的手机,而不是服务器级硬件。341
在本地部署中,Liquid AI 的文档将 GGUF 和 MLX 区分开来:GGUF 常用于配合 llama.cpp,在 CPU 或 GPU 上运行;MLX 则面向 Apple Silicon 设备,利用统一内存进行推理。47
需要注意的是,量化模型的文件大小只是结果的一部分。相同的模型文件交给不同运行时,或使用不同的 CPU、GPU 后端处理,实际速度和内存占用都可能不同。
Pipette 的首批发布数据覆盖 256 至 8,192 token 的标准化推理配置。3 Artificial Analysis 的移动端智能评测则使用 16K token 的上下文上限。33
这两个数字不应与模型宣传中的最大上下文窗口混为一谈。Liquid AI 的模型文档显示,许多 LFM 模型支持 32K 上下文,LFM2.5-8B-A1B 则支持 128K 上下文;但模型理论上支持更长上下文,并不代表每一次手机基准测试都会跑到这个长度。47
对手机而言,上下文越长,通常意味着需要为 KV cache 等中间数据留出更多内存,因此统一上下文上限有助于让不同模型在相近条件下接受比较。
Pipette 不把“每秒生成多少 token”当作唯一答案,而是综合考察五项端侧性能指标:1314
这些指标分别对应不同的使用感受。一个部署可能生成速度很快,却需要较长时间才开始响应;也可能首 token 很快,但上下文变长后明显变慢,或者占用过多内存。
对普通用户来说,完整响应耗时往往比孤立的解码速度更接近日常体验。对开发者来说,内存、预填充速度和持续运行表现同样关键。
Artificial Analysis 则从模型能力侧进行评测,涉及指令遵循、工具使用、推理等测试。33 这让结果可以同时呈现“回答质量”和“设备执行效率”,但二者并不是同一个分数。
Pipette 的核心价值之一,是把每个结果绑定到明确的测试配置,并公开生成验证数据所使用的协议。其公开仪表板将排行榜、详细结果和提交记录分开,用户可以查看底层测试行,而不只是接受一个最终排名。1
它还记录运行时依赖。Liquid AI 表示,目前公开性能结果要求使用指定版本的 llama.cpp 构建,包括 b10216 和 b10516。2 固定运行时版本,可以减少软件更新被误认为模型或硬件性能提升的情况。
不过,可复现协议并不能消除所有变量。手机的温度控制、操作系统状态、可用内存、固件、后端选择,以及持续功耗限制,都可能改变最终成绩。只有在这些条件尽可能一致时,分数才具有较强的可比性。
Pipette 的初步结果恰好说明,端侧 AI 不适合简单地给模型贴上一个“全球最快”标签。
由此可以看出,能力、速度、延迟和内存占用可能指向不同方向。最快的模型不一定最擅长回答问题,能力分数最高的模型也不一定是手机上的最佳选择。
初始移动版最值得注意的限制,在于两个客户端使用的计算后端并不相同。
iOS 版本可以通过 Apple 的 Metal 生态使用 GPU 计算,并支持 MLX;截至目前,Android 版本则仅支持 CPU 推理。4150
这意味着,使用 MLX/Metal 得到的 iPhone 结果,与 Android 客户端通过 CPU 得到的结果,并不是严格意义上的“手机整体 AI 硬件对决”。前者可能获得 GPU 加速,而后者反映的是当前客户端提供的 CPU 路径性能。
Android 结果仍然有价值:它可以帮助用户和开发者了解 CPU 本地推理,以及该实现方式下的实际体验。但在双方都使用等效 GPU 或 NPU 后端、并采用相同工作负载之前,不能据此断言某一部手机的整体 AI 芯片一定比另一部更快。
Pipette 的发布正值芯片厂商加速宣传本地 AI 和智能体 AI 性能之际。高通表示,Snapdragon 8 Elite Gen 5 平台搭载第三代 Oryon CPU,最高频率为 4.74GHz,并宣称 CPU 性能提升 20%、CPU 能效提升 35%。24
高通还预告了后续旗舰 Snapdragon 平台:其 Oryon CPU 目标频率达到 5GHz,并采用 FlexCache 架构,让异构 CPU 核心能够共享按工作负载动态分配的缓存池。23
这些规格说明,端侧 AI 正逐渐成为移动芯片竞争的新战场。但主频并不能单独预测大语言模型的推理速度。量化方式、内存带宽、缓存行为、运行时实现、GPU 或 NPU 是否参与、机身散热,以及持续功耗限制,都可能同样重要。
这正是 Pipette 采用“完整配置”作为测量单位的意义:它最终要回答的不是某个芯片的宣传数字有多大,而是性能提升能否在可复现的工作负载下,转化为更快的响应、更低的延迟和更少的内存占用。
Pipette 最适合被理解为一个透明的端侧 AI 部署基准,而不是一张可以直接宣布 iPhone 或 Android 谁胜出的总排行榜。
它把过去容易被拆散的几个因素——模型能力、量化格式、运行时、设备硬件和上下文工作负载——放到了同一张测试表里。对于希望在手机、笔记本电脑或其他边缘设备上运行模型的开发者,这种信息比单独的模型分数或厂商标称 token 速度更有参考价值。
但在 Android GPU、NPU 等加速后端与 iOS 形成等效测试之前,跨平台结论仍需谨慎。Pipette 的真正价值,也许不在于给出一个永远不变的冠军,而在于让每一个“更快”的说法都必须说明:在哪个模型、哪种量化、哪个运行时、哪台设备和什么工作负载下更快。
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
Pipette 于 2026 年 8 月 24 日发布,测量的是完整的端侧 AI 部署,而不是脱离运行环境的模型权重。[3][1]
Pipette 于 2026 年 8 月 24 日发布,测量的是完整的端侧 AI 部署,而不是脱离运行环境的模型权重。[3][1] 首批公开数据覆盖 1,000 多种模型、量化、运行时、设备和上下文配置,包含 30 多个模型,以及 macOS、iOS、Windows 和 Android 上的 llama.cpp 构建。[3]
在上下文长度限制为 16K 的移动端智能评测中,Nanbeige4.2 3B 与 LFM2.5 2.6B 以 63 分并列第一;iPhone 17 Pro 上 4 位量化 Gemma 4 E2B 使用 Apple MLX 时,报告解码速度为每秒 48.37 个 token。[33][4][5]