Pipette 於 2026 年 8 月 24 日推出,量度嘅係完整本地 AI 部署,而唔係單睇模型權重。 公開數據涵蓋超過 1,000 個模型、量化格式、運行時、裝置及上下文組合,支援 30 多個模型,以及 macOS、iOS、Windows 同 Android 上嘅 llama.cpp 建置版本。[3] 初步手機智能評測中,Nanbeige4.2 3B 同 LFM2.5 2.6B 以平均 63 分並列第一;iPhone 17 Pro 上以 Apple MLX 運行 4 bit Gemma 4 E2B,曾錄得每秒 48.37 個解碼 token。[33][4][5]
研究答案

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open-source on-device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open-source benchmark suite for measuring an actual on-device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload. Released August 24 wi. Topic tags: general, general web, user generated, academic, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wa
Liquid AI 同 Artificial Analysis 於 2026 年 8 月 24 日推出開源基準測試套件 Pipette,專門評估 AI 模型喺手機、手提電腦、PC 等邊緣裝置上實際運行時嘅表現。佢嘅核心概念好簡單:測試單位唔係「一個模型」,而係「一套完整部署」——包括模型、量化格式、運行時、裝置同工作負載。31
換句話講,同一個模型換咗量化方式、推論引擎、後端或者硬件,結果可以完全唔同。Pipette 就係要將呢啲差異攤開嚟睇,而唔係只係喺排行榜上放一個單一速度數字。
好多 AI 基準測試主要比較能力分數,或者只報告一個推論速度。Pipette 就嘗試呈現 AI 喺真實裝置上由頭到尾嘅完整表現:模型幾叻固然重要,但量化格式、運行時、記憶體壓力、後端同硬件都會影響最終體驗。
首批公開數據包括超過 1,000 個由實驗室驗證嘅模型、量化、運行時、裝置同上下文組合;涵蓋 30 多個模型、多種量化格式,以及適用於 macOS、iOS、Windows 同 Android 嘅 llama.cpp 建置版本。標準化測試嘅上下文長度由 256 tokens 至 8,192 tokens。3
Pipette 嘅推論數據,亦配合 Artificial Analysis 對手機模型智能表現嘅評估。兩者合併之後,睇到嘅唔單止係「答得啱唔啱」,亦包括特定部署到底幾快、幾慳記憶體同幾有反應。33
Pipette 提供原生 iOS 同 Android 客戶端,畀用戶直接喺手機下載及運行模型。更廣泛嘅基準測試亦包括透過支援嘅運行時建置版本,在 macOS 同 Windows 上進行測試。公開資料列出嘅參考硬件包括 iPhone 17 Pro、Galaxy S26 Ultra,以及採用 M5 Max 晶片嘅 MacBook Pro。338
測試前要先將模型下載到裝置,因而 Pipette 量度嘅係本地推論,而唔係連接雲端 API 時嘅網絡延遲。4150
排行榜除咗 Liquid AI 自己嘅 LFM2.5 系列,亦包括第三方模型,例如 Gemma、Nanbeige、Granite、Qwen 等小型或壓縮版本。941
Pipette 支援多種量化格式。Artificial Analysis 嘅手機智能比較,集中測試經 4-bit 量化後可以放入 8 GB 以內嘅模型,令測試更加貼近記憶體有限嘅手機環境。341
Liquid AI 文件將 GGUF 同 MLX 分開說明:GGUF 常見於配合 llama.cpp,在 CPU 或 GPU 上作本地推論;MLX 就針對 Apple Silicon 部署而設。47 不過,量化模型嘅檔案大小只係其中一環,真正點樣處理模型,仲要視乎運行時同硬件後端。
Pipette 首批數據以 256 至 8,192 tokens 嘅上下文長度,報告標準化推論結果。3 另一邊,Artificial Analysis 嘅手機智能評估就採用 16K-token 上限。33
呢啲數字唔應該同模型聲稱嘅最大上下文窗口混為一談。Liquid AI 文件列出,多款 LFM 模型支援 32K tokens,而 LFM2.5-8B-A1B 就支援 128K tokens;但模型本身有呢個能力,唔代表每部手機嘅基準測試都會用盡全部長度。47
Pipette 唔會將結果簡化成「每秒生成幾多 token」。佢包括五項本地裝置效能指標:
呢種量度方式比較貼近日常使用。某個部署可能生成 token 好快,但啟動要等好耐;又或者速度唔錯,卻食晒記憶體,甚至隨住上下文變長而明顯變慢。對本地 AI 助手嚟講,由提交問題到收到完整答案嘅總時間,往往比單睇 decode 速度更有參考價值。
Artificial Analysis 就負責智能質素一邊,測試範圍包括指令跟從、工具使用、推理等相關能力。33
Pipette 會將每個結果綁定到清楚列明嘅完整配置,並公開產生驗證數據所用嘅測試協議。其公開儀表板亦分開排行榜、詳細結果同提交記錄,方便大家追查底層測試資料,而唔係只睇一個搶眼排名。1
方法亦會記錄運行時依賴。例如 Liquid AI 表示,目前公開效能結果要求指定版本嘅 llama.cpp 建置,包括 b10216 同 b10516。2 固定運行時版本,可以減少軟件更新被誤當成模型或者硬件進步嘅情況。
當然,呢啲措施唔代表所有變數都消失。手機溫度及降頻、作業系統當時狀態、可用記憶體、韌體、後端選擇同持續功耗上限,都可能影響結果。要公平比較,相關條件就要盡量一致。
初步數據正好展示點解 Pipette 要報告「完整配置」,而唔係推出一個適用於所有情況嘅模型總排名:
重點係:能力、速度、延遲同記憶體用量未必同一方向。最快嘅模型未必最有能力,能力分最高嘅模型亦未必係最適合手機部署。
初版手機測試最大嘅限制,在於兩個客戶端採用嘅硬件路徑唔同。iOS 版本可以透過 Apple Metal 生態系統使用 GPU 運算,包括 MLX;Android 版本初期就只可以用 CPU 推論。4150
所以,一個用 MLX/Metal 嘅 iPhone 成績,同一個只經 CPU 推論嘅 Android 成績,唔係真正「手機 AI 硬件對手機 AI 硬件」嘅公平比較。前者可能受惠於 GPU 加速,後者反映嘅主要係目前客戶端所提供嘅 CPU 路徑表現。
Android 數據仍然有用:佢可以反映 CPU 本地推論,以及該實作方式帶畀用戶嘅實際體驗。但現階段唔應該用呢啲結果,直接宣布某部手機嘅整體 AI 晶片一定快過另一部,除非雙方都以相等嘅 GPU 或 NPU 後端,在相同工作負載下測試。
Pipette 推出之際,晶片製造商正積極推廣更快嘅本地 AI 及 agentic AI 處理能力。Qualcomm 表示,Snapdragon 8 Elite Gen 5 採用第三代 Oryon CPU,最高時脈達 4.74 GHz,並聲稱 CPU 效能提升 20%、CPU 能源效益提升 35%。24
Qualcomm 亦預告另一款後續旗艦 Snapdragon 平台,當中 Oryon CPU 目標達到 5 GHz,並加入 FlexCache 架構,畀不同核心共享一個按工作負載動態分配嘅快取池。23
但時脈高,唔代表語言模型推論一定快。量化方式、記憶體頻寬、快取行為、運行時實作、GPU 或 NPU 是否啟用、散熱,以及長時間運行時嘅功耗限制,同樣可以左右結果。
呢個正正係 Pipette 採用「完整配置」方法嘅價值:長遠而言,佢可以幫大家睇清楚晶片商聲稱嘅提升,究竟有冇轉化成可重現嘅本地 AI 速度、反應時間及記憶體效益。
現階段,Pipette 最適合被理解為一套透明嘅本地 AI 部署基準測試,而唔係 iPhone 對 Android 嘅終極硬件排行榜。真正公平嘅跨平台比較,仍然要等到相同加速後端同更一致嘅測試條件出現。
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
Pipette 於 2026 年 8 月 24 日推出,量度嘅係完整本地 AI 部署,而唔係單睇模型權重。
Pipette 於 2026 年 8 月 24 日推出,量度嘅係完整本地 AI 部署,而唔係單睇模型權重。 公開數據涵蓋超過 1,000 個模型、量化格式、運行時、裝置及上下文組合,支援 30 多個模型,以及 macOS、iOS、Windows 同 Android 上嘅 llama.cpp 建置版本。[3]
初步手機智能評測中,Nanbeige4.2 3B 同 LFM2.5 2.6B 以平均 63 分並列第一;iPhone 17 Pro 上以 Apple MLX 運行 4 bit Gemma 4 E2B,曾錄得每秒 48.37 個解碼 token。[33][4][5]