Pipette 是 Liquid AI 與 Artificial Analysis 於 2026 年 8 月 24 日推出的開源基準測試套件,用來評估 AI 模型在手機、筆電、桌上型電腦及其他邊緣裝置上的實際運作表現。它測量的單位不是「某個模型」而是完整部署:模型、量化方式、執行環境、裝置與工作負載的組合。
3
1
這種設計回答了一個傳統模型排行榜往往忽略的問題:同一個模型換了量化格式、推論引擎或硬體後,使用者實際得到的速度、延遲與記憶體佔用會有多大差異?
Pipette 與一般模型排行榜有何不同?
許多 AI 排行榜著重能力分數,或只提供單一的推論速度數字;Pipette 則試圖呈現整套部署在真實裝置上的行為。即使模型權重完全相同,只要更換量化格式、執行環境、後端、硬體,或提高上下文長度,結果就可能明顯改變。
Liquid AI 表示,首波公開資料集包含超過 1,000 組經實驗室驗證的配置,涵蓋 30 多個模型、多種量化格式,以及適用於 macOS、iOS、Windows 和 Android 的 llama.cpp 建置版本。標準化效能資料的上下文長度則從 256 token 延伸至 8,192 token。
3
Pipette 的推論效能測量,也與 Artificial Analysis 對手機模型智慧程度的評估搭配呈現。換句話說,這項合作同時觀察模型「答得好不好」,以及特定部署「跑得快不快、耗用多少資源」。
33
支援哪些裝置與作業系統?
Pipette 提供原生 iOS 與 Android 用戶端,使用者可以先將模型下載到手機,再直接在本機執行測試。更廣泛的基準資料也涵蓋透過支援的執行環境建置,在 macOS 與 Windows 上進行的測試。
3
38
公開資料列出的參考硬體包括 iPhone 17 Pro、Galaxy S26 Ultra,以及搭載 M5 Max 晶片的 MacBook Pro。
3
38
由於模型必須先下載至裝置,Pipette 測量的是本地推論效能,而不是連接雲端 API 的網路延遲。
41
50
模型與量化格式
排行榜除了 Liquid AI 自家的 LFM2.5 系列,也納入第三方模型,例如 Gemma、Nanbeige、Granite、Qwen 等小型或壓縮模型變體。
9
41
Pipette 支援多種量化格式。Artificial Analysis 的手機智慧比較,主要挑選經 4-bit 量化後能控制在 8 GB 以內的模型,讓測試更貼近手機記憶體有限的使用情境。
3
41
Liquid AI 的文件區分了兩種常見部署格式:GGUF 通常搭配 llama.cpp,在 CPU 或 GPU 上執行;MLX 則主要用於 Apple Silicon 裝置。
47 不過,量化模型的檔案大小只是其中一環,真正的處理速度仍會受到執行環境與硬體後端影響。
上下文長度與工作負載
Pipette 首波資料以 256 至 8,192 token 的上下文長度,建立標準化推論配置。
3 另一方面,Artificial Analysis 的手機智慧評測採用 16K token 的上下文上限。
33
這些數字不應與模型宣稱的最大上下文視窗混為一談。Liquid AI 的模型文件顯示,許多 LFM 模型支援 32K 上下文,LFM2.5-8B-A1B 則支援 128K;但模型本身具備這種能力,不代表每一款手機測試都會使用完整長度。
47
Pipette 測量哪些指標?
Pipette 不把結果簡化成「每秒能生成多少 token」,而是結合五項裝置端效能指標:
- 提示詞或 prefill 處理速度
- 生成或 decode 吞吐量
- 首個 token 延遲(time to first token)
- 從送出請求到完整回答的總耗時
- 記憶體使用量
1
3
14
這些指標各自反映不同的使用體驗。一個部署可能生成速度很快,卻需要較長時間才輸出第一個 token;也可能因為記憶體壓力過高,隨著上下文變長而逐漸變慢。因此,端到端回應時間往往比單純的 decode 速度,更能反映本地 AI 助理是否「用起來順」。
Artificial Analysis 則從品質面進行手機模型智慧評估,測試項目包括指令遵循、工具使用、推理等能力。
33
如何提高測試的可重現性?
Pipette 會將每項結果綁定至明確的完整配置,並公開產生驗證資料時使用的測試流程。其公開儀表板也將排行榜、詳細結果與提交資料分開,讓使用者能檢視底層測試紀錄,而不只是依賴一個總排名。
1
方法設計也記錄執行環境的依賴版本。例如 Liquid AI 表示,目前公開效能結果要求使用指定的 llama.cpp 建置版本,包括 b10216 與 b10516。
2 固定執行環境版本,有助於避免軟體更新被誤認為硬體或模型本身的效能提升。
這些措施能改善可比性,卻無法消除所有變因。手機溫度與降頻、作業系統狀態、可用記憶體、韌體、後端選擇,以及持續功耗限制,都可能影響結果。只有在相關條件一致時,分數才適合直接比較。
首波結果透露了什麼?
Pipette 的首波結果,正好說明為什麼它強調完整配置,而不是提供一個適用於所有情境的模型排名。
- iPhone 17 Pro 搭配 4-bit Gemma 4 E2B,使用 Apple MLX 測得 每秒 48.37 個 decode token。這是該模型、量化格式、MLX/Metal 執行環境與 iPhone 17 Pro 的特定結果,不能直接套用到所有 Gemma 部署或所有手機。
4
5
- 在上下文上限為 16K 的手機智慧評測中,Nanbeige4.2-3B 與 LFM2.5-2.6B 以 63 分並列平均分數第一。
33
- Artificial Analysis 也指出,LFM2.5-2.6B 在 iPhone 17 Pro 上處理標準的 1,024-token 提示詞時,耗時 8.0 秒、使用 2.3 GB 記憶體。這同樣是特定測試配置的結果,不應推論至所有裝置。
33
這些數字帶出的重點是:品質、速度、延遲與記憶體效率可能朝不同方向發展。最快的模型不一定最有能力;能力分數最高的模型,也不一定是最適合手機部署的選擇。
為什麼目前不能直接比較 iOS 與 Android?
首波手機版本最重要的限制,在於兩個用戶端使用的硬體後端不同。iOS 版本可以透過 Apple 的 Metal 生態系使用 GPU 運算,包括 MLX;Android 版本在初始階段則僅支援 CPU 推論。
41
50
因此,使用 MLX/Metal 的 iPhone 結果,與目前由 Android CPU-only 執行的結果,並不能視為對兩支手機整體 AI 硬體能力的公平比較。前者可能受惠於 GPU 加速,後者反映的是當前用戶端所提供的 CPU 路徑。
Android 測試仍可用來了解 CPU 本地推論,以及該實作帶來的實際使用體驗;但在雙方以等效的 GPU 或 NPU 後端、相同工作負載進行測試前,不能據此宣稱某支手機的完整 AI 晶片一定比另一支更快。
Pipette 與手機晶片競賽的關係
Pipette 推出的時間點,正值晶片商積極宣傳更快的本地 AI 與代理式 AI 運算。Qualcomm 表示,Snapdragon 8 Elite Gen 5 採用第三代 Oryon CPU,時脈最高達 4.74GHz,CPU 效能提升 20%,CPU 能效提升 35%。
24
Qualcomm 也預告後續旗艦 Snapdragon 平台,搭載目標達 5GHz 的 Oryon CPU,以及 FlexCache 架構,讓異質 CPU 核心能依工作負載動態共用快取池。
23
這些規格顯示,裝置端 AI 正逐漸成為手機晶片競爭的核心,但單看時脈並不能預測語言模型的實際效能。量化方式、記憶體頻寬、快取行為、執行環境、GPU 或 NPU 是否啟用、散熱,以及長時間功耗限制,同樣可能左右結果。
Pipette 的價值,正在於它能將這些因素放進同一個可追蹤的配置中。長期而言,它最值得觀察的地方,不是替 iPhone 或 Android 排出一個簡單名次,而是檢驗晶片商宣稱的提升,是否真的能在可重現的工作負載下,轉化為更快、更低延遲且更節省記憶體的本地 AI。
現階段,Pipette 最適合被理解為透明的「部署基準」,而不是 iPhone 對 Android 硬體能力的最終裁判。