Pipette 於 2026 年 8 月 24 日發布,測量的是完整的裝置端 AI 部署組合,而不只是模型權重本身。[3][1] 初始公開資料涵蓋超過 1,000 組模型、量化格式、執行環境、裝置與上下文長度配置,支援 iOS、Android、macOS 與 Windows。[3] 在 16K 上下文的手機智慧評測中,Nanbeige4.2 3B 與 LFM2.5 2.6B 以 63 分並列第一;iPhone 17 Pro 上的 4 bit Gemma 4 E2B 則測得每秒 48.37 個解碼 token。[33][4][5]
研究答案

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open-source on-device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open-source benchmark suite for measuring an actual on-device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload. Released August 24 wi. Topic tags: general, general web, user generated, academic, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wa
Pipette 是 Liquid AI 與 Artificial Analysis 於 2026 年 8 月 24 日推出的開源基準測試套件,用來評估 AI 模型在手機、筆電、桌上型電腦及其他邊緣裝置上的實際運作表現。它測量的單位不是「某個模型」而是完整部署:模型、量化方式、執行環境、裝置與工作負載的組合。31
這種設計回答了一個傳統模型排行榜往往忽略的問題:同一個模型換了量化格式、推論引擎或硬體後,使用者實際得到的速度、延遲與記憶體佔用會有多大差異?
許多 AI 排行榜著重能力分數,或只提供單一的推論速度數字;Pipette 則試圖呈現整套部署在真實裝置上的行為。即使模型權重完全相同,只要更換量化格式、執行環境、後端、硬體,或提高上下文長度,結果就可能明顯改變。
Liquid AI 表示,首波公開資料集包含超過 1,000 組經實驗室驗證的配置,涵蓋 30 多個模型、多種量化格式,以及適用於 macOS、iOS、Windows 和 Android 的 llama.cpp 建置版本。標準化效能資料的上下文長度則從 256 token 延伸至 8,192 token。3
Pipette 的推論效能測量,也與 Artificial Analysis 對手機模型智慧程度的評估搭配呈現。換句話說,這項合作同時觀察模型「答得好不好」,以及特定部署「跑得快不快、耗用多少資源」。33
Pipette 提供原生 iOS 與 Android 用戶端,使用者可以先將模型下載到手機,再直接在本機執行測試。更廣泛的基準資料也涵蓋透過支援的執行環境建置,在 macOS 與 Windows 上進行的測試。338
公開資料列出的參考硬體包括 iPhone 17 Pro、Galaxy S26 Ultra,以及搭載 M5 Max 晶片的 MacBook Pro。338
由於模型必須先下載至裝置,Pipette 測量的是本地推論效能,而不是連接雲端 API 的網路延遲。4150
排行榜除了 Liquid AI 自家的 LFM2.5 系列,也納入第三方模型,例如 Gemma、Nanbeige、Granite、Qwen 等小型或壓縮模型變體。941
Pipette 支援多種量化格式。Artificial Analysis 的手機智慧比較,主要挑選經 4-bit 量化後能控制在 8 GB 以內的模型,讓測試更貼近手機記憶體有限的使用情境。341
Liquid AI 的文件區分了兩種常見部署格式:GGUF 通常搭配 llama.cpp,在 CPU 或 GPU 上執行;MLX 則主要用於 Apple Silicon 裝置。47 不過,量化模型的檔案大小只是其中一環,真正的處理速度仍會受到執行環境與硬體後端影響。
Pipette 首波資料以 256 至 8,192 token 的上下文長度,建立標準化推論配置。3 另一方面,Artificial Analysis 的手機智慧評測採用 16K token 的上下文上限。33
這些數字不應與模型宣稱的最大上下文視窗混為一談。Liquid AI 的模型文件顯示,許多 LFM 模型支援 32K 上下文,LFM2.5-8B-A1B 則支援 128K;但模型本身具備這種能力,不代表每一款手機測試都會使用完整長度。47
Pipette 不把結果簡化成「每秒能生成多少 token」,而是結合五項裝置端效能指標:
這些指標各自反映不同的使用體驗。一個部署可能生成速度很快,卻需要較長時間才輸出第一個 token;也可能因為記憶體壓力過高,隨著上下文變長而逐漸變慢。因此,端到端回應時間往往比單純的 decode 速度,更能反映本地 AI 助理是否「用起來順」。
Artificial Analysis 則從品質面進行手機模型智慧評估,測試項目包括指令遵循、工具使用、推理等能力。33
Pipette 會將每項結果綁定至明確的完整配置,並公開產生驗證資料時使用的測試流程。其公開儀表板也將排行榜、詳細結果與提交資料分開,讓使用者能檢視底層測試紀錄,而不只是依賴一個總排名。1
方法設計也記錄執行環境的依賴版本。例如 Liquid AI 表示,目前公開效能結果要求使用指定的 llama.cpp 建置版本,包括 b10216 與 b10516。2 固定執行環境版本,有助於避免軟體更新被誤認為硬體或模型本身的效能提升。
這些措施能改善可比性,卻無法消除所有變因。手機溫度與降頻、作業系統狀態、可用記憶體、韌體、後端選擇,以及持續功耗限制,都可能影響結果。只有在相關條件一致時,分數才適合直接比較。
Pipette 的首波結果,正好說明為什麼它強調完整配置,而不是提供一個適用於所有情境的模型排名。
這些數字帶出的重點是:品質、速度、延遲與記憶體效率可能朝不同方向發展。最快的模型不一定最有能力;能力分數最高的模型,也不一定是最適合手機部署的選擇。
首波手機版本最重要的限制,在於兩個用戶端使用的硬體後端不同。iOS 版本可以透過 Apple 的 Metal 生態系使用 GPU 運算,包括 MLX;Android 版本在初始階段則僅支援 CPU 推論。4150
因此,使用 MLX/Metal 的 iPhone 結果,與目前由 Android CPU-only 執行的結果,並不能視為對兩支手機整體 AI 硬體能力的公平比較。前者可能受惠於 GPU 加速,後者反映的是當前用戶端所提供的 CPU 路徑。
Android 測試仍可用來了解 CPU 本地推論,以及該實作帶來的實際使用體驗;但在雙方以等效的 GPU 或 NPU 後端、相同工作負載進行測試前,不能據此宣稱某支手機的完整 AI 晶片一定比另一支更快。
Pipette 推出的時間點,正值晶片商積極宣傳更快的本地 AI 與代理式 AI 運算。Qualcomm 表示,Snapdragon 8 Elite Gen 5 採用第三代 Oryon CPU,時脈最高達 4.74GHz,CPU 效能提升 20%,CPU 能效提升 35%。24
Qualcomm 也預告後續旗艦 Snapdragon 平台,搭載目標達 5GHz 的 Oryon CPU,以及 FlexCache 架構,讓異質 CPU 核心能依工作負載動態共用快取池。23
這些規格顯示,裝置端 AI 正逐漸成為手機晶片競爭的核心,但單看時脈並不能預測語言模型的實際效能。量化方式、記憶體頻寬、快取行為、執行環境、GPU 或 NPU 是否啟用、散熱,以及長時間功耗限制,同樣可能左右結果。
Pipette 的價值,正在於它能將這些因素放進同一個可追蹤的配置中。長期而言,它最值得觀察的地方,不是替 iPhone 或 Android 排出一個簡單名次,而是檢驗晶片商宣稱的提升,是否真的能在可重現的工作負載下,轉化為更快、更低延遲且更節省記憶體的本地 AI。
現階段,Pipette 最適合被理解為透明的「部署基準」,而不是 iPhone 對 Android 硬體能力的最終裁判。
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
Pipette 於 2026 年 8 月 24 日發布,測量的是完整的裝置端 AI 部署組合,而不只是模型權重本身。[3][1]
Pipette 於 2026 年 8 月 24 日發布,測量的是完整的裝置端 AI 部署組合,而不只是模型權重本身。[3][1] 初始公開資料涵蓋超過 1,000 組模型、量化格式、執行環境、裝置與上下文長度配置,支援 iOS、Android、macOS 與 Windows。[3]
在 16K 上下文的手機智慧評測中,Nanbeige4.2 3B 與 LFM2.5 2.6B 以 63 分並列第一;iPhone 17 Pro 上的 4 bit Gemma 4 E2B 則測得每秒 48.37 個解碼 token。[33][4][5]