Liquid AIが2026年8月24日にArtificial Analysisと共同で公開した「Pipette」は、スマートフォンやPCなどでAIモデルをローカル実行したときの性能を測る、オープンソースのベンチマークスイートです。特徴は、モデルの性能だけでなく、モデル、量子化、ランタイム、端末、ワークロードを組み合わせたデプロイ全体を測定単位にしている点にあります。
3
1
モデル単体のベンチマークと何が違うのか
一般的なAIベンチマークでは、知能性能のスコアや推論速度を単一の数値で比較することがあります。しかし、実際の端末上の動作は、同じモデルでも量子化形式、ランタイム、バックエンド、メモリ状況、ハードウェアによって変わります。
Pipetteは、こうした条件を切り分けずに「実際に使う構成」として記録します。公開時点では、1,000を超えるモデル・量子化・ランタイム・端末・コンテキスト長の組み合わせについて、研究室で検証した結果を公開。30以上のモデル、複数の量子化形式、macOS・iOS・Windows・Android向けのllama.cppビルド、256〜8,192トークンのコンテキスト長をカバーしています。
3
また、Liquid AIが推論性能を測定し、Artificial Analysisがモバイル向けモデルの知能評価を担当します。つまり、モデルがどれだけ賢いかだけでなく、特定の端末でどれだけ速く、効率よく動くかも同時に見られる設計です。
33
対応する端末とOS
Pipetteには、端末上でモデルを実行できるiOS版とAndroid版のクライアントがあります。公開されているベンチマーク範囲には、対応ランタイムを使ったmacOSとWindowsも含まれます。初期の代表的な検証端末として、iPhone 17 Pro、Galaxy S26 Ultra、M5 Max搭載MacBook Proが挙げられています。
3
38
測定前にはモデルを端末へダウンロードする必要があります。したがって、Pipetteが測るのはクラウドAPIの通信遅延ではなく、モデルを端末内で処理するローカル推論の性能です。
41
50
対応モデルと量子化形式
リーダーボードにはLiquid AIのLFM2.5シリーズだけでなく、Gemma、Nanbeige、Granite、Qwenなど、他社の小型・圧縮モデルも掲載されています。
9
41
量子化形式にも対応しており、モバイル向けの知能比較では、4ビット量子化時に8GB以内へ収まるモデルが中心となりました。これは、メモリ容量に制約のあるスマートフォンでの利用を想定した条件です。
3
41
ローカル実行では、llama.cppを使ってCPUやGPU向けに展開しやすいGGUFと、Apple Silicon向けに設計されたMLXを区別する必要があります。
47 モデルファイルのサイズが小さいだけで高速になるわけではありません。実際の処理速度は、ランタイムやGPU・CPUなどのバックエンド、端末側のメモリ構成によって左右されます。
コンテキスト長と測定ワークロード
Pipetteの公開データセットは、256〜8,192トークンのコンテキスト長で標準化された推論設定を報告しています。
3 一方、Artificial Analysisによるモバイル知能評価では、コンテキスト長を16Kトークンに制限しています。
33
ここで注意したいのは、ベンチマークの条件とモデルが公称する最大コンテキスト長は別物だということです。Liquid AIの資料では、多くのLFMモデルが32Kトークン、LFM2.5-8B-A1Bが128Kトークンに対応するとされていますが、スマートフォンでの評価がその最大長で実行されるとは限りません。
47
Pipetteが測定する5つの性能指標
Pipetteは、生成速度だけでオンデバイスAIの性能を判断しません。主な指標は次の5つです。
1
3
14
- プロンプト処理・プリフィル速度
- 生成・デコード速度
- 最初のトークンが出るまでの時間(TTFT)
- 応答全体が完了するまでの時間
- メモリ使用量
たとえば、トークン生成は速くても、最初の応答までに時間がかかったり、メモリを過剰に消費したりする場合があります。コンテキストが長くなるほど処理が遅くなるケースもあります。こうした複数の指標を組み合わせることで、ローカルアシスタントを実際に操作したときの体感に近い評価が可能になります。
Artificial Analysis側では、指示追従、ツール利用、推論などのテストを通じて、モデルの知能面を評価しています。
33
再現性を高める仕組み
Pipetteでは、結果ごとに明示的な構成をひも付け、検証データを作成したプロトコルも公開しています。ダッシュボードでは、構成を比較するリーダーボード、個別の測定値を確認する結果画面、提出されたベンチマーク行を追跡できる画面が分けられています。
1
ランタイムの依存関係も記録対象です。Liquid AIによると、現在公開されている性能結果では、b10216やb10516を含む特定のllama.cppビルドが必要です。
2 ランタイムのバージョンを固定することで、ソフトウェアの変更をモデルや端末の性能向上と誤認しにくくなります。
もちろん、これで端末差が完全になくなるわけではありません。発熱による性能低下、OSの状態、搭載メモリ、ファームウェア、選択したバックエンド、継続的な電力制限なども結果に影響します。比較する際は、できるだけ同じ条件をそろえることが重要です。
初期ベンチマークで見えたこと
初期結果は、Pipetteが「モデルの絶対ランキング」ではなく、「特定の構成の評価」を目指していることを示しています。
- iPhone 17 Proで、4ビット量子化したGemma 4 E2BをApple MLXで実行した場合、デコード速度は毎秒48.37トークンと報告されています。これは、Gemma 4 E2B、4ビット量子化、MLX/Metal、iPhone 17 Proという特定の組み合わせの結果であり、すべてのGemmaモデルやスマートフォンに当てはまる数値ではありません。
4
5
- 16Kコンテキストのモバイル知能評価では、Nanbeige4.2-3BとLFM2.5-2.6Bが平均スコア63で並びました。
33
- LFM2.5-2.6Bは、iPhone 17 Proで標準的な1,024トークンのプロンプトに8.0秒で回答し、メモリ使用量は2.3GBだったと報告されています。この値も特定の測定条件に基づく結果です。
33
ここから分かるのは、品質、速度、応答開始までの時間、メモリ使用量は必ずしも同じ方向に伸びないということです。最速のモデルが最も高性能とは限らず、知能スコアが最も高いモデルが、スマートフォンで最良の選択になるとも限りません。
iOSとAndroidの結果を単純比較できない理由
初期リリースで特に注意すべきなのが、iOS版とAndroid版の実行方式の違いです。iOS版はAppleのMetal環境を通じたGPU計算に対応し、MLXも利用できます。一方、記事執筆時点のAndroid版はCPU推論に限られています。
41
50
そのため、MLX/Metalを使ったiPhoneの結果と、CPUのみで測定したAndroidの結果を並べても、端末全体のAIハードウェアを公平に比較したことにはなりません。前者にはGPUアクセラレーションの効果が含まれる可能性がある一方、後者は現在のクライアントが提供するCPU経路の性能を示すものだからです。
Androidの結果は、CPUベースのローカル推論や、その実装で得られるユーザー体験を知るうえでは有用です。ただし、同じワークロードでGPUやNPUなど同等のアクセラレーション経路を検証するまでは、どちらのスマートフォンのAIチップ全体が速いかを断定する材料にはなりません。
モバイルチップ競争との関係
Pipetteの登場は、半導体メーカーがローカルAIやエージェント型AIの処理性能を競う流れとも重なります。QualcommのSnapdragon 8 Elite Gen 5は、第3世代Oryon CPUの最大クロック4.74GHzを掲げ、CPU性能20%向上、CPU電力効率35%向上を主張しています。
24
さらにQualcommは、次世代フラッグシップSnapdragon向けに、最大5GHzを目標とするOryon CPUと、異なるCPUコアが動的に共有できるキャッシュプールを備えた「FlexCache」アーキテクチャを予告しています。
23
こうした仕様は、オンデバイスAIがチップ競争の重要な舞台になっていることを示します。ただし、クロック周波数だけで言語モデルの実行性能を予測することはできません。量子化、メモリ帯域、キャッシュの挙動、ランタイムの実装、GPUやNPUの利用状況、発熱、継続的な電力制限も大きく関係します。
だからこそ、Pipetteの構成ベースの測定には意味があります。チップメーカーが示す性能向上が、同じ条件のローカルAIで、より速く、応答性が高く、メモリ効率のよい動作につながるのかを確認できるからです。現時点でのPipetteは、iPhoneとAndroidの優劣を決める最終ランキングというより、オンデバイスAIの実際のデプロイ性能を透明に比較するためのベンチマークと捉えるのが適切です。