Pipette는 AI 모델 자체가 아니라 모델·양자화·런타임·기기·작업량을 묶은 실제 온디바이스 배포 구성을 측정하는 무료 오픈소스 벤치마크입니다. 2026년 8월 24일 Artificial Analysis와 함께 공개됐으며, 추론 성능 측정과 모바일 모델의 지능 평가를 결합합니다.
연구 답변

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open source on device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open source benchmark suite for measuring an actual on device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload.. Topic tags: general web, llm, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait
Pipette는 Liquid AI가 Artificial Analysis와 함께 공개한 무료 오픈소스 온디바이스 AI 벤치마크 플랫폼입니다. 2026년 8월 24일 공개됐으며, 클라우드 서버에서 모델을 돌린 결과가 아니라 스마트폰이나 컴퓨터에서 AI 모델을 실제로 실행했을 때의 성능을 측정하는 데 초점을 둡니다. 119
핵심은 ‘모델 하나의 점수’를 매기는 방식에서 벗어났다는 점입니다. Pipette가 비교하는 단위는 다음 요소를 모두 포함한 완전한 배포 구성입니다.
따라서 같은 모델이라도 어떤 정밀도로 변환했는지, 어떤 런타임과 하드웨어를 사용했는지에 따라 결과가 달라질 수 있다는 현실을 벤치마크에 반영합니다. 411
공개 데이터셋에는 실험실에서 검증한 1,000개 이상의 구성 결과가 담겼습니다. 현재 리더보드는 30개 이상의 모델, 7개 양자화 옵션, 초기 4개 기기를 다루며, 여러 런타임과 컨텍스트 조건에서 측정한 결과를 보여줍니다. 114
공개된 주요 성능 지표는 다음과 같습니다.
즉, 단순히 초당 몇 개의 토큰을 생성하는지만 보지 않습니다. 첫 반응이 빠른지, 전체 답변을 얼마나 빨리 끝내는지, 메모리를 얼마나 사용하는지까지 함께 확인할 수 있습니다.
Pipette는 iOS와 Android용 클라이언트를 제공하며, 사용자가 모델을 기기에 먼저 내려받은 뒤 클라우드 API가 아닌 로컬 환경에서 벤치마크를 실행하는 방식입니다. 10
공개 결과에는 macOS·iOS·Windows·Android용 llama.cpp 빌드가 포함돼 있습니다. 현재 공개 데이터셋은 256~8,192토큰 컨텍스트 조건을 포함하고 있으며, 세부 결과는 특정 모델·런타임·기기 조합별로 확인해야 합니다. 11
다만 iOS와 Android의 초기 지원 방식에는 중요한 차이가 있습니다. iOS 버전은 Metal과 MLX를 통한 GPU 연산을 사용할 수 있지만, 초기 Android 클라이언트는 CPU 연산만 지원합니다. 10
초기 모델 목록에는 Liquid AI의 LFM 계열뿐 아니라 Gemma, Nanbeige 등 다른 개발사의 소형 언어 모델도 포함됩니다. Artificial Analysis의 모바일 지능 비교는 4비트 양자화 기준으로 8GB 안에 들어가는 모델을 중심으로 진행됐습니다. 810
모바일 지능 평가의 표준 조건은 16K 토큰 컨텍스트였습니다. 이 조건에서 Nanbeige4.2-3B와 LFM2.5-2.6B가 평균 63점으로 공동 선두에 올랐고, Ornith-1.0-9B는 62점, Qwen3.5 9B(Reasoning)는 61점을 기록했습니다. 9
여기서 16K는 Pipette의 모든 성능 측정에 공통으로 적용되는 모델의 최대 컨텍스트 길이를 뜻하지는 않습니다. Liquid AI의 LFM 모델 카탈로그에는 많은 모델이 32K 컨텍스트를 지원하고, LFM2.5-8B-A1B는 128K를 지원하지만, 이는 모델 자체의 기능입니다. 2
Pipette는 여러 양자화 옵션을 비교 대상으로 삼습니다. 양자화는 모델의 숫자 정밀도를 낮춰 메모리 사용량을 줄이고, 스마트폰이나 노트북 같은 기기에서 실행하기 쉽게 만드는 과정입니다. 공개 리더보드는 7개 양자화 옵션을 다루지만, 모든 모델이 모든 형식을 지원하는 것은 아닙니다. 114
Liquid AI 문서에서는 GGUF를 로컬 CPU·GPU 추론에 적합한 형식으로, MLX를 Apple Silicon 기기에서 사용하기 좋은 형식으로 안내합니다. 실제 Pipette 결과를 비교할 때는 모델 이름만 볼 것이 아니라 양자화 형식과 런타임까지 함께 확인해야 합니다. 2
초기 결과 중에는 iPhone 17 Pro에서 4비트 Gemma 4 E2B를 Apple MLX로 실행했을 때 디코드 속도 48.37토큰/초가 보고됐습니다. 하지만 이 수치는 ‘모든 스마트폰에서 Gemma가 48.37토큰/초로 작동한다’는 뜻이 아닙니다. 정확히는 ‘Gemma 4 E2B + 4비트 양자화 + MLX/Metal + iPhone 17 Pro’라는 특정 구성의 결과입니다. 45
이처럼 Pipette의 수치는 모델명만으로 해석하면 안 됩니다. 다음 조건이 달라지면 결과도 달라질 수 있습니다.
Pipette는 결과를 명시적인 전체 구성과 연결하고, 검증된 실험실 측정과 공개된 재현성 프로토콜을 함께 제공합니다. 현재 공개 성능 결과에는 특정 llama.cpp 빌드가 필요하기 때문에, 런타임 버전이 달라져 생기는 차이도 어느 정도 통제합니다. 4116
현재 Pipette 결과만으로 ‘어느 스마트폰의 AI 하드웨어가 더 빠르다’고 단정하기는 어렵습니다. iOS 결과에는 GPU 기반 Metal·MLX 가속이 포함될 수 있지만, 초기 Android 결과는 CPU 추론에 한정되기 때문입니다. 104
따라서 지금의 iPhone 대 Android 처리량 비교는 동일한 조건의 실리콘 대 실리콘 비교가 아닙니다. Android 수치는 해당 기기의 CPU 기반 로컬 AI 성능과 사용자 경험을 파악하는 데는 유용하지만, 스마트폰 전체의 GPU·NPU·메모리 시스템을 포함한 종합 성능 순위를 의미하지는 않습니다.
Android GPU와 NPU를 동등한 방식으로 활용하는 백엔드가 추가돼야 플랫폼 간 비교가 한층 공정해질 수 있습니다. Liquid AI도 향후 더 많은 기기와 NPU 가속 테스트를 지원할 방향을 제시하고 있습니다. 6
Pipette의 등장은 모바일 칩 제조사들이 로컬 AI와 에이전트형 작업의 처리 속도를 강조하는 흐름과 맞물립니다. Qualcomm은 차세대 Oryon CPU의 최고 클럭 5GHz와 코어 간 캐시를 동적으로 공유하는 FlexCache 구조를 공개했습니다. 127
하지만 클럭 속도만으로 대규모 언어 모델의 실제 추론 성능을 예측할 수는 없습니다. 메모리 대역폭, 캐시 동작, 양자화, 런타임, GPU·NPU 백엔드, 발열, 지속 전력 제한이 모두 영향을 미칩니다.
결국 Pipette의 가장 큰 가치는 ‘최종 스마트폰 순위’를 제시하는 데 있지 않습니다. 어떤 모델을 어떤 형식으로 어떤 기기에서 실행했는지를 투명하게 공개하고, CPU 성능 향상과 GPU·NPU 가속의 효과를 분리해 볼 수 있는 기준을 제공한다는 데 있습니다. 더 많은 기기와 가속 백엔드가 추가되기 전까지 Pipette는 완성된 하드웨어 서열표라기보다, 실제 배포 환경을 비교하는 재현 가능한 측정 도구로 보는 것이 가장 정확합니다. 64
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
Pipette는 AI 모델 자체가 아니라 모델·양자화·런타임·기기·작업량을 묶은 실제 온디바이스 배포 구성을 측정하는 무료 오픈소스 벤치마크입니다.
Pipette는 AI 모델 자체가 아니라 모델·양자화·런타임·기기·작업량을 묶은 실제 온디바이스 배포 구성을 측정하는 무료 오픈소스 벤치마크입니다. 2026년 8월 24일 Artificial Analysis와 함께 공개됐으며, 추론 성능 측정과 모바일 모델의 지능 평가를 결합합니다. [11][9]
공개 데이터셋에는 1,000개가 넘는 실험 구성이 포함됐고, 30개 이상 모델·7개 양자화 옵션·초기 4개 기기 범위를 다룹니다. [11][4]