피펫(Pipette)은 Liquid AI가 Artificial Analysis와 함께 8월 24일 공개한 오픈소스 온디바이스 AI 벤치마크 제품군입니다. 스마트폰, 노트북, PC 같은 엣지 기기에서 AI 모델이 실제로 어떻게 작동하는지를 측정하는 것이 핵심입니다.
3
1
일반적인 모델 벤치마크가 모델의 능력이나 특정 환경에서의 추론 속도에 초점을 맞춘다면, 피펫은 배포 구성 전체를 측정 단위로 삼습니다. 즉, 같은 모델이라도 어떤 양자화 형식과 런타임을 사용했는지, 어떤 기기와 작업 조건에서 실행했는지에 따라 결과가 달라질 수 있다는 점을 기록합니다.
모델 점수만으로는 알 수 없는 것
AI 모델의 성능을 비교할 때 흔히 파라미터 수, 정답률, 초당 생성 토큰 수 같은 단일 지표를 봅니다. 하지만 스마트폰에서 로컬 AI를 실행할 때는 모델 파일만으로 체감 성능을 설명하기 어렵습니다.
양자화 방식, 런타임, 하드웨어 백엔드, 메모리 압박, 컨텍스트 길이가 바뀌면 모델 가중치가 같아도 실행 결과가 달라질 수 있기 때문입니다. 피펫은 이 요소들을 따로 떼어내기보다 하나의 배포 구성으로 묶어 평가합니다.
출시와 함께 공개된 데이터셋에는 실험실에서 검증한 1,000개 이상의 모델·양자화·런타임·기기·컨텍스트 조합이 포함됐습니다. 초기 데이터는 30개 이상의 모델, 여러 양자화 형식, macOS·iOS·Windows·안드로이드용 llama.cpp 빌드, 256~8,192토큰의 컨텍스트 길이를 아우릅니다.
3
또한 Liquid AI의 추론 성능 측정은 Artificial Analysis가 진행한 모바일 모델 지능 평가와 함께 제공됩니다. 따라서 특정 배포가 얼마나 빠르고 효율적인지뿐 아니라, 모델이 지시 따르기·도구 사용·추론 같은 작업을 얼마나 잘 수행하는지도 함께 살펴볼 수 있습니다.
33
어떤 기기와 운영체제를 지원하나
피펫은 스마트폰에서 모델을 직접 실행할 수 있는 iOS·안드로이드 클라이언트를 제공합니다. 전체 벤치마크 범위에는 지원되는 런타임 빌드를 통한 macOS와 Windows도 포함됩니다. 공개 자료에서 언급한 기준 하드웨어는 iPhone 17 Pro, Galaxy S26 Ultra, M5 Max 칩을 탑재한 MacBook Pro입니다.
3
38
테스트를 시작하려면 먼저 모델을 기기에 내려받아야 합니다. 따라서 피펫이 측정하는 것은 클라우드 API 왕복 지연 시간이 아니라, 기기 내부에서 AI를 실행하는 로컬 추론 성능입니다.
41
50
지원 모델과 양자화 형식
피펫 리더보드에는 Liquid AI의 LFM2.5 제품군과 함께 Gemma, Nanbeige, Granite, Qwen 등 여러 기업과 커뮤니티의 소형·압축 모델이 올라와 있습니다.
9
41
모바일 지능 비교에서는 4비트로 양자화했을 때 8GB 이내에 들어오는 모델을 중심으로 평가했습니다. 스마트폰처럼 메모리가 제한된 환경에서 실제로 실행할 수 있는 모델을 비교하려는 취지입니다.
3
41
로컬 배포 형식으로는 여러 CPU·GPU 대상에서 널리 쓰이는 GGUF와 Apple Silicon 환경에 맞춰 설계된 MLX가 구분됩니다. Liquid AI 문서에 따르면 GGUF는 llama.cpp와 함께 사용할 수 있고, MLX는 Apple Silicon의 통합 메모리를 활용하는 배포에 적합합니다.
47
다만 양자화한 모델의 파일 크기만으로 실행 성능을 판단할 수는 없습니다. 실제 처리 속도와 메모리 사용량에는 런타임과 하드웨어 백엔드가 함께 영향을 줍니다.
컨텍스트 길이와 작업 조건
피펫 출시 데이터셋은 256~8,192토큰의 컨텍스트 길이에 걸쳐 표준화된 추론 설정을 보고합니다.
3 별도로 Artificial Analysis가 진행한 모바일 지능 평가는 컨텍스트 길이를 16K토큰으로 제한했습니다.
33
이 수치는 모델이 이론적으로 지원하는 최대 컨텍스트 길이와는 다릅니다. Liquid AI의 모델 문서에는 많은 LFM 모델이 32K토큰 컨텍스트를 지원하고, LFM2.5-8B-A1B는 128K를 지원한다고 나와 있습니다. 그러나 모델이 지원하는 최대 길이가 모든 스마트폰 벤치마크에서 그대로 사용된다는 뜻은 아닙니다.
47
피펫이 측정하는 다섯 가지 성능 지표
피펫은 결과를 단순히 디코드 속도로 환원하지 않습니다. 다음 다섯 가지 성능 지표를 함께 봅니다.
1
3
14
- 프롬프트 처리 또는 프리필 속도
- 응답 생성 또는 디코드 처리량
- 첫 토큰이 나올 때까지 걸리는 시간
- 전체 응답 완료 시간
- 메모리 사용량
이 구성이 중요한 이유는 여러 지표가 서로 다른 결과를 보여줄 수 있기 때문입니다. 토큰 생성은 빠르지만 첫 응답이 늦을 수도 있고, 메모리를 과도하게 사용하거나 컨텍스트가 길어질수록 속도가 크게 떨어질 수도 있습니다.
특히 전체 응답 완료 시간은 사용자가 로컬 AI 비서와 상호작용할 때 실제로 경험하는 반응성을 판단하는 데 유용합니다. Artificial Analysis는 여기에 지시 따르기, 도구 사용, 추론 등 모바일 모델의 지능 평가를 더합니다.
33
재현성을 높이기 위한 장치
피펫은 각 결과에 명확한 배포 구성을 연결하고, 검증 데이터 생성에 사용한 프로토콜을 공개합니다. 대시보드도 단순 순위표에 그치지 않고 리더보드, 상세 결과, 제출 데이터로 나뉘어 있어 개별 벤치마크 행을 확인할 수 있습니다.
1
런타임 의존성도 기록합니다. Liquid AI는 현재 공개 성능 결과를 얻으려면 b10216, b10516을 포함한 특정 llama.cpp 빌드가 필요하다고 설명합니다.
2 실행 소프트웨어 버전을 고정하면 런타임 업데이트로 인한 개선을 하드웨어나 모델 자체의 성능 향상으로 잘못 해석할 가능성을 줄일 수 있습니다.
물론 이 방식이 모든 변수를 없애는 것은 아닙니다. 스마트폰의 발열과 스로틀링, 운영체제 상태, 사용 가능한 메모리, 펌웨어, 백엔드 선택, 지속 전력 제한 등이 결과에 영향을 줄 수 있습니다. 따라서 두 결과를 비교하려면 가능한 한 이런 조건도 일치해야 합니다.
초기 결과가 보여준 것
초기 결과는 피펫이 왜 ‘모델별 보편 순위’보다 ‘구성별 결과’를 제시하는지 잘 보여줍니다.
- iPhone 17 Pro에서 Apple MLX를 사용해 4비트 Gemma 4 E2B를 실행한 결과는 초당 48.37 디코드 토큰으로 보고됐습니다. 이는 해당 Gemma 모델·4비트 양자화·MLX/Metal·iPhone 17 Pro 조합의 결과이지, 모든 Gemma 배포나 모든 스마트폰에 적용되는 점수는 아닙니다.
4
5
- 16K 컨텍스트 모바일 지능 평가에서는 Nanbeige4.2-3B와 LFM2.5-2.6B가 평균 63점으로 공동 1위를 차지했습니다.
33
- Artificial Analysis는 iPhone 17 Pro에서 LFM2.5-2.6B가 표준 1,024토큰 프롬프트에 8.0초 만에 응답했고, 메모리 사용량은 2.3GB였다고 보고했습니다. 이 역시 특정 테스트 구성의 결과로 봐야 하며 모든 기기에 일반화할 수 없습니다.
33
결국 지능, 속도, 지연 시간, 메모리는 서로 다른 방향을 가리킬 수 있습니다. 가장 빠른 모델이 반드시 가장 뛰어난 모델은 아니며, 지능 평가 점수가 가장 높은 모델이 반드시 스마트폰에서 가장 좋은 배포가 되는 것도 아닙니다.
iOS와 안드로이드 결과를 바로 비교하기 어려운 이유
초기 모바일 출시에서 가장 중요한 제한은 두 클라이언트의 실행 방식이 다르다는 점입니다. iOS 버전은 Apple의 Metal 생태계를 통한 GPU 연산을 지원하며 MLX를 사용할 수 있습니다. 반면 초기 안드로이드 버전은 CPU 추론만 지원합니다.
41
50
따라서 MLX/Metal을 사용한 iPhone 결과와 CPU만으로 생성된 안드로이드 결과는 두 스마트폰의 전체 AI 하드웨어를 동일 조건에서 비교한 결과가 아닙니다. iOS 측정에는 GPU 가속의 이점이 포함될 수 있지만, 안드로이드 측정은 현재 클라이언트가 제공하는 CPU 경로의 성능을 반영하기 때문입니다.
안드로이드 결과는 CPU 기반 로컬 추론과 해당 구현에서의 사용자 경험을 이해하는 데는 유용합니다. 그러나 동등한 GPU 또는 NPU 백엔드를 같은 작업 조건에서 테스트하기 전까지는 어느 스마트폰의 전체 AI 실리콘이 더 빠르다고 단정해서는 안 됩니다.
모바일 칩 경쟁에서 피펫이 갖는 의미
피펫의 등장은 칩 제조사들이 로컬 AI와 에이전트형 AI 처리 성능을 앞세우는 흐름과 맞물려 있습니다. Qualcomm의 Snapdragon 8 Elite Gen 5 플랫폼은 3세대 Oryon CPU를 사용하며 최대 4.74GHz의 클록 속도와 CPU 성능 20% 향상, CPU 전력 효율 35% 향상을 내세웁니다.
24
Qualcomm은 이어 차세대 플래그십 Snapdragon 플랫폼의 Oryon CPU가 5GHz를 목표로 하며, 이기종 CPU 코어가 동적으로 할당된 캐시 풀을 공유할 수 있는 FlexCache 아키텍처를 적용한다고 예고했습니다.
23
이런 사양은 온디바이스 AI가 하드웨어 경쟁으로 이동하고 있음을 보여줍니다. 하지만 클록 속도만으로 언어 모델 성능을 예측할 수는 없습니다. 양자화 방식, 메모리 대역폭, 캐시 동작, 런타임 구현, GPU·NPU 사용 여부, 발열, 지속 전력 제한이 모두 영향을 줍니다.
피펫의 구성 기반 접근법이 의미 있는 지점도 여기에 있습니다. 장기적으로 피펫은 칩 제조사가 주장하는 성능 향상이 동일하고 재현 가능한 작업 조건에서 더 빠르고 반응성이 높은, 메모리 효율적인 로컬 AI로 이어지는지 보여줄 수 있습니다.
현재 피펫은 iPhone과 안드로이드 하드웨어의 최종 순위를 매기는 도구라기보다, 실제 배포 환경을 투명하게 측정하는 벤치마크로 이해하는 것이 가장 정확합니다.