Pipette — бесплатный набор открытых инструментов для проверки реальной работы ИИ моделей непосредственно на устройстве, а не через облачный сервер. Платформа учитывает связку «модель + квантование + runtime + устройство + рабочая нагрузка» и публикует результаты воспроизводимых лабораторных тестов.
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open source on device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open source benchmark suite for measuring an actual on device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload.. Topic tags: general web, llm, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait
Pipette — это бесплатный набор открытых инструментов Liquid AI для тестирования искусственного интеллекта непосредственно на смартфонах и других периферийных устройствах. Платформа появилась 24 августа 2026 года в сотрудничестве с Artificial Analysis и оценивает не отдельную модель в вакууме, а полноценную конфигурацию развертывания: модель, степень квантования, среду выполнения, устройство и сценарий нагрузки. 119
Главная идея Pipette — приблизить тесты к реальному пользовательскому опыту. Скорость модели зависит не только от числа параметров: на результат влияют формат весов, используемый runtime, память устройства, тип вычислительного ускорителя и длина контекста.
В открытый набор данных вошли результаты лабораторно проверенных тестов более чем для 1 000 конфигураций. Таблица лидеров на старте охватывает свыше 30 моделей, семь вариантов квантования и четыре исходных устройства. 114
Платформа измеряет пять показателей производительности, среди которых:
Такой подход важен: высокая скорость генерации сама по себе еще не означает, что модель будет быстро отвечать в реальном приложении. Она может долго обрабатывать запрос перед началом вывода или занимать слишком много оперативной памяти.
Pipette предоставляет клиенты для iOS и Android. Модели сначала скачиваются на устройство, после чего тест запускается локально — запросы не отправляются на облачный endpoint. 108
В первоначальный набор входят модели семейства Liquid Foundation Models (LFM), а также небольшие сторонние модели, включая Gemma и Nanbeige. Для сопоставления «интеллекта» на мобильных устройствах Artificial Analysis отбирала модели, которые помещаются в 8 ГБ памяти после 4-битного квантования. 108
В опубликованных тестах качества используется ограничение контекста в 16 000 токенов. При этом отдельные модели LFM поддерживают более длинный контекст: обычно до 32 000 токенов, а LFM2.5-8B-A1B — до 128 000. Это характеристики самих моделей, а не обязательно единый режим работы первоначального теста Pipette. 82
В документации Liquid AI также упоминаются разные форматы и среды запуска. Например, GGUF предназначен для локального CPU/GPU-инференса на разных платформах, а MLX оптимизирован для устройств Apple Silicon. 2
Результат Pipette привязан к полной конфигурации и сопровождается описанием методики. Публичные данные получены в проверенных лабораторных запусках, а протоколы воспроизводимости опубликованы вместе с результатами. Кроме того, платформа фиксирует программные зависимости: для некоторых текущих показателей требуются конкретные сборки llama.cpp, включая b10216 и b10516. 4116
Это делает такие измерения информативнее, чем одиночное заявление производителя о количестве «токенов в секунду». Однако даже воспроизводимый тест не отменяет различия между экземплярами устройств, объемом оперативной памяти, температурой, состоянием операционной системы и выбранным backend. Сравнивать показатели можно только при совпадении этих условий.
Один из заметных результатов — 48,37 токена в секунду при генерации 4-битной Gemma 4 E2B на iPhone 17 Pro с использованием Apple MLX. Это показатель конкретной связки: «Gemma 4 E2B + 4-битное квантование + MLX/Metal + iPhone 17 Pro». Его нельзя трактовать как универсальную оценку всей модели Gemma или любого смартфона. 45
В оценке мобильного «интеллекта» с контекстом до 16 000 токенов Nanbeige4.2-3B и LFM2.5-2.6B разделили первое место со средним результатом 63. 98
Но сравнение iPhone и Android пока имеет существенное ограничение:
Поэтому текущие цифры нельзя считать чистым сравнением аппаратных платформ. Результат iPhone может включать ускорение GPU, а результат Android отражает работу модели на CPU. Такие данные полезны для оценки CPU-производительности и пользовательского опыта при конкретном backend, но не доказывают, что один смартфон в целом быстрее другого в локальном ИИ. 104
Для более честного межплатформенного сравнения нужны Android-backend с поддержкой NPU и сопоставимое GPU-ускорение.
Запуск Pipette совпал с активным продвижением производителями чипов локальных и агентных ИИ-сценариев. Qualcomm заявляет, что CPU Oryon третьего поколения в Snapdragon 8 Elite Gen 5 достигает частоты 4,74 ГГц; компания также указывает прирост производительности CPU на 20% и энергоэффективности CPU на 35% для этой платформы. 14
Отдельно Qualcomm предварительно представила следующую флагманскую платформу Snapdragon с Oryon, рассчитанным на частоту до 5 ГГц, и архитектурой FlexCache, которая динамически распределяет кэш между ядрами. Эти заявления указывают на стремление ускорить локальные вычисления и сделать их более отзывчивыми, но одна только тактовая частота не позволяет предсказать скорость инференса языковой модели. На нее также влияют runtime, пропускная способность памяти, работа кэша, квантование, GPU/NPU-backend, температура и ограничения длительного энергопотребления. 913
Liquid AI планирует расширять список устройств и добавлять тесты с использованием NPU. Это сделает Pipette еще полезнее: платформа сможет отделять преимущества CPU от эффектов GPU- и NPU-ускорения в одинаковых сценариях. Пока же Pipette лучше всего воспринимать как прозрачный бенчмарк конкретных конфигураций, а не как окончательный рейтинг мобильного оборудования. 64
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
Pipette — бесплатный набор открытых инструментов для проверки реальной работы ИИ моделей непосредственно на устройстве, а не через облачный сервер.
Pipette — бесплатный набор открытых инструментов для проверки реальной работы ИИ моделей непосредственно на устройстве, а не через облачный сервер. Платформа учитывает связку «модель + квантование + runtime + устройство + рабочая нагрузка» и публикует результаты воспроизводимых лабораторных тестов.
На старте доступны клиенты для iOS и Android, более 30 моделей, семь вариантов квантования и свыше 1 000 проверенных конфигураций.