Pipette, выпущенный 24 августа, оценивает полную конфигурацию локального ИИ, а не только параметры модели. Бенчмарк поддерживает iOS и Android, локальный запуск моделей, разные форматы квантизации и сборки llama.cpp для macOS, iOS, Windows и Android.
ОпубликовалОтредактировано с помощью GPT-5.6 LunaИзображения созданы с помощью GPT Image 1.5
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open-source on-device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open-source benchmark suite for measuring an actual on-device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload. Released August 24 wi. Topic tags: general, general web, user generated, academic, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wa
Pipette — это открытый набор тестов Liquid AI для оценки моделей искусственного интеллекта там, где они действительно работают: на смартфонах, ноутбуках, ПК и других устройствах периферийного уровня. Платформа, представленная 24 августа совместно с Artificial Analysis, рассматривает единицей измерения не саму модель, а её полноценное развертывание — модель, квантизацию, среду выполнения, устройство и рабочую нагрузку. 3
1
Такой подход важен для локального ИИ. Одна и та же модель может работать с разной скоростью и потреблять разный объём памяти в зависимости от формата сжатия, версии runtime, выбранного бэкенда и конкретного чипа.
Многие рейтинги ИИ сосредоточены на способности модели решать задачи или приводят одну цифру скорости генерации. Pipette пытается показать, как ведёт себя вся система в реальном сценарии запуска.
Изменение квантизации, среды выполнения, нагрузки на память или аппаратного бэкенда способно заметно повлиять на результат, даже если веса модели остались прежними. Поэтому в Pipette сравниваются конкретные конфигурации, а не абстрактные «модели вообще».
На момент запуска Liquid AI опубликовала набор лабораторно проверенных данных более чем по 1 000 конфигурациям, включающим модели, форматы квантизации, runtime, устройства и длину контекста. В начальный набор вошли более 30 моделей, несколько форматов квантизации и сборки llama.cpp для macOS, iOS, Windows и Android. Стандартизированные тесты охватывают контекст от 256 до 8 192 токенов. 3
Инфраструктура Pipette также дополняется оценкой «интеллекта» мобильных моделей от Artificial Analysis. В результате можно смотреть не только на скорость и эффективность запуска, но и на то, насколько хорошо модель справляется с поставленными задачами. 33
Для смартфонов доступны нативные клиенты Pipette для iOS и Android. Более широкая база результатов включает macOS и Windows через поддерживаемые сборки runtime. Среди референсных устройств запуска упоминаются iPhone 17 Pro, Galaxy S26 Ultra и MacBook Pro с чипом M5 Max. 3
38
Перед тестированием модель необходимо скачать на устройство. Это означает, что Pipette измеряет локальный запуск и не учитывает задержку обращения к облачному API. 41
50
В таблице результатов представлены модели семейства Liquid AI LFM2.5 и разработки сторонних компаний. Среди примеров — Gemma, Nanbeige, Granite, Qwen и другие небольшие или сжатые модели. 9
41
Pipette поддерживает несколько форматов квантизации — способа уменьшить размер модели и требования к памяти за счёт представления её чисел с меньшей точностью. В мобильном сравнении основное внимание уделялось моделям, которые после 4-битной квантизации укладываются в 8 ГБ. Это делает тест особенно актуальным для смартфонов с ограниченным объёмом оперативной памяти. 3
41
В документации Liquid AI отдельно рассматриваются два популярных формата локального запуска. GGUF широко используется с llama.cpp на CPU и GPU, а MLX предназначен прежде всего для устройств Apple с чипами Apple Silicon. 47 При этом размер файла модели — лишь часть картины: итоговую скорость определяют также runtime и аппаратный бэкенд.
Публичный набор Pipette содержит стандартизированные конфигурации с длиной контекста от 256 до 8 192 токенов. 3 В отдельной оценке мобильного «интеллекта» Artificial Analysis использовалось ограничение в 16K токенов.
33
Эти значения не следует путать с максимальным контекстным окном самой модели. В документации Liquid AI для многих LFM указано до 32K токенов, а для LFM2.5-8B-A1B — до 128K. Однако заявленная возможностями модели длина контекста не означает, что любой смартфон будет тестироваться на таком объёме. 47
Pipette не сводит оценку к скорости декодирования. Набор включает пять ключевых показателей производительности:
Это позволяет увидеть разницу между быстрым продолжением генерации и действительно отзывчивым помощником. Модель может выдавать много токенов в секунду, но долго готовиться к ответу, занимать слишком много памяти или заметно замедляться при увеличении контекста.
Для оценки качества Artificial Analysis использует тесты на следование инструкциям, работу с инструментами, рассуждение и другие способности моделей. 33
Каждый результат привязан к явно указанной конфигурации, а протоколы проверенных тестов опубликованы. На публичной панели есть отдельные представления для рейтинга, подробных результатов и отправленных измерений. Это позволяет изучать исходные строки бенчмарка, а не ориентироваться только на итоговое место в таблице. 1
Методика также фиксирует программные зависимости. Например, текущие публичные результаты требуют определённых сборок llama.cpp, включая b10216 и b10516. 2 Фиксация версии runtime помогает не принять изменения в программном обеспечении за улучшение модели или аппаратной платформы.
Однако даже такой подход не устраняет все источники разброса. На результат смартфона могут влиять нагрев и троттлинг, состояние операционной системы, доступная память, прошивка, выбранный бэкенд и ограничения длительного энергопотребления. Корректно сравнивать показатели можно только при совпадении этих условий.
Первые результаты хорошо демонстрируют, почему Pipette публикует данные по конкретным конфигурациям, а не универсальный рейтинг моделей.
Главный вывод: качество, скорость, задержка и потребление памяти могут двигаться в разных направлениях. Самая быстрая модель не обязательно самая способная, а лучшая по качеству модель не обязательно обеспечит лучший пользовательский опыт на смартфоне.
Ключевое ограничение первого мобильного релиза связано с разницей между клиентами. Версия для iOS умеет использовать GPU через экосистему Apple Metal, включая MLX. Первоначальная версия Android была ограничена вычислениями на CPU. 41
50
Поэтому результат iPhone, полученный через MLX/Metal, и показатель Android при работе только на CPU не являются чистым сравнением всей вычислительной начинки смартфонов. В случае iOS измерение может использовать ускорение GPU, тогда как результат Android отражает возможности процессорного пути, доступного текущему клиенту.
Показатели Android всё равно полезны: они позволяют оценить локальный запуск на CPU и опыт, который даёт конкретная реализация. Но на их основании нельзя утверждать, что искусственный интеллект в одном смартфоне в целом быстрее, чем в другом. Для честного межплатформенного сравнения нужны эквивалентные GPU- или NPU-бэкенды и одинаковая рабочая нагрузка.
Запуск бенчмарка совпал с активным продвижением производителями чипов более быстрой локальной и агентной обработки ИИ. Qualcomm заявляет, что платформа Snapdragon 8 Elite Gen 5 использует процессор Oryon третьего поколения с частотой до 4,74 ГГц, обеспечивая прирост производительности CPU на 20% и энергоэффективности CPU на 35%. 24
Компания также предварительно представила следующую флагманскую платформу Snapdragon с процессором Oryon, рассчитанным на частоту до 5 ГГц, и архитектурой FlexCache. Она позволяет разнородным ядрам динамически использовать общий пул кэш-памяти. 23
Эти характеристики показывают, что локальный ИИ становится частью аппаратной гонки. Но одна только тактовая частота не позволяет предсказать скорость языковой модели. Не меньшее значение имеют пропускная способность памяти, поведение кэша, квантизация, реализация runtime, использование GPU или NPU, температура и ограничения длительной мощности.
Именно поэтому конфигурационный подход Pipette может оказаться особенно полезным. В перспективе он позволит проверить, превращается ли заявленное улучшение чипа в более быстрый, отзывчивый и экономичный локальный ИИ при воспроизводимой нагрузке.
Пока Pipette стоит воспринимать прежде всего как прозрачный бенчмарк развертывания. Это не окончательный рейтинг аппаратного превосходства iPhone над Android или наоборот, а инструмент для понимания того, как конкретная модель работает в конкретной программно-аппаратной связке.
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
Pipette, выпущенный 24 августа, оценивает полную конфигурацию локального ИИ, а не только параметры модели.
Pipette, выпущенный 24 августа, оценивает полную конфигурацию локального ИИ, а не только параметры модели. Бенчмарк поддерживает iOS и Android, локальный запуск моделей, разные форматы квантизации и сборки llama.cpp для macOS, iOS, Windows и Android.
В первой оценке с ограничением контекста 16K токенов Nanbeige4.2 3B и LFM2.5 2.6B разделили первое место со средним результатом 63.
Pipette, выпущенный 24 августа, оценивает полную конфигурацию локального ИИ, а не только параметры модели. Бенчмарк поддерживает iOS и Android, локальный запуск моделей, разные форматы квантизации и сборки llama.cpp для macOS, iOS, Windows и Android.
ОпубликовалОтредактировано с помощью GPT-5.6 LunaИзображения созданы с помощью GPT Image 1.5
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open-source on-device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open-source benchmark suite for measuring an actual on-device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload. Released August 24 wi. Topic tags: general, general web, user generated, academic, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wa
Pipette — это открытый набор тестов Liquid AI для оценки моделей искусственного интеллекта там, где они действительно работают: на смартфонах, ноутбуках, ПК и других устройствах периферийного уровня. Платформа, представленная 24 августа совместно с Artificial Analysis, рассматривает единицей измерения не саму модель, а её полноценное развертывание — модель, квантизацию, среду выполнения, устройство и рабочую нагрузку. 3
1
Такой подход важен для локального ИИ. Одна и та же модель может работать с разной скоростью и потреблять разный объём памяти в зависимости от формата сжатия, версии runtime, выбранного бэкенда и конкретного чипа.
Многие рейтинги ИИ сосредоточены на способности модели решать задачи или приводят одну цифру скорости генерации. Pipette пытается показать, как ведёт себя вся система в реальном сценарии запуска.
Изменение квантизации, среды выполнения, нагрузки на память или аппаратного бэкенда способно заметно повлиять на результат, даже если веса модели остались прежними. Поэтому в Pipette сравниваются конкретные конфигурации, а не абстрактные «модели вообще».
На момент запуска Liquid AI опубликовала набор лабораторно проверенных данных более чем по 1 000 конфигурациям, включающим модели, форматы квантизации, runtime, устройства и длину контекста. В начальный набор вошли более 30 моделей, несколько форматов квантизации и сборки llama.cpp для macOS, iOS, Windows и Android. Стандартизированные тесты охватывают контекст от 256 до 8 192 токенов. 3
Инфраструктура Pipette также дополняется оценкой «интеллекта» мобильных моделей от Artificial Analysis. В результате можно смотреть не только на скорость и эффективность запуска, но и на то, насколько хорошо модель справляется с поставленными задачами. 33
Для смартфонов доступны нативные клиенты Pipette для iOS и Android. Более широкая база результатов включает macOS и Windows через поддерживаемые сборки runtime. Среди референсных устройств запуска упоминаются iPhone 17 Pro, Galaxy S26 Ultra и MacBook Pro с чипом M5 Max. 3
38
Перед тестированием модель необходимо скачать на устройство. Это означает, что Pipette измеряет локальный запуск и не учитывает задержку обращения к облачному API. 41
50
В таблице результатов представлены модели семейства Liquid AI LFM2.5 и разработки сторонних компаний. Среди примеров — Gemma, Nanbeige, Granite, Qwen и другие небольшие или сжатые модели. 9
41
Pipette поддерживает несколько форматов квантизации — способа уменьшить размер модели и требования к памяти за счёт представления её чисел с меньшей точностью. В мобильном сравнении основное внимание уделялось моделям, которые после 4-битной квантизации укладываются в 8 ГБ. Это делает тест особенно актуальным для смартфонов с ограниченным объёмом оперативной памяти. 3
41
В документации Liquid AI отдельно рассматриваются два популярных формата локального запуска. GGUF широко используется с llama.cpp на CPU и GPU, а MLX предназначен прежде всего для устройств Apple с чипами Apple Silicon. 47 При этом размер файла модели — лишь часть картины: итоговую скорость определяют также runtime и аппаратный бэкенд.
Публичный набор Pipette содержит стандартизированные конфигурации с длиной контекста от 256 до 8 192 токенов. 3 В отдельной оценке мобильного «интеллекта» Artificial Analysis использовалось ограничение в 16K токенов.
33
Эти значения не следует путать с максимальным контекстным окном самой модели. В документации Liquid AI для многих LFM указано до 32K токенов, а для LFM2.5-8B-A1B — до 128K. Однако заявленная возможностями модели длина контекста не означает, что любой смартфон будет тестироваться на таком объёме. 47
Pipette не сводит оценку к скорости декодирования. Набор включает пять ключевых показателей производительности:
Это позволяет увидеть разницу между быстрым продолжением генерации и действительно отзывчивым помощником. Модель может выдавать много токенов в секунду, но долго готовиться к ответу, занимать слишком много памяти или заметно замедляться при увеличении контекста.
Для оценки качества Artificial Analysis использует тесты на следование инструкциям, работу с инструментами, рассуждение и другие способности моделей. 33
Каждый результат привязан к явно указанной конфигурации, а протоколы проверенных тестов опубликованы. На публичной панели есть отдельные представления для рейтинга, подробных результатов и отправленных измерений. Это позволяет изучать исходные строки бенчмарка, а не ориентироваться только на итоговое место в таблице. 1
Методика также фиксирует программные зависимости. Например, текущие публичные результаты требуют определённых сборок llama.cpp, включая b10216 и b10516. 2 Фиксация версии runtime помогает не принять изменения в программном обеспечении за улучшение модели или аппаратной платформы.
Однако даже такой подход не устраняет все источники разброса. На результат смартфона могут влиять нагрев и троттлинг, состояние операционной системы, доступная память, прошивка, выбранный бэкенд и ограничения длительного энергопотребления. Корректно сравнивать показатели можно только при совпадении этих условий.
Первые результаты хорошо демонстрируют, почему Pipette публикует данные по конкретным конфигурациям, а не универсальный рейтинг моделей.
Главный вывод: качество, скорость, задержка и потребление памяти могут двигаться в разных направлениях. Самая быстрая модель не обязательно самая способная, а лучшая по качеству модель не обязательно обеспечит лучший пользовательский опыт на смартфоне.
Ключевое ограничение первого мобильного релиза связано с разницей между клиентами. Версия для iOS умеет использовать GPU через экосистему Apple Metal, включая MLX. Первоначальная версия Android была ограничена вычислениями на CPU. 41
50
Поэтому результат iPhone, полученный через MLX/Metal, и показатель Android при работе только на CPU не являются чистым сравнением всей вычислительной начинки смартфонов. В случае iOS измерение может использовать ускорение GPU, тогда как результат Android отражает возможности процессорного пути, доступного текущему клиенту.
Показатели Android всё равно полезны: они позволяют оценить локальный запуск на CPU и опыт, который даёт конкретная реализация. Но на их основании нельзя утверждать, что искусственный интеллект в одном смартфоне в целом быстрее, чем в другом. Для честного межплатформенного сравнения нужны эквивалентные GPU- или NPU-бэкенды и одинаковая рабочая нагрузка.
Запуск бенчмарка совпал с активным продвижением производителями чипов более быстрой локальной и агентной обработки ИИ. Qualcomm заявляет, что платформа Snapdragon 8 Elite Gen 5 использует процессор Oryon третьего поколения с частотой до 4,74 ГГц, обеспечивая прирост производительности CPU на 20% и энергоэффективности CPU на 35%. 24
Компания также предварительно представила следующую флагманскую платформу Snapdragon с процессором Oryon, рассчитанным на частоту до 5 ГГц, и архитектурой FlexCache. Она позволяет разнородным ядрам динамически использовать общий пул кэш-памяти. 23
Эти характеристики показывают, что локальный ИИ становится частью аппаратной гонки. Но одна только тактовая частота не позволяет предсказать скорость языковой модели. Не меньшее значение имеют пропускная способность памяти, поведение кэша, квантизация, реализация runtime, использование GPU или NPU, температура и ограничения длительной мощности.
Именно поэтому конфигурационный подход Pipette может оказаться особенно полезным. В перспективе он позволит проверить, превращается ли заявленное улучшение чипа в более быстрый, отзывчивый и экономичный локальный ИИ при воспроизводимой нагрузке.
Пока Pipette стоит воспринимать прежде всего как прозрачный бенчмарк развертывания. Это не окончательный рейтинг аппаратного превосходства iPhone над Android или наоборот, а инструмент для понимания того, как конкретная модель работает в конкретной программно-аппаратной связке.
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
Pipette, выпущенный 24 августа, оценивает полную конфигурацию локального ИИ, а не только параметры модели.
Pipette, выпущенный 24 августа, оценивает полную конфигурацию локального ИИ, а не только параметры модели. Бенчмарк поддерживает iOS и Android, локальный запуск моделей, разные форматы квантизации и сборки llama.cpp для macOS, iOS, Windows и Android.
В первой оценке с ограничением контекста 16K токенов Nanbeige4.2 3B и LFM2.5 2.6B разделили первое место со средним результатом 63.