O Pipette é uma suíte gratuita e de código aberto que mede uma implantação completa de IA no dispositivo — não apenas o modelo. A avaliação combina modelo, formato de quantização, runtime, aparelho e carga de trabalho, com cinco métricas de desempenho.
Publicado porImagens geradas com GPT Image 1.5
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open source on device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open source benchmark suite for measuring an actual on device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload.. Topic tags: general web, llm, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait
O Pipette é uma suíte de benchmark gratuita e de código aberto criada pela Liquid AI para medir como modelos de inteligência artificial funcionam quando são executados localmente em celulares e outros dispositivos. A plataforma foi lançada em 24 de agosto de 2026 em parceria com a Artificial Analysis. 11
9
A principal diferença em relação a rankings tradicionais é que o Pipette não trata o modelo como uma unidade isolada. Ele avalia a combinação completa de modelo, quantização, runtime, dispositivo e carga de trabalho. Na prática, isso mostra o desempenho de uma implantação específica — e não uma suposta velocidade universal de determinado modelo. 4
11
O lançamento inclui um conjunto de dados com mais de 1.000 configurações verificadas em laboratório. O leaderboard reúne mais de 30 modelos, sete opções de quantização e quatro dispositivos iniciais. 11
4
As cinco métricas de desempenho abrangem:
Essa abordagem evita que uma única cifra de “tokens por segundo” seja usada como retrato completo da experiência. Um aparelho pode gerar tokens rapidamente, mas ainda apresentar alta latência inicial, consumir muita memória ou demorar para concluir uma resposta.
O Pipette oferece clientes para iOS e Android e executa modelos baixados no próprio aparelho, em vez de enviar as solicitações para um endpoint na nuvem. A cobertura inicial inclui a família de modelos LFM, da Liquid AI, e modelos pequenos de terceiros, como Gemma e Nanbeige. 10
8
Os resultados públicos iniciais também abrangem builds do llama.cpp para macOS, iOS, Windows e Android. Os contextos padronizados do conjunto de dados publicado variam de 256 a 8.192 tokens. 11
É importante não confundir esses limites com a capacidade máxima dos modelos. A biblioteca LFM inclui modelos com contexto de 32 mil tokens e o LFM2.5-8B-A1B chega a 128 mil tokens. Esses números descrevem as capacidades dos modelos, não necessariamente o tamanho da tarefa padronizada usada pelo benchmark inicial. 2
O Pipette testa modelos quantizados em diferentes configurações. Quantização é o processo de reduzir a precisão numérica dos parâmetros de um modelo para diminuir o uso de memória e, potencialmente, acelerar a execução local. O lançamento informa sete opções de quantização no leaderboard, mas o resultado depende também do runtime e do dispositivo usados. 4
11
Entre os modelos avaliados estão variantes da linha LFM, Gemma 4 E2B, Nanbeige4.2-3B e outros modelos pequenos. A comparação de inteligência móvel foi concentrada em modelos que cabem em até 8 GB quando convertidos para quantização de 4 bits. 8
A Liquid AI também documenta formatos voltados a diferentes ambientes. O GGUF é indicado para inferência local com CPU ou GPU em várias plataformas, enquanto o MLX é voltado principalmente a Macs com Apple Silicon. 2
O Pipette associa cada resultado a uma configuração explícita e publica protocolos de reprodução. As medições vêm de execuções verificadas em laboratório, e as dependências de software são especificadas. Atualmente, por exemplo, os resultados públicos de desempenho exigem versões determinadas do llama.cpp, incluindo as builds b10216 e b10516. 4
11
6
Isso torna a comparação mais transparente do que um número de desempenho divulgado isoladamente por um fabricante. Ainda assim, o benchmark não elimina todas as variações. Temperatura, estado do sistema operacional, versão e quantidade de memória do aparelho, backend utilizado e limites de consumo sustentado podem alterar o resultado.
Por isso, dois números só são realmente comparáveis quando correspondem à mesma combinação de modelo, quantização, runtime, aparelho e carga de trabalho.
Um dos resultados divulgados foi de 48,37 tokens por segundo na geração para o Gemma 4 E2B em quantização de 4 bits, usando Apple MLX em um iPhone 17 Pro. O dado é relevante para essa configuração específica — Gemma 4 E2B, 4 bits, MLX/Metal e iPhone 17 Pro —, mas não deve ser interpretado como uma nota universal para o modelo ou para qualquer celular. 4
5
Na avaliação de inteligência móvel com contexto limitado a 16 mil tokens, Nanbeige4.2-3B e LFM2.5-2.6B dividiram a liderança, com média de 63 pontos. 9
8
Há, porém, uma ressalva importante na comparação entre plataformas:
Assim, os números atuais de throughput entre iPhone e Android não constituem uma comparação limpa entre os chips dos aparelhos. O resultado do iPhone pode incluir aceleração por GPU, enquanto o Android avalia inferência na CPU. Os dados ainda podem ser úteis para entender o desempenho e a experiência sob cada backend, mas não provam que o hardware total de um celular seja inerentemente mais rápido que o de outro. 10
4
A inclusão de backends Android com GPU ou NPU será necessária para uma comparação multiplataforma mais equilibrada.
A chegada do Pipette ocorre em um momento em que fabricantes de chips destacam o desempenho de cargas locais e de aplicações com agentes de IA. A Qualcomm afirma que a terceira geração da CPU Oryon do Snapdragon 8 Elite Gen 5 alcança 4,74 GHz e promete ganhos de 20% no desempenho da CPU e de 35% na eficiência energética da CPU. 7
A empresa também antecipou uma futura plataforma Snapdragon topo de linha com CPU Oryon voltada a 5 GHz e uma arquitetura de cache chamada FlexCache, que distribui dinamicamente o cache entre os núcleos. Essas informações apontam para uma corrida por cargas locais mais rápidas e responsivas, mas a frequência do processador, sozinha, não determina o desempenho de inferência de um modelo de linguagem. Runtime, largura de banda da memória, comportamento do cache, quantização, backend de GPU ou NPU, temperatura e limites de energia sustentada também pesam. 7
12
A direção anunciada pela Liquid AI — ampliar a cobertura de dispositivos e incluir testes acelerados por NPU — pode tornar o Pipette ainda mais útil. Com isso, seria possível separar melhor ganhos obtidos pela CPU daqueles proporcionados por GPU e NPU em cargas de trabalho comuns. Até lá, a interpretação mais segura é considerar o Pipette um benchmark transparente de implantações completas, e não um ranking definitivo do melhor hardware entre plataformas. 6
4
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
O Pipette é uma suíte gratuita e de código aberto que mede uma implantação completa de IA no dispositivo — não apenas o modelo.
O Pipette é uma suíte gratuita e de código aberto que mede uma implantação completa de IA no dispositivo — não apenas o modelo. A avaliação combina modelo, formato de quantização, runtime, aparelho e carga de trabalho, com cinco métricas de desempenho.
O lançamento reúne mais de 1.000 configurações verificadas em laboratório, 30 ou mais modelos, sete opções de quantização e quatro dispositivos iniciais.
O Pipette é uma suíte gratuita e de código aberto que mede uma implantação completa de IA no dispositivo — não apenas o modelo. A avaliação combina modelo, formato de quantização, runtime, aparelho e carga de trabalho, com cinco métricas de desempenho.
Publicado porImagens geradas com GPT Image 1.5
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open source on device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open source benchmark suite for measuring an actual on device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload.. Topic tags: general web, llm, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait
O Pipette é uma suíte de benchmark gratuita e de código aberto criada pela Liquid AI para medir como modelos de inteligência artificial funcionam quando são executados localmente em celulares e outros dispositivos. A plataforma foi lançada em 24 de agosto de 2026 em parceria com a Artificial Analysis. 11
9
A principal diferença em relação a rankings tradicionais é que o Pipette não trata o modelo como uma unidade isolada. Ele avalia a combinação completa de modelo, quantização, runtime, dispositivo e carga de trabalho. Na prática, isso mostra o desempenho de uma implantação específica — e não uma suposta velocidade universal de determinado modelo. 4
11
O lançamento inclui um conjunto de dados com mais de 1.000 configurações verificadas em laboratório. O leaderboard reúne mais de 30 modelos, sete opções de quantização e quatro dispositivos iniciais. 11
4
As cinco métricas de desempenho abrangem:
Essa abordagem evita que uma única cifra de “tokens por segundo” seja usada como retrato completo da experiência. Um aparelho pode gerar tokens rapidamente, mas ainda apresentar alta latência inicial, consumir muita memória ou demorar para concluir uma resposta.
O Pipette oferece clientes para iOS e Android e executa modelos baixados no próprio aparelho, em vez de enviar as solicitações para um endpoint na nuvem. A cobertura inicial inclui a família de modelos LFM, da Liquid AI, e modelos pequenos de terceiros, como Gemma e Nanbeige. 10
8
Os resultados públicos iniciais também abrangem builds do llama.cpp para macOS, iOS, Windows e Android. Os contextos padronizados do conjunto de dados publicado variam de 256 a 8.192 tokens. 11
É importante não confundir esses limites com a capacidade máxima dos modelos. A biblioteca LFM inclui modelos com contexto de 32 mil tokens e o LFM2.5-8B-A1B chega a 128 mil tokens. Esses números descrevem as capacidades dos modelos, não necessariamente o tamanho da tarefa padronizada usada pelo benchmark inicial. 2
O Pipette testa modelos quantizados em diferentes configurações. Quantização é o processo de reduzir a precisão numérica dos parâmetros de um modelo para diminuir o uso de memória e, potencialmente, acelerar a execução local. O lançamento informa sete opções de quantização no leaderboard, mas o resultado depende também do runtime e do dispositivo usados. 4
11
Entre os modelos avaliados estão variantes da linha LFM, Gemma 4 E2B, Nanbeige4.2-3B e outros modelos pequenos. A comparação de inteligência móvel foi concentrada em modelos que cabem em até 8 GB quando convertidos para quantização de 4 bits. 8
A Liquid AI também documenta formatos voltados a diferentes ambientes. O GGUF é indicado para inferência local com CPU ou GPU em várias plataformas, enquanto o MLX é voltado principalmente a Macs com Apple Silicon. 2
O Pipette associa cada resultado a uma configuração explícita e publica protocolos de reprodução. As medições vêm de execuções verificadas em laboratório, e as dependências de software são especificadas. Atualmente, por exemplo, os resultados públicos de desempenho exigem versões determinadas do llama.cpp, incluindo as builds b10216 e b10516. 4
11
6
Isso torna a comparação mais transparente do que um número de desempenho divulgado isoladamente por um fabricante. Ainda assim, o benchmark não elimina todas as variações. Temperatura, estado do sistema operacional, versão e quantidade de memória do aparelho, backend utilizado e limites de consumo sustentado podem alterar o resultado.
Por isso, dois números só são realmente comparáveis quando correspondem à mesma combinação de modelo, quantização, runtime, aparelho e carga de trabalho.
Um dos resultados divulgados foi de 48,37 tokens por segundo na geração para o Gemma 4 E2B em quantização de 4 bits, usando Apple MLX em um iPhone 17 Pro. O dado é relevante para essa configuração específica — Gemma 4 E2B, 4 bits, MLX/Metal e iPhone 17 Pro —, mas não deve ser interpretado como uma nota universal para o modelo ou para qualquer celular. 4
5
Na avaliação de inteligência móvel com contexto limitado a 16 mil tokens, Nanbeige4.2-3B e LFM2.5-2.6B dividiram a liderança, com média de 63 pontos. 9
8
Há, porém, uma ressalva importante na comparação entre plataformas:
Assim, os números atuais de throughput entre iPhone e Android não constituem uma comparação limpa entre os chips dos aparelhos. O resultado do iPhone pode incluir aceleração por GPU, enquanto o Android avalia inferência na CPU. Os dados ainda podem ser úteis para entender o desempenho e a experiência sob cada backend, mas não provam que o hardware total de um celular seja inerentemente mais rápido que o de outro. 10
4
A inclusão de backends Android com GPU ou NPU será necessária para uma comparação multiplataforma mais equilibrada.
A chegada do Pipette ocorre em um momento em que fabricantes de chips destacam o desempenho de cargas locais e de aplicações com agentes de IA. A Qualcomm afirma que a terceira geração da CPU Oryon do Snapdragon 8 Elite Gen 5 alcança 4,74 GHz e promete ganhos de 20% no desempenho da CPU e de 35% na eficiência energética da CPU. 7
A empresa também antecipou uma futura plataforma Snapdragon topo de linha com CPU Oryon voltada a 5 GHz e uma arquitetura de cache chamada FlexCache, que distribui dinamicamente o cache entre os núcleos. Essas informações apontam para uma corrida por cargas locais mais rápidas e responsivas, mas a frequência do processador, sozinha, não determina o desempenho de inferência de um modelo de linguagem. Runtime, largura de banda da memória, comportamento do cache, quantização, backend de GPU ou NPU, temperatura e limites de energia sustentada também pesam. 7
12
A direção anunciada pela Liquid AI — ampliar a cobertura de dispositivos e incluir testes acelerados por NPU — pode tornar o Pipette ainda mais útil. Com isso, seria possível separar melhor ganhos obtidos pela CPU daqueles proporcionados por GPU e NPU em cargas de trabalho comuns. Até lá, a interpretação mais segura é considerar o Pipette um benchmark transparente de implantações completas, e não um ranking definitivo do melhor hardware entre plataformas. 6
4
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
O Pipette é uma suíte gratuita e de código aberto que mede uma implantação completa de IA no dispositivo — não apenas o modelo.
O Pipette é uma suíte gratuita e de código aberto que mede uma implantação completa de IA no dispositivo — não apenas o modelo. A avaliação combina modelo, formato de quantização, runtime, aparelho e carga de trabalho, com cinco métricas de desempenho.
O lançamento reúne mais de 1.000 configurações verificadas em laboratório, 30 ou mais modelos, sete opções de quantização e quatro dispositivos iniciais.