Pipette è una suite gratuita e open source che valuta una distribuzione completa di IA sul dispositivo: modello, quantizzazione, runtime, hardware e carico di lavoro. Rilasciata il 24 agosto in collaborazione con Artificial Analysis, unisce i test d’inferenza di Liquid AI alla valutazione dell’intelligenza dei model...
Pubblicato daImmagini generate con GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open source on device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open source benchmark suite for measuring an actual on device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload.. Topic tags: general web, llm, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait
Pipette è la suite di benchmark gratuita e open source di Liquid AI per misurare come si comporta un modello di intelligenza artificiale quando viene eseguito davvero su un dispositivo. Non valuta soltanto il modello in astratto: considera l’intera combinazione di modello, quantizzazione, runtime, hardware e carico di lavoro. Il progetto è stato rilasciato il 24 agosto in collaborazione con Artificial Analysis, che ha curato la parte relativa alla valutazione dell’intelligenza dei modelli mobili. 11
9
La release pubblica mette a disposizione un dataset di oltre 1.000 configurazioni verificate in laboratorio e cinque metriche dedicate alle prestazioni on-device. La leaderboard iniziale copre più di 30 modelli, sette opzioni di quantizzazione e quattro dispositivi. 11
4
Pipette dispone di client per iOS e Android e sottopone a test modelli scaricati sul dispositivo, invece di interrogare un servizio cloud. Tra i modelli inizialmente disponibili figurano la famiglia LFM di Liquid AI e modelli compatti di altri sviluppatori, tra cui Gemma e Nanbeige. Per il confronto sull’intelligenza mobile sono stati considerati i modelli che, dopo la quantizzazione a 4 bit, rientrano in 8 GB di memoria. 10
8
Le misurazioni comprendono:
In questo modo, un modello non viene considerato automaticamente migliore solo perché raggiunge un’elevata velocità di generazione: anche latenza, memoria e tempo totale di risposta entrano nel confronto. 4
11
Il benchmark lavora con modelli quantizzati in diversi formati e runtime. Tra le opzioni documentate da Liquid AI ci sono il formato GGUF, adatto all’inferenza locale tramite strumenti come llama.cpp, e MLX, pensato soprattutto per i dispositivi Apple Silicon. 2
5
I test di intelligenza mobile pubblicati da Artificial Analysis utilizzano un limite di contesto di 16.000 token. Il catalogo LFM supporta però contesti diversi: molti modelli arrivano a 32.000 token, mentre LFM2.5-8B-A1B arriva a 128.000. Si tratta delle capacità dichiarate dai singoli modelli, non necessariamente del carico di lavoro standardizzato usato nella prima versione del benchmark. 8
2
Il contributo più interessante di Pipette è metodologico. Ogni risultato è legato a una configurazione completa, proviene da esecuzioni verificate in laboratorio ed è accompagnato da protocolli pubblici per poter ripetere il test. La piattaforma indica anche le dipendenze software: gli attuali risultati pubblici, per esempio, richiedono specifiche build di llama.cpp, tra cui b10216 e b10516. 4
11
6
È un approccio più utile del semplice confronto tra valori isolati di “token al secondo” comunicati dai produttori. Non elimina però tutte le variabili: temperatura del dispositivo, stato del sistema operativo, modello preciso dello smartphone, quantità di RAM, backend utilizzato e limiti di consumo possono influenzare il risultato. Per parlare di confronto corretto, tutte queste condizioni devono essere il più possibile equivalenti.
Tra i dati iniziali spicca il risultato di 48,37 token al secondo in decodifica ottenuto da Gemma 4 E2B a 4 bit su un iPhone 17 Pro utilizzando Apple MLX. Il dato va letto come il risultato di una configurazione precisa — Gemma 4 E2B, quantizzazione a 4 bit, runtime MLX/Metal e iPhone 17 Pro — e non come un punteggio universale per Gemma o per gli smartphone. 4
5
Nella valutazione dell’intelligenza con contesto limitato a 16.000 token, Nanbeige4.2-3B e LFM2.5-2.6B hanno condiviso il primo posto con un punteggio medio di 63. 9
8
C’è però una differenza tecnica importante tra le due piattaforme:
Di conseguenza, i numeri di throughput tra iPhone e Android pubblicati in questa fase non rappresentano un confronto diretto tra i rispettivi chip. I risultati Apple possono beneficiare dell’accelerazione GPU, mentre quelli Android riflettono l’inferenza sulla CPU. Sono quindi utili per valutare le prestazioni e l’esperienza d’uso di quella specifica configurazione, ma non dimostrano che l’hardware complessivo di un telefono sia intrinsecamente più veloce di quello di un altro. 10
4
Per un confronto multipiattaforma più solido serviranno backend Android con accelerazione GPU o NPU equivalenti.
Pipette arriva mentre i produttori di chip puntano sempre di più sull’IA locale e sui carichi di lavoro agentici. Qualcomm sostiene che la CPU Oryon di terza generazione dello Snapdragon 8 Elite Gen 5 raggiunga i 4,74 GHz e dichiara, per la piattaforma, miglioramenti del 20% nelle prestazioni della CPU e del 35% nell’efficienza energetica della CPU. 7
Separatamente, Qualcomm ha anticipato una piattaforma Snapdragon di fascia alta successiva con una CPU Oryon orientata ai 5 GHz e una nuova architettura FlexCache, progettata per condividere dinamicamente la cache tra i core. Questi annunci indicano la ricerca di carichi locali più rapidi e reattivi, ma la frequenza di clock da sola non permette di prevedere le prestazioni nell’inferenza dei modelli linguistici. Contano anche runtime, banda della memoria, comportamento della cache, quantizzazione, backend GPU o NPU, temperatura e limiti di consumo sostenuto. 7
12
Liquid AI ha indicato una direzione futura basata su una copertura più ampia dei dispositivi e sull’integrazione di test accelerati dalla NPU. Sarebbe un passaggio importante, perché permetterebbe di distinguere meglio i miglioramenti ottenuti dalla CPU da quelli dovuti a GPU e NPU, usando carichi di lavoro comuni. Fino ad allora, Pipette va interpretato soprattutto come un benchmark trasparente della distribuzione completa, non come una classifica definitiva dell’hardware mobile. 6
4
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Pipette è una suite gratuita e open source che valuta una distribuzione completa di IA sul dispositivo: modello, quantizzazione, runtime, hardware e carico di lavoro.
Pipette è una suite gratuita e open source che valuta una distribuzione completa di IA sul dispositivo: modello, quantizzazione, runtime, hardware e carico di lavoro. Rilasciata il 24 agosto in collaborazione con Artificial Analysis, unisce i test d’inferenza di Liquid AI alla valutazione dell’intelligenza dei modelli mobili.
Il dataset pubblico comprende oltre 1.000 configurazioni verificate in laboratorio, cinque metriche di prestazione, più di 30 modelli, sette opzioni di quantizzazione e quattro dispositivi iniziali.
Pipette è una suite gratuita e open source che valuta una distribuzione completa di IA sul dispositivo: modello, quantizzazione, runtime, hardware e carico di lavoro. Rilasciata il 24 agosto in collaborazione con Artificial Analysis, unisce i test d’inferenza di Liquid AI alla valutazione dell’intelligenza dei model...
Pubblicato daImmagini generate con GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open source on device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open source benchmark suite for measuring an actual on device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload.. Topic tags: general web, llm, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait
Pipette è la suite di benchmark gratuita e open source di Liquid AI per misurare come si comporta un modello di intelligenza artificiale quando viene eseguito davvero su un dispositivo. Non valuta soltanto il modello in astratto: considera l’intera combinazione di modello, quantizzazione, runtime, hardware e carico di lavoro. Il progetto è stato rilasciato il 24 agosto in collaborazione con Artificial Analysis, che ha curato la parte relativa alla valutazione dell’intelligenza dei modelli mobili. 11
9
La release pubblica mette a disposizione un dataset di oltre 1.000 configurazioni verificate in laboratorio e cinque metriche dedicate alle prestazioni on-device. La leaderboard iniziale copre più di 30 modelli, sette opzioni di quantizzazione e quattro dispositivi. 11
4
Pipette dispone di client per iOS e Android e sottopone a test modelli scaricati sul dispositivo, invece di interrogare un servizio cloud. Tra i modelli inizialmente disponibili figurano la famiglia LFM di Liquid AI e modelli compatti di altri sviluppatori, tra cui Gemma e Nanbeige. Per il confronto sull’intelligenza mobile sono stati considerati i modelli che, dopo la quantizzazione a 4 bit, rientrano in 8 GB di memoria. 10
8
Le misurazioni comprendono:
In questo modo, un modello non viene considerato automaticamente migliore solo perché raggiunge un’elevata velocità di generazione: anche latenza, memoria e tempo totale di risposta entrano nel confronto. 4
11
Il benchmark lavora con modelli quantizzati in diversi formati e runtime. Tra le opzioni documentate da Liquid AI ci sono il formato GGUF, adatto all’inferenza locale tramite strumenti come llama.cpp, e MLX, pensato soprattutto per i dispositivi Apple Silicon. 2
5
I test di intelligenza mobile pubblicati da Artificial Analysis utilizzano un limite di contesto di 16.000 token. Il catalogo LFM supporta però contesti diversi: molti modelli arrivano a 32.000 token, mentre LFM2.5-8B-A1B arriva a 128.000. Si tratta delle capacità dichiarate dai singoli modelli, non necessariamente del carico di lavoro standardizzato usato nella prima versione del benchmark. 8
2
Il contributo più interessante di Pipette è metodologico. Ogni risultato è legato a una configurazione completa, proviene da esecuzioni verificate in laboratorio ed è accompagnato da protocolli pubblici per poter ripetere il test. La piattaforma indica anche le dipendenze software: gli attuali risultati pubblici, per esempio, richiedono specifiche build di llama.cpp, tra cui b10216 e b10516. 4
11
6
È un approccio più utile del semplice confronto tra valori isolati di “token al secondo” comunicati dai produttori. Non elimina però tutte le variabili: temperatura del dispositivo, stato del sistema operativo, modello preciso dello smartphone, quantità di RAM, backend utilizzato e limiti di consumo possono influenzare il risultato. Per parlare di confronto corretto, tutte queste condizioni devono essere il più possibile equivalenti.
Tra i dati iniziali spicca il risultato di 48,37 token al secondo in decodifica ottenuto da Gemma 4 E2B a 4 bit su un iPhone 17 Pro utilizzando Apple MLX. Il dato va letto come il risultato di una configurazione precisa — Gemma 4 E2B, quantizzazione a 4 bit, runtime MLX/Metal e iPhone 17 Pro — e non come un punteggio universale per Gemma o per gli smartphone. 4
5
Nella valutazione dell’intelligenza con contesto limitato a 16.000 token, Nanbeige4.2-3B e LFM2.5-2.6B hanno condiviso il primo posto con un punteggio medio di 63. 9
8
C’è però una differenza tecnica importante tra le due piattaforme:
Di conseguenza, i numeri di throughput tra iPhone e Android pubblicati in questa fase non rappresentano un confronto diretto tra i rispettivi chip. I risultati Apple possono beneficiare dell’accelerazione GPU, mentre quelli Android riflettono l’inferenza sulla CPU. Sono quindi utili per valutare le prestazioni e l’esperienza d’uso di quella specifica configurazione, ma non dimostrano che l’hardware complessivo di un telefono sia intrinsecamente più veloce di quello di un altro. 10
4
Per un confronto multipiattaforma più solido serviranno backend Android con accelerazione GPU o NPU equivalenti.
Pipette arriva mentre i produttori di chip puntano sempre di più sull’IA locale e sui carichi di lavoro agentici. Qualcomm sostiene che la CPU Oryon di terza generazione dello Snapdragon 8 Elite Gen 5 raggiunga i 4,74 GHz e dichiara, per la piattaforma, miglioramenti del 20% nelle prestazioni della CPU e del 35% nell’efficienza energetica della CPU. 7
Separatamente, Qualcomm ha anticipato una piattaforma Snapdragon di fascia alta successiva con una CPU Oryon orientata ai 5 GHz e una nuova architettura FlexCache, progettata per condividere dinamicamente la cache tra i core. Questi annunci indicano la ricerca di carichi locali più rapidi e reattivi, ma la frequenza di clock da sola non permette di prevedere le prestazioni nell’inferenza dei modelli linguistici. Contano anche runtime, banda della memoria, comportamento della cache, quantizzazione, backend GPU o NPU, temperatura e limiti di consumo sostenuto. 7
12
Liquid AI ha indicato una direzione futura basata su una copertura più ampia dei dispositivi e sull’integrazione di test accelerati dalla NPU. Sarebbe un passaggio importante, perché permetterebbe di distinguere meglio i miglioramenti ottenuti dalla CPU da quelli dovuti a GPU e NPU, usando carichi di lavoro comuni. Fino ad allora, Pipette va interpretato soprattutto come un benchmark trasparente della distribuzione completa, non come una classifica definitiva dell’hardware mobile. 6
4
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Pipette è una suite gratuita e open source che valuta una distribuzione completa di IA sul dispositivo: modello, quantizzazione, runtime, hardware e carico di lavoro.
Pipette è una suite gratuita e open source che valuta una distribuzione completa di IA sul dispositivo: modello, quantizzazione, runtime, hardware e carico di lavoro. Rilasciata il 24 agosto in collaborazione con Artificial Analysis, unisce i test d’inferenza di Liquid AI alla valutazione dell’intelligenza dei modelli mobili.
Il dataset pubblico comprende oltre 1.000 configurazioni verificate in laboratorio, cinque metriche di prestazione, più di 30 modelli, sette opzioni di quantizzazione e quattro dispositivi iniziali.