Rilasciata il 24 agosto in collaborazione con Artificial Analysis, Pipette valuta implementazioni complete di IA eseguite localmente. Il dataset iniziale comprende oltre 1.000 configurazioni, più di 30 modelli, diversi formati di quantizzazione, build di llama.cpp e contesti da 256 a 8.192 token.
Pubblicato daModificato con GPT-5.6 LunaImmagini generate con GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open-source on-device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open-source benchmark suite for measuring an actual on-device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload. Released August 24 wi. Topic tags: general, general web, user generated, academic, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wa
Pipette è la suite open source di Liquid AI per valutare i modelli di intelligenza artificiale nel luogo in cui vengono realmente eseguiti: smartphone, portatili, PC e altri dispositivi edge. Presentata il 24 agosto in collaborazione con Artificial Analysis, considera come unità di misura l’implementazione completa, non i soli pesi del modello. 3
1
In pratica, ogni risultato è legato alla combinazione di modello, quantizzazione, runtime, dispositivo e carico di lavoro. Cambiare il formato numerico, il motore di esecuzione, il backend o l’hardware può modificare sensibilmente le prestazioni anche quando il modello resta invariato.
Molte leaderboard riportano soprattutto punteggi di capacità oppure un singolo valore di velocità d’inferenza. Pipette prova invece a descrivere il comportamento dell’intero sistema in una situazione di utilizzo reale.
Il rilascio iniziale include un dataset pubblico di risultati verificati in laboratorio relativo a oltre 1.000 configurazioni tra modello, quantizzazione, runtime, dispositivo e contesto. I dati coprono più di 30 modelli, diversi formati di quantizzazione, build di llama.cpp per macOS, iOS, Windows e Android e lunghezze del contesto comprese tra 256 e 8.192 token. 3
Artificial Analysis aggiunge la valutazione dell’“intelligenza” dei modelli mobili, mentre Liquid AI misura le prestazioni d’inferenza. La collaborazione permette quindi di osservare sia la qualità delle risposte sia la rapidità e l’efficienza con cui una specifica implementazione opera sul dispositivo. 33
Pipette offre client nativi per iOS e Android, così da eseguire i modelli direttamente su uno smartphone. La copertura più ampia del benchmark comprende anche macOS e Windows tramite runtime supportati. Tra i dispositivi di riferimento indicati nei materiali di lancio figurano iPhone 17 Pro, Galaxy S26 Ultra e MacBook Pro con chip M5 Max. 3
38
Prima del test, il modello deve essere scaricato sul dispositivo. Pipette misura dunque l’inferenza locale, non il tempo di risposta di un’API cloud. 41
50
La leaderboard include la famiglia LFM2.5 di Liquid AI e modelli di altri sviluppatori, tra cui varianti di Gemma, Nanbeige, Granite, Qwen e altri modelli di piccole dimensioni o compressi. 9
41
Il benchmark supporta più formati di quantizzazione. Il confronto sull’intelligenza mobile si è concentrato sui modelli che, dopo la quantizzazione a 4 bit, rientrano in 8 GB, una soglia pensata per rappresentare i limiti di memoria degli smartphone. 3
41
Per l’esecuzione locale, la documentazione di Liquid distingue tra GGUF, utilizzato comunemente con llama.cpp su obiettivi CPU e GPU, e MLX, pensato per le implementazioni su Apple Silicon. 47 La dimensione del file quantizzato, quindi, racconta solo una parte della storia: sono il runtime e il backend hardware a determinare come il modello viene elaborato.
Il dataset di lancio usa configurazioni standardizzate con contesti da 256 a 8.192 token. 3 La valutazione separata di Artificial Analysis sull’intelligenza mobile utilizza invece un limite di 16K token.
33
Questi valori non vanno confusi con la finestra di contesto massima dichiarata per un modello. La documentazione di Liquid indica contesti da 32K token per molti modelli LFM e da 128K per LFM2.5-8B-A1B, ma la capacità teorica di un modello non significa che ogni test su smartphone venga eseguito a quella lunghezza. 47
Pipette non riduce il risultato alla sola velocità di generazione. Le cinque metriche principali comprendono:
La distinzione è importante: un modello può generare token molto rapidamente, ma impiegare troppo tempo prima di iniziare, consumare una quantità eccessiva di memoria oppure rallentare quando il contesto si allunga. Il tempo complessivo di risposta è spesso il dato più vicino all’esperienza percepita da chi usa un assistente locale.
Artificial Analysis copre invece il versante qualitativo con prove che includono rispetto delle istruzioni, uso degli strumenti, ragionamento e altre capacità. 33
Ogni risultato è associato a una configurazione esplicita e ai protocolli pubblicati per produrre i dati verificati. La dashboard separa leaderboard, risultati dettagliati e invii dei benchmark, consentendo di esaminare le singole righe dei test invece di affidarsi soltanto a una classifica sintetica. 1
La metodologia registra anche le dipendenze software. Liquid AI, per esempio, segnala che gli attuali risultati pubblici richiedono specifiche build di llama.cpp, tra cui b10216 e b10516. 2 Fissare il runtime aiuta a evitare che un aggiornamento del software venga scambiato per un miglioramento del modello o dell’hardware.
Queste precauzioni aumentano la comparabilità, ma non eliminano tutte le variabili. Temperatura, riduzione automatica delle frequenze, stato del sistema operativo, memoria disponibile, firmware, backend selezionato e limiti di alimentazione prolungata possono influire sul risultato di uno smartphone. Un punteggio è significativo soprattutto quando queste condizioni coincidono.
I dati iniziali mostrano perché Pipette pubblica configurazioni complete invece di proporre una graduatoria universale dei modelli.
La lezione è semplice: qualità, velocità, latenza e memoria possono muoversi in direzioni diverse. Il modello più rapido non è automaticamente il più capace, così come quello con il punteggio qualitativo più alto non è necessariamente la scelta migliore per un’applicazione su smartphone.
Il limite più rilevante del primo rilascio mobile riguarda la differenza tra i due client. La versione iOS può usare l’elaborazione GPU attraverso l’ecosistema Metal di Apple, incluso MLX. La versione Android, invece, inizialmente era limitata all’inferenza sulla CPU. 41
50
Di conseguenza, confrontare direttamente un risultato ottenuto su iPhone con MLX/Metal e uno ottenuto su Android in modalità solo CPU non equivale a mettere a confronto l’intero hardware dedicato all’IA dei due telefoni. Il test iOS può beneficiare dell’accelerazione GPU, mentre quello Android riflette il percorso CPU esposto dal client attuale.
I risultati Android restano utili per capire l’inferenza locale basata sulla CPU e l’esperienza offerta da quella specifica implementazione. Non consentono però di dichiarare quale smartphone possieda il silicio IA complessivamente più veloce, almeno finché non verranno testati backend GPU o NPU equivalenti con lo stesso carico di lavoro.
Pipette arriva mentre i produttori di chip promuovono prestazioni sempre maggiori per l’elaborazione locale e per i carichi di lavoro agentici. Qualcomm indica per la piattaforma Snapdragon 8 Elite Gen 5 una CPU Oryon di terza generazione con frequenza fino a 4,74 GHz, oltre a miglioramenti dichiarati del 20% nelle prestazioni CPU e del 35% nell’efficienza energetica della CPU. 24
Qualcomm ha inoltre anticipato una successiva piattaforma Snapdragon di punta con CPU Oryon destinata a raggiungere i 5 GHz e con architettura FlexCache, che consente ai core eterogenei di condividere una cache allocata dinamicamente. 23
Questi annunci spiegano perché l’IA on-device stia diventando anche una competizione hardware, ma la frequenza di clock da sola non basta a prevedere le prestazioni di un modello linguistico. Contano anche quantizzazione, banda di memoria, comportamento della cache, implementazione del runtime, uso di GPU o NPU, temperatura e potenza sostenuta nel tempo.
È proprio qui che l’approccio basato sulle configurazioni di Pipette può rivelarsi utile. Il suo valore a lungo termine sarà mostrare se un miglioramento dichiarato per un chip si traduce davvero in IA locale più rapida, reattiva ed efficiente in termini di memoria, usando carichi di lavoro riproducibili. Per ora, Pipette va interpretata come un benchmark trasparente dell’implementazione, non come una classifica definitiva dell’hardware iPhone contro Android.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Rilasciata il 24 agosto in collaborazione con Artificial Analysis, Pipette valuta implementazioni complete di IA eseguite localmente.
Rilasciata il 24 agosto in collaborazione con Artificial Analysis, Pipette valuta implementazioni complete di IA eseguite localmente. Il dataset iniziale comprende oltre 1.000 configurazioni, più di 30 modelli, diversi formati di quantizzazione, build di llama.cpp e contesti da 256 a 8.192 token.
Tra i risultati iniziali figurano 48,37 token generati al secondo per Gemma 4 E2B a 4 bit su iPhone 17 Pro con Apple MLX.
Rilasciata il 24 agosto in collaborazione con Artificial Analysis, Pipette valuta implementazioni complete di IA eseguite localmente. Il dataset iniziale comprende oltre 1.000 configurazioni, più di 30 modelli, diversi formati di quantizzazione, build di llama.cpp e contesti da 256 a 8.192 token.
Pubblicato daModificato con GPT-5.6 LunaImmagini generate con GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open-source on-device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open-source benchmark suite for measuring an actual on-device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload. Released August 24 wi. Topic tags: general, general web, user generated, academic, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wa
Pipette è la suite open source di Liquid AI per valutare i modelli di intelligenza artificiale nel luogo in cui vengono realmente eseguiti: smartphone, portatili, PC e altri dispositivi edge. Presentata il 24 agosto in collaborazione con Artificial Analysis, considera come unità di misura l’implementazione completa, non i soli pesi del modello. 3
1
In pratica, ogni risultato è legato alla combinazione di modello, quantizzazione, runtime, dispositivo e carico di lavoro. Cambiare il formato numerico, il motore di esecuzione, il backend o l’hardware può modificare sensibilmente le prestazioni anche quando il modello resta invariato.
Molte leaderboard riportano soprattutto punteggi di capacità oppure un singolo valore di velocità d’inferenza. Pipette prova invece a descrivere il comportamento dell’intero sistema in una situazione di utilizzo reale.
Il rilascio iniziale include un dataset pubblico di risultati verificati in laboratorio relativo a oltre 1.000 configurazioni tra modello, quantizzazione, runtime, dispositivo e contesto. I dati coprono più di 30 modelli, diversi formati di quantizzazione, build di llama.cpp per macOS, iOS, Windows e Android e lunghezze del contesto comprese tra 256 e 8.192 token. 3
Artificial Analysis aggiunge la valutazione dell’“intelligenza” dei modelli mobili, mentre Liquid AI misura le prestazioni d’inferenza. La collaborazione permette quindi di osservare sia la qualità delle risposte sia la rapidità e l’efficienza con cui una specifica implementazione opera sul dispositivo. 33
Pipette offre client nativi per iOS e Android, così da eseguire i modelli direttamente su uno smartphone. La copertura più ampia del benchmark comprende anche macOS e Windows tramite runtime supportati. Tra i dispositivi di riferimento indicati nei materiali di lancio figurano iPhone 17 Pro, Galaxy S26 Ultra e MacBook Pro con chip M5 Max. 3
38
Prima del test, il modello deve essere scaricato sul dispositivo. Pipette misura dunque l’inferenza locale, non il tempo di risposta di un’API cloud. 41
50
La leaderboard include la famiglia LFM2.5 di Liquid AI e modelli di altri sviluppatori, tra cui varianti di Gemma, Nanbeige, Granite, Qwen e altri modelli di piccole dimensioni o compressi. 9
41
Il benchmark supporta più formati di quantizzazione. Il confronto sull’intelligenza mobile si è concentrato sui modelli che, dopo la quantizzazione a 4 bit, rientrano in 8 GB, una soglia pensata per rappresentare i limiti di memoria degli smartphone. 3
41
Per l’esecuzione locale, la documentazione di Liquid distingue tra GGUF, utilizzato comunemente con llama.cpp su obiettivi CPU e GPU, e MLX, pensato per le implementazioni su Apple Silicon. 47 La dimensione del file quantizzato, quindi, racconta solo una parte della storia: sono il runtime e il backend hardware a determinare come il modello viene elaborato.
Il dataset di lancio usa configurazioni standardizzate con contesti da 256 a 8.192 token. 3 La valutazione separata di Artificial Analysis sull’intelligenza mobile utilizza invece un limite di 16K token.
33
Questi valori non vanno confusi con la finestra di contesto massima dichiarata per un modello. La documentazione di Liquid indica contesti da 32K token per molti modelli LFM e da 128K per LFM2.5-8B-A1B, ma la capacità teorica di un modello non significa che ogni test su smartphone venga eseguito a quella lunghezza. 47
Pipette non riduce il risultato alla sola velocità di generazione. Le cinque metriche principali comprendono:
La distinzione è importante: un modello può generare token molto rapidamente, ma impiegare troppo tempo prima di iniziare, consumare una quantità eccessiva di memoria oppure rallentare quando il contesto si allunga. Il tempo complessivo di risposta è spesso il dato più vicino all’esperienza percepita da chi usa un assistente locale.
Artificial Analysis copre invece il versante qualitativo con prove che includono rispetto delle istruzioni, uso degli strumenti, ragionamento e altre capacità. 33
Ogni risultato è associato a una configurazione esplicita e ai protocolli pubblicati per produrre i dati verificati. La dashboard separa leaderboard, risultati dettagliati e invii dei benchmark, consentendo di esaminare le singole righe dei test invece di affidarsi soltanto a una classifica sintetica. 1
La metodologia registra anche le dipendenze software. Liquid AI, per esempio, segnala che gli attuali risultati pubblici richiedono specifiche build di llama.cpp, tra cui b10216 e b10516. 2 Fissare il runtime aiuta a evitare che un aggiornamento del software venga scambiato per un miglioramento del modello o dell’hardware.
Queste precauzioni aumentano la comparabilità, ma non eliminano tutte le variabili. Temperatura, riduzione automatica delle frequenze, stato del sistema operativo, memoria disponibile, firmware, backend selezionato e limiti di alimentazione prolungata possono influire sul risultato di uno smartphone. Un punteggio è significativo soprattutto quando queste condizioni coincidono.
I dati iniziali mostrano perché Pipette pubblica configurazioni complete invece di proporre una graduatoria universale dei modelli.
La lezione è semplice: qualità, velocità, latenza e memoria possono muoversi in direzioni diverse. Il modello più rapido non è automaticamente il più capace, così come quello con il punteggio qualitativo più alto non è necessariamente la scelta migliore per un’applicazione su smartphone.
Il limite più rilevante del primo rilascio mobile riguarda la differenza tra i due client. La versione iOS può usare l’elaborazione GPU attraverso l’ecosistema Metal di Apple, incluso MLX. La versione Android, invece, inizialmente era limitata all’inferenza sulla CPU. 41
50
Di conseguenza, confrontare direttamente un risultato ottenuto su iPhone con MLX/Metal e uno ottenuto su Android in modalità solo CPU non equivale a mettere a confronto l’intero hardware dedicato all’IA dei due telefoni. Il test iOS può beneficiare dell’accelerazione GPU, mentre quello Android riflette il percorso CPU esposto dal client attuale.
I risultati Android restano utili per capire l’inferenza locale basata sulla CPU e l’esperienza offerta da quella specifica implementazione. Non consentono però di dichiarare quale smartphone possieda il silicio IA complessivamente più veloce, almeno finché non verranno testati backend GPU o NPU equivalenti con lo stesso carico di lavoro.
Pipette arriva mentre i produttori di chip promuovono prestazioni sempre maggiori per l’elaborazione locale e per i carichi di lavoro agentici. Qualcomm indica per la piattaforma Snapdragon 8 Elite Gen 5 una CPU Oryon di terza generazione con frequenza fino a 4,74 GHz, oltre a miglioramenti dichiarati del 20% nelle prestazioni CPU e del 35% nell’efficienza energetica della CPU. 24
Qualcomm ha inoltre anticipato una successiva piattaforma Snapdragon di punta con CPU Oryon destinata a raggiungere i 5 GHz e con architettura FlexCache, che consente ai core eterogenei di condividere una cache allocata dinamicamente. 23
Questi annunci spiegano perché l’IA on-device stia diventando anche una competizione hardware, ma la frequenza di clock da sola non basta a prevedere le prestazioni di un modello linguistico. Contano anche quantizzazione, banda di memoria, comportamento della cache, implementazione del runtime, uso di GPU o NPU, temperatura e potenza sostenuta nel tempo.
È proprio qui che l’approccio basato sulle configurazioni di Pipette può rivelarsi utile. Il suo valore a lungo termine sarà mostrare se un miglioramento dichiarato per un chip si traduce davvero in IA locale più rapida, reattiva ed efficiente in termini di memoria, usando carichi di lavoro riproducibili. Per ora, Pipette va interpretata come un benchmark trasparente dell’implementazione, non come una classifica definitiva dell’hardware iPhone contro Android.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Rilasciata il 24 agosto in collaborazione con Artificial Analysis, Pipette valuta implementazioni complete di IA eseguite localmente.
Rilasciata il 24 agosto in collaborazione con Artificial Analysis, Pipette valuta implementazioni complete di IA eseguite localmente. Il dataset iniziale comprende oltre 1.000 configurazioni, più di 30 modelli, diversi formati di quantizzazione, build di llama.cpp e contesti da 256 a 8.192 token.
Tra i risultati iniziali figurano 48,37 token generati al secondo per Gemma 4 E2B a 4 bit su iPhone 17 Pro con Apple MLX.