Pipette est une suite de benchmarks gratuite et open source qui mesure une configuration complète : modèle, quantification, runtime, appareil et charge de travail. Lancée le 24 août 2026 avec Artificial Analysis, elle combine mesures d’inférence et évaluation de l’intelligence des modèles mobiles.
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open source on device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open source benchmark suite for measuring an actual on device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload.. Topic tags: general web, llm, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait
Pipette est la suite de benchmarks gratuite et open source de Liquid AI destinée à mesurer les performances d’un modèle d’IA une fois installé sur un appareil. Son unité de comparaison n’est donc pas le modèle seul, mais l’ensemble formé par le modèle, sa quantification, le moteur d’inférence, l’appareil et la charge de travail. Lancée le 24 août 2026 en partenariat avec Artificial Analysis, la plateforme associe les mesures d’inférence de Liquid AI à l’évaluation de l’intelligence des modèles réalisée par Artificial Analysis. 119
La version publique comprend :
Pipette mesure notamment les performances de préremplissage — le traitement initial de la requête — et de génération, le délai avant le premier token, le temps de réponse total ainsi que la mémoire utilisée. Une vitesse élevée de génération ne suffit donc pas à obtenir un bon score : la latence de démarrage et l’empreinte mémoire comptent également. 411
Pipette propose des clients pour iOS et Android. Les modèles sont téléchargés puis exécutés localement sur le smartphone ou l’ordinateur testé, plutôt que traités sur un serveur distant. 108
Les premiers modèles évalués comprennent la famille LFM de Liquid AI, ainsi que des modèles tiers de petite taille comme Gemma et Nanbeige. Pour la comparaison d’intelligence mobile publiée au lancement, Artificial Analysis a retenu des modèles capables de tenir dans 8 Go de mémoire lorsqu’ils sont quantifiés en 4 bits. 108
La plateforme s’appuie notamment sur des moteurs et formats adaptés à l’exécution locale. La documentation de Liquid AI cite le format GGUF pour l’inférence CPU ou GPU avec des outils comme llama.cpp, ainsi que le format MLX pour les appareils équipés de puces Apple. 2 Sur iOS, Pipette permet notamment de choisir entre llama.cpp et MLX ; la version Android initiale utilise uniquement le CPU. 10
Les résultats publics reposent par ailleurs sur des versions précises de llama.cpp, notamment les builds b10216 et b10516. Cette contrainte évite qu’une mise à jour du runtime modifie discrètement les résultats. 6
Les tests d’intelligence mobile publiés utilisent une limite de contexte de 16 000 tokens. Il ne faut pas la confondre avec la capacité maximale des modèles : plusieurs modèles LFM annoncent 32 000 tokens, tandis que le LFM2.5-8B-A1B peut aller jusqu’à 128 000 tokens. Ces valeurs décrivent les capacités des modèles, pas nécessairement la charge de travail standardisée du benchmark initial. 82
La principale force de Pipette est sa transparence méthodologique. Les résultats sont rattachés à une configuration complète, issus de tests vérifiés en laboratoire et accompagnés de protocoles de reproductibilité publiés. Le tableau de classement permet de comparer les configurations, tandis que les pages de résultats et de soumissions permettent de remonter aux mesures utilisées. 411
Cette approche est plus informative qu’un simple chiffre de « tokens par seconde » communiqué par un fabricant. Elle ne supprime toutefois pas toutes les sources de variation : température de l’appareil, état du système d’exploitation, quantité de mémoire, référence exacte du produit, moteur utilisé et limites de puissance peuvent encore modifier les performances. Deux résultats ne sont réellement comparables que si ces paramètres correspondent.
Ce dernier point est essentiel. Les chiffres de débit d’un iPhone et d’un smartphone Android ne constituent pas encore une comparaison directe de leurs composants. Les résultats Apple peuvent bénéficier d’une accélération GPU, tandis que les résultats Android mesurent l’inférence CPU avec le backend actuellement disponible. Ils peuvent donc renseigner sur les performances et l’expérience d’usage dans cette configuration, mais ne permettent pas de conclure qu’un appareil possède, dans l’ensemble, un matériel d’IA local plus rapide qu’un autre. 104
Une prise en charge des NPU et de backends Android accélérés — notamment par GPU ou NPU — sera nécessaire pour établir des comparaisons réellement équilibrées entre plateformes.
Le lancement intervient alors que les fabricants de puces mettent l’accent sur les usages d’IA locale et les tâches dites « agentiques », capables d’enchaîner plusieurs actions. Qualcomm affirme que le CPU Oryon de troisième génération de son Snapdragon 8 Elite Gen 5 atteint 4,74 GHz et annonce, pour cette plateforme, des gains de 20 % en performances CPU et de 35 % en efficacité énergétique du CPU. 14
Qualcomm a également présenté les grandes lignes d’un Snapdragon haut de gamme ultérieur doté d’un CPU Oryon visant 5 GHz et d’une architecture de cache FlexCache, qui répartit dynamiquement le cache entre les cœurs. Ces annonces illustrent la recherche d’une IA locale plus rapide et plus réactive, mais la fréquence d’horloge ne suffit pas à prédire les performances d’un grand modèle de langage. La bande passante mémoire, le comportement du cache, la quantification, le runtime, le backend GPU ou NPU, la température et la puissance soutenue jouent aussi un rôle. 913
Liquid AI indique vouloir élargir la couverture des appareils et ajouter des tests accélérés par NPU. Cette évolution rendrait Pipette encore plus utile : elle permettrait de distinguer les gains provenant du CPU de ceux apportés par le GPU ou le NPU, à charge de travail comparable. En l’état, Pipette doit surtout être considéré comme un benchmark transparent de déploiement local, et non comme un classement définitif de la puissance matérielle des smartphones. 64
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Pipette est une suite de benchmarks gratuite et open source qui mesure une configuration complète : modèle, quantification, runtime, appareil et charge de travail.
Pipette est une suite de benchmarks gratuite et open source qui mesure une configuration complète : modèle, quantification, runtime, appareil et charge de travail. Lancée le 24 août 2026 avec Artificial Analysis, elle combine mesures d’inférence et évaluation de l’intelligence des modèles mobiles.
Sa base publique rassemble plus de 1 000 configurations vérifiées en laboratoire, cinq métriques de performance, plus de 30 modèles, sept options de quantification et quatre appareils de départ.