Pipette mesure un déploiement complet d’IA sur l’appareil, et non les seuls poids d’un modèle. La plateforme couvre plus de 1 000 configurations, plus de 30 modèles, plusieurs formats de quantification et des contextes de 256 à 8 192 tokens.
Publié parModifié avec GPT-5.6 LunaImages générées avec GPT Image 1.5
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open-source on-device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open-source benchmark suite for measuring an actual on-device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload. Released August 24 wi. Topic tags: general, general web, user generated, academic, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wa
Pipette est la suite de benchmarks open source de Liquid AI conçue pour évaluer les modèles là où ils sont réellement utilisés : sur les smartphones, les ordinateurs portables, les PC et autres appareils périphériques. Lancée le 24 août en partenariat avec Artificial Analysis, elle considère le déploiement complet — et non le modèle seul — comme unité de mesure. Les résultats dépendent donc simultanément du modèle, de sa quantification, du moteur d’exécution, de l’appareil et de la charge de travail. 3
1
De nombreux palmarès se concentrent sur les capacités d’un modèle ou publient un unique chiffre de vitesse d’inférence. Pipette cherche plutôt à montrer comment se comporte toute la chaîne dans une situation de déploiement concrète.
Modifier la quantification, le moteur d’exécution, le backend, la pression mémoire ou le matériel peut changer fortement le résultat, même si les poids du modèle restent identiques. C’est une distinction importante pour l’IA locale : un modèle rapide sur une configuration donnée ne sera pas nécessairement aussi performant sur un autre téléphone ou avec un autre runtime.
Le lancement s’est accompagné d’un jeu de données public vérifié en laboratoire, couvrant plus de 1 000 configurations combinant modèles, quantifications, runtimes, appareils et contextes. La première version comprend plus de 30 modèles, plusieurs formats de quantification et des versions de llama.cpp pour macOS, iOS, Windows et Android. Les mesures standardisées couvrent des contextes de 256 à 8 192 tokens. 3
Les mesures d’inférence de Pipette sont associées à l’évaluation par Artificial Analysis de l’intelligence de modèles adaptés aux appareils mobiles. La collaboration examine ainsi à la fois la qualité des réponses et la rapidité ou l’efficacité d’un déploiement particulier. 33
Pipette propose des clients natifs pour iOS et Android afin d’exécuter les modèles directement sur un smartphone. Sa couverture plus large inclut également macOS et Windows grâce aux versions prises en charge des runtimes. Les appareils de référence cités dans les documents de lancement comprennent notamment l’iPhone 17 Pro, le Galaxy S26 Ultra et un MacBook Pro équipé d’une puce M5 Max. 3
38
Les modèles doivent être téléchargés sur l’appareil avant le test. Pipette mesure donc l’inférence locale, et non la latence d’un service d’IA dans le cloud. 41
50
Le classement inclut la famille LFM2.5 de Liquid AI ainsi que des modèles tiers. Parmi les exemples figurent Gemma, Nanbeige, Granite, Qwen et plusieurs variantes compactes ou compressées. 9
41
Le benchmark prend en charge plusieurs formats de quantification. L’évaluation de l’intelligence sur mobile s’est concentrée sur des modèles dont la taille reste inférieure à 8 Go après une quantification sur 4 bits, un choix adapté aux smartphones à mémoire limitée. 3
41
Pour le déploiement local, la documentation de Liquid distingue notamment le format GGUF, couramment utilisé avec llama.cpp sur des cibles CPU et GPU, du format MLX, destiné aux déploiements sur les puces Apple Silicon. 47 La taille du fichier quantifié ne suffit toutefois pas à prédire les performances : le runtime et le backend matériel déterminent la manière dont le modèle est effectivement traité.
Le jeu de données du lancement rapporte des configurations d’inférence standardisées pour des contextes allant de 256 à 8 192 tokens. 3 L’évaluation distincte d’Artificial Analysis sur l’intelligence mobile utilise, elle, une limite de contexte de 16 000 tokens.
33
Ces valeurs ne doivent pas être confondues avec la fenêtre de contexte maximale annoncée pour un modèle. La documentation de Liquid indique un contexte de 32 000 tokens pour de nombreux modèles LFM et de 128 000 tokens pour le LFM2.5-8B-A1B. Cela ne signifie pas que chaque test sur smartphone utilise la longueur maximale. 47
Pipette combine plusieurs dimensions des performances sur l’appareil au lieu de réduire l’évaluation à la vitesse de génération. Ses cinq indicateurs couvrent le traitement du prompt ou préremplissage, le débit de génération ou de décodage, le délai avant le premier token, le temps nécessaire pour obtenir la réponse complète et l’utilisation de la mémoire. 1
3
14
Cette combinaison permet d’éviter des conclusions trop rapides. Un déploiement peut générer des tokens rapidement tout en étant lent au démarrage, trop gourmand en mémoire ou en ralentissement lorsque le contexte s’allonge. Le temps de réponse de bout en bout est particulièrement parlant pour évaluer l’expérience réelle d’un assistant local.
Artificial Analysis apporte le volet qualité de la comparaison mobile avec des tests portant notamment sur le respect des consignes, l’utilisation d’outils, le raisonnement et d’autres capacités. 33
Pipette associe chaque résultat à une configuration explicite et publie les protocoles utilisés pour produire les données vérifiées. Son tableau de bord sépare les comparaisons du classement, les résultats détaillés et les soumissions, afin de permettre l’examen des lignes de benchmark sous-jacentes plutôt que de s’en remettre à un simple rang. 1
La méthodologie documente également les dépendances logicielles. Liquid indique par exemple que les résultats publics actuels nécessitent certaines versions précises de llama.cpp, notamment les builds b10216 et b10516. 2 Le fait de figer le runtime réduit le risque de confondre une évolution logicielle avec un progrès du modèle ou du matériel.
Ces précautions améliorent la comparaison sans supprimer toutes les variations possibles. La température de l’appareil, l’état du système d’exploitation, la mémoire disponible, le firmware, le backend choisi et les limites de puissance prolongée peuvent tous modifier les résultats d’un smartphone. Un score n’a de sens que si ces variables sont comparables.
Les premières données illustrent pourquoi Pipette publie des configurations complètes plutôt qu’un classement universel des modèles.
La conclusion essentielle est que qualité, vitesse, latence et consommation mémoire peuvent évoluer dans des directions différentes. Le modèle le plus rapide n’est pas forcément le plus performant, et celui qui obtient la meilleure note de capacités n’est pas automatiquement le meilleur choix pour un smartphone.
La principale limite de la première version mobile tient à la différence entre les deux clients. La version iOS peut utiliser le GPU via l’écosystème Metal d’Apple, notamment avec MLX. La version Android était initialement limitée à l’inférence sur CPU. 41
50
Ainsi, comparer directement un résultat iPhone obtenu avec MLX/Metal à un résultat Android produit uniquement par le CPU ne revient pas à comparer équitablement l’ensemble des composants matériels dédiés à l’IA. La mesure iOS peut profiter de l’accélération GPU, tandis que la mesure Android reflète les performances du chemin CPU exposé par le client actuel.
Les résultats Android restent utiles pour comprendre l’inférence locale sur CPU et l’expérience offerte par cette implémentation. Ils ne permettent cependant pas d’affirmer qu’un smartphone possède une puce d’IA globalement plus rapide qu’une autre tant que des backends GPU ou NPU équivalents ne sont pas testés avec la même charge de travail.
Pipette arrive alors que les fabricants de puces mettent en avant des capacités accrues pour l’IA locale et les usages dits « agentiques ». La plateforme Snapdragon 8 Elite Gen 5 de Qualcomm utilise un processeur Oryon de troisième génération, cadencé jusqu’à 4,74 GHz, et revendique une progression de 20 % des performances CPU ainsi qu’une amélioration de 35 % de l’efficacité énergétique du CPU. 24
Qualcomm a également présenté les grandes lignes d’une future plateforme Snapdragon haut de gamme équipée d’un processeur Oryon visant 5 GHz et d’une architecture FlexCache permettant à des cœurs hétérogènes de partager dynamiquement un même pool de cache. 23
Ces annonces montrent que l’IA exécutée localement devient un terrain de compétition matérielle. Mais la fréquence d’horloge ne suffit pas à prédire les performances d’un modèle de langage : quantification, bande passante mémoire, comportement du cache, implémentation du runtime, utilisation du GPU ou du NPU, température et puissance soutenue peuvent être tout aussi déterminants.
C’est précisément là que l’approche de Pipette est intéressante. À terme, son rôle le plus utile sera de vérifier si une amélioration annoncée pour une puce se traduit réellement par une IA locale plus rapide, plus réactive et moins gourmande en mémoire dans une charge de travail reproductible. Pour l’instant, Pipette doit être considéré comme un benchmark transparent du déploiement, et non comme un classement définitif opposant le matériel iPhone à celui des smartphones Android.
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Pipette mesure un déploiement complet d’IA sur l’appareil, et non les seuls poids d’un modèle.
Pipette mesure un déploiement complet d’IA sur l’appareil, et non les seuls poids d’un modèle. La plateforme couvre plus de 1 000 configurations, plus de 30 modèles, plusieurs formats de quantification et des contextes de 256 à 8 192 tokens.
Les cinq indicateurs incluent le préremplissage, la génération, le délai avant le premier token, le temps de réponse total et la mémoire utilisée.
Pipette mesure un déploiement complet d’IA sur l’appareil, et non les seuls poids d’un modèle. La plateforme couvre plus de 1 000 configurations, plus de 30 modèles, plusieurs formats de quantification et des contextes de 256 à 8 192 tokens.
Publié parModifié avec GPT-5.6 LunaImages générées avec GPT Image 1.5
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open-source on-device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open-source benchmark suite for measuring an actual on-device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload. Released August 24 wi. Topic tags: general, general web, user generated, academic, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wa
Pipette est la suite de benchmarks open source de Liquid AI conçue pour évaluer les modèles là où ils sont réellement utilisés : sur les smartphones, les ordinateurs portables, les PC et autres appareils périphériques. Lancée le 24 août en partenariat avec Artificial Analysis, elle considère le déploiement complet — et non le modèle seul — comme unité de mesure. Les résultats dépendent donc simultanément du modèle, de sa quantification, du moteur d’exécution, de l’appareil et de la charge de travail. 3
1
De nombreux palmarès se concentrent sur les capacités d’un modèle ou publient un unique chiffre de vitesse d’inférence. Pipette cherche plutôt à montrer comment se comporte toute la chaîne dans une situation de déploiement concrète.
Modifier la quantification, le moteur d’exécution, le backend, la pression mémoire ou le matériel peut changer fortement le résultat, même si les poids du modèle restent identiques. C’est une distinction importante pour l’IA locale : un modèle rapide sur une configuration donnée ne sera pas nécessairement aussi performant sur un autre téléphone ou avec un autre runtime.
Le lancement s’est accompagné d’un jeu de données public vérifié en laboratoire, couvrant plus de 1 000 configurations combinant modèles, quantifications, runtimes, appareils et contextes. La première version comprend plus de 30 modèles, plusieurs formats de quantification et des versions de llama.cpp pour macOS, iOS, Windows et Android. Les mesures standardisées couvrent des contextes de 256 à 8 192 tokens. 3
Les mesures d’inférence de Pipette sont associées à l’évaluation par Artificial Analysis de l’intelligence de modèles adaptés aux appareils mobiles. La collaboration examine ainsi à la fois la qualité des réponses et la rapidité ou l’efficacité d’un déploiement particulier. 33
Pipette propose des clients natifs pour iOS et Android afin d’exécuter les modèles directement sur un smartphone. Sa couverture plus large inclut également macOS et Windows grâce aux versions prises en charge des runtimes. Les appareils de référence cités dans les documents de lancement comprennent notamment l’iPhone 17 Pro, le Galaxy S26 Ultra et un MacBook Pro équipé d’une puce M5 Max. 3
38
Les modèles doivent être téléchargés sur l’appareil avant le test. Pipette mesure donc l’inférence locale, et non la latence d’un service d’IA dans le cloud. 41
50
Le classement inclut la famille LFM2.5 de Liquid AI ainsi que des modèles tiers. Parmi les exemples figurent Gemma, Nanbeige, Granite, Qwen et plusieurs variantes compactes ou compressées. 9
41
Le benchmark prend en charge plusieurs formats de quantification. L’évaluation de l’intelligence sur mobile s’est concentrée sur des modèles dont la taille reste inférieure à 8 Go après une quantification sur 4 bits, un choix adapté aux smartphones à mémoire limitée. 3
41
Pour le déploiement local, la documentation de Liquid distingue notamment le format GGUF, couramment utilisé avec llama.cpp sur des cibles CPU et GPU, du format MLX, destiné aux déploiements sur les puces Apple Silicon. 47 La taille du fichier quantifié ne suffit toutefois pas à prédire les performances : le runtime et le backend matériel déterminent la manière dont le modèle est effectivement traité.
Le jeu de données du lancement rapporte des configurations d’inférence standardisées pour des contextes allant de 256 à 8 192 tokens. 3 L’évaluation distincte d’Artificial Analysis sur l’intelligence mobile utilise, elle, une limite de contexte de 16 000 tokens.
33
Ces valeurs ne doivent pas être confondues avec la fenêtre de contexte maximale annoncée pour un modèle. La documentation de Liquid indique un contexte de 32 000 tokens pour de nombreux modèles LFM et de 128 000 tokens pour le LFM2.5-8B-A1B. Cela ne signifie pas que chaque test sur smartphone utilise la longueur maximale. 47
Pipette combine plusieurs dimensions des performances sur l’appareil au lieu de réduire l’évaluation à la vitesse de génération. Ses cinq indicateurs couvrent le traitement du prompt ou préremplissage, le débit de génération ou de décodage, le délai avant le premier token, le temps nécessaire pour obtenir la réponse complète et l’utilisation de la mémoire. 1
3
14
Cette combinaison permet d’éviter des conclusions trop rapides. Un déploiement peut générer des tokens rapidement tout en étant lent au démarrage, trop gourmand en mémoire ou en ralentissement lorsque le contexte s’allonge. Le temps de réponse de bout en bout est particulièrement parlant pour évaluer l’expérience réelle d’un assistant local.
Artificial Analysis apporte le volet qualité de la comparaison mobile avec des tests portant notamment sur le respect des consignes, l’utilisation d’outils, le raisonnement et d’autres capacités. 33
Pipette associe chaque résultat à une configuration explicite et publie les protocoles utilisés pour produire les données vérifiées. Son tableau de bord sépare les comparaisons du classement, les résultats détaillés et les soumissions, afin de permettre l’examen des lignes de benchmark sous-jacentes plutôt que de s’en remettre à un simple rang. 1
La méthodologie documente également les dépendances logicielles. Liquid indique par exemple que les résultats publics actuels nécessitent certaines versions précises de llama.cpp, notamment les builds b10216 et b10516. 2 Le fait de figer le runtime réduit le risque de confondre une évolution logicielle avec un progrès du modèle ou du matériel.
Ces précautions améliorent la comparaison sans supprimer toutes les variations possibles. La température de l’appareil, l’état du système d’exploitation, la mémoire disponible, le firmware, le backend choisi et les limites de puissance prolongée peuvent tous modifier les résultats d’un smartphone. Un score n’a de sens que si ces variables sont comparables.
Les premières données illustrent pourquoi Pipette publie des configurations complètes plutôt qu’un classement universel des modèles.
La conclusion essentielle est que qualité, vitesse, latence et consommation mémoire peuvent évoluer dans des directions différentes. Le modèle le plus rapide n’est pas forcément le plus performant, et celui qui obtient la meilleure note de capacités n’est pas automatiquement le meilleur choix pour un smartphone.
La principale limite de la première version mobile tient à la différence entre les deux clients. La version iOS peut utiliser le GPU via l’écosystème Metal d’Apple, notamment avec MLX. La version Android était initialement limitée à l’inférence sur CPU. 41
50
Ainsi, comparer directement un résultat iPhone obtenu avec MLX/Metal à un résultat Android produit uniquement par le CPU ne revient pas à comparer équitablement l’ensemble des composants matériels dédiés à l’IA. La mesure iOS peut profiter de l’accélération GPU, tandis que la mesure Android reflète les performances du chemin CPU exposé par le client actuel.
Les résultats Android restent utiles pour comprendre l’inférence locale sur CPU et l’expérience offerte par cette implémentation. Ils ne permettent cependant pas d’affirmer qu’un smartphone possède une puce d’IA globalement plus rapide qu’une autre tant que des backends GPU ou NPU équivalents ne sont pas testés avec la même charge de travail.
Pipette arrive alors que les fabricants de puces mettent en avant des capacités accrues pour l’IA locale et les usages dits « agentiques ». La plateforme Snapdragon 8 Elite Gen 5 de Qualcomm utilise un processeur Oryon de troisième génération, cadencé jusqu’à 4,74 GHz, et revendique une progression de 20 % des performances CPU ainsi qu’une amélioration de 35 % de l’efficacité énergétique du CPU. 24
Qualcomm a également présenté les grandes lignes d’une future plateforme Snapdragon haut de gamme équipée d’un processeur Oryon visant 5 GHz et d’une architecture FlexCache permettant à des cœurs hétérogènes de partager dynamiquement un même pool de cache. 23
Ces annonces montrent que l’IA exécutée localement devient un terrain de compétition matérielle. Mais la fréquence d’horloge ne suffit pas à prédire les performances d’un modèle de langage : quantification, bande passante mémoire, comportement du cache, implémentation du runtime, utilisation du GPU ou du NPU, température et puissance soutenue peuvent être tout aussi déterminants.
C’est précisément là que l’approche de Pipette est intéressante. À terme, son rôle le plus utile sera de vérifier si une amélioration annoncée pour une puce se traduit réellement par une IA locale plus rapide, plus réactive et moins gourmande en mémoire dans une charge de travail reproductible. Pour l’instant, Pipette doit être considéré comme un benchmark transparent du déploiement, et non comme un classement définitif opposant le matériel iPhone à celui des smartphones Android.
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Pipette mesure un déploiement complet d’IA sur l’appareil, et non les seuls poids d’un modèle.
Pipette mesure un déploiement complet d’IA sur l’appareil, et non les seuls poids d’un modèle. La plateforme couvre plus de 1 000 configurations, plus de 30 modèles, plusieurs formats de quantification et des contextes de 256 à 8 192 tokens.
Les cinq indicateurs incluent le préremplissage, la génération, le délai avant le premier token, le temps de réponse total et la mémoire utilisée.