Pipette es una suite gratuita y de código abierto que mide despliegues completos de IA en el dispositivo, no solo modelos aislados. El lanzamiento incluye más de 1.000 configuraciones verificadas en laboratorio, más de 30 modelos, siete opciones de cuantización y cuatro dispositivos iniciales.
Publicado porImágenes generadas con GPT Image 1.5
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open source on device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open source benchmark suite for measuring an actual on device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload.. Topic tags: general web, llm, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait
Pipette es la suite gratuita y de código abierto de Liquid AI para medir cómo funciona un modelo de inteligencia artificial cuando se ejecuta de verdad en un dispositivo. Su unidad de comparación no es únicamente el modelo, sino la combinación de modelo, cuantización, runtime, dispositivo y carga de trabajo. La plataforma se lanzó el 24 de agosto de 2026 en colaboración con Artificial Analysis: Liquid AI aporta las mediciones de inferencia y Artificial Analysis, la evaluación de inteligencia de los modelos móviles. 11
9
El objetivo es responder una pregunta más útil que “¿cuántos tokens por segundo produce este modelo?”: ¿qué rendimiento ofrece esta configuración concreta en un teléfono o equipo específico?
La publicación inicial incluye:
Las mediciones abarcan el rendimiento de prompt o prellenado, la generación o decodificación, el tiempo hasta el primer token, el tiempo total de respuesta y el uso de memoria. De este modo, una alta velocidad de decodificación no se considera suficiente por sí sola. 4
11
Pipette ofrece clientes para iOS y Android y prueba modelos descargados en el propio dispositivo, en lugar de enviar las consultas a un servicio en la nube. 10
8
La cobertura inicial incluye la familia de modelos LFM de Liquid AI y modelos pequeños de terceros, como Gemma y Nanbeige. En la comparación de inteligencia móvil se seleccionaron modelos capaces de caber en un límite de 8 GB al utilizar cuantización de 4 bits. 10
8
La suite también contempla compilaciones de llama.cpp para macOS, iOS, Windows y Android. El conjunto de resultados publicado cubre longitudes de contexto de entre 256 y 8.192 tokens. 11
Aquí conviene distinguir dos pruebas diferentes. La evaluación de inteligencia móvil publicada por Artificial Analysis utiliza un límite de contexto de 16.000 tokens. En cambio, las capacidades anunciadas para algunos modelos LFM son mayores: muchos admiten contextos de 32.000 tokens y el LFM2.5-8B-A1B llega a 128.000. Esas cifras describen las capacidades de los modelos, no necesariamente la carga de trabajo estandarizada de la primera versión de Pipette. 8
2
La cuantización reduce la precisión numérica de un modelo para disminuir su tamaño y sus necesidades de memoria. Por eso, un mismo modelo en 4 bits, 8 bits o una precisión superior puede ofrecer resultados distintos.
También cambia el resultado el software utilizado. En el ecosistema de Liquid AI, por ejemplo, GGUF está orientado a la inferencia local con CPU o GPU en distintas plataformas, mientras que MLX está especialmente adaptado a equipos con Apple Silicon. 2
Pipette registra estas diferencias en lugar de ocultarlas dentro de una cifra única. Una comparación válida debe indicar, como mínimo, el modelo, su cuantización, el runtime, el dispositivo y la carga de trabajo empleada.
La principal aportación de Pipette no es solo la aplicación, sino su metodología. Los resultados están vinculados a una configuración completa, proceden de ejecuciones verificadas en laboratorio y se acompañan de protocolos publicados. Además, la plataforma fija dependencias de software: los resultados públicos actuales requieren compilaciones concretas de llama.cpp, entre ellas b10216 y b10516. 4
11
6
Esto mejora la comparación frente a una cifra aislada de “tokens por segundo” proporcionada por un fabricante. Sin embargo, no elimina todas las fuentes de variación. La temperatura del dispositivo, el estado del sistema operativo, la variante exacta del teléfono, la memoria RAM, el backend utilizado y los límites de consumo sostenido también pueden alterar el resultado.
Uno de los resultados destacados es el de un iPhone 17 Pro, que alcanzó 48,37 tokens por segundo en decodificación al ejecutar Gemma 4 E2B en 4 bits mediante Apple MLX. Es una cifra notable para esa configuración concreta —Gemma 4 E2B, 4 bits, MLX/Metal e iPhone 17 Pro—, pero no debe interpretarse como una puntuación universal para Gemma ni para todos los teléfonos. 4
5
En la evaluación de inteligencia móvil con contexto de 16.000 tokens, Nanbeige4.2-3B y LFM2.5-2.6B empataron en el primer puesto, con una puntuación media de 63. 9
8
La comparación entre plataformas exige cautela:
Por tanto, las cifras actuales de rendimiento entre iPhone y Android no son una comparación directa entre chips equivalentes. Los resultados de Android pueden servir para analizar el rendimiento de la CPU y la experiencia bajo ese backend, pero no demuestran que el hardware de IA local de un teléfono sea intrínsecamente más rápido que el del otro. 10
4
Para una comparación multiplataforma más justa será necesario incorporar backends de Android con aceleración equivalente mediante GPU o NPU.
Pipette llega en un momento en el que los fabricantes de chips compiten por ofrecer mejores cargas de trabajo de IA local y de agentes. Qualcomm afirma que la CPU Oryon de su Snapdragon 8 Elite Gen 5 alcanza los 4,74 GHz, además de anunciar mejoras del 20 % en rendimiento de CPU y del 35 % en eficiencia energética de CPU para esa plataforma. 14
Por separado, Qualcomm ha anticipado otro Snapdragon insignia con una CPU Oryon capaz de llegar a 5 GHz y una arquitectura FlexCache que comparte dinámicamente la caché entre los núcleos. Estas cifras apuntan a una carrera por lograr respuestas locales más rápidas, pero la frecuencia de reloj, por sí sola, no predice el rendimiento de un modelo de lenguaje. También influyen el runtime, el ancho de banda de memoria, el comportamiento de la caché, la cuantización, el backend de GPU o NPU, la temperatura y los límites de potencia sostenida. 9
13
La dirección anunciada por Liquid AI —ampliar la cobertura de dispositivos e incorporar pruebas aceleradas por NPU— podría hacer que Pipette resulte aún más útil. Permitiría separar las mejoras obtenidas únicamente con CPU de las que proceden de una GPU o una NPU.
Hasta entonces, la interpretación más sólida es esta: Pipette es un benchmark transparente para comparar despliegues completos de IA en dispositivos, no una clasificación definitiva de qué plataforma móvil tiene el hardware más rápido. 6
4
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
Pipette es una suite gratuita y de código abierto que mide despliegues completos de IA en el dispositivo, no solo modelos aislados.
Pipette es una suite gratuita y de código abierto que mide despliegues completos de IA en el dispositivo, no solo modelos aislados. El lanzamiento incluye más de 1.000 configuraciones verificadas en laboratorio, más de 30 modelos, siete opciones de cuantización y cuatro dispositivos iniciales.
Tiene clientes para iOS y Android y ejecuta modelos descargados localmente, sin depender de un endpoint en la nube.
Pipette es una suite gratuita y de código abierto que mide despliegues completos de IA en el dispositivo, no solo modelos aislados. El lanzamiento incluye más de 1.000 configuraciones verificadas en laboratorio, más de 30 modelos, siete opciones de cuantización y cuatro dispositivos iniciales.
Publicado porImágenes generadas con GPT Image 1.5
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open source on device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open source benchmark suite for measuring an actual on device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload.. Topic tags: general web, llm, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait
Pipette es la suite gratuita y de código abierto de Liquid AI para medir cómo funciona un modelo de inteligencia artificial cuando se ejecuta de verdad en un dispositivo. Su unidad de comparación no es únicamente el modelo, sino la combinación de modelo, cuantización, runtime, dispositivo y carga de trabajo. La plataforma se lanzó el 24 de agosto de 2026 en colaboración con Artificial Analysis: Liquid AI aporta las mediciones de inferencia y Artificial Analysis, la evaluación de inteligencia de los modelos móviles. 11
9
El objetivo es responder una pregunta más útil que “¿cuántos tokens por segundo produce este modelo?”: ¿qué rendimiento ofrece esta configuración concreta en un teléfono o equipo específico?
La publicación inicial incluye:
Las mediciones abarcan el rendimiento de prompt o prellenado, la generación o decodificación, el tiempo hasta el primer token, el tiempo total de respuesta y el uso de memoria. De este modo, una alta velocidad de decodificación no se considera suficiente por sí sola. 4
11
Pipette ofrece clientes para iOS y Android y prueba modelos descargados en el propio dispositivo, en lugar de enviar las consultas a un servicio en la nube. 10
8
La cobertura inicial incluye la familia de modelos LFM de Liquid AI y modelos pequeños de terceros, como Gemma y Nanbeige. En la comparación de inteligencia móvil se seleccionaron modelos capaces de caber en un límite de 8 GB al utilizar cuantización de 4 bits. 10
8
La suite también contempla compilaciones de llama.cpp para macOS, iOS, Windows y Android. El conjunto de resultados publicado cubre longitudes de contexto de entre 256 y 8.192 tokens. 11
Aquí conviene distinguir dos pruebas diferentes. La evaluación de inteligencia móvil publicada por Artificial Analysis utiliza un límite de contexto de 16.000 tokens. En cambio, las capacidades anunciadas para algunos modelos LFM son mayores: muchos admiten contextos de 32.000 tokens y el LFM2.5-8B-A1B llega a 128.000. Esas cifras describen las capacidades de los modelos, no necesariamente la carga de trabajo estandarizada de la primera versión de Pipette. 8
2
La cuantización reduce la precisión numérica de un modelo para disminuir su tamaño y sus necesidades de memoria. Por eso, un mismo modelo en 4 bits, 8 bits o una precisión superior puede ofrecer resultados distintos.
También cambia el resultado el software utilizado. En el ecosistema de Liquid AI, por ejemplo, GGUF está orientado a la inferencia local con CPU o GPU en distintas plataformas, mientras que MLX está especialmente adaptado a equipos con Apple Silicon. 2
Pipette registra estas diferencias en lugar de ocultarlas dentro de una cifra única. Una comparación válida debe indicar, como mínimo, el modelo, su cuantización, el runtime, el dispositivo y la carga de trabajo empleada.
La principal aportación de Pipette no es solo la aplicación, sino su metodología. Los resultados están vinculados a una configuración completa, proceden de ejecuciones verificadas en laboratorio y se acompañan de protocolos publicados. Además, la plataforma fija dependencias de software: los resultados públicos actuales requieren compilaciones concretas de llama.cpp, entre ellas b10216 y b10516. 4
11
6
Esto mejora la comparación frente a una cifra aislada de “tokens por segundo” proporcionada por un fabricante. Sin embargo, no elimina todas las fuentes de variación. La temperatura del dispositivo, el estado del sistema operativo, la variante exacta del teléfono, la memoria RAM, el backend utilizado y los límites de consumo sostenido también pueden alterar el resultado.
Uno de los resultados destacados es el de un iPhone 17 Pro, que alcanzó 48,37 tokens por segundo en decodificación al ejecutar Gemma 4 E2B en 4 bits mediante Apple MLX. Es una cifra notable para esa configuración concreta —Gemma 4 E2B, 4 bits, MLX/Metal e iPhone 17 Pro—, pero no debe interpretarse como una puntuación universal para Gemma ni para todos los teléfonos. 4
5
En la evaluación de inteligencia móvil con contexto de 16.000 tokens, Nanbeige4.2-3B y LFM2.5-2.6B empataron en el primer puesto, con una puntuación media de 63. 9
8
La comparación entre plataformas exige cautela:
Por tanto, las cifras actuales de rendimiento entre iPhone y Android no son una comparación directa entre chips equivalentes. Los resultados de Android pueden servir para analizar el rendimiento de la CPU y la experiencia bajo ese backend, pero no demuestran que el hardware de IA local de un teléfono sea intrínsecamente más rápido que el del otro. 10
4
Para una comparación multiplataforma más justa será necesario incorporar backends de Android con aceleración equivalente mediante GPU o NPU.
Pipette llega en un momento en el que los fabricantes de chips compiten por ofrecer mejores cargas de trabajo de IA local y de agentes. Qualcomm afirma que la CPU Oryon de su Snapdragon 8 Elite Gen 5 alcanza los 4,74 GHz, además de anunciar mejoras del 20 % en rendimiento de CPU y del 35 % en eficiencia energética de CPU para esa plataforma. 14
Por separado, Qualcomm ha anticipado otro Snapdragon insignia con una CPU Oryon capaz de llegar a 5 GHz y una arquitectura FlexCache que comparte dinámicamente la caché entre los núcleos. Estas cifras apuntan a una carrera por lograr respuestas locales más rápidas, pero la frecuencia de reloj, por sí sola, no predice el rendimiento de un modelo de lenguaje. También influyen el runtime, el ancho de banda de memoria, el comportamiento de la caché, la cuantización, el backend de GPU o NPU, la temperatura y los límites de potencia sostenida. 9
13
La dirección anunciada por Liquid AI —ampliar la cobertura de dispositivos e incorporar pruebas aceleradas por NPU— podría hacer que Pipette resulte aún más útil. Permitiría separar las mejoras obtenidas únicamente con CPU de las que proceden de una GPU o una NPU.
Hasta entonces, la interpretación más sólida es esta: Pipette es un benchmark transparente para comparar despliegues completos de IA en dispositivos, no una clasificación definitiva de qué plataforma móvil tiene el hardware más rápido. 6
4
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
Pipette es una suite gratuita y de código abierto que mide despliegues completos de IA en el dispositivo, no solo modelos aislados.
Pipette es una suite gratuita y de código abierto que mide despliegues completos de IA en el dispositivo, no solo modelos aislados. El lanzamiento incluye más de 1.000 configuraciones verificadas en laboratorio, más de 30 modelos, siete opciones de cuantización y cuatro dispositivos iniciales.
Tiene clientes para iOS y Android y ejecuta modelos descargados localmente, sin depender de un endpoint en la nube.