Pipette, presentada el 24 de agosto, mide implementaciones completas de IA en el dispositivo, no solo los pesos de un modelo. El benchmark cubre clientes para iOS y Android, ejecución local, varios formatos de cuantización y compilaciones de llama.cpp para macOS, iOS, Windows y Android.
Publicado porEditado con GPT-5.6 LunaImágenes generadas con GPT Image 1.5
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open-source on-device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open-source benchmark suite for measuring an actual on-device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload. Released August 24 wi. Topic tags: general, general web, user generated, academic, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wa
Pipette es la suite de benchmarks de código abierto de Liquid AI para evaluar modelos de inteligencia artificial allí donde realmente se ejecutan: teléfonos, portátiles, ordenadores y otros dispositivos periféricos. Presentada en colaboración con Artificial Analysis el 24 de agosto, toma como unidad de medida la implementación completa, no únicamente el modelo. En la práctica, cada resultado combina modelo, cuantización, runtime, dispositivo y carga de trabajo. 3
1
Muchas clasificaciones de IA se centran en las capacidades del modelo o publican una única cifra de velocidad de inferencia. Pipette intenta mostrar qué ocurre con toda la cadena cuando el modelo se despliega en hardware real.
Eso significa que un cambio en la cuantización, el runtime, el backend, la presión de memoria o el dispositivo puede modificar el resultado aunque los pesos del modelo sean exactamente los mismos. La pregunta no es solo «¿qué modelo es mejor?», sino también «¿qué combinación funciona mejor en este dispositivo y con esta carga de trabajo?».
El lanzamiento incluyó un conjunto de datos público con resultados verificados en laboratorio para más de 1.000 configuraciones de modelo, cuantización, runtime, dispositivo y contexto. La primera versión abarca más de 30 modelos, varios formatos de cuantización y compilaciones de llama.cpp para macOS, iOS, Windows y Android. Los datos estandarizados cubren longitudes de contexto de entre 256 y 8.192 tokens. 3
Las mediciones de inferencia de Pipette se combinan con la evaluación de inteligencia de modelos móviles de Artificial Analysis. La colaboración analiza, por tanto, tanto la calidad de las respuestas como la velocidad y la eficiencia de una implementación concreta. 33
Pipette ofrece clientes nativos para iOS y Android que permiten ejecutar modelos localmente en un teléfono. La cobertura más amplia del benchmark también incluye macOS y Windows mediante las compilaciones de runtime compatibles. Entre los equipos de referencia identificados en los materiales iniciales figuran el iPhone 17 Pro, el Galaxy S26 Ultra y un MacBook Pro con chip M5 Max. 3
38
Antes de realizar una prueba, el usuario debe descargar el modelo en el dispositivo. Por eso Pipette mide inferencia local y no la latencia de una API alojada en la nube. 41
50
La clasificación incluye la familia LFM2.5 de Liquid AI junto con modelos de terceros. Entre los ejemplos aparecen variantes pequeñas o comprimidas de Gemma, Nanbeige, Granite, Qwen y otras familias. 9
41
La cuantización permite reducir el tamaño y el coste de ejecución de un modelo mediante representaciones numéricas más compactas. Pipette admite varios formatos. Para la comparación de inteligencia móvil se seleccionaron modelos que caben en 8 GB cuando se cuantizan a 4 bits, un criterio especialmente relevante para teléfonos con memoria limitada. 3
41
En los despliegues locales, la documentación de Liquid distingue entre GGUF, habitual en llama.cpp para objetivos de CPU y GPU, y MLX, orientado a dispositivos con Apple Silicon. 47 El tamaño del archivo cuantizado es solo una parte de la historia: el runtime y el backend del hardware determinan cómo se procesa realmente el modelo.
El conjunto de datos del lanzamiento informa de configuraciones de inferencia estandarizadas con longitudes de contexto de 256 a 8.192 tokens. 3 La evaluación independiente de inteligencia móvil de Artificial Analysis utiliza un límite de contexto de 16K tokens.
33
Estas cifras no deben confundirse con la ventana de contexto máxima anunciada para cada modelo. La documentación de Liquid indica contextos de 32K tokens para muchos modelos LFM y de 128K para LFM2.5-8B-A1B, pero que un modelo admita esa longitud no significa que todas las pruebas en un teléfono se ejecuten con el contexto completo. 47
Pipette combina varias dimensiones del rendimiento en el dispositivo en lugar de reducirlo todo a la velocidad de generación. Sus cinco métricas principales cubren:
La combinación es importante porque una implementación puede generar tokens rápidamente y, aun así, tardar demasiado en empezar, consumir demasiada memoria o perder velocidad cuando aumenta el contexto. El tiempo total de respuesta resulta especialmente útil para valorar la experiencia real de una persona que utiliza un asistente local.
Artificial Analysis aporta la parte de calidad mediante pruebas de seguimiento de instrucciones, uso de herramientas, razonamiento y otras capacidades relacionadas. 33
Pipette vincula cada resultado a una configuración explícita y publica los protocolos empleados para generar los datos verificados. Su panel separa las comparaciones de la clasificación, los resultados detallados y los envíos, de modo que es posible consultar las filas subyacentes del benchmark y no depender únicamente de una posición en la tabla. 1
La metodología también registra las dependencias del runtime. Liquid indica, por ejemplo, que los resultados públicos actuales requieren compilaciones concretas de llama.cpp, entre ellas b10216 y b10516. 2 Fijar la versión del software ayuda a evitar que un cambio en el runtime se interprete erróneamente como una mejora del modelo o del hardware.
Estas medidas mejoran la comparabilidad, pero no eliminan todas las fuentes de variación. La limitación térmica, el estado del sistema operativo, la memoria disponible, el firmware, la selección del backend y los límites de potencia sostenida pueden alterar el resultado de un teléfono. Una puntuación solo es verdaderamente significativa cuando esas variables coinciden.
Los primeros datos explican por qué Pipette publica configuraciones completas en lugar de ofrecer una clasificación universal de modelos.
La conclusión clave es que calidad, velocidad, latencia y memoria pueden apuntar en direcciones distintas. El modelo más rápido no es automáticamente el más capaz, y el que obtiene la mayor puntuación de calidad no tiene por qué ofrecer la mejor experiencia en un teléfono.
La principal limitación de la primera versión móvil está en la diferencia entre ambos clientes. La aplicación de iOS puede utilizar la GPU mediante el ecosistema Metal de Apple, incluido MLX. En cambio, la versión inicial de Android estaba limitada a la inferencia mediante CPU. 41
50
Por ello, un resultado de iPhone obtenido con MLX y Metal frente a uno de Android producido únicamente con CPU no constituye una comparación limpia de todo el hardware de IA de ambos teléfonos. La medición de iOS puede beneficiarse de la aceleración de GPU, mientras que la de Android refleja el rendimiento de la ruta de CPU disponible en el cliente actual.
Los resultados de Android siguen siendo útiles para entender la inferencia local basada en CPU y la experiencia que ofrece esa implementación. Sin embargo, no permiten afirmar que el silicio de IA completo de un teléfono sea más rápido que el de otro hasta que se prueben backends de GPU o NPU equivalentes con la misma carga de trabajo.
Pipette llega en un momento en el que los fabricantes de chips promocionan mejoras para la IA local y los llamados flujos de trabajo agénticos. La plataforma Snapdragon 8 Elite Gen 5 de Qualcomm utiliza una CPU Oryon de tercera generación con velocidades de hasta 4,74 GHz; Qualcomm afirma además una mejora del 20 % en rendimiento de CPU y del 35 % en eficiencia energética de la CPU. 24
Qualcomm también ha anticipado una plataforma Snapdragon insignia posterior con una CPU Oryon que apunta a 5 GHz y una arquitectura FlexCache que permite a núcleos heterogéneos compartir una reserva de caché asignada dinámicamente. 23
Estas especificaciones muestran por qué la IA en el dispositivo se está convirtiendo en un terreno de competencia entre fabricantes. Pero la frecuencia de reloj, por sí sola, no predice el rendimiento de un modelo de lenguaje. La cuantización, el ancho de banda de memoria, el comportamiento de la caché, la implementación del runtime, el uso de GPU o NPU, la temperatura y la potencia sostenida pueden ser igual de importantes.
Ahí es donde resulta útil el enfoque basado en configuraciones de Pipette. Su valor a largo plazo estará en mostrar si una mejora anunciada para un chip se traduce en una IA local más rápida, con menor latencia y un uso de memoria más eficiente bajo una carga de trabajo reproducible. Por ahora, Pipette debe entenderse como un benchmark transparente del despliegue, no como una clasificación definitiva entre el hardware de iPhone y Android.
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
Pipette, presentada el 24 de agosto, mide implementaciones completas de IA en el dispositivo, no solo los pesos de un modelo.
Pipette, presentada el 24 de agosto, mide implementaciones completas de IA en el dispositivo, no solo los pesos de un modelo. El benchmark cubre clientes para iOS y Android, ejecución local, varios formatos de cuantización y compilaciones de llama.cpp para macOS, iOS, Windows y Android.
La base de datos inicial incluye más de 1.000 configuraciones verificadas en laboratorio, más de 30 modelos y longitudes de contexto de entre 256 y 8.192 tokens.
Pipette, presentada el 24 de agosto, mide implementaciones completas de IA en el dispositivo, no solo los pesos de un modelo. El benchmark cubre clientes para iOS y Android, ejecución local, varios formatos de cuantización y compilaciones de llama.cpp para macOS, iOS, Windows y Android.
Publicado porEditado con GPT-5.6 LunaImágenes generadas con GPT Image 1.5
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open-source on-device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open-source benchmark suite for measuring an actual on-device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload. Released August 24 wi. Topic tags: general, general web, user generated, academic, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wa
Pipette es la suite de benchmarks de código abierto de Liquid AI para evaluar modelos de inteligencia artificial allí donde realmente se ejecutan: teléfonos, portátiles, ordenadores y otros dispositivos periféricos. Presentada en colaboración con Artificial Analysis el 24 de agosto, toma como unidad de medida la implementación completa, no únicamente el modelo. En la práctica, cada resultado combina modelo, cuantización, runtime, dispositivo y carga de trabajo. 3
1
Muchas clasificaciones de IA se centran en las capacidades del modelo o publican una única cifra de velocidad de inferencia. Pipette intenta mostrar qué ocurre con toda la cadena cuando el modelo se despliega en hardware real.
Eso significa que un cambio en la cuantización, el runtime, el backend, la presión de memoria o el dispositivo puede modificar el resultado aunque los pesos del modelo sean exactamente los mismos. La pregunta no es solo «¿qué modelo es mejor?», sino también «¿qué combinación funciona mejor en este dispositivo y con esta carga de trabajo?».
El lanzamiento incluyó un conjunto de datos público con resultados verificados en laboratorio para más de 1.000 configuraciones de modelo, cuantización, runtime, dispositivo y contexto. La primera versión abarca más de 30 modelos, varios formatos de cuantización y compilaciones de llama.cpp para macOS, iOS, Windows y Android. Los datos estandarizados cubren longitudes de contexto de entre 256 y 8.192 tokens. 3
Las mediciones de inferencia de Pipette se combinan con la evaluación de inteligencia de modelos móviles de Artificial Analysis. La colaboración analiza, por tanto, tanto la calidad de las respuestas como la velocidad y la eficiencia de una implementación concreta. 33
Pipette ofrece clientes nativos para iOS y Android que permiten ejecutar modelos localmente en un teléfono. La cobertura más amplia del benchmark también incluye macOS y Windows mediante las compilaciones de runtime compatibles. Entre los equipos de referencia identificados en los materiales iniciales figuran el iPhone 17 Pro, el Galaxy S26 Ultra y un MacBook Pro con chip M5 Max. 3
38
Antes de realizar una prueba, el usuario debe descargar el modelo en el dispositivo. Por eso Pipette mide inferencia local y no la latencia de una API alojada en la nube. 41
50
La clasificación incluye la familia LFM2.5 de Liquid AI junto con modelos de terceros. Entre los ejemplos aparecen variantes pequeñas o comprimidas de Gemma, Nanbeige, Granite, Qwen y otras familias. 9
41
La cuantización permite reducir el tamaño y el coste de ejecución de un modelo mediante representaciones numéricas más compactas. Pipette admite varios formatos. Para la comparación de inteligencia móvil se seleccionaron modelos que caben en 8 GB cuando se cuantizan a 4 bits, un criterio especialmente relevante para teléfonos con memoria limitada. 3
41
En los despliegues locales, la documentación de Liquid distingue entre GGUF, habitual en llama.cpp para objetivos de CPU y GPU, y MLX, orientado a dispositivos con Apple Silicon. 47 El tamaño del archivo cuantizado es solo una parte de la historia: el runtime y el backend del hardware determinan cómo se procesa realmente el modelo.
El conjunto de datos del lanzamiento informa de configuraciones de inferencia estandarizadas con longitudes de contexto de 256 a 8.192 tokens. 3 La evaluación independiente de inteligencia móvil de Artificial Analysis utiliza un límite de contexto de 16K tokens.
33
Estas cifras no deben confundirse con la ventana de contexto máxima anunciada para cada modelo. La documentación de Liquid indica contextos de 32K tokens para muchos modelos LFM y de 128K para LFM2.5-8B-A1B, pero que un modelo admita esa longitud no significa que todas las pruebas en un teléfono se ejecuten con el contexto completo. 47
Pipette combina varias dimensiones del rendimiento en el dispositivo en lugar de reducirlo todo a la velocidad de generación. Sus cinco métricas principales cubren:
La combinación es importante porque una implementación puede generar tokens rápidamente y, aun así, tardar demasiado en empezar, consumir demasiada memoria o perder velocidad cuando aumenta el contexto. El tiempo total de respuesta resulta especialmente útil para valorar la experiencia real de una persona que utiliza un asistente local.
Artificial Analysis aporta la parte de calidad mediante pruebas de seguimiento de instrucciones, uso de herramientas, razonamiento y otras capacidades relacionadas. 33
Pipette vincula cada resultado a una configuración explícita y publica los protocolos empleados para generar los datos verificados. Su panel separa las comparaciones de la clasificación, los resultados detallados y los envíos, de modo que es posible consultar las filas subyacentes del benchmark y no depender únicamente de una posición en la tabla. 1
La metodología también registra las dependencias del runtime. Liquid indica, por ejemplo, que los resultados públicos actuales requieren compilaciones concretas de llama.cpp, entre ellas b10216 y b10516. 2 Fijar la versión del software ayuda a evitar que un cambio en el runtime se interprete erróneamente como una mejora del modelo o del hardware.
Estas medidas mejoran la comparabilidad, pero no eliminan todas las fuentes de variación. La limitación térmica, el estado del sistema operativo, la memoria disponible, el firmware, la selección del backend y los límites de potencia sostenida pueden alterar el resultado de un teléfono. Una puntuación solo es verdaderamente significativa cuando esas variables coinciden.
Los primeros datos explican por qué Pipette publica configuraciones completas en lugar de ofrecer una clasificación universal de modelos.
La conclusión clave es que calidad, velocidad, latencia y memoria pueden apuntar en direcciones distintas. El modelo más rápido no es automáticamente el más capaz, y el que obtiene la mayor puntuación de calidad no tiene por qué ofrecer la mejor experiencia en un teléfono.
La principal limitación de la primera versión móvil está en la diferencia entre ambos clientes. La aplicación de iOS puede utilizar la GPU mediante el ecosistema Metal de Apple, incluido MLX. En cambio, la versión inicial de Android estaba limitada a la inferencia mediante CPU. 41
50
Por ello, un resultado de iPhone obtenido con MLX y Metal frente a uno de Android producido únicamente con CPU no constituye una comparación limpia de todo el hardware de IA de ambos teléfonos. La medición de iOS puede beneficiarse de la aceleración de GPU, mientras que la de Android refleja el rendimiento de la ruta de CPU disponible en el cliente actual.
Los resultados de Android siguen siendo útiles para entender la inferencia local basada en CPU y la experiencia que ofrece esa implementación. Sin embargo, no permiten afirmar que el silicio de IA completo de un teléfono sea más rápido que el de otro hasta que se prueben backends de GPU o NPU equivalentes con la misma carga de trabajo.
Pipette llega en un momento en el que los fabricantes de chips promocionan mejoras para la IA local y los llamados flujos de trabajo agénticos. La plataforma Snapdragon 8 Elite Gen 5 de Qualcomm utiliza una CPU Oryon de tercera generación con velocidades de hasta 4,74 GHz; Qualcomm afirma además una mejora del 20 % en rendimiento de CPU y del 35 % en eficiencia energética de la CPU. 24
Qualcomm también ha anticipado una plataforma Snapdragon insignia posterior con una CPU Oryon que apunta a 5 GHz y una arquitectura FlexCache que permite a núcleos heterogéneos compartir una reserva de caché asignada dinámicamente. 23
Estas especificaciones muestran por qué la IA en el dispositivo se está convirtiendo en un terreno de competencia entre fabricantes. Pero la frecuencia de reloj, por sí sola, no predice el rendimiento de un modelo de lenguaje. La cuantización, el ancho de banda de memoria, el comportamiento de la caché, la implementación del runtime, el uso de GPU o NPU, la temperatura y la potencia sostenida pueden ser igual de importantes.
Ahí es donde resulta útil el enfoque basado en configuraciones de Pipette. Su valor a largo plazo estará en mostrar si una mejora anunciada para un chip se traduce en una IA local más rápida, con menor latencia y un uso de memoria más eficiente bajo una carga de trabajo reproducible. Por ahora, Pipette debe entenderse como un benchmark transparente del despliegue, no como una clasificación definitiva entre el hardware de iPhone y Android.
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
Pipette, presentada el 24 de agosto, mide implementaciones completas de IA en el dispositivo, no solo los pesos de un modelo.
Pipette, presentada el 24 de agosto, mide implementaciones completas de IA en el dispositivo, no solo los pesos de un modelo. El benchmark cubre clientes para iOS y Android, ejecución local, varios formatos de cuantización y compilaciones de llama.cpp para macOS, iOS, Windows y Android.
La base de datos inicial incluye más de 1.000 configuraciones verificadas en laboratorio, más de 30 modelos y longitudes de contexto de entre 256 y 8.192 tokens.