Pipette wurde am 24. August gemeinsam mit Artificial Analysis veröffentlicht und bewertet komplette On Device Konfigurationen statt nur Modellgewichte.
Veröffentlicht vonBearbeitet mit GPT-5.6 LunaBilder erstellt mit GPT Image 1.5
Forschungsantwort

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open-source on-device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open-source benchmark suite for measuring an actual on-device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload. Released August 24 wi. Topic tags: general, general web, user generated, academic, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wa
Liquid AI und Artificial Analysis wollen mit Pipette eine Lücke bei KI-Benchmarks schließen: Statt ein Modell unabhängig von seinem Einsatzort zu bewerten, misst die Open-Source-Suite, wie eine komplette Bereitstellung tatsächlich läuft – auf dem Smartphone, Laptop, PC oder anderer Edge-Hardware. Berücksichtigt werden dabei das Modell, die Quantisierung, die Laufzeitumgebung, das Gerät und der konkrete Workload. 3
1
Viele Bestenlisten vergleichen vor allem Fähigkeiten oder nennen eine einzelne Zahl für die Inferenzgeschwindigkeit. Pipette setzt an einer anderen Stelle an: Entscheidend ist nicht nur, welches Modell verwendet wird, sondern wie es auf einer bestimmten Hardware ausgeführt wird.
Schon eine andere Quantisierung, Runtime, Backend-Auswahl oder Speichersituation kann das Ergebnis verändern – selbst wenn die Modellgewichte unverändert bleiben. Die Messung gilt deshalb immer für eine konkrete Kombination und nicht automatisch für alle Geräte oder Varianten eines Modells.
Zum Start veröffentlichte Liquid AI einen Datensatz mit mehr als 1.000 im Labor überprüften Kombinationen aus Modell, Quantisierung, Runtime, Gerät und Kontext. Die Daten umfassen mehr als 30 Modelle, mehrere Quantisierungsformate, llama.cpp-Builds für macOS, iOS, Windows und Android sowie Kontextlängen von 256 bis 8.192 Tokens. 3
Artificial Analysis ergänzt diese Inferenzdaten um eine Bewertung der Modellintelligenz auf Mobilgeräten. Damit stehen sich zwei Fragen gegenüber: Wie gut arbeitet das Modell – und wie schnell und effizient läuft es in einer bestimmten lokalen Bereitstellung? 33
Pipette bietet native Apps für iOS und Android, mit denen Modelle direkt auf einem Smartphone ausgeführt werden können. Die breitere Benchmark-Abdeckung enthält außerdem macOS und Windows über unterstützte Runtime-Builds. Als Referenzgeräte werden unter anderem das iPhone 17 Pro, das Galaxy S26 Ultra und ein MacBook Pro mit M5-Max-Chip genannt. 3
38
Vor einem Test muss das Modell auf das Gerät heruntergeladen werden. Pipette misst damit lokale Inferenz und nicht die Antwortzeit einer Cloud-API. 41
50
Auf der Bestenliste stehen Modelle aus Liquid AIs LFM2.5-Familie neben Varianten anderer Anbieter. Genannt werden unter anderem Gemma, Nanbeige, Granite und Qwen. 9
41
Ein Schwerpunkt des mobilen Intelligenzvergleichs liegt auf Modellen, die bei einer Quantisierung auf 4 Bit in 8 GB passen. Das ist für Smartphones relevant, deren Arbeitsspeicher deutlich stärker begrenzt ist als der eines Servers. 3
41
Bei lokalen Deployments unterscheidet Liquid AI insbesondere zwischen zwei Formaten:
Die Dateigröße eines quantisierten Modells ist jedoch nur ein Teil der Rechnung. Erst die Kombination aus Runtime, Backend und Hardware zeigt, wie schnell das Modell tatsächlich verarbeitet wird. 47
Der veröffentlichte Pipette-Datensatz nutzt standardisierte Konfigurationen mit Kontextlängen von 256 bis 8.192 Tokens. 3 Der separate mobile Intelligenzvergleich von Artificial Analysis arbeitet mit einer Grenze von 16K Tokens.
33
Diese Werte sind nicht mit dem maximal beworbenen Kontextfenster eines Modells gleichzusetzen. In der Dokumentation von Liquid AI werden für viele LFM-Modelle 32K Tokens und für LFM2.5-8B-A1B bis zu 128K Tokens angegeben. Das bedeutet aber nicht, dass ein Smartphone-Benchmark diese maximale Länge auch tatsächlich verwendet. 47
Pipette reduziert die Leistung nicht auf die Geschwindigkeit beim Ausgeben einzelner Tokens. Die fünf zentralen On-Device-Metriken decken ab:
Das ist für die Alltagserfahrung entscheidend. Ein Modell kann zwar sehr schnell Tokens erzeugen, beim Start aber lange warten lassen, zu viel Speicher belegen oder mit wachsendem Kontext deutlich langsamer werden. Besonders die Zeit für die komplette Antwort zeigt, wie sich ein lokaler Assistent für Nutzerinnen und Nutzer tatsächlich anfühlt.
Die Qualitätsseite des mobilen Vergleichs umfasst unter anderem Aufgaben zum Befolgen von Anweisungen, zur Tool-Nutzung und zum Schlussfolgern. 33
Jedes Ergebnis ist an eine ausdrücklich dokumentierte Konfiguration gebunden. Liquid AI veröffentlicht die verwendeten Protokolle und trennt im Dashboard Bestenliste, Detailergebnisse und Einreichungen. So lassen sich einzelne Benchmark-Zeilen nachvollziehen, statt nur einer Rangfolge zu vertrauen. 1
Auch die Software-Abhängigkeiten werden festgehalten. Für aktuelle öffentliche Performance-Ergebnisse sind beispielsweise bestimmte llama.cpp-Builds erforderlich, darunter b10216 und b10516. Dadurch soll verhindert werden, dass Änderungen an der Runtime fälschlich als Fortschritt des Modells oder der Hardware erscheinen. 2
Vollständig verschwinden mögliche Abweichungen dadurch nicht. Temperatur und Drosselung, der Zustand des Betriebssystems, verfügbarer Gerätespeicher, Firmware, Backend und dauerhafte Leistungsgrenzen können das Ergebnis beeinflussen. Aussagekräftig ist ein Vergleich vor allem dann, wenn diese Bedingungen übereinstimmen.
Die veröffentlichten Daten zeigen, warum Pipette konkrete Konfigurationen ausweist und kein universelles Modellranking verspricht:
Die zentrale Erkenntnis: Qualität, Geschwindigkeit, Latenz und Speicherverbrauch können in unterschiedliche Richtungen zeigen. Das schnellste Modell ist nicht automatisch das leistungsfähigste – und das Modell mit dem höchsten Qualitätswert nicht zwangsläufig die beste Wahl für ein Smartphone.
Die wichtigste Einschränkung des ersten mobilen Releases liegt in den unterschiedlichen Clients. Die iOS-Version kann Rechenleistung über Apples Metal-Ökosystem nutzen, einschließlich MLX. Die Android-Version war zunächst auf Inferenz über die CPU beschränkt. 41
50
Ein iPhone-Ergebnis mit MLX und Metal sowie ein Android-Ergebnis aus einer reinen CPU-Ausführung vergleichen daher nicht die gesamte KI-Hardware der beiden Geräte unter identischen Bedingungen. Das iPhone kann von GPU-Beschleunigung profitieren, während der Android-Wert den CPU-Pfad des aktuellen Clients abbildet.
Android-Ergebnisse bleiben nützlich, um lokale CPU-Inferenz und die Leistung dieser konkreten Implementierung zu beurteilen. Sie reichen aber nicht aus, um die gesamte KI-Hardware eines Smartphones zum Sieger zu erklären. Dafür wären gleichwertige GPU- oder NPU-Backends und derselbe Workload erforderlich.
Der Start der Benchmark-Suite fällt in eine Phase, in der Chiphersteller mit schnellerer lokaler und agentischer KI werben. Qualcomms Snapdragon 8 Elite Gen 5 setzt auf eine dritte Generation der Oryon-CPU mit bis zu 4,74 GHz. Qualcomm nennt außerdem 20 Prozent mehr CPU-Leistung und 35 Prozent bessere CPU-Energieeffizienz. 24
Für eine nachfolgende Snapdragon-Flaggschiffplattform hat Qualcomm zudem eine Oryon-CPU mit bis zu 5 GHz angekündigt. Die Architektur FlexCache soll es heterogenen CPU-Kernen ermöglichen, auf einen dynamisch zugewiesenen gemeinsamen Cache-Pool zuzugreifen. 23
Solche technischen Daten zeigen, warum On-Device-KI zunehmend zum Hardware-Wettbewerb wird. Die Taktrate allein sagt jedoch wenig über die Leistung eines Sprachmodells aus. Quantisierung, Speicherbandbreite, Cache-Verhalten, Runtime, GPU- oder NPU-Nutzung, Temperatur und dauerhaft verfügbare Leistung können ebenso wichtig sein.
Genau hier liegt Pipettes langfristiger Wert: Die Suite kann sichtbar machen, ob eine behauptete Chipverbesserung unter einem nachvollziehbaren Workload tatsächlich zu schnelleren Antworten, geringerer Latenz und effizienterem Speicherverbrauch führt. Zum jetzigen Zeitpunkt ist Pipette deshalb am besten als transparenter Deployment-Benchmark zu verstehen – nicht als endgültige Rangliste für iPhone- und Android-Hardware.
Studio Global AI
Diese Seite enthält eine quellengestützte Antwort, die Sie in Studio Global fortsetzen können.
Pipette wurde am 24. August gemeinsam mit Artificial Analysis veröffentlicht und bewertet komplette On Device Konfigurationen statt nur Modellgewichte.
Pipette wurde am 24. August gemeinsam mit Artificial Analysis veröffentlicht und bewertet komplette On Device Konfigurationen statt nur Modellgewichte. Die Suite umfasst mehr als 1.000 laborgestützte Konfigurationen, über 30 Modelle, mehrere Quantisierungsformate sowie llama.cpp Builds für macOS, iOS, Windows und Android.
Im mobilen Vergleich erreichten Nanbeige4.2 3B und LFM2.5 2.6B bei einem 16K Kontext gemeinsam den Spitzenwert von 63.
Pipette wurde am 24. August gemeinsam mit Artificial Analysis veröffentlicht und bewertet komplette On Device Konfigurationen statt nur Modellgewichte.
Veröffentlicht vonBearbeitet mit GPT-5.6 LunaBilder erstellt mit GPT Image 1.5
Forschungsantwort

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open-source on-device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open-source benchmark suite for measuring an actual on-device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload. Released August 24 wi. Topic tags: general, general web, user generated, academic, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wa
Liquid AI und Artificial Analysis wollen mit Pipette eine Lücke bei KI-Benchmarks schließen: Statt ein Modell unabhängig von seinem Einsatzort zu bewerten, misst die Open-Source-Suite, wie eine komplette Bereitstellung tatsächlich läuft – auf dem Smartphone, Laptop, PC oder anderer Edge-Hardware. Berücksichtigt werden dabei das Modell, die Quantisierung, die Laufzeitumgebung, das Gerät und der konkrete Workload. 3
1
Viele Bestenlisten vergleichen vor allem Fähigkeiten oder nennen eine einzelne Zahl für die Inferenzgeschwindigkeit. Pipette setzt an einer anderen Stelle an: Entscheidend ist nicht nur, welches Modell verwendet wird, sondern wie es auf einer bestimmten Hardware ausgeführt wird.
Schon eine andere Quantisierung, Runtime, Backend-Auswahl oder Speichersituation kann das Ergebnis verändern – selbst wenn die Modellgewichte unverändert bleiben. Die Messung gilt deshalb immer für eine konkrete Kombination und nicht automatisch für alle Geräte oder Varianten eines Modells.
Zum Start veröffentlichte Liquid AI einen Datensatz mit mehr als 1.000 im Labor überprüften Kombinationen aus Modell, Quantisierung, Runtime, Gerät und Kontext. Die Daten umfassen mehr als 30 Modelle, mehrere Quantisierungsformate, llama.cpp-Builds für macOS, iOS, Windows und Android sowie Kontextlängen von 256 bis 8.192 Tokens. 3
Artificial Analysis ergänzt diese Inferenzdaten um eine Bewertung der Modellintelligenz auf Mobilgeräten. Damit stehen sich zwei Fragen gegenüber: Wie gut arbeitet das Modell – und wie schnell und effizient läuft es in einer bestimmten lokalen Bereitstellung? 33
Pipette bietet native Apps für iOS und Android, mit denen Modelle direkt auf einem Smartphone ausgeführt werden können. Die breitere Benchmark-Abdeckung enthält außerdem macOS und Windows über unterstützte Runtime-Builds. Als Referenzgeräte werden unter anderem das iPhone 17 Pro, das Galaxy S26 Ultra und ein MacBook Pro mit M5-Max-Chip genannt. 3
38
Vor einem Test muss das Modell auf das Gerät heruntergeladen werden. Pipette misst damit lokale Inferenz und nicht die Antwortzeit einer Cloud-API. 41
50
Auf der Bestenliste stehen Modelle aus Liquid AIs LFM2.5-Familie neben Varianten anderer Anbieter. Genannt werden unter anderem Gemma, Nanbeige, Granite und Qwen. 9
41
Ein Schwerpunkt des mobilen Intelligenzvergleichs liegt auf Modellen, die bei einer Quantisierung auf 4 Bit in 8 GB passen. Das ist für Smartphones relevant, deren Arbeitsspeicher deutlich stärker begrenzt ist als der eines Servers. 3
41
Bei lokalen Deployments unterscheidet Liquid AI insbesondere zwischen zwei Formaten:
Die Dateigröße eines quantisierten Modells ist jedoch nur ein Teil der Rechnung. Erst die Kombination aus Runtime, Backend und Hardware zeigt, wie schnell das Modell tatsächlich verarbeitet wird. 47
Der veröffentlichte Pipette-Datensatz nutzt standardisierte Konfigurationen mit Kontextlängen von 256 bis 8.192 Tokens. 3 Der separate mobile Intelligenzvergleich von Artificial Analysis arbeitet mit einer Grenze von 16K Tokens.
33
Diese Werte sind nicht mit dem maximal beworbenen Kontextfenster eines Modells gleichzusetzen. In der Dokumentation von Liquid AI werden für viele LFM-Modelle 32K Tokens und für LFM2.5-8B-A1B bis zu 128K Tokens angegeben. Das bedeutet aber nicht, dass ein Smartphone-Benchmark diese maximale Länge auch tatsächlich verwendet. 47
Pipette reduziert die Leistung nicht auf die Geschwindigkeit beim Ausgeben einzelner Tokens. Die fünf zentralen On-Device-Metriken decken ab:
Das ist für die Alltagserfahrung entscheidend. Ein Modell kann zwar sehr schnell Tokens erzeugen, beim Start aber lange warten lassen, zu viel Speicher belegen oder mit wachsendem Kontext deutlich langsamer werden. Besonders die Zeit für die komplette Antwort zeigt, wie sich ein lokaler Assistent für Nutzerinnen und Nutzer tatsächlich anfühlt.
Die Qualitätsseite des mobilen Vergleichs umfasst unter anderem Aufgaben zum Befolgen von Anweisungen, zur Tool-Nutzung und zum Schlussfolgern. 33
Jedes Ergebnis ist an eine ausdrücklich dokumentierte Konfiguration gebunden. Liquid AI veröffentlicht die verwendeten Protokolle und trennt im Dashboard Bestenliste, Detailergebnisse und Einreichungen. So lassen sich einzelne Benchmark-Zeilen nachvollziehen, statt nur einer Rangfolge zu vertrauen. 1
Auch die Software-Abhängigkeiten werden festgehalten. Für aktuelle öffentliche Performance-Ergebnisse sind beispielsweise bestimmte llama.cpp-Builds erforderlich, darunter b10216 und b10516. Dadurch soll verhindert werden, dass Änderungen an der Runtime fälschlich als Fortschritt des Modells oder der Hardware erscheinen. 2
Vollständig verschwinden mögliche Abweichungen dadurch nicht. Temperatur und Drosselung, der Zustand des Betriebssystems, verfügbarer Gerätespeicher, Firmware, Backend und dauerhafte Leistungsgrenzen können das Ergebnis beeinflussen. Aussagekräftig ist ein Vergleich vor allem dann, wenn diese Bedingungen übereinstimmen.
Die veröffentlichten Daten zeigen, warum Pipette konkrete Konfigurationen ausweist und kein universelles Modellranking verspricht:
Die zentrale Erkenntnis: Qualität, Geschwindigkeit, Latenz und Speicherverbrauch können in unterschiedliche Richtungen zeigen. Das schnellste Modell ist nicht automatisch das leistungsfähigste – und das Modell mit dem höchsten Qualitätswert nicht zwangsläufig die beste Wahl für ein Smartphone.
Die wichtigste Einschränkung des ersten mobilen Releases liegt in den unterschiedlichen Clients. Die iOS-Version kann Rechenleistung über Apples Metal-Ökosystem nutzen, einschließlich MLX. Die Android-Version war zunächst auf Inferenz über die CPU beschränkt. 41
50
Ein iPhone-Ergebnis mit MLX und Metal sowie ein Android-Ergebnis aus einer reinen CPU-Ausführung vergleichen daher nicht die gesamte KI-Hardware der beiden Geräte unter identischen Bedingungen. Das iPhone kann von GPU-Beschleunigung profitieren, während der Android-Wert den CPU-Pfad des aktuellen Clients abbildet.
Android-Ergebnisse bleiben nützlich, um lokale CPU-Inferenz und die Leistung dieser konkreten Implementierung zu beurteilen. Sie reichen aber nicht aus, um die gesamte KI-Hardware eines Smartphones zum Sieger zu erklären. Dafür wären gleichwertige GPU- oder NPU-Backends und derselbe Workload erforderlich.
Der Start der Benchmark-Suite fällt in eine Phase, in der Chiphersteller mit schnellerer lokaler und agentischer KI werben. Qualcomms Snapdragon 8 Elite Gen 5 setzt auf eine dritte Generation der Oryon-CPU mit bis zu 4,74 GHz. Qualcomm nennt außerdem 20 Prozent mehr CPU-Leistung und 35 Prozent bessere CPU-Energieeffizienz. 24
Für eine nachfolgende Snapdragon-Flaggschiffplattform hat Qualcomm zudem eine Oryon-CPU mit bis zu 5 GHz angekündigt. Die Architektur FlexCache soll es heterogenen CPU-Kernen ermöglichen, auf einen dynamisch zugewiesenen gemeinsamen Cache-Pool zuzugreifen. 23
Solche technischen Daten zeigen, warum On-Device-KI zunehmend zum Hardware-Wettbewerb wird. Die Taktrate allein sagt jedoch wenig über die Leistung eines Sprachmodells aus. Quantisierung, Speicherbandbreite, Cache-Verhalten, Runtime, GPU- oder NPU-Nutzung, Temperatur und dauerhaft verfügbare Leistung können ebenso wichtig sein.
Genau hier liegt Pipettes langfristiger Wert: Die Suite kann sichtbar machen, ob eine behauptete Chipverbesserung unter einem nachvollziehbaren Workload tatsächlich zu schnelleren Antworten, geringerer Latenz und effizienterem Speicherverbrauch führt. Zum jetzigen Zeitpunkt ist Pipette deshalb am besten als transparenter Deployment-Benchmark zu verstehen – nicht als endgültige Rangliste für iPhone- und Android-Hardware.
Studio Global AI
Diese Seite enthält eine quellengestützte Antwort, die Sie in Studio Global fortsetzen können.
Pipette wurde am 24. August gemeinsam mit Artificial Analysis veröffentlicht und bewertet komplette On Device Konfigurationen statt nur Modellgewichte.
Pipette wurde am 24. August gemeinsam mit Artificial Analysis veröffentlicht und bewertet komplette On Device Konfigurationen statt nur Modellgewichte. Die Suite umfasst mehr als 1.000 laborgestützte Konfigurationen, über 30 Modelle, mehrere Quantisierungsformate sowie llama.cpp Builds für macOS, iOS, Windows und Android.
Im mobilen Vergleich erreichten Nanbeige4.2 3B und LFM2.5 2.6B bei einem 16K Kontext gemeinsam den Spitzenwert von 63.