Pipette ist eine kostenlose Open Source Benchmark Suite für vollständige On Device Konfigurationen aus Modell, Quantisierung, Laufzeit, Gerät und Arbeitslast. Der am 24.
Veröffentlicht vonBilder erstellt mit GPT Image 1.5
Forschungsantwort

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open source on device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open source benchmark suite for measuring an actual on device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload.. Topic tags: general web, llm, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait
Pipette ist eine kostenlose Open-Source-Benchmark-Suite von Liquid AI. Sie soll zeigen, wie gut ein KI-Modell tatsächlich auf einem Smartphone, Laptop oder einem anderen Edge-Gerät läuft. Gemeinsam mit Artificial Analysis veröffentlichte Liquid AI das Projekt am 24. August. Dabei kombiniert Pipette Messungen zur lokalen Inferenz mit einer Bewertung der Modellqualität für mobile Geräte. 11
9
Der entscheidende Unterschied zu einem gewöhnlichen Modellvergleich: Pipette misst nicht nur das Modell. Die eigentliche Vergleichseinheit ist die komplette Bereitstellungskonfiguration – also Modell, Quantisierung, Laufzeit, Gerät und Arbeitslast. Dadurch soll sichtbar werden, warum dasselbe Modell je nach App, Format, Hardware und Software unterschiedlich schnell oder speicherhungrig sein kann. 4
11
Die öffentliche Startversion enthält mehr als 1.000 im Labor überprüfte Konfigurationen und fünf On-Device-Leistungsmetriken. Die Rangliste deckt mehr als 30 Modelle, sieben Quantisierungsoptionen und zunächst vier Geräte ab. Zum Einsatz kommen unter anderem Builds von llama.cpp für macOS, iOS, Windows und Android; die veröffentlichten Performance-Daten berücksichtigen Kontextlängen von 256 bis 8.192 Tokens. 11
4
Gemessen werden unter anderem:
Damit will Pipette verhindern, dass eine einzelne hohe Decode-Rate als vollständiges Leistungsurteil missverstanden wird. Ein Modell kann etwa schnell Token erzeugen, aber lange bis zum ersten Token brauchen oder besonders viel Speicher belegen.
Pipette bietet native Clients für iOS und Android. Die Modelle werden heruntergeladen und anschließend lokal auf dem Gerät ausgeführt, statt über einen entfernten Server verarbeitet zu werden. 10
8
Zum unterstützten Modellbestand gehören Liquid AIs eigene LFM-Modelle sowie kleine Modelle anderer Anbieter, darunter Gemma und Nanbeige. Die mobile Intelligenzbewertung beschränkt sich auf Modelle, die nach einer 4-Bit-Quantisierung in einen Speicherrahmen von 8 GB passen. 10
8
Bei den Quantisierungsformaten umfasst die Startabdeckung sieben Optionen. Liquid AI beschreibt für lokale Bereitstellungen unter anderem GGUF als Format für CPU- und GPU-Inferenz über llama.cpp; MLX ist vor allem für Apple-Silicon-Geräte vorgesehen. 2 Die konkrete Geschwindigkeit hängt deshalb nicht nur von der Bitbreite, sondern auch vom verwendeten Runtime-Backend ab.
Die LFM-Modellbibliothek nennt für viele Modelle einen Kontext von 32.000 Tokens und für LFM2.5-8B-A1B bis zu 128.000 Tokens. Das sind jedoch Modellfähigkeiten und nicht automatisch die standardisierte Arbeitslast des Pipette-Intelligenztests. 2
Pipette veröffentlicht nicht nur Endwerte, sondern auch Messprotokolle und eine nachvollziehbare Zuordnung zur jeweiligen vollständigen Konfiguration. Die Ergebnisse stammen aus überprüften Laborläufen und werden in einer öffentlichen Datensammlung dokumentiert. Außerdem werden Softwareabhängigkeiten festgelegt: Für aktuelle öffentliche Performance-Ergebnisse sind beispielsweise bestimmte llama.cpp-Builds wie b10216 und b10516 erforderlich. 4
11
6
Das ist aussagekräftiger als eine isolierte Herstellerangabe wie „X Tokens pro Sekunde“. Vollständig verschwinden Unterschiede dadurch aber nicht. Temperatur, Betriebssystemzustand, Gerätemodell und RAM-Ausstattung sowie das Backend können die Resultate beeinflussen. Nur wenn diese Faktoren übereinstimmen, sind zwei Messwerte wirklich sauber vergleichbar.
Ein veröffentlichtes Beispiel ist ein Wert von 48,37 generierten Tokens pro Sekunde auf einem iPhone 17 Pro. Gemessen wurde Gemma 4 E2B in 4-Bit-Quantisierung über Apple MLX. Der Wert beschreibt daher genau diese Kombination – nicht pauschal die Leistung von Gemma 4 oder sämtlicher Smartphones. 4
5
Bei der mobilen Intelligenzbewertung unter einem Kontextlimit von 16.000 Tokens erreichten Nanbeige4.2-3B und LFM2.5-2.6B gemeinsam den Spitzenwert von 63 Punkten. 9
8 Artificial Analysis meldet außerdem, dass LFM2.5-2.6B auf einem iPhone 17 Pro eine standardisierte Eingabe mit 1.024 Tokens in 8,0 Sekunden bei 2,3 GB Speicher beantwortete.
9
Der direkte Vergleich zwischen iPhone und Android ist derzeit allerdings mit Vorsicht zu genießen:
Die aktuellen Zahlen sind deshalb kein sauberer Vergleich der gesamten Smartphone-Chips. Ein iPhone-Wert kann GPU-Beschleunigung enthalten, während ein Android-Wert die Inferenz auf der CPU abbildet. Die Android-Ergebnisse bleiben für die CPU-Leistung und die Nutzererfahrung unter diesem Backend interessant; sie beweisen aber nicht, dass die Hardware eines Geräts insgesamt schneller oder langsamer für lokale KI ist. 10
4
Die Veröffentlichung fällt in eine Phase, in der Chiphersteller mit immer schnelleren lokalen und agentischen KI-Arbeitslasten werben. Qualcomm gibt für die dritte Generation seiner Oryon-CPU im Snapdragon 8 Elite Gen 5 eine Taktrate von bis zu 4,74 GHz sowie Verbesserungen von 20 Prozent bei der CPU-Leistung und 35 Prozent bei der CPU-Energieeffizienz an. 14
Separat hat Qualcomm eine nachfolgende Snapdragon-Flaggschiffplattform mit einer Oryon-CPU vorgestellt, die bis zu 5 GHz erreichen soll. Hinzu kommt die FlexCache-Architektur, bei der sich unterschiedliche Kerne dynamisch einen Cache-Pool teilen können. Solche Angaben deuten auf schnellere lokale Anwendungen hin, doch die Taktrate allein sagt wenig über die LLM-Inferenz aus. Entscheidend sind auch Laufzeit, Speicherbandbreite, Cache-Verhalten, Quantisierung, GPU- oder NPU-Backend, Temperatur und die dauerhaft verfügbare Leistungsaufnahme. 9
13
Gerade deshalb wären künftig Messungen mit mehr Geräten, Android-GPU-Unterstützung und NPU-Beschleunigung wichtig. Sie könnten zeigen, ob ein Fortschritt tatsächlich von der CPU stammt oder durch GPU und NPU erzielt wird. Bis dahin ist Pipette am besten als transparenter Benchmark für konkrete Bereitstellungen zu verstehen – nicht als endgültige Rangliste der schnellsten Smartphone-Hardware. 6
4
Studio Global AI
Diese Seite enthält eine quellengestützte Antwort, die Sie in Studio Global fortsetzen können.
Pipette ist eine kostenlose Open Source Benchmark Suite für vollständige On Device Konfigurationen aus Modell, Quantisierung, Laufzeit, Gerät und Arbeitslast.
Pipette ist eine kostenlose Open Source Benchmark Suite für vollständige On Device Konfigurationen aus Modell, Quantisierung, Laufzeit, Gerät und Arbeitslast. Der am 24. August veröffentlichte Start umfasst mehr als 1.000 im Labor überprüfte Konfigurationen, fünf Leistungsmetriken, mehr als 30 Modelle, sieben Quantisierungsoptionen und zunächst vier Geräte.
Die App gibt es für iOS und Android. Modelle werden zunächst auf das Gerät geladen und dort lokal ausgeführt – ein Cloud Endpunkt ist nicht Teil des Tests.
Pipette ist eine kostenlose Open Source Benchmark Suite für vollständige On Device Konfigurationen aus Modell, Quantisierung, Laufzeit, Gerät und Arbeitslast. Der am 24.
Veröffentlicht vonBilder erstellt mit GPT Image 1.5
Forschungsantwort

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open source on device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open source benchmark suite for measuring an actual on device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload.. Topic tags: general web, llm, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait
Pipette ist eine kostenlose Open-Source-Benchmark-Suite von Liquid AI. Sie soll zeigen, wie gut ein KI-Modell tatsächlich auf einem Smartphone, Laptop oder einem anderen Edge-Gerät läuft. Gemeinsam mit Artificial Analysis veröffentlichte Liquid AI das Projekt am 24. August. Dabei kombiniert Pipette Messungen zur lokalen Inferenz mit einer Bewertung der Modellqualität für mobile Geräte. 11
9
Der entscheidende Unterschied zu einem gewöhnlichen Modellvergleich: Pipette misst nicht nur das Modell. Die eigentliche Vergleichseinheit ist die komplette Bereitstellungskonfiguration – also Modell, Quantisierung, Laufzeit, Gerät und Arbeitslast. Dadurch soll sichtbar werden, warum dasselbe Modell je nach App, Format, Hardware und Software unterschiedlich schnell oder speicherhungrig sein kann. 4
11
Die öffentliche Startversion enthält mehr als 1.000 im Labor überprüfte Konfigurationen und fünf On-Device-Leistungsmetriken. Die Rangliste deckt mehr als 30 Modelle, sieben Quantisierungsoptionen und zunächst vier Geräte ab. Zum Einsatz kommen unter anderem Builds von llama.cpp für macOS, iOS, Windows und Android; die veröffentlichten Performance-Daten berücksichtigen Kontextlängen von 256 bis 8.192 Tokens. 11
4
Gemessen werden unter anderem:
Damit will Pipette verhindern, dass eine einzelne hohe Decode-Rate als vollständiges Leistungsurteil missverstanden wird. Ein Modell kann etwa schnell Token erzeugen, aber lange bis zum ersten Token brauchen oder besonders viel Speicher belegen.
Pipette bietet native Clients für iOS und Android. Die Modelle werden heruntergeladen und anschließend lokal auf dem Gerät ausgeführt, statt über einen entfernten Server verarbeitet zu werden. 10
8
Zum unterstützten Modellbestand gehören Liquid AIs eigene LFM-Modelle sowie kleine Modelle anderer Anbieter, darunter Gemma und Nanbeige. Die mobile Intelligenzbewertung beschränkt sich auf Modelle, die nach einer 4-Bit-Quantisierung in einen Speicherrahmen von 8 GB passen. 10
8
Bei den Quantisierungsformaten umfasst die Startabdeckung sieben Optionen. Liquid AI beschreibt für lokale Bereitstellungen unter anderem GGUF als Format für CPU- und GPU-Inferenz über llama.cpp; MLX ist vor allem für Apple-Silicon-Geräte vorgesehen. 2 Die konkrete Geschwindigkeit hängt deshalb nicht nur von der Bitbreite, sondern auch vom verwendeten Runtime-Backend ab.
Die LFM-Modellbibliothek nennt für viele Modelle einen Kontext von 32.000 Tokens und für LFM2.5-8B-A1B bis zu 128.000 Tokens. Das sind jedoch Modellfähigkeiten und nicht automatisch die standardisierte Arbeitslast des Pipette-Intelligenztests. 2
Pipette veröffentlicht nicht nur Endwerte, sondern auch Messprotokolle und eine nachvollziehbare Zuordnung zur jeweiligen vollständigen Konfiguration. Die Ergebnisse stammen aus überprüften Laborläufen und werden in einer öffentlichen Datensammlung dokumentiert. Außerdem werden Softwareabhängigkeiten festgelegt: Für aktuelle öffentliche Performance-Ergebnisse sind beispielsweise bestimmte llama.cpp-Builds wie b10216 und b10516 erforderlich. 4
11
6
Das ist aussagekräftiger als eine isolierte Herstellerangabe wie „X Tokens pro Sekunde“. Vollständig verschwinden Unterschiede dadurch aber nicht. Temperatur, Betriebssystemzustand, Gerätemodell und RAM-Ausstattung sowie das Backend können die Resultate beeinflussen. Nur wenn diese Faktoren übereinstimmen, sind zwei Messwerte wirklich sauber vergleichbar.
Ein veröffentlichtes Beispiel ist ein Wert von 48,37 generierten Tokens pro Sekunde auf einem iPhone 17 Pro. Gemessen wurde Gemma 4 E2B in 4-Bit-Quantisierung über Apple MLX. Der Wert beschreibt daher genau diese Kombination – nicht pauschal die Leistung von Gemma 4 oder sämtlicher Smartphones. 4
5
Bei der mobilen Intelligenzbewertung unter einem Kontextlimit von 16.000 Tokens erreichten Nanbeige4.2-3B und LFM2.5-2.6B gemeinsam den Spitzenwert von 63 Punkten. 9
8 Artificial Analysis meldet außerdem, dass LFM2.5-2.6B auf einem iPhone 17 Pro eine standardisierte Eingabe mit 1.024 Tokens in 8,0 Sekunden bei 2,3 GB Speicher beantwortete.
9
Der direkte Vergleich zwischen iPhone und Android ist derzeit allerdings mit Vorsicht zu genießen:
Die aktuellen Zahlen sind deshalb kein sauberer Vergleich der gesamten Smartphone-Chips. Ein iPhone-Wert kann GPU-Beschleunigung enthalten, während ein Android-Wert die Inferenz auf der CPU abbildet. Die Android-Ergebnisse bleiben für die CPU-Leistung und die Nutzererfahrung unter diesem Backend interessant; sie beweisen aber nicht, dass die Hardware eines Geräts insgesamt schneller oder langsamer für lokale KI ist. 10
4
Die Veröffentlichung fällt in eine Phase, in der Chiphersteller mit immer schnelleren lokalen und agentischen KI-Arbeitslasten werben. Qualcomm gibt für die dritte Generation seiner Oryon-CPU im Snapdragon 8 Elite Gen 5 eine Taktrate von bis zu 4,74 GHz sowie Verbesserungen von 20 Prozent bei der CPU-Leistung und 35 Prozent bei der CPU-Energieeffizienz an. 14
Separat hat Qualcomm eine nachfolgende Snapdragon-Flaggschiffplattform mit einer Oryon-CPU vorgestellt, die bis zu 5 GHz erreichen soll. Hinzu kommt die FlexCache-Architektur, bei der sich unterschiedliche Kerne dynamisch einen Cache-Pool teilen können. Solche Angaben deuten auf schnellere lokale Anwendungen hin, doch die Taktrate allein sagt wenig über die LLM-Inferenz aus. Entscheidend sind auch Laufzeit, Speicherbandbreite, Cache-Verhalten, Quantisierung, GPU- oder NPU-Backend, Temperatur und die dauerhaft verfügbare Leistungsaufnahme. 9
13
Gerade deshalb wären künftig Messungen mit mehr Geräten, Android-GPU-Unterstützung und NPU-Beschleunigung wichtig. Sie könnten zeigen, ob ein Fortschritt tatsächlich von der CPU stammt oder durch GPU und NPU erzielt wird. Bis dahin ist Pipette am besten als transparenter Benchmark für konkrete Bereitstellungen zu verstehen – nicht als endgültige Rangliste der schnellsten Smartphone-Hardware. 6
4
Studio Global AI
Diese Seite enthält eine quellengestützte Antwort, die Sie in Studio Global fortsetzen können.
Pipette ist eine kostenlose Open Source Benchmark Suite für vollständige On Device Konfigurationen aus Modell, Quantisierung, Laufzeit, Gerät und Arbeitslast.
Pipette ist eine kostenlose Open Source Benchmark Suite für vollständige On Device Konfigurationen aus Modell, Quantisierung, Laufzeit, Gerät und Arbeitslast. Der am 24. August veröffentlichte Start umfasst mehr als 1.000 im Labor überprüfte Konfigurationen, fünf Leistungsmetriken, mehr als 30 Modelle, sieben Quantisierungsoptionen und zunächst vier Geräte.
Die App gibt es für iOS und Android. Modelle werden zunächst auf das Gerät geladen und dort lokal ausgeführt – ein Cloud Endpunkt ist nicht Teil des Tests.