Pipette היא חבילת בדיקות חינמית בקוד פתוח שמודדת פריסת AI מלאה על המכשיר — לא רק את המודל עצמו — לפי השילוב של מודל, קוונטיזציה, סביבת הרצה, מכשיר ועומס עבודה. הפלטפורמה הושקה ב־24 באוגוסט בשיתוף Artificial Analysis, ומשלבת מדידות ביצועים של Liquid AI עם הערכת איכות ויכולות של מודלים ניידים.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open source on device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open source benchmark suite for measuring an actual on device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload.. Topic tags: general web, llm, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait
Pipette היא חבילת בדיקות חינמית בקוד פתוח של Liquid AI, שפותחה בשיתוף Artificial Analysis. היא נועדה למדוד כיצד מודלי בינה מלאכותית מתפקדים כשהם רצים באמת על מכשיר קצה — למשל סמארטפון או מחשב — ולא רק על חומרת שרתים במעבדה.
הנקודה החשובה היא שיחידת המדידה אינה המודל לבדו. Pipette בוחנת את השילוב המלא של:
llama.cpp או MLX;כך אפשר לקבל תמונה מציאותית יותר של חוויית השימוש המקומית, במקום להסתמך על מספר יחיד של "טוקנים לשנייה" שמגיע מסביבת בדיקה שאינה דומה לטלפון של המשתמש. 119
ההשקה מ־24 באוגוסט כוללת מאגר תוצאות שנבדקו במעבדה ובו יותר מ־1,000 תצורות של מודל, קוונטיזציה, סביבת הרצה, מכשיר ואורך הקשר. המאגר כולל חמישה מדדי ביצועים, והטבלה הציבורית מכסה יותר מ־30 מודלים, שבע אפשרויות קוונטיזציה וארבעה מכשירים ראשוניים. 114
הבדיקות משתמשות בגרסאות מוגדרות של llama.cpp עבור macOS, iOS, Windows ואנדרואיד. אורכי ההקשר שנכללו במאגר ההשקה נעים בין 256 ל־8,192 טוקנים. 11
המודלים הראשוניים כוללים את משפחת LFM של Liquid AI, לצד מודלים קטנים של חברות אחרות, בהם Gemma ו־Nanbeige. בתיעוד של Liquid מופיעים גם פורמטים כמו GGUF, שמתאים להרצה מקומית באמצעות CPU או GPU, ו־MLX, שמיועד במיוחד למחשבי Mac עם שבבי Apple Silicon. 2
Pipette מציעה לקוחות ל־iOS ולאנדרואיד, והמודלים מורדים למכשיר לפני תחילת הבדיקה. כלומר, הבקשות אינן נשלחות לנקודת קצה בענן; המדידה מתבצעת מקומית על החומרה של המכשיר. 108
עם זאת, חשוב להבחין בין תמיכה במערכת הפעלה לבין כיסוי חומרתי מלא. העובדה שהאפליקציה פועלת על iOS או אנדרואיד אינה אומרת שכל מאיצי ה־AI של המכשיר כבר נכללים בבדיקה.
בגרסה הראשונית, iOS יכולה להשתמש בעיבוד GPU דרך Metal ו־MLX, ואילו לקוח האנדרואיד הראשוני מבצע את החישובים באמצעות CPU בלבד. 10 לכן, מספרי הביצועים הנוכחיים בין iPhone לבין מכשיר Android אינם השוואה נקייה בין השבבים עצמם: תוצאות iPhone עשויות ליהנות מהאצת GPU, בעוד שתוצאות Android משקפות הרצת CPU.
המודלים שנבדקו כוללים את דגמי LFM של Liquid AI ומודלים קטנים נוספים, כגון Gemma ו־Nanbeige. בהערכת היכולות הניידות התמקדו החוקרים במודלים שנכנסים לנפח של עד 8 ג׳יגה־בייט לאחר קוונטיזציה ל־4 ביט. 108
קוונטיזציה היא תהליך שמפחית את הדיוק המספרי של משקלי המודל כדי להקטין את צריכת הזיכרון ולעיתים גם לשפר את מהירות ההרצה. אך אותו מודל בדיוק יכול להתנהג אחרת לחלוטין לפי פורמט הקוונטיזציה, סביבת ההרצה והחומרה שעליה הוא עובד. לכן תוצאה של מודל בגרסת 4 ביט אינה בהכרח מייצגת את ביצועיו ב־8 ביט או ב־FP16.
גם אורכי ההקשר דורשים תשומת לב. בדיקות איכות המודל שפורסמו השתמשו במגבלת הקשר של 16K טוקנים. משפחת LFM עצמה כוללת מודלים עם הקשר של 32K טוקנים, ול־LFM2.5-8B-A1B יש הקשר של 128K טוקנים — אך אלה יכולות של המודלים, ולא בהכרח עומס העבודה האחיד ששימש בגרסה הראשונית של Pipette. 82
הפלטפורמה אינה מסתפקת במהירות יצירת הטקסט. המדדים כוללים ביצועי עיבוד קלט (prefill), מהירות יצירת הפלט (decode), הזמן עד לקבלת הטוקן הראשון, זמן התגובה הכולל וצריכת הזיכרון. 411
השילוב הזה חשוב משום שמודל יכול להציג קצב decode גבוה, אך עדיין להרגיש איטי אם לוקח לו זמן רב לעבד את ההנחיה הראשונית או אם זמן התגובה הכולל ארוך. גם צריכת הזיכרון משפיעה ישירות על האפשרות להריץ את המודל לצד אפליקציות אחרות ועל הסיכון להתחממות ולהאטה.
התרומה המרכזית של Pipette היא מתודולוגית. כל תוצאה קשורה לתצורה מפורשת ומלאה, מגיעה מהרצה מאומתת במעבדה ומלווה בפרוטוקולים שפורסמו. בנוסף, התוצאות מקבעות גם תלויות תוכנה — למשל גרסאות מסוימות של llama.cpp הנדרשות לתוצאות הביצועים הציבוריות. 4116
זה עדיף משמעותית מהשוואה בין נתוני "טוקנים לשנייה" מבודדים של יצרנים שונים. עם זאת, גם בדיקה מבוקרת אינה מבטלת את כל השונות: מצב מערכת ההפעלה, טמפרטורה, דגם מדויק של המכשיר, כמות ה־RAM, בחירת ה־backend והתנהגות צריכת החשמל יכולים להשפיע על התוצאה.
כדי ששתי תוצאות יהיו בנות־השוואה, צריך לוודא שכל השדות האלה זהים או לפחות מתועדים בבירור.
אחת התוצאות שפורסמו היא 48.37 טוקנים לשנייה ב־decode עבור Gemma 4 E2B בקוונטיזציה של 4 ביט, בהרצה באמצעות Apple MLX על iPhone 17 Pro. זו תוצאה חזקה עבור התצורה הספציפית הזו — Gemma 4 E2B, 4 ביט, MLX/Metal ו־iPhone 17 Pro — אך אין לקרוא לה "הציון של Gemma" או "המהירות של כל טלפון". 45
בהערכת היכולות עם הקשר של 16K טוקנים, Nanbeige4.2-3B ו־LFM2.5-2.6B חלקו את המקום הראשון בציון הממוצע, עם 63 נקודות. 98
הנתונים של Artificial Analysis מצביעים גם על הבדל בין איכות, מהירות ויעילות. למשל, LFM2.5-2.6B הגיע לציון המוביל תוך שימוש ב־2.3 ג׳יגה־בייט זיכרון ובזמן של 8.0 שניות למענה על הנחיה סטנדרטית של 1,024 טוקנים ב־iPhone 17 Pro. 9
Pipette מגיעה בתקופה שבה יצרניות שבבים מדגישות ביצועים טובים יותר למשימות AI מקומיות ואוטונומיות. Qualcomm טוענת כי מעבד ה־Oryon מהדור השלישי, המשולב בפלטפורמת Snapdragon 8 Elite Gen 5, מגיע לתדר של 4.74 ג׳יגה־הרץ, וכן מציגה שיפור של 20% בביצועי CPU ושל 35% ביעילות צריכת החשמל של ה־CPU. 14
בנפרד, Qualcomm חשפה תצוגה מקדימה של פלטפורמת Snapdragon עתידית עם מעבד Oryon שמכוון ל־5 ג׳יגה־הרץ וארכיטקטורת FlexCache, שמאפשרת חלוקה דינמית של המטמון בין הליבות. ההכרזות האלה מעידות על המרוץ להפוך משימות מקומיות למהירות ותגובתיות יותר, אך תדר השעון לבדו אינו מנבא את ביצועי ה־LLM.
רוחב פס הזיכרון, התנהגות המטמון, הקוונטיזציה, סביבת ההרצה, השימוש ב־GPU או NPU, הטמפרטורה ומגבלות ההספק המתמשך — כולם עשויים להיות חשובים לא פחות. 913
Pipette היא כלי שימושי ושקוף יותר למדידת AI מקומי משום שהיא בוחנת את הפריסה המלאה ולא מפרידה באופן מלאכותי בין המודל לבין המכשיר שעליו הוא רץ.
אבל נכון לעכשיו היא אינה מספקת דירוג סופי של "הטלפון המהיר ביותר ל־AI". כל עוד האנדרואיד נבדק בתחילה באמצעות CPU בלבד, בעוד שב־iOS אפשר להפעיל האצת GPU, השוואה ישירה בין הפלטפורמות עלולה להטעות. תמיכה ב־NPU וב־GPU של מכשירי Android תהיה הצעד החשוב הבא להשוואה הוגנת יותר. 64
לכן הדרך המדויקת ביותר לקרוא את תוצאות Pipette היא: איזו תצורה — מודל, דחיסה, סביבת הרצה ומכשיר — מספקת את האיזון הטוב ביותר בין איכות, מהירות, זמן תגובה וזיכרון בעומס עבודה מסוים.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Pipette היא חבילת בדיקות חינמית בקוד פתוח שמודדת פריסת AI מלאה על המכשיר — לא רק את המודל עצמו — לפי השילוב של מודל, קוונטיזציה, סביבת הרצה, מכשיר ועומס עבודה.
Pipette היא חבילת בדיקות חינמית בקוד פתוח שמודדת פריסת AI מלאה על המכשיר — לא רק את המודל עצמו — לפי השילוב של מודל, קוונטיזציה, סביבת הרצה, מכשיר ועומס עבודה. הפלטפורמה הושקה ב־24 באוגוסט בשיתוף Artificial Analysis, ומשלבת מדידות ביצועים של Liquid AI עם הערכת איכות ויכולות של מודלים ניידים.
המהדורה הציבורית כוללת יותר מ־1,000 תצורות שנבדקו במעבדה, חמישה מדדי ביצועים, יותר מ־30 מודלים, שבע אפשרויות קוונטיזציה וארבעה מכשירים ראשוניים.