أطلقت Liquid AI معيار Pipette في 24 أغسطس بالتعاون مع Artificial Analysis لقياس أداء الذكاء الاصطناعي محليًا على الأجهزة، لا أداء أوزان النموذج وحدها. يغطي الإصدار الأول أكثر من 1,000 إعداد يجمع بين النموذج والضغط الكمي ومحرك التشغيل والجهاز وسياق الاستخدام، عبر أكثر من 30 نموذجًا وأطوال سياق من 256 إلى 8,192 رمزًا.
نشر بواسطةتم التحرير باستخدام GPT-5.6 Lunaتم إنشاء الصور باستخدام GPT Image 1.5
إجابة البحث

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open-source on-device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open-source benchmark suite for measuring an actual on-device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload. Released August 24 wi. Topic tags: general, general web, user generated, academic, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wa
Pipette هو معيار مفتوح المصدر من Liquid AI لقياس نماذج الذكاء الاصطناعي حيث تُستخدم فعليًا: على الهواتف وأجهزة الكمبيوتر المحمولة والحواسيب الشخصية وغيرها من الأجهزة الطرفية. أُطلق المشروع في 24 أغسطس بالتعاون مع Artificial Analysis، لكنه لا يتعامل مع النموذج بوصفه وحدة القياس الوحيدة؛ بل يختبر عملية النشر كاملة، بما يشمل النموذج، والضغط الكمي، ومحرك التشغيل، والجهاز، وحجم المهمة. 3
1
تركّز كثير من لوحات الصدارة على درجات القدرة أو على رقم واحد لسرعة الاستدلال. أما Pipette فيحاول إظهار ما يحدث عند تشغيل النموذج في بيئة حقيقية. فقد تتغير النتيجة بسبب طريقة الضغط الكمي أو محرك التشغيل أو الذاكرة المتاحة أو نوع المعالج، حتى إذا بقيت أوزان النموذج نفسها دون تغيير.
وشمل الإطلاق مجموعة بيانات عامة لنتائج موثقة مخبريًا تغطي أكثر من 1,000 إعداد يجمع بين النموذج والضغط الكمي ومحرك التشغيل والجهاز وطول السياق. وتضم البيانات الأولية أكثر من 30 نموذجًا، وصيغ ضغط كمي متعددة، وإصدارات من llama.cpp لأنظمة macOS وiOS وWindows وAndroid، إضافة إلى أطوال سياق تتراوح بين 256 و8,192 رمزًا. 3
وتترافق قياسات الاستدلال في Pipette مع تقييم Artificial Analysis لمدى ذكاء النماذج المناسبة للهواتف. وبذلك ينظر المشروع إلى جانبين معًا: جودة أداء النموذج، وسرعة وكفاءة تشغيل إعداد معين على جهاز محدد. 33
يوفر Pipette تطبيقين أصليين لنظامي iOS وAndroid لتشغيل النماذج محليًا على الهاتف. كما تشمل تغطيته الأوسع نظامي macOS وWindows من خلال إصدارات محركات التشغيل المدعومة. وتذكر مواد الإطلاق أجهزة مرجعية مثل iPhone 17 Pro وGalaxy S26 Ultra وMacBook Pro المزود بشريحة M5 Max. 3
38
يجب تنزيل النموذج إلى الجهاز قبل بدء الاختبار، ولذلك يقيس Pipette الاستدلال المحلي، لا زمن الاستجابة الناتج عن الاتصال بواجهة برمجة سحابية. 41
50
تضم لوحة الصدارة عائلة LFM2.5 من Liquid AI إلى جانب نماذج من جهات أخرى، مثل Gemma وNanbeige وGranite وQwen وغيرها من النماذج الصغيرة أو المضغوطة. 9
41
ويدعم المعيار صيغًا متعددة للضغط الكمي. أما مقارنة الذكاء على الهواتف فركّزت على نماذج لا يتجاوز حجمها 8 غيغابايت عند ضغطها إلى 4 بت، وهو نطاق مناسب لاختبار الهواتف ذات الذاكرة المحدودة. 3
41
وبالنسبة إلى التشغيل المحلي، تميّز وثائق Liquid AI بين صيغة GGUF الشائعة مع llama.cpp على أهداف CPU وGPU، وصيغة MLX المصممة لتشغيل النماذج على أجهزة Apple Silicon. 47 ولا يكفي النظر إلى حجم ملف النموذج المضغوط؛ فمحرك التشغيل والواجهة العتادية يحددان كيفية معالجة النموذج فعليًا.
تقدم بيانات الإطلاق إعدادات استدلال موحدة بأطوال سياق من 256 إلى 8,192 رمزًا. 3 أما تقييم Artificial Analysis لذكاء النماذج على الهواتف فيستخدم حدًا أقصى يبلغ 16 ألف رمز.
33
ولا ينبغي الخلط بين هذه الحدود وبين أكبر نافذة سياق يعلنها النموذج. فوثائق Liquid AI تذكر سياقًا يبلغ 32 ألف رمز لعدد كبير من نماذج LFM، و128 ألف رمز لنموذج LFM2.5-8B-A1B، لكن قدرة النموذج النظرية لا تعني أن كل اختبار على الهاتف سيستخدم هذا الطول كاملًا. 47
يجمع Pipette عدة جوانب من أداء الجهاز بدل اختزال النتيجة في سرعة توليد الرموز. وتشمل مقاييسه الخمسة:
وتكمن أهمية هذا الجمع في أن الإعداد قد يولّد الرموز بسرعة، لكنه يتأخر في بدء الإجابة أو يستهلك ذاكرة كبيرة أو يتباطأ مع ازدياد طول السياق. لذلك يعد زمن الاستجابة الكامل مؤشرًا مهمًا على التجربة التي يحصل عليها المستخدم من المساعد المحلي.
أما Artificial Analysis فتوفّر جانب الجودة من خلال اختبارات تشمل اتباع التعليمات، واستخدام الأدوات، والاستدلال، وقدرات أخرى ذات صلة. 33
يربط Pipette كل نتيجة بإعداد واضح، وينشر البروتوكولات المستخدمة لإنتاج البيانات الموثقة. كما تفصل لوحة التحكم بين المقارنات العامة في لوحة الصدارة وبين النتائج التفصيلية وعمليات الإرسال، ما يتيح فحص صفوف القياس الأساسية بدل الاكتفاء بترتيب مختصر. 1
ويسجل المنهج أيضًا تبعيات محرك التشغيل. فعلى سبيل المثال، تقول Liquid AI إن نتائج الأداء العامة الحالية تتطلب إصدارات محددة من llama.cpp، من بينها الإصداران b10216 وb10516. 2 ويساعد تثبيت إصدار المحرك على منع التغييرات البرمجية من الظهور كما لو كانت تحسنًا ناتجًا عن العتاد أو النموذج.
لكن هذه الضوابط لا تلغي جميع مصادر التفاوت. فقد يؤثر ارتفاع حرارة الهاتف، وحالة نظام التشغيل، والذاكرة المتاحة، والبرمجيات الثابتة، واختيار الواجهة الخلفية، وحدود الطاقة المستمرة في النتيجة. وتصبح المقارنة أكثر معنى عندما تتطابق هذه المتغيرات.
توضح النتائج الأولية سبب إصرار Pipette على عرض إعدادات كاملة بدل تقديم ترتيب عالمي للنماذج:
والخلاصة أن الجودة والسرعة وزمن الاستجابة واستهلاك الذاكرة قد تسير في اتجاهات مختلفة. فالنموذج الأسرع ليس بالضرورة الأكثر قدرة، والنموذج صاحب أعلى درجة في اختبار القدرة ليس بالضرورة أفضل خيار لتشغيله على الهاتف.
أبرز قيود الإصدار الأول على الهواتف هو اختلاف التطبيقين. إذ يستطيع إصدار iOS استخدام الحوسبة عبر GPU ضمن منظومة Metal من Apple، بما في ذلك MLX، بينما كان إصدار Android في البداية محدودًا بالاستدلال عبر CPU. 41
50
لذلك لا تمثل نتيجة iPhone التي تستخدم MLX/Metal ونتيجة Android الناتجة عن CPU فقط مقارنة نظيفة بين كامل العتاد المخصص للذكاء الاصطناعي في الهاتفين. فقد تستفيد نتيجة iOS من تسريع GPU، في حين تعكس نتيجة Android أداء مسار CPU الذي يتيحه التطبيق الحالي.
وتظل نتائج Android مفيدة لفهم الاستدلال المحلي المعتمد على CPU والتجربة التي يقدمها هذا التنفيذ. لكنها لا تصلح لإعلان أن شرائح الذكاء الاصطناعي الكاملة في هاتف أسرع من هاتف آخر قبل اختبار واجهات GPU أو NPU متكافئة، وبحجم عمل واحد.
يأتي إطلاق Pipette في وقت تروّج فيه شركات الشرائح لقدرات أسرع لمعالجة الذكاء الاصطناعي المحلي والمهام الوكيلة. وتستخدم منصة Snapdragon 8 Elite Gen 5 من Qualcomm معالج Oryon من الجيل الثالث، بتردد يصل إلى 4.74 غيغاهرتز، مع ادعاء الشركة تحسن أداء CPU بنسبة 20% وكفاءة استهلاك طاقة CPU بنسبة 35%. 24
كما كشفت Qualcomm مبدئيًا عن منصة Snapdragon رائدة لاحقة تستهدف وصول معالج Oryon إلى 5 غيغاهرتز، مع بنية FlexCache التي تتيح للأنوية غير المتجانسة مشاركة مجموعة ذاكرة مخبئية تُخصص ديناميكيًا وفق حجم العمل. 23
توضح هذه المواصفات أن الذكاء الاصطناعي المحلي يتحول إلى ساحة تنافس عتادية، لكن تردد الساعة وحده لا يتنبأ بأداء نماذج اللغة. فالضغط الكمي، وعرض نطاق الذاكرة، وسلوك الذاكرة المخبئية، وتنفيذ محرك التشغيل، واستخدام GPU أو NPU، ودرجات الحرارة، وحدود الطاقة المستمرة قد تكون مؤثرة بالقدر نفسه.
وهنا تظهر فائدة منهج Pipette القائم على الإعدادات. فدوره الأهم على المدى الطويل هو إظهار ما إذا كان التحسن المعلن في شريحة ما يتحول فعلًا إلى ذكاء اصطناعي محلي أسرع وأكثر استجابة وأقل استهلاكًا للذاكرة، ضمن مهمة قابلة لإعادة الاختبار. وحتى الآن، من الأدق فهم Pipette بوصفه معيارًا شفافًا لقياس النشر الفعلي، لا حكمًا نهائيًا في مقارنة عتاد iPhone وAndroid.
Studio Global AI
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
أطلقت Liquid AI معيار Pipette في 24 أغسطس بالتعاون مع Artificial Analysis لقياس أداء الذكاء الاصطناعي محليًا على الأجهزة، لا أداء أوزان النموذج وحدها.
أطلقت Liquid AI معيار Pipette في 24 أغسطس بالتعاون مع Artificial Analysis لقياس أداء الذكاء الاصطناعي محليًا على الأجهزة، لا أداء أوزان النموذج وحدها. يغطي الإصدار الأول أكثر من 1,000 إعداد يجمع بين النموذج والضغط الكمي ومحرك التشغيل والجهاز وسياق الاستخدام، عبر أكثر من 30 نموذجًا وأطوال سياق من 256 إلى 8,192 رمزًا.
تصدّر نموذجا Nanbeige4.2 3B وLFM2.5 2.6B التقييم المشترك بمتوسط 63 عند حد سياق يبلغ 16 ألف رمز.
أطلقت Liquid AI معيار Pipette في 24 أغسطس بالتعاون مع Artificial Analysis لقياس أداء الذكاء الاصطناعي محليًا على الأجهزة، لا أداء أوزان النموذج وحدها. يغطي الإصدار الأول أكثر من 1,000 إعداد يجمع بين النموذج والضغط الكمي ومحرك التشغيل والجهاز وسياق الاستخدام، عبر أكثر من 30 نموذجًا وأطوال سياق من 256 إلى 8,192 رمزًا.
نشر بواسطةتم التحرير باستخدام GPT-5.6 Lunaتم إنشاء الصور باستخدام GPT Image 1.5
إجابة البحث

Create a landscape editorial hero image for this Studio Global article: What is Liquid AI’s Pipette, the free open-source on-device AI benchmarking platform released on August 24 by the startup founded by former. Article summary: Pipette is Liquid AI’s free, open-source benchmark suite for measuring an actual on-device deployment—not merely a model—across the combination of model, quantization, runtime, device, and workload. Released August 24 wi. Topic tags: general, general web, user generated, academic, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wa
Pipette هو معيار مفتوح المصدر من Liquid AI لقياس نماذج الذكاء الاصطناعي حيث تُستخدم فعليًا: على الهواتف وأجهزة الكمبيوتر المحمولة والحواسيب الشخصية وغيرها من الأجهزة الطرفية. أُطلق المشروع في 24 أغسطس بالتعاون مع Artificial Analysis، لكنه لا يتعامل مع النموذج بوصفه وحدة القياس الوحيدة؛ بل يختبر عملية النشر كاملة، بما يشمل النموذج، والضغط الكمي، ومحرك التشغيل، والجهاز، وحجم المهمة. 3
1
تركّز كثير من لوحات الصدارة على درجات القدرة أو على رقم واحد لسرعة الاستدلال. أما Pipette فيحاول إظهار ما يحدث عند تشغيل النموذج في بيئة حقيقية. فقد تتغير النتيجة بسبب طريقة الضغط الكمي أو محرك التشغيل أو الذاكرة المتاحة أو نوع المعالج، حتى إذا بقيت أوزان النموذج نفسها دون تغيير.
وشمل الإطلاق مجموعة بيانات عامة لنتائج موثقة مخبريًا تغطي أكثر من 1,000 إعداد يجمع بين النموذج والضغط الكمي ومحرك التشغيل والجهاز وطول السياق. وتضم البيانات الأولية أكثر من 30 نموذجًا، وصيغ ضغط كمي متعددة، وإصدارات من llama.cpp لأنظمة macOS وiOS وWindows وAndroid، إضافة إلى أطوال سياق تتراوح بين 256 و8,192 رمزًا. 3
وتترافق قياسات الاستدلال في Pipette مع تقييم Artificial Analysis لمدى ذكاء النماذج المناسبة للهواتف. وبذلك ينظر المشروع إلى جانبين معًا: جودة أداء النموذج، وسرعة وكفاءة تشغيل إعداد معين على جهاز محدد. 33
يوفر Pipette تطبيقين أصليين لنظامي iOS وAndroid لتشغيل النماذج محليًا على الهاتف. كما تشمل تغطيته الأوسع نظامي macOS وWindows من خلال إصدارات محركات التشغيل المدعومة. وتذكر مواد الإطلاق أجهزة مرجعية مثل iPhone 17 Pro وGalaxy S26 Ultra وMacBook Pro المزود بشريحة M5 Max. 3
38
يجب تنزيل النموذج إلى الجهاز قبل بدء الاختبار، ولذلك يقيس Pipette الاستدلال المحلي، لا زمن الاستجابة الناتج عن الاتصال بواجهة برمجة سحابية. 41
50
تضم لوحة الصدارة عائلة LFM2.5 من Liquid AI إلى جانب نماذج من جهات أخرى، مثل Gemma وNanbeige وGranite وQwen وغيرها من النماذج الصغيرة أو المضغوطة. 9
41
ويدعم المعيار صيغًا متعددة للضغط الكمي. أما مقارنة الذكاء على الهواتف فركّزت على نماذج لا يتجاوز حجمها 8 غيغابايت عند ضغطها إلى 4 بت، وهو نطاق مناسب لاختبار الهواتف ذات الذاكرة المحدودة. 3
41
وبالنسبة إلى التشغيل المحلي، تميّز وثائق Liquid AI بين صيغة GGUF الشائعة مع llama.cpp على أهداف CPU وGPU، وصيغة MLX المصممة لتشغيل النماذج على أجهزة Apple Silicon. 47 ولا يكفي النظر إلى حجم ملف النموذج المضغوط؛ فمحرك التشغيل والواجهة العتادية يحددان كيفية معالجة النموذج فعليًا.
تقدم بيانات الإطلاق إعدادات استدلال موحدة بأطوال سياق من 256 إلى 8,192 رمزًا. 3 أما تقييم Artificial Analysis لذكاء النماذج على الهواتف فيستخدم حدًا أقصى يبلغ 16 ألف رمز.
33
ولا ينبغي الخلط بين هذه الحدود وبين أكبر نافذة سياق يعلنها النموذج. فوثائق Liquid AI تذكر سياقًا يبلغ 32 ألف رمز لعدد كبير من نماذج LFM، و128 ألف رمز لنموذج LFM2.5-8B-A1B، لكن قدرة النموذج النظرية لا تعني أن كل اختبار على الهاتف سيستخدم هذا الطول كاملًا. 47
يجمع Pipette عدة جوانب من أداء الجهاز بدل اختزال النتيجة في سرعة توليد الرموز. وتشمل مقاييسه الخمسة:
وتكمن أهمية هذا الجمع في أن الإعداد قد يولّد الرموز بسرعة، لكنه يتأخر في بدء الإجابة أو يستهلك ذاكرة كبيرة أو يتباطأ مع ازدياد طول السياق. لذلك يعد زمن الاستجابة الكامل مؤشرًا مهمًا على التجربة التي يحصل عليها المستخدم من المساعد المحلي.
أما Artificial Analysis فتوفّر جانب الجودة من خلال اختبارات تشمل اتباع التعليمات، واستخدام الأدوات، والاستدلال، وقدرات أخرى ذات صلة. 33
يربط Pipette كل نتيجة بإعداد واضح، وينشر البروتوكولات المستخدمة لإنتاج البيانات الموثقة. كما تفصل لوحة التحكم بين المقارنات العامة في لوحة الصدارة وبين النتائج التفصيلية وعمليات الإرسال، ما يتيح فحص صفوف القياس الأساسية بدل الاكتفاء بترتيب مختصر. 1
ويسجل المنهج أيضًا تبعيات محرك التشغيل. فعلى سبيل المثال، تقول Liquid AI إن نتائج الأداء العامة الحالية تتطلب إصدارات محددة من llama.cpp، من بينها الإصداران b10216 وb10516. 2 ويساعد تثبيت إصدار المحرك على منع التغييرات البرمجية من الظهور كما لو كانت تحسنًا ناتجًا عن العتاد أو النموذج.
لكن هذه الضوابط لا تلغي جميع مصادر التفاوت. فقد يؤثر ارتفاع حرارة الهاتف، وحالة نظام التشغيل، والذاكرة المتاحة، والبرمجيات الثابتة، واختيار الواجهة الخلفية، وحدود الطاقة المستمرة في النتيجة. وتصبح المقارنة أكثر معنى عندما تتطابق هذه المتغيرات.
توضح النتائج الأولية سبب إصرار Pipette على عرض إعدادات كاملة بدل تقديم ترتيب عالمي للنماذج:
والخلاصة أن الجودة والسرعة وزمن الاستجابة واستهلاك الذاكرة قد تسير في اتجاهات مختلفة. فالنموذج الأسرع ليس بالضرورة الأكثر قدرة، والنموذج صاحب أعلى درجة في اختبار القدرة ليس بالضرورة أفضل خيار لتشغيله على الهاتف.
أبرز قيود الإصدار الأول على الهواتف هو اختلاف التطبيقين. إذ يستطيع إصدار iOS استخدام الحوسبة عبر GPU ضمن منظومة Metal من Apple، بما في ذلك MLX، بينما كان إصدار Android في البداية محدودًا بالاستدلال عبر CPU. 41
50
لذلك لا تمثل نتيجة iPhone التي تستخدم MLX/Metal ونتيجة Android الناتجة عن CPU فقط مقارنة نظيفة بين كامل العتاد المخصص للذكاء الاصطناعي في الهاتفين. فقد تستفيد نتيجة iOS من تسريع GPU، في حين تعكس نتيجة Android أداء مسار CPU الذي يتيحه التطبيق الحالي.
وتظل نتائج Android مفيدة لفهم الاستدلال المحلي المعتمد على CPU والتجربة التي يقدمها هذا التنفيذ. لكنها لا تصلح لإعلان أن شرائح الذكاء الاصطناعي الكاملة في هاتف أسرع من هاتف آخر قبل اختبار واجهات GPU أو NPU متكافئة، وبحجم عمل واحد.
يأتي إطلاق Pipette في وقت تروّج فيه شركات الشرائح لقدرات أسرع لمعالجة الذكاء الاصطناعي المحلي والمهام الوكيلة. وتستخدم منصة Snapdragon 8 Elite Gen 5 من Qualcomm معالج Oryon من الجيل الثالث، بتردد يصل إلى 4.74 غيغاهرتز، مع ادعاء الشركة تحسن أداء CPU بنسبة 20% وكفاءة استهلاك طاقة CPU بنسبة 35%. 24
كما كشفت Qualcomm مبدئيًا عن منصة Snapdragon رائدة لاحقة تستهدف وصول معالج Oryon إلى 5 غيغاهرتز، مع بنية FlexCache التي تتيح للأنوية غير المتجانسة مشاركة مجموعة ذاكرة مخبئية تُخصص ديناميكيًا وفق حجم العمل. 23
توضح هذه المواصفات أن الذكاء الاصطناعي المحلي يتحول إلى ساحة تنافس عتادية، لكن تردد الساعة وحده لا يتنبأ بأداء نماذج اللغة. فالضغط الكمي، وعرض نطاق الذاكرة، وسلوك الذاكرة المخبئية، وتنفيذ محرك التشغيل، واستخدام GPU أو NPU، ودرجات الحرارة، وحدود الطاقة المستمرة قد تكون مؤثرة بالقدر نفسه.
وهنا تظهر فائدة منهج Pipette القائم على الإعدادات. فدوره الأهم على المدى الطويل هو إظهار ما إذا كان التحسن المعلن في شريحة ما يتحول فعلًا إلى ذكاء اصطناعي محلي أسرع وأكثر استجابة وأقل استهلاكًا للذاكرة، ضمن مهمة قابلة لإعادة الاختبار. وحتى الآن، من الأدق فهم Pipette بوصفه معيارًا شفافًا لقياس النشر الفعلي، لا حكمًا نهائيًا في مقارنة عتاد iPhone وAndroid.
Studio Global AI
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
أطلقت Liquid AI معيار Pipette في 24 أغسطس بالتعاون مع Artificial Analysis لقياس أداء الذكاء الاصطناعي محليًا على الأجهزة، لا أداء أوزان النموذج وحدها.
أطلقت Liquid AI معيار Pipette في 24 أغسطس بالتعاون مع Artificial Analysis لقياس أداء الذكاء الاصطناعي محليًا على الأجهزة، لا أداء أوزان النموذج وحدها. يغطي الإصدار الأول أكثر من 1,000 إعداد يجمع بين النموذج والضغط الكمي ومحرك التشغيل والجهاز وسياق الاستخدام، عبر أكثر من 30 نموذجًا وأطوال سياق من 256 إلى 8,192 رمزًا.
تصدّر نموذجا Nanbeige4.2 3B وLFM2.5 2.6B التقييم المشترك بمتوسط 63 عند حد سياق يبلغ 16 ألف رمز.