قالت Floatboat إن النموذج نفسه، DeepSeek V4 Flash، تجاوز مقارنات Claude Opus 4.8 المنشورة في خمسة اختبارات عامة للوكلاء بعد استبدال بيئة التنفيذ فقط؛ لكن النتيجة لم تخضع لإعادة تحقق مستقلة. عند افتراض نسبة 3 إلى 1 بين رموز الإدخال والإخراج، بلغت تكلفة DeepSeek المدمجة 0.175 دولار لكل مليون رمز مقابل 10 دولارات لـ Op...
إجابة البحث

Create a landscape editorial hero image for this Studio Global article: How did AOE Tech Labs’ Floatboat team’s August 7, 2026 single-variable Harness benchmark experiment show that DeepSeek-V4-Flash—the $0.14 mo. Article summary: Floatboat’s August 7 result is best understood as a vendor-reported ablation: it held the DeepSeek-V4-Flash model constant and replaced the execution harness. Its claim is not that model capability ceased to matter, but . Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
لا ينبغي قراءة تجربة Floatboat المعلنة في 7 أغسطس 2026 على أنها دليل قاطع على أن DeepSeek-V4-Flash أكثر قدرة جوهريًا من Claude Opus 4.8. الأدق أنها تجربة عزل متغير واحدة أبلغت عنها الشركة: ثبّتت النموذج، ثم استبدلت بيئة التشغيل أو الـHarness المحيطة به.
وبحسب Floatboat، كان هذا التغيير كافيًا لرفع النموذج منخفض التكلفة فوق المقارنات المنشورة لـOpus 4.8 في خمسة اختبارات عامة للوكلاء. 3
الاستنتاج الأهم أضيق نطاقًا وأكثر فائدة: في المهام التي تستمر طويلًا، قد تسهم المنظومة التي تدير النموذج في نجاح الوكيل بقدر إسهام النموذج نفسه. لكن هذه النتيجة ما تزال مؤشرًا أوليًا، لأن التجربة لم تُكرَّر مستقلًا حتى الآن.
تقول الشركة إنها استخدمت الإصدار الرسمي DeepSeek-V4-Flash-0731، مع المدخلات والمعلمات نفسها، ثم قارنت بين بيئة DeepSeek الرسمية المبسطة وبيئة التقييم الخاصة بها. تضمنت بيئة Floatboat صندوق تشغيل فعليًا معزولًا، ومساحة عمل وملفات، وأدوات، وحالة محفوظة، وحلقة تنفيذ تسمح للوكيل بفحص النتائج، وتصحيح الأخطاء، ومواصلة العمل. 3
وهذا فارق جوهري. فالوكيل لا ينجح بمجرد إنتاج إجابة جيدة مرة واحدة؛ بل يحتاج إلى التفاعل المتكرر مع البيئة، وملاحظة ما حدث، وتحديث خطته، والحفاظ على العمل الذي أنجزه بدل إفساده في الخطوة التالية.
في بيئة Floatboat، أبلغت الشركة عن النتائج التالية لـDeepSeek-V4-Flash:
وتقول Floatboat إن هذه النتائج تجاوزت المقارنات المنشورة لـClaude Opus 4.8 في الاختبارات الخمسة كلها. 3
لكن العنوان يحتاج إلى قدر من التحفظ. فالمقارنات العامة بين الاختبارات قد تجمع نتائج أُجريت باستخدام بيئات تشغيل، وتوجيهات، وإعدادات أدوات، وطرق أخذ عينات، وإجراءات تقييم مختلفة.
لذلك فإن الجزء الأكثر دلالة في التجربة هو المقارنة المضبوطة نسبيًا بين النموذج نفسه مع بيئتي تشغيل مختلفتين، لا مجرد وضع أنظمة غير متماثلة على جدول ترتيب واحد. ومع ذلك، تظل النتيجة تقريرًا صادرًا عن الشركة نفسها.
بحسب الأسعار المذكورة، تبلغ تكلفة DeepSeek:
وعند افتراض أن نسبة الإدخال إلى الإخراج هي 3 إلى 1، تصبح التكلفة المدمجة:
(3 × 0.14 + 0.28) ÷ 4 = 0.175 دولار لكل مليون رمز
أما أسعار Claude Opus 4.8 المستخدمة في المقارنة فهي:
وبالنسبة نفسها، تكون التكلفة المدمجة:
(3 × 5 + 25) ÷ 4 = 10 دولارات لكل مليون رمز
أي أن Opus أغلى بنحو 57.1 مرة وفق تسعير رموز الواجهة المدمج. 3
لكن هذا لا يعني أن إنجاز المهمة كاملة يكلف 57.1 مرة أكثر. فالحساب لا يشمل رسوم الأدوات، أو تكاليف الحوسبة، أو التخزين المؤقت، أو طول السياق، أو المحاولات المعادة، أو أعمال الهندسة، أو تكلفة تشغيل الـHarness نفسه. إنها مقارنة لسعر رموز النموذج، وليست تحليلًا شاملًا للتكلفة الكلية.
أبلغت Floatboat عن مكاسب نسبية بلغت 1.9% و9.6% و12.6% و19.9% و23.6% عند ترتيب الاختبارات من المهام الأقصر إلى الأعمال الأطول أفقًا. وتعرض الشركة هذا التسلسل باعتباره غير متناقص: كلما زاد عدد الخطوات المترابطة، ازداد أثر بيئة التشغيل. 3
وقد يفشل الوكيل في مهمة طويلة حتى عندما تبدو قراراته الفردية معقولة. فهو يحتاج إلى:
قد يحوّل مسار تنفيذ ضعيف التفكير الجيد إلى سياق مفقود، أو استدعاءات أدوات غير صالحة، أو إنهاء مبكر للمهمة، أو تغييرات لا يمكن استردادها. ويساعد النموذج الأقوى في تحسين القرارات المحلية، لكنه لا يستطيع تعويض بيئة لا تحفظ الحالة، ولا توفر تغذية راجعة مفيدة، ولا تتيح التعافي الآمن.
لهذا تتجاوز دلالة النتيجة مقارنة نموذجين بعينهما. فهي تنقل السؤال من: «أي نموذج أذكى؟» إلى: «أي تركيبة من نموذج وبيئة تشغيل تستطيع إنهاء المهمة بصورة موثوقة؟»
قدمت Floatboat مقياسًا أسمته Harness Leverage Ratio، أو HLR، لمقارنة فائدة تغيير بيئة التشغيل بفائدة ترقية النموذج:
HLR = المكسب الناتج عن تغيير بيئة التشغيل
────────────────────────────────
المكسب الناتج عن الترقية إلى النظام المرجعي الأقوى
إذا تجاوزت قيمة HLR الرقم 1، فهذا يعني أن تغيير بيئة التشغيل حقق، في الاختبار والمقارنة المحددين، زيادة في النتيجة أكبر من الزيادة المقاسة عند الانتقال إلى النظام المرجعي الأقوى.
لكن HLR ليس معيارًا معتمدًا في الصناعة، وتعتمد قيمته على النموذج الأساسي، والنظام المرجعي، وإصدار الاختبار، وضوابط التقييم المختارة. 2
4
في اختبار DeepSWE، قالت Floatboat إن نتيجة Flash ارتفعت من 54.4 في بيئة DeepSeek إلى 67.25 في بيئتها، أي بزيادة قدرها 12.85 نقطة. أما نتيجة Opus 4.8 المشار إليها فكانت 58.0، بفارق 3.6 نقاط عن خط أساس DeepSeek. وبذلك يصل HLR إلى نحو 3.57. 3
كما أبلغت الشركة عن ارتفاع HLR من 0.78 في أقصر مهمة إلى 3.57 في أطولها. وإذا أكدت اختبارات مستقلة هذا النمط، فقد يدعم فكرة أن تحسينات بيئة التشغيل تصبح أكثر قيمة على نحو متزايد عندما تتطلب المهمة حفظ حالة أكبر، واستدعاءات أدوات أكثر، وقدرات أفضل على التعافي.
لكن لا ينبغي التعامل مع ذلك كقانون عام؛ فتغيير النظام المرجعي أو طريقة التقييم قد يغيّر النسبة.
تتوافق هذه النتائج مع تموضع Floatboat الأوسع. فالمواد المنشورة تصفها بأنها بيئة عمل أصلية لوكلاء الذكاء الاصطناعي موجهة إلى العاملين بصورة مستقلة، وتجمع الملفات، والتصفح، وتفاعلات الذكاء الاصطناعي، والجدولة، والاتصالات، والمهارات أو مسارات العمل القابلة لإعادة الاستخدام. 1
وفي إعلان إطلاق صدر في مايو 2026، قالت الشركة إن تركيزها يشمل مسارات عمل استباقية يديرها الوكيل وفقًا للجدول الزمني، كما ذكرت أن Sequoia وWelight Capital من داعميها. 18
هذه الرؤية تتعامل مع بيئة التشغيل باعتبارها طبقة أساسية، لا مجرد غلاف رقيق حول نموذج لغوي. فالوكيل يحتاج إلى الحفاظ على السياق بين التطبيقات، والعمل في الوقت المناسب، واحترام الصلاحيات، وإحراز تقدم من دون أن يضطر المستخدم إلى إعادة بناء كل خطوة يدويًا.
إذا صمدت النتيجة أمام الاختبارات المستقلة، فقد ينتقل جانب كبير من المنافسة في وكلاء الاستخدام اليومي إلى طبقة التنفيذ نفسها: إدارة آمنة للحالة، ورصد واضح لما يحدث، والتحقق من النتائج، والتعافي من الأخطاء، وإدارة الصلاحيات، والتحكم من جانب المستخدم.
وقد يتيح ذلك استراتيجية أكثر مرونة لاختيار النماذج. فالنماذج الأقل تكلفة يمكن أن تتولى الأعمال الروتينية جيدة التنظيم داخل بيئة موثوقة، بينما تُحجز النماذج الأعلى سعرًا للمهام التي تتطلب فعلًا استدلالًا أو حكمًا أعمق.
بعبارة أخرى، قد لا يكون أفضل منتج هو النموذج الأرخص أو الأقوى منفردًا، بل النظام الذي يستخدم كل نموذج في الموضع الذي يحقق فيه أكبر فائدة.
تظل المذكرة التقنية الخاصة بـFloatboat أقوى دليل متاح على تجربة 7 أغسطس، كما تقر الشركة بأن المقارنات الأوسع بين النماذج استخدمت بيئات تشغيل وإعدادات تقييم مختلفة.
وتُعد تجربة إبقاء النموذج ثابتًا وتغيير الـHarness أكثر فائدة من مجرد عنوان «خمسة انتصارات»، لكن تحويل النتيجة إلى حقيقة مستقرة في الصناعة يتطلب إعادة تشغيل مستقلة، ونشر ملفات التقييم، وضبط التوجيهات والميزانيات والأدوات والمحاولات المعادة وإصدارات البيانات بصورة أكثر صرامة. 3
Studio Global AI
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
قالت Floatboat إن النموذج نفسه، DeepSeek V4 Flash، تجاوز مقارنات Claude Opus 4.8 المنشورة في خمسة اختبارات عامة للوكلاء بعد استبدال بيئة التنفيذ فقط؛ لكن النتيجة لم تخضع لإعادة تحقق مستقلة.
قالت Floatboat إن النموذج نفسه، DeepSeek V4 Flash، تجاوز مقارنات Claude Opus 4.8 المنشورة في خمسة اختبارات عامة للوكلاء بعد استبدال بيئة التنفيذ فقط؛ لكن النتيجة لم تخضع لإعادة تحقق مستقلة. عند افتراض نسبة 3 إلى 1 بين رموز الإدخال والإخراج، بلغت تكلفة DeepSeek المدمجة 0.175 دولار لكل مليون رمز مقابل 10 دولارات لـ Opus، أي أن Opus أغلى بنحو 57.1 مرة على مستوى رموز واجهة البرمجة.
ازدادت مكاسب بيئة التشغيل المعلنة من 1.9% في المهام الأقصر إلى 23.6% في المهام الأطول، ما يشير إلى أهمية حفظ الحالة، واستخدام الأدوات، والتحقق، والتعافي من الأخطاء في المهام متعددة الخطوات.