استقر سعر واجهة البرمجة API عند 0.14 دولار لكل مليون رمز إدخال و0.28 دولار لكل مليون رمز إخراج، بينما قد ينخفض سعر الرموز المخزنة مؤقتًا إلى 0.028 دولار لكل مليون رمز . وبحسب المقارنات المتاحة، يجعل ذلك النموذج من أرخص واجهات البرمجة ضمن فئة نماذج الاستدلال المتقدمة؛ إذ يقل عن سعر Gemini 2.5 Flash البالغ 0.30 دولار للإدخال و2.50 دولار للإخراج لكل مليون رمز .
أما نسخة 0731، وهي نسخة أُعيد تدريبها، فقد صدرت في 31 يوليو 2026 بوصفها النسخة التجريبية العامة الرسمية للواجهة البرمجية. وتشير التقارير المتاحة إلى تفوقها على V4-Pro-Preview في بعض اختبارات الوكلاء، محققة 82.7 في Terminal Bench 2.1 و76.7 في Cybergym . كما تتيح التحكم في مستوى الاستدلال عبر أوضاع قياسية وعالية وأقصى، إلى جانب وضع غير استدلالي مناسب للعمليات ذات الإنتاجية العالية .
أطلقت شركة MiniMax نموذج H3 في 31 يوليو 2026، وقدّمته باعتباره نموذج توليد عامًّا متعدد الوسائط قادرًا على فهم النصوص والصور والفيديو والصوت ضمن سياق موحد . ويمكنه إنتاج فيديو تصل مدته إلى 15 ثانية بدقة 2K، أي 2560×1440 بكسل، وبمعدل 24 إطارًا في الثانية، مع صوت ستيريو أصلي يُنتج في عملية الاستدلال نفسها بدل إضافته عبر مسار صوتي منفصل .
ويدعم H3 إدخال ما يصل إلى 9 صور و3 مقاطع فيديو و3 مسارات صوتية في الطلب الواحد . كما تعهدت MiniMax بإتاحة أوزان النموذج خلال أيام، مع الإشارة إلى أن الإتاحة كانت وعدًا عند الإطلاق وليست بالضرورة تسليمًا فوريًا للأوزان . وذكرت الشركة أن تكلفة الثانية الواحدة بدقة 2K تقل عن ثلث تكلفة النماذج المنافسة السائدة .
يمثل هذا التوجه توسعًا لنهج الأوزان المفتوحة من نماذج اللغة إلى توليد الفيديو، في مجال لا تزال فيه نماذج تجارية بارزة مغلقة المصدر .
أعلنت ByteDance عن Seedance 2.5 في مؤتمر Volcano Engine FORCE بتاريخ 23 يونيو 2026 ، ثم فُتح الوصول العام إلى واجهته البرمجية في 16 يوليو 2026 .
ويتمثل أبرز تحديث في القدرة على توليد فيديو مدته 30 ثانية في عملية واحدة متواصلة، بدل تركيب عدة مقاطع قصيرة لاحقًا . وتشير المواد المتاحة إلى دعم دقة تصل إلى 4K وعمق ألوان 10 بت . كما يقبل النموذج ما يصل إلى 50 مرجعًا متعدد الوسائط، تشمل الصور والمقاطع الصوتية والنماذج البيضاء ثلاثية الأبعاد وإطارات الأسلوب وتوجيهات المشهد، مقارنة بـ12 مرجعًا في الإصدار السابق .
وأتاحت ByteDance كذلك التحرير على مستوى المناطق، بحيث يمكن تعديل جزء محدد من المقطع المولّد دون إعادة توليد التسلسل بأكمله . وتُذكر للتقنية تطبيقات في صناعة الأفلام والإعلانات والتعليم والتصنيع الصناعي ومحاكاة القيادة الذاتية .
رغم اختلاف وظائف النماذج الثلاثة — إذ يركز DeepSeek على الاستدلال النصي، بينما يركز H3 وSeedance على الفيديو — فإن إطلاقاتها تشترك في ثلاثة اتجاهات استراتيجية:
أشارت الصياغة الأصلية إلى إطلاق النماذج الثلاثة في ديسمبر 2024، وإلى أن النماذج الصينية مفتوحة المصدر تمثل 41% من التنزيلات العالمية، فضلًا عن مزاعم أمريكية بشأن «تقطير» النماذج ورفض الصين لهذه الاتهامات. لكن نتائج البحث المتاحة هنا لا تثبت تاريخ ديسمبر 2024 ولا الإحصائية المحددة البالغة 41%، كما لا توثق تلك المزاعم السياسية على نحو كافٍ. وقد تكون بعض هذه الإشارات مرتبطة بأحداث أقدم تخص DeepSeek-V3 أو Qwen، لكن لا يمكن تأكيد ذلك من المصادر المقدمة.
| النموذج | تاريخ الإطلاق | أبرز المواصفات |
|---|---|---|
| DeepSeek V4-Flash | معاينة: 24 أبريل 2026؛ نسخة تجريبية عامة: 31 يوليو 2026 | 284 مليار مَعلمة بنية MoE، منها 13 مليارًا نشطة؛ سياق مليون رمز؛ 0.14 دولار لكل مليون رمز إدخال |
| MiniMax H3 | 31 يوليو 2026 | فيديو 2K لمدة تصل إلى 15 ثانية؛ صوت ستيريو أصلي؛ أوزان مفتوحة موعودة |
| ByteDance Seedance 2.5 | الإعلان: 23 يونيو 2026؛ واجهة API: 16 يوليو 2026 | فيديو متواصل لمدة 30 ثانية؛ دقة تصل إلى 4K بحسب المواد المتاحة؛ 50 مرجعًا متعدد الوسائط |
الخلاصة أن هذه الإصدارات لا تمثل حدثًا وقع في يوم واحد من عام 2024، بل تسارعًا موزعًا على أشهر عدة في منتصف عام 2026. ويبرز بينها نمط واضح: تكلفة أقل، تكامل أوسع بين الوسائط، وفيديوهات أطول، مع دفع متزايد نحو إتاحة الأوزان أمام المطورين.