المقصود بالتعددية الأصلية للوسائط هو أن يتعامل الوكيل مع النص والصورة والفيديو والكود ضمن دورة واحدة: يبني النتيجة، ويرى ما عُرض منها، ثم يراجعها ويحسّنها. تصف Kimi K3 وQwen3.8 Max هذا النهج صراحةً؛ وقد سجلت Kimi K3 1,679 نقطة في Frontend Code Arena، بينما تقول Qwen إن الفهم البصري يمتد من التخطيط إلى التنفيذ والتحقق.
إجابة البحث

Create a landscape editorial hero image for this Studio Global article: Why are Moonshot AI’s Kimi K3, Alibaba’s Qwen3.8-Max, and ByteDance’s Doubao-Seed-2.1 pursuing native multimodal training while DeepSeek, Zh. Article summary: The split is primarily a product and training bet: native multimodal models treat visual perception as part of the agent’s core reasoning-and-action loop, while text-first models optimize the cheaper, better-established . Topic tags: general, news, general web, documentation, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
الفارق المتزايد بين نماذج الذكاء الاصطناعي المتقدمة لا يتعلق فقط بقدرتها على استقبال صورة، بل بما إذا كانت الأدلة البصرية جزءاً أصيلاً من دورة تفكير الوكيل واتخاذه للإجراء.
تُقدَّم Kimi K3 من Moonshot AI كنموذج وكيلي متعدد الوسائط أصلاً، موجه للبرمجة طويلة الأمد والعمل المعرفي والفهم البصري والاستدلال. وتقول Alibaba إن الفهم البصري في Qwen3.8-Max حاضر عبر مراحل التخطيط والتنفيذ والتحقق. 17
35 والهدف العملي واضح: أن يتمكن الوكيل من بناء شيء ما، ورؤية النتيجة بعد عرضها، وتحديد الخلل، ثم إصلاحه، بدلاً من اختزال كل ما يراه إلى تقرير نصي وسيط.
لا تزال النماذج العامة المعتمدة على النص أولاً مفيدة جداً في توليد الشيفرة، وتحليل السياقات الطويلة، واستدعاء الأدوات، والمهام التي تكون مدخلاتها ومعايير نجاحها نصية أساساً. ففي إعداد يعتمد على الأدوات، يستطيع الوكيل استدعاء التعرّف الضوئي على الحروف (OCR)، أو فحص شجرة DOM أو شجرة تسهيلات الاستخدام، أو طلب إحداثيات عناصر الواجهة، أو إرسال لقطة شاشة إلى نموذج منفصل للرؤية واللغة. وقد تكون هذه بنية مناسبة لاستخراج البيانات من المستندات أو فحص واجهة منظّم أو سؤال بصري لمرة واحدة.
أما التدريب متعدد الوسائط أصلاً، فيراهن على معالجة النص والصور والفيديو والشيفرة وحالة الوكيل معاً، بحيث تؤثر المعلومات البصرية مباشرة في التخطيط والمراجعة. ووصفت تغطية لسوق النماذج الصينية Moonshot وAlibaba وByteDance بأنها تسير في هذا الاتجاه، مقابل إصدارات عامة أكثر تمحوراً حول النص من DeepSeek وZhipu وHunyuan في تلك اللحظة. 15
لكن لا ينبغي فهم ذلك كأنه انقسام دائم بين الشركات. فقد بدأ DeepSeek V4 Flash وV4 Pro بدعم النص فقط، ثم أطلقت DeepSeek لاحقاً النموذج التجريبي DeepSeek-V4-Flash-Vision-Exp. 13
4 وتتغير تشكيلة النماذج بسرعة، كما أن المصادر المتاحة لا تثبت سبباً داخلياً حاسماً وراء خيارات كل مختبر، وبخاصة ByteDance وZhipu وTencent.
صفحة الويب ليست كلمات وبنية DOM فقط؛ فهي أيضاً هرمية بصرية، ومسافات بيضاء، ومحاذاة، وتباين، وخطوط، واقتصاص للعناصر، وصور، وعلاقات بين المكونات. وعندما يُطلب من وكيل إعادة إنتاج تصميم مرجعي، تكون هذه التفاصيل غالباً هي معايير القبول الفعلية.
يمكن أن تسير دورة عمل تعتمد الرؤية داخل الحلقة كالتالي:
تصف Qwen3.8-Max هذا النموذج المغلق صراحةً: فالفهم البصري الأصلي يُستخدم عبر التخطيط والتنفيذ والتحقق في الأعمال طويلة الأمد. ويدعم النموذج المستضاف مدخلات الصور والنص والفيديو، بينما يكون مخرجه نصياً. 35 كذلك تفهم Kimi K3 النصوص والصور والفيديو ضمن نموذج واحد، مع نافذة سياق تبلغ مليون رمز مميز (Token).
25
ليست الميزة إذاً مجرد أن «النموذج يرى»، بل أن الوكيل نفسه يحتفظ بالطلب والشيفرة والمخرج البصري وخطته المتطورة في سياق واحد أثناء التكرار.
أدوات الإدراك الخارجية فعالة في حالات كثيرة، لكنها تنشئ واجهة فاصلة بين الرؤية والتصرف.
OCR انتقائي. يمكنه استخراج الكلمات الظاهرة، لكن استخراج النص وحده لا يشرح بالكامل ما إذا كان زر مقصوصاً، أو التخطيط غير متوازن، أو نافذة منبثقة تحجب المحتوى، أو التسلسل البصري مختلفاً عن التصميم المرجعي.
الإحداثيات منظّمة لكنها محدودة. تقرير مثل «العنصر عند x/y» مفيد للأتمتة، لكنه قد لا ينقل الأهمية البصرية أو النمط أو التداخل، أو حتى ما إذا كان هذا هو العنصر الصحيح بصرياً.
الترجمة المتكررة للمشهد تعقّد السلاسل الطويلة. في سير عمل متعدد الخطوات، قد تفقد كل إحالة من لقطة الشاشة إلى وصف أو إحداثيات جزءاً من السياق، أو تجبر الوكيل على إعادة بنائه. وقد يولد إصلاح مبني على وصف ناقص مشكلة بصرية جديدة، فتبدأ دورة ملاحظة أخرى.
لا يعني هذا أن النموذج متعدد الوسائط أصلاً لن يخطئ، لكنه يستطيع الاستدلال على لقطة الشاشة وسياق التنفيذ معاً، بدلاً من الاعتماد حصراً على ملخص نصي لما تحتويه الصورة. وهذه هي الجاذبية الأساسية في تطوير الواجهات الأمامية، وأتمتة الواجهات الرسومية، وتشخيص الانحدارات البصرية، وتحرير الصور، وسير عمل الفيديو.
توضح نتائج Kimi K3 المعلنة سبب اهتمام المطورين. فقد أفادت Arena بأن Kimi K3 تصدرت Frontend Code Arena بـ1,679 نقطة، في قفزة من 17 مركزاً مقارنةً بـKimi K2.6، وحلت أولاً في ستة من سبعة مجالات مدرجة للواجهات الأمامية. 32 وفي اختبار آخر نُسب إلى منصة Puter، اكتشفت Kimi K3 خمسة فروق بصرية أُدخلت عمداً بين صفحة ويب مستهدفة ونسختها المعروضة، من دون نتائج إيجابية خاطئة.
28
هذه عروض مهمة لقيمة التحقق البصري، لكنها لا تثبت أن الرؤية الأصلية وحدها صنعت النتيجة. فحجم النموذج، وبيانات التدريب، والتدريب اللاحق، وصياغة التعليمات، وأدوات المتصفح، وهيكل الوكيل، وطبيعة المعيار نفسه، كلها عوامل قد تؤثر في الأداء. والخلاصة الأقوى والأضيق هي أن التغذية الراجعة البصرية تعالج فئة حقيقية من الإخفاقات التي قد تفوتها الاختبارات النصية فقط.
يفضل اختيار وكيل متعدد الوسائط أصلاً عندما تتطلب المهمة ملاحظة ومراجعة متكررتين، وحين تكون الدقة البصرية جزءاً من تعريف الإنجاز، مثل:
أما خط أنابيب معياري يعتمد OCR أو نموذج رؤية خارجي، فقد يبقى الخيار الأنسب لاستخراج منخفض الكلفة، أو المعالجة الدفعية، أو الحالات التي تحتاج نصاً منظماً وحالة واجهة فقط. والسؤال الحاسم ليس: هل أصبحت الرؤية رائجة؟ بل: هل يحتاج الوكيل إلى الإجابة مراراً عن سؤال بصري: هل تبدو هذه النتيجة صحيحة فعلاً؟
في هذه الفئة من الأعمال، يحوّل التعدد الأصلي للوسائط الإدراك من استدعاء أداة عرضي إلى جزء من حلقة تشغيل الوكيل، وهو اتجاه تتابعه Kimi K3 وQwen3.8-Max بصورة صريحة. 17
35
Studio Global AI
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
المقصود بالتعددية الأصلية للوسائط هو أن يتعامل الوكيل مع النص والصورة والفيديو والكود ضمن دورة واحدة: يبني النتيجة، ويرى ما عُرض منها، ثم يراجعها ويحسّنها.
المقصود بالتعددية الأصلية للوسائط هو أن يتعامل الوكيل مع النص والصورة والفيديو والكود ضمن دورة واحدة: يبني النتيجة، ويرى ما عُرض منها، ثم يراجعها ويحسّنها. تصف Kimi K3 وQwen3.8 Max هذا النهج صراحةً؛ وقد سجلت Kimi K3 1,679 نقطة في Frontend Code Arena، بينما تقول Qwen إن الفهم البصري يمتد من التخطيط إلى التنفيذ والتحقق.