يرى تقرير Kimi K3 أن التقدم في الذكاء الاصطناعي يتطلب توسيع موردين متكاملين: سعة النموذج قبل النشر، والحوسبة المستهلكة وقت الاستدلال بعد النشر. يضم النموذج 2.78 تريليون معلمة إجمالاً، لكنه يفعّل 104.2 مليار معلمة فقط لكل رمز، ضمن بنية «مزيج الخبراء» MoE.
إجابة البحث

Create a landscape editorial hero image for this Studio Global article: How does Moonshot AI’s 47 page Kimi K3 technical report argue that AI progress depends on scaling both pre deployment model size and post de. Article summary: K3’s core argument is that frontier progress requires scaling two complementary resources: model capacity before deployment, and the compute spent after deployment on long reasoning, tool use, and agentic rollouts.. Topic tags: general web, llm, agents, ai, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
تطرح Moonshot AI في تقريرها التقني عن Kimi K3 فكرة محورية: الوصول إلى قدرات متقدمة لا يتحقق بتكبير النموذج قبل الإطلاق فقط، بل يحتاج أيضاً إلى زيادة الحوسبة التي يستهلكها النموذج بعد الإطلاق، أثناء الاستدلال. أي إن النموذج ينبغي أن يمتلك سعة كبيرة لتخزين المعرفة والمهارات، وأن يكون قادراً، بتكلفة عملية، على تخصيص خطوات أطول للتفكير والتخطيط واستخدام الأدوات وتصحيح المسار.
يُقدَّم K3 بوصفه نموذج «مزيج خبراء» متعدد الوسائط أصلياً، يضم 2.78 تريليون معلمة إجمالاً، لكنه يفعّل 104.2 مليار معلمة لكل رمز فقط، مع نافذة سياق تصل إلى مليون رمز. 1
الفكرة هنا أن العدد الإجمالي الكبير يوسّع السعة الممكنة للنموذج، فيما يمنع تفعيل جزء محدود من الخبراء لكل رمز دفع كلفة استدلال تعادل نموذجاً كثيفاً يضم 2.78 تريليون معلمة. وهذا هو الأساس الاقتصادي الذي تستند إليه الشركة في الجمع بين نموذج كبير وحوسبة استدلال إضافية.
يؤكد التقرير أن K3 يستهدف الاستقراء الأصلي حتى مليون رمز، وليس 100 ألف رمز. يبدأ التدريب بسياقات من 8 آلاف رمز ثم 64 ألف رمز، ولا يستخدم تضمينات موضعية صريحة؛ إذ تقول Moonshot إن البوابات والتلاشي المتكررَين في KDA يوفران تمثيلاً كافياً للموقع يسمح بالتمديد من دون تعديل RoPE. 1
وهذا مهم للمهام التي تتطلب الاحتفاظ بسجل طويل: ملفات برمجية كبيرة، أو بحوث متعددة المصادر، أو مسارات عمل مطولة لوكلاء يستخدمون أدوات رقمية.
تستبدل Kimi Delta Attention (KDA) كثيراً من آليات الانتباه التربيعي بحالة متكررة ذات حجم ثابت. وبذلك لا تتزايد حالة كل رمز وتكلفة التوليد مع طول السياق السابق بالطريقة نفسها التي تتزايد بها ذاكرة KV في الانتباه الكامل. 1
لكن الشركة لا تعتمد KDA وحدها: فهي تضع ثلاث طبقات KDA مقابل طبقة واحدة من Gated MLA. تمنح KDA معالجة متسلسلة مستمرة ومنخفضة الكلفة، بينما تعيد Gated MLA القدرة على استرجاع معلومات بعيدة ومحددة من السياق. 1
كما أن الحد الأدنى المقرر لمعدل تلاشي KDA ليس مجرد تعديل سلوكي للنموذج؛ فالتقرير يصفه كآلية تنفيذية تتجنب قيماً عددية صغيرة إشكالية وتتيح حسابات مجمعة مناسبة لمسرعات المصفوفات. 1
في شبكة عميقة من 93 طبقة، يمكن أن يؤدي الاعتماد الواسع على الانتباه الخطي إلى انتقال المعلومات طبقةً بعد طبقة بصورة مقيدة. تأتي Attention Residuals (AttnRes) لتوفر مساراً تسترجع من خلاله الطبقات اللاحقة تمثيلات مضغوطة من كتل أسبق في عمق الشبكة. 1
بعبارة أبسط، لا يُجبر النموذج على تمرير كل معلومة نافعة عبر السلسلة الكاملة للطبقات؛ إذ يحصل على مسار استرجاع عبر العمق. والهدف المعلن هو الحفاظ على الجودة مع استبدال جزء كبير من الانتباه العالمي المكلف بـKDA. 1
يعتمد K3 على 896 خبيراً مع اختيار أفضل 16 خبيراً لكل رمز. وتصف Moonshot أسلوب Stable LatentMoE لموازنة التوجيه باعتباره مسألة إسناد متوازن، مع حل أمثل دقيق ضمن افتراضاته على مستوى الدفعة التدريبية. أما عند النشر، فيستخدم الموجّه انحيازات ثابتة للخبراء واختيار top-k المعتاد، بدلاً من تشغيل محلل الموازنة أثناء الاستدلال. 1
لذلك، فإن وصف «التوازن المثالي» يجب فهمه ضمن مسألة التحسين والافتراضات التي حددها التقرير، لا باعتباره ضماناً بأن كل دفعة حقيقية في التشغيل ستكون موزعة بالتساوي تماماً.
ويبرز هنا دور MoonEP، نظام الاتصال المتوازي بين الخبراء. فاقتصاد نموذج MoE يعتمد على نقل الرموز إلى الخبراء الذين اختارهم الموجّه من دون أن تصبح اختناقات الشبكة أو التأخر غير المتوازن العامل المسيطر على زمن الاستجابة. 1 لذا فادعاءات البنية المعمارية والبنية التحتية متكاملة: أحدهما لا يفسر نتائج الأداء بمعزل عن الآخر.
لا تقف أطروحة التقرير عند البنية. فهو يصف أسطولاً من بيئات معزولة خفيفة شبيهة بالآلات الافتراضية، يتيح إنتاج مسارات كثيرة قابلة للتحقق للتعلم المعزز في مهام طويلة الأمد، مع إمكان التفرع من اللقطات أو استئنافها بتكلفة أقل. 1
هذه البنية التدريبية تستهدف نماذج تستفيد من خطوات إضافية وقت الاختبار: التخطيط، والتصفح، والبرمجة، واستدعاء الأدوات، والمراجعة الذاتية. كما يذكر التقرير تقطير عدة معلمين متخصصين في المجالات والاستدلال داخل نظام واحد، لتجميع هذه السلوكيات من دون الحاجة إلى خدمة تسعة نماذج منفصلة. 1
سجل K3 نسبة 91.2% في معيار BrowseComp، وهو معيار يقيس سلوك البحث على الويب في مهام معلوماتية طويلة الأمد؛ وتضعه لوحة ترتيب خارجية حالياً في المرتبة الثانية خلف GPT-5.6 Sol الذي سجل 92.2%. 4
إذا تكررت هذه النتيجة، فإنها تدعم فكرة أن النظام قوي في مهام الوكلاء الباحثين عن المعلومات عبر مراحل طويلة. لكنها لا تثبت بمفردها مقدار إسهام KDA أو AttnRes أو توجيه الخبراء أو بيئات التعلم المعزز أو التقطير أو الحوسبة وقت الاختبار، لأن الدرجة تقيس النظام كاملاً لا مكوناته منفصلة.
لا يقدم التقرير التقني، ولا مصدر مستقل عالي الموثوقية ضمن المواد المتاحة، توثيقاً كافياً لادعاء أن K3 يكلف «نصف كلفة GPT-5.6 Sol»، أو لادعاء فارق محدد في نتائج Kimi Code Bench مقابل «Claude Fable 5» عند 38% من الكلفة. في المقابل، يورد أحد المصادر تقديرات لكلفة المهمة المكتملة تبلغ نحو 0.94 دولار لـK3 مقابل 1.04 دولار لـGPT-5.6 Sol، وهي فجوة لا تقترب من 50%. 8
لذلك ينبغي التعامل مع مقارنات الأسعار باعتبارها شديدة الاعتماد على إعدادات التقييم، والمطالبات، وتاريخ التسعير، ومنهجية احتساب الكلفة، ما لم تُنشر منصة اختبار وحسابات تفصيلية قابلة للتحقق.
الخلاصة: رهان Moonshot ليس منافسة سعرية مجردة، بل بناء حزمة مشتركة من تصميم النموذج والأنظمة والتدريب تجعل تجاوز حاجز التريليون معلمة، وتحويل الاستدلال الطويل والوكلاء إلى قدرة قابلة للاستخدام، أمراً عملياً. أما الادعاءات الأوسع حول تعثر النماذج المفتوحة قرب تريليون معلمة أو المقارنات المحددة مع نماذج أخرى، فلا يثبتها تقرير K3 نفسه بالأدلة المتاحة هنا.
Studio Global AI
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
يرى تقرير Kimi K3 أن التقدم في الذكاء الاصطناعي يتطلب توسيع موردين متكاملين: سعة النموذج قبل النشر، والحوسبة المستهلكة وقت الاستدلال بعد النشر.
يرى تقرير Kimi K3 أن التقدم في الذكاء الاصطناعي يتطلب توسيع موردين متكاملين: سعة النموذج قبل النشر، والحوسبة المستهلكة وقت الاستدلال بعد النشر. يضم النموذج 2.78 تريليون معلمة إجمالاً، لكنه يفعّل 104.2 مليار معلمة فقط لكل رمز، ضمن بنية «مزيج الخبراء» MoE.
تستخدم البنية مزيجاً من KDA وGated MLA لتقليل كلفة معالجة السياقات الطويلة، مع آليات لتحسين تدفق المعلومات بين الطبقات وتوزيع العمل على الخبراء.