يراهن Kimi K3 على محورين: زيادة سعة النموذج قبل النشر، ثم إتاحة حوسبة أكبر بعد النشر للاستدلال واستخدام الأدوات والمهام الوكيلية. يضم النموذج 2.8 تريليون معامل إجمالي، لكنه يفعّل نحو 104 مليارات فقط لكل رمز؛ وتستند كفاءته في السياق الطويل إلى KDA وGated MLA وAttnRes، إلى جانب توجيه خبراء واتصالات موزعة.
إجابة البحث

Create a landscape editorial hero image for this Studio Global article: How does Moonshot AI’s 47-page Kimi K3 technical report argue that AI progress depends on scaling both pre-deployment model size and post-de. Article summary: K3’s core argument is that frontier progress requires scaling two complementary resources: model capacity before deployment, and the compute spent after deployment on long reasoning, tool use, and agentic rollouts. Its a. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
تقدّم «مونشوت AI» نموذج Kimi K3 بوصفه اختباراً لمبدأ التوسّع على محورين: بناء نموذج أكبر بكثير قبل الإطلاق، ثم إتاحة قدر كافٍ من الحوسبة له عند الاستخدام كي يستدل، ويستعمل الأدوات، ويتصفح الويب، ويكتب الشيفرة، ويصحّح أخطاءه. لكن التحدي الحقيقي اقتصادي: لا جدوى من نموذج أعمق وأكثف إذا كانت كلفة خدمته مع سياقات طويلة تجعل هذه القدرات غير عملية. 1
K3 نموذج متعدد الوسائط أصلاً من نوع خليط الخبراء (MoE)، بسعة إجمالية تبلغ 2.8 تريليون معامل، مع نحو 104 مليارات معامل مُفعّل لكل رمز، ونافذة سياق تصل إلى مليون رمز. 1
17
الرقمان لا يصفان الشيء نفسه:
وهذه هي جاذبية MoE عملياً: يمكن للنموذج أن يكون هائلاً من حيث السعة، من دون أن يدفع تكلفة تشغيل شبكة كثيفة تحتوي 2.8 تريليون معامل عند توليد كل رمز. لا يعني ذلك أن التشغيل رخيص—فـ104 مليارات معامل نشط رقم كبير جداً—لكنه أقل كلفة من تفعيل النموذج الضخم كاملاً في كل خطوة. 1
السياق الطويل يضغط على الذاكرة والحوسبة، لأن الانتباه التقليدي يراكم بيانات وتكاليف مع ازدياد طول السلسلة. لذلك يستخدم K3 تصميماً هجيناً يجمع بين Kimi Delta Attention (KDA) وGated Multi-head Latent Attention (Gated MLA). ويتألف العمود الفقري المعلن من 69 طبقة KDA و24 طبقة Gated MLA، في نمط تقريبي من ثلاث طبقات KDA مقابل طبقة MLA واحدة. 1
12
KDA هو مكوّن الانتباه الخطي في النموذج. وبدلاً من الاحتفاظ بذاكرة مفاتيح وقيم (KV cache) تكبر مع كامل السجل في كل طبقة من هذا النوع، يستخدم حالة متكررة ثابتة الحجم. والهدف هو ألا تتضخم الذاكرة وكلفة فك الترميز مع السياق السابق بالطريقة نفسها التي يحدث بها ذلك في الانتباه الكامل. 1
ويصف التقرير أيضاً حداً أدنى لمعدل اضمحلال KDA. هذه ليست مجرد تفصيلة نمذجة؛ إذ تمنع قيماً صغيرة للغاية قد تضر بالحساب العددي الفعال، وتتيح تنفيذاً كتلياً مناسباً لوحدات Tensor Cores في المعالجات الرسومية. 1
المعالجة الخطية المتكررة وحدها قد لا توفر القدرة نفسها على استرجاع معلومة بعينها من سياق كامل وطويل. لذا يحتفظ K3 بطبقات Gated MLA عبر الشبكة: تتولى KDA المعالجة المستمرة الأقل كلفة، فيما تؤمن MLA استرجاعاً عالمياً دورياً للمعلومات ذات الصلة. 1
الفكرة هنا ليست معمارية فقط، بل تشغيلية أيضاً: نافذة سياق ضخمة تكتسب قيمتها عندما يستطيع النموذج استرجاع ما يلزم منها والاستجابة بتكلفة وزمن قابلين للاستخدام.
المكوّن الثاني هو Attention Residuals (AttnRes). يتكون K3 من 93 طبقة، ويستخدم التقرير AttnRes كي تتمكن الطبقات اللاحقة من استرجاع تمثيلات مضغوطة من كتل أعمق سابقة، بدلاً من إجبار كل معلومة على المرور طبقةً بعد طبقة فقط. 1
بعبارة مبسطة: تعالج KDA انتقال المعلومات عبر طول السياق، بينما تعالج AttnRes انتقالها عبر عمق النموذج. وهذا مهم في نموذج عميق يعتمد بدرجة كبيرة على الانتباه الخطي؛ إذ إن تقليل الاعتماد على الانتباه العالمي المكلف لا يفيد إذا ضاعت المعلومات المفيدة داخل التسلسل العميق للطبقات. 1
يُقال إن طبقة MoE في K3 تضم 896 خبيراً موجهاً، مع اختيار 16 خبيراً لكل رمز. 1
6 وهذا ما يفسر الفارق بين السعة الكلية الضخمة والحوسبة الفعلية لكل رمز.
ويركز نهج Stable LatentMoE على إبقاء هذا التوجيه مستقراً ومتوازناً. فالتقرير يصوغ توزيع الرموز بين الخبراء كمشكلة تحسين على مستوى الدفعة، ويطرح موازنة قائمة على الكميات الإحصائية. ويشتق حلاً أمثل وفق افتراضاته، لكن التوجيه أثناء النشر يستخدم انحيازات ثابتة للخبراء واختيار top-k الاعتيادي، بدلاً من إعادة حل مسألة الموازنة لكل دفعة استدلال. 1
لذلك، فإن «التوازن المثالي» نتيجة ضمن صياغة التقرير وافتراضاته، لا ضمان بأن كل حمل إنتاجي حقيقي سيتوزع بالتساوي التام بين الخبراء.
في نماذج MoE الضخمة، قد تُرسل الرموز إلى أجهزة مختلفة للوصول إلى الخبراء المخصصين لها. وإذا تلقى بعض الخبراء طلبات أكثر بكثير من غيرهم، فقد يحدد أبطأ مسار اتصال زمن الاستجابة كله.
تضع «مونشوت» MoonEP كطبقة أنظمة مكملة للتواصل المتوازي بين الخبراء. مهمتها تقليل الاختلال في تبادلات all-to-all التي يفرضها التوجيه المتناثر، بما يساعد على تدريب مجموعة الخبراء الكبيرة وخدمتها عملياً. 1
وهذا يوضح أن المعمارية، وتوجيه الخبراء، والاتصالات ليست تفسيرات منفصلة للأداء؛ بل أجزاء من منظومة واحدة لتحويل السعة النظرية إلى إنتاجية فعلية.
لا تتوقف استراتيجية K3 عند التدريب المسبق. يصف التقرير بنية تحتية لمسارات تعلّم معزز تتضمن مهام طويلة الأفق، واستخدام أدوات، وبرمجة، وتصفحاً، وحل مشكلات تكرارياً. كما يذكر تقطير قدرات عدة معلّمين متخصصين في المجالات والاستدلال داخل نظام واحد. 1
وتستند البيئة المساندة إلى نظام صناديق اختبار قائم على آلات افتراضية خفيفة، صُمم لإنشاء بيئات المهام وحفظ حالتها واستئنافها على نطاق واسع. وتشمل الأرقام المعلنة 51.2 مليون بيئة صندوق اختبار، و133 مللي ثانية لالتقاط اللقطة، و49 مللي ثانية للاستعادة. 1
المغزى: إذا كان النموذج سيقضي وقتاً إضافياً في التخطيط، أو استدعاء الأدوات، أو التحقق من عمله، أو متابعة مهمة طويلة، فينبغي أن يتدرب على هذه المسارات. تسهيل إيقاف البيئات واستنساخها واستعادتها يجعل تنفيذ عدد أكبر من هذه التجارب التدريبية ممكناً.
ولا يعني ذلك أن كل إجابة تستخدم حوسبة غير محدودة. بل إن حجة التقرير هي أن النظام يستطيع تحويل الخطوات الإضافية والسياق الأوسع إلى أداء أفضل، بدلاً من الاعتماد على تكبير نموذج مدرّب مسبقاً فقط.
سجّل Kimi K3، وفق ما أُبلغ عنه، 91.2% في معيار BrowseComp المخصص للبحث عن المعلومات في مهام طويلة الأفق. كما تعرضه لوحة ترتيب خارجية بالنتيجة ذاتها، مع قابلية تغير الترتيب وإعدادات الإبلاغ بمرور الوقت. 18
تنسجم النتيجة مع هدف المنتج: نموذج صُمم للسياق الطويل، والتدريب اللاحق الوكيلي، والاستدلال وقت الاختبار، ينبغي أن يُختبر في مهام بحث معلومات معقدة. لكن الدرجة ليست اختبار عزل يحدد مساهمة كل مكوّن على حدة.
فلا يمكن لنتيجة معيار واحد أن تحدد كم جاء من KDA، أو AttnRes، أو توجيه الخبراء، أو بنية الاتصال، أو بيئات التعلم المعزز، أو التقطير، أو إعدادات التلقين والاستدلال. والقراءة الأدق هي أن النظام المتكامل حقق أداءً قوياً وفق النتيجة المعلنة، لا أن ابتكاراً معمارياً واحداً يفسرها بمفرده. 1
18
مقارنات كلفة الرمز أو المهمة شديدة الحساسية للإعدادات: صياغة الطلب، ومقدار الاستدلال، وطول السياق، والتخزين المؤقت، واستخدام الأدوات، ومعدل الإنتاجية، وتاريخ التسعير، ومنهجية التقييم.
أحد التقديرات المنشورة يضع كلفة المهمة المكتملة عند نحو 0.94 دولار لـK3 و1.04 دولار لـGPT-5.6 Sol. وقد يوحي ذلك بأفضلية محدودة في هذا الإعداد المحدد، لكنه لا يثبت ادعاءً عاماً بأن K3 يكلّف نصف كلفة Sol. 20
حجة Kimi K3 هي حجة توسع متكاملة: قبل النشر، سعة MoE تبلغ 2.8 تريليون معامل مع نحو 104 مليارات معامل مُفعّل لكل رمز؛ وبعد النشر، نظام قادر على استثمار سياق طويل، وأدوات، وخطوات استدلال، ومسارات عمل وكيلية. 1
17
تعمل KDA وGated MLA وAttnRes وStable LatentMoE وMoonEP وبنية صناديق اختبار التعلم المعزز كأجزاء من الفرضية ذاتها: السلوك الوكيلي المتقدم لا يحتاج نموذجاً أكبر فقط، بل يحتاج تصميماً يجعل السياق الأوسع والعمل الحسابي الإضافي وقت الاستدلال قابلين للاستخدام. وتبقى نتائج المقاييس مؤشراً واعداً على أداء المنظومة ككل، لا حكماً نهائياً على أثر كل مكوّن منفرداً. 1
18
Studio Global AI
تتضمن هذه الصفحة إجابة مدعومة بالمصدر يمكنك المتابعة داخل Studio Global.
يراهن Kimi K3 على محورين: زيادة سعة النموذج قبل النشر، ثم إتاحة حوسبة أكبر بعد النشر للاستدلال واستخدام الأدوات والمهام الوكيلية.
يراهن Kimi K3 على محورين: زيادة سعة النموذج قبل النشر، ثم إتاحة حوسبة أكبر بعد النشر للاستدلال واستخدام الأدوات والمهام الوكيلية. يضم النموذج 2.8 تريليون معامل إجمالي، لكنه يفعّل نحو 104 مليارات فقط لكل رمز؛ وتستند كفاءته في السياق الطويل إلى KDA وGated MLA وAttnRes، إلى جانب توجيه خبراء واتصالات موزعة.
تتطلب مقارنات الكلفة حذراً: تقدير منشور يضع كلفة المهمة المكتملة عند نحو 0.94 دولار لـK3 مقابل 1.04 دولار لـGPT 5.6 Sol، ولا يدعم ذلك ادعاءً عاماً بأن K3 أرخص بالنصف.