Moonshot AI membingkaikan Kimi K3 sebagai strategi dua paksi: besarkan kapasiti model sebelum digunakan, kemudian sediakan komputasi inferens untuk penaakulan, alat, pelayaran web dan tugasan ejen. Kimi K3 mempunyai 2.8 trilion parameter secara keseluruhan, tetapi mengaktifkan kira kira 104 bilion parameter bagi set...
Research answer

Create a landscape editorial hero image for this Studio Global article: How does Moonshot AI’s 47-page Kimi K3 technical report argue that AI progress depends on scaling both pre-deployment model size and post-de. Article summary: K3’s core argument is that frontier progress requires scaling two complementary resources: model capacity before deployment, and the compute spent after deployment on long reasoning, tool use, and agentic rollouts. Its a. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Moonshot AI mempersembahkan Kimi K3 sebagai hujah untuk penskalaan pada dua paksi: membina model yang jauh lebih besar sebelum ia digunakan, kemudian membekalkan komputasi yang mencukupi ketika penggunaan untuk membolehkan model itu menaakul, menggunakan alat, melayari web, menulis kod dan membetulkan kesilapan sendiri. Cabaran utamanya ialah ekonomi. Model tidak boleh sekadar dibuat lebih padat dan lebih dalam jika kos penyajiannya bagi konteks panjang menjadikan keupayaan tersebut tidak praktikal. Reka bentuk K3 bertujuan meningkatkan kapasiti keseluruhan sambil mengehadkan komputasi dan memori bagi setiap token yang dijana. 1
Kimi K3 diterangkan sebagai model campuran pakar (mixture-of-experts, MoE) multimodal natif dengan 2.8 trilion parameter keseluruhan, kira-kira 104 bilion parameter diaktifkan bagi setiap token, serta tetingkap konteks sehingga satu juta token. 1
17
Dua angka parameter ini menjawab dua soalan yang berlainan:
Di sinilah tarikan praktikal MoE. K3 boleh menjadi jauh lebih besar secara agregat berbanding model padat dengan jejak komputasi per token yang setanding. Ia bukan bermaksud kos penyajian menjadi murah — 104B parameter aktif masih amat besar — tetapi K3 tidak perlu membayar kos inferens rangkaian padat 2.8T parameter pada setiap token. 1
Jadi, hujah Moonshot bukan sekadar “lebih banyak parameter adalah lebih baik”. Hujahnya ialah pengiraan bersyarat boleh menjadikan kapasiti model pada skala baharu berguna untuk tugasan yang panjang dan berterusan.
Konteks sejuta token sukar bukan hanya dari sudut latihan, tetapi juga kerana perhatian konvensional boleh mengumpulkan kos memori dan komputasi yang tinggi apabila urutan menjadi semakin panjang. K3 menggunakan reka bentuk hibrid yang menggabungkan Kimi Delta Attention (KDA) dengan Gated Multi-head Latent Attention (Gated MLA). Komposisi tulang belakang yang dilaporkan ialah 69 lapisan KDA dan 24 lapisan Gated MLA, kebanyakannya dalam corak tiga KDA bagi satu MLA. 1
12
KDA ialah komponen perhatian linear model itu. Berbanding menyimpan cache kunci-nilai (key-value cache) konvensional yang terus membesar sepanjang sejarah dalam setiap lapisan tersebut, KDA menggunakan keadaan berulang bersaiz tetap. Manfaat yang disasarkan ialah keadaan memori dan kerja penyahkodan tidak berkembang mengikut konteks terdahulu seperti perhatian penuh. 1
Laporan itu turut menerangkan had bawah bagi kadar susutan KDA. Ini bukan sekadar pilihan pemodelan: ia menghalang nilai susutan yang terlalu kecil, yang bermasalah untuk pengiraan berangka cekap, dan membolehkan pelaksanaan berblok yang sesuai dengan pelaksanaan teras tensor. 1
Ulangan linear sahaja mungkin tidak menawarkan tingkah laku carian global terpilih yang sama seperti perhatian terhadap konteks penuh. Oleh itu, K3 mengekalkan lapisan Gated MLA di seluruh rangkaian. Dalam hibrid yang dilaporkan, KDA menyediakan pemprosesan berterusan yang lebih murah, manakala MLA menyediakan capaian global secara berkala. 1
Reka bentuk ini penting kerana ia menganggap keupayaan konteks panjang sebagai masalah sistem, bukan masalah seni bina semata-mata. Tetingkap konteks besar hanya benar-benar bermakna apabila model masih boleh mendapatkan semula maklumat relevan dan menjana jawapan pada kos yang boleh digunakan.
Komponen seni bina kedua K3 ialah Attention Residuals (AttnRes). Model ini mempunyai 93 lapisan, dan laporan tersebut menggunakan AttnRes bagi membolehkan lapisan kemudian mendapatkan semula perwakilan termampat daripada blok kedalaman terdahulu, tanpa memaksa semua maklumat bergerak secara ketat satu lapisan demi satu lapisan. 1
Secara konsep, KDA menangani aliran maklumat merentasi panjang urutan, manakala AttnRes menangani aliran maklumat merentasi kedalaman. Gabungan ini penting dalam model mendalam yang banyak menggunakan perhatian linear: menggantikan perhatian global yang mahal hanya membantu jika maklumat berguna tidak hilang atau terasing ketika aktivasi bergerak melalui rangkaian. 1
Lapisan MoE K3 dilaporkan menggunakan 896 pakar yang dihala, dengan 16 pakar dipilih bagi setiap token. 1
6 Inilah mekanisme di sebalik jurang antara parameter keseluruhan dan parameter aktif.
Pendekatan Stable LatentMoE dalam laporan itu menumpukan kepada memastikan penghalaan ini stabil dan seimbang. Ia membingkaikan penugasan pakar pada peringkat kelompok (batch) sebagai masalah pengoptimuman dan memperkenalkan pengimbangan berasaskan kuantil. Laporan itu menerbitkan optimum tepat di bawah andaian yang dinyatakannya; namun ketika penggunaan, penghalaan menggunakan bias pakar tetap bersama pemilihan top-k biasa, bukannya menyelesaikan semula masalah pengimbangan untuk setiap kelompok inferens. 1
Perbezaan ini penting. Keseimbangan optimum yang didakwa ialah hasil untuk perumusan penghalaan dalam laporan itu, bukannya jaminan bahawa setiap beban kerja pengeluaran sebenar akan mengagihkan token secara sempurna dan sekata kepada semua pakar.
Model MoE besar turut membawa masalah rangkaian: token yang dipilih sering perlu dihantar merentasi peranti untuk sampai kepada pakar yang ditugaskan. Jika sesetengah pakar menerima permintaan yang tidak seimbang, laluan komunikasi paling perlahan boleh menentukan kependaman keseluruhan.
Moonshot meletakkan MoonEP sebagai lapisan sistem pelengkap untuk komunikasi selari pakar. Tugasnya adalah mengurangkan ketidakseimbangan dalam pertukaran semua-ke-semua (all-to-all) yang terhasil daripada penghalaan jarang, agar kumpulan pakar besar itu kekal boleh dilatih dan disajikan. 1
Ini ialah bahagian penting dalam tuntutan K3 yang lebih luas. Seni bina, penghalaan dan komunikasi tidak boleh dinilai sebagai penjelasan prestasi yang berdiri sendiri; model itu memerlukan ketiga-tiganya untuk menukar kapasiti jarang secara teori kepada daya pemprosesan sebenar.
Paksi kedua dalam tesis K3 ialah apa yang berlaku selepas pralatihan. Moonshot menerangkan infrastruktur untuk trajektori pembelajaran pengukuhan (reinforcement learning, RL) yang melibatkan tugasan jangka panjang, penggunaan alat, pengekodan, pelayaran web dan penyelesaian masalah secara berulang. Laporan itu juga menerangkan penyulingan beberapa guru domain dan penaakulan ke dalam satu sistem. 1
Persekitaran sokongannya ialah sistem kotak pasir mesin maya ringan yang direka untuk mencipta, mengambil syot kilat dan menyambung semula persekitaran tugasan pada skala besar. Angka yang dilaporkan termasuk 51.2 juta instans kotak pasir, syot kilat 133 ms, dan pemulihan 49 ms. 1
Tujuan strategiknya mudah: jika model dimaksudkan untuk menggunakan lebih banyak komputasi ketika inferens bagi merancang, memanggil alat, menyemak kerja atau meneruskan tugasan panjang, maka persediaan latihan perlu mendedahkannya kepada trajektori seperti itu. Keupayaan menjeda, mencabang dan memulihkan persekitaran dengan murah menjadikan lebih banyak pelancaran latihan sebegini dapat dilaksanakan.
Ini tidak bermaksud satu respons model secara automatik menggunakan komputasi inferens tanpa had. Sebaliknya, laporan K3 berhujah untuk sistem yang boleh menukar langkah tambahan dan konteks tambahan kepada prestasi tugasan yang lebih baik, bukannya bergantung semata-mata pada model pralatih yang lebih besar.
Kimi K3 dilaporkan mencatat 91.2% dalam BrowseComp, penanda aras yang menyasarkan pencarian maklumat jangka panjang. Papan pendahulu pihak ketiga juga menyenaraikan K3 pada 91.2%, walaupun kedudukan dan konfigurasi pelaporan boleh berubah dari semasa ke semasa. 18
Keputusan itu selari dengan matlamat produk: model yang direka sekitar konteks panjang, pascalatihan ejen dan penaakulan masa ujian patut dinilai melalui tugasan pencarian maklumat yang kompleks. Namun, ia bukan pengasingan kesan (ablation) yang bersih bagi setiap komponen.
Satu skor penanda aras tidak dapat memberitahu pembaca berapa banyak hasil itu datang daripada KDA, AttnRes, penghalaan pakar, infrastruktur komunikasi, persekitaran RL, penyulingan, pemetaan arahan atau tetapan masa inferens. Tafsiran paling kukuh ialah sistem yang dilaporkan menunjukkan prestasi baik sebagai satu timbunan bersepadu — bukan bahawa satu inovasi seni bina sahaja menerangkan skor tersebut. 1
18
K3 sering dibingkaikan sebagai cabaran kepada model terbuka besar yang lain, termasuk sistem DeepSeek. Kesimpulan yang boleh dipertahankan daripada laporan itu bukanlah carta liga muktamad tentang kemajuan model terbuka, tetapi penekanan reka bentuk yang berbeza: Moonshot mengusulkan timbunan yang menggabungkan kapasiti jarang yang sangat besar, pemprosesan konteks panjang yang cekap dan infrastruktur pascalatihan untuk ejen. 1
17
Kertas itu sendiri menyokong spesifikasi dan pilihan reka bentuk K3. Namun, ia tidak dengan sendirinya membuktikan bahawa model terbuka lain “terhenti”, atau mengasingkan kelebihan seni bina yang menentukan berbanding pesaing tertentu. Itu ialah tuntutan pasaran yang lebih luas dan memerlukan perbandingan yang konsisten serta boleh dihasilkan semula secara bebas.
Perbandingan harga setiap token dan kos setiap tugasan sangat mudah ditafsir secara berlebihan. Nilainya boleh berubah mengikut pemetaan arahan, tahap usaha penaakulan, panjang konteks, caching, penggunaan alat, andaian daya pemprosesan, tarikh harga dan rangka kerja tugasan.
Satu perbandingan yang diterbitkan dalam bahan tersedia menganggarkan kos tugasan siap sekitar AS$0.94 untuk K3 dan AS$1.04 untuk GPT-5.6 Sol. Ini mungkin mencadangkan kelebihan kecil dalam tetapan khusus itu, tetapi tidak menyokong dakwaan umum bahawa K3 menelan kos separuh daripada Sol. 20
Kesimpulan yang lebih berguna dan tahan lama kurang dramatik: K3 ialah usaha untuk menjadikan keupayaan ejen dan konteks panjang munasabah dari segi ekonomi pada skala model keseluruhan yang jauh lebih besar. Sama ada ia benar-benar mencapai kelebihan itu dalam amalan bergantung pada penilaian yang boleh diulang dan pengiraan kos khusus untuk setiap penggunaan.
Laporan teknikal Kimi K3 mengemukakan hujah penskalaan hujung ke hujung. Skala sebelum penggunaan datang daripada MoE 2.8T parameter dengan kira-kira 104B parameter diaktifkan bagi setiap token. Skala selepas penggunaan datang daripada latihan dan penyajian model yang boleh menggunakan konteks panjang, alat, langkah penaakulan dan pelancaran ejen. 1
17
KDA, Gated MLA, AttnRes, Stable LatentMoE, MoonEP dan infrastruktur kotak pasir RL semuanya ialah bahagian daripada cadangan yang sama: tingkah laku ejen bertaraf hadapan memerlukan bukan sahaja model yang lebih besar, tetapi reka bentuk yang menjadikan lebih banyak konteks dan lebih banyak kerja pada masa inferens benar-benar boleh dimanfaatkan. Dakwaan penanda aras itu ialah bukti yang menjanjikan bagi pendekatan bersepadu tersebut, tetapi wajar dibaca sebagai keputusan sistem yang dilaporkan — bukan bukti muktamad tentang sumbangan setiap komponen. 1
18
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Moonshot AI membingkaikan Kimi K3 sebagai strategi dua paksi: besarkan kapasiti model sebelum digunakan, kemudian sediakan komputasi inferens untuk penaakulan, alat, pelayaran web dan tugasan ejen.
Moonshot AI membingkaikan Kimi K3 sebagai strategi dua paksi: besarkan kapasiti model sebelum digunakan, kemudian sediakan komputasi inferens untuk penaakulan, alat, pelayaran web dan tugasan ejen. Kimi K3 mempunyai 2.8 trilion parameter secara keseluruhan, tetapi mengaktifkan kira kira 104 bilion parameter bagi setiap token.
Dakwaan kos perlu dibaca mengikut konfigurasi ujian. Satu perbandingan menganggarkan sekitar AS$0.94 bagi setiap tugasan siap untuk K3 berbanding AS$1.04 untuk GPT 5.6 Sol, bukan separuh daripada kos Sol.