Kimi K3 mengemukakan dua paksi penskalaan: kapasiti model sebelum pelancaran dan komputasi inferens selepas model digunakan. Model MoE ini mempunyai 2.78 trilion parameter keseluruhan, tetapi mengaktifkan 104.2 bilion parameter bagi setiap token.
Research answer

Create a landscape editorial hero image for this Studio Global article: How does Moonshot AI’s 47 page Kimi K3 technical report argue that AI progress depends on scaling both pre deployment model size and post de. Article summary: K3’s core argument is that frontier progress requires scaling two complementary resources: model capacity before deployment, and the compute spent after deployment on long reasoning, tool use, and agentic rollouts.. Topic tags: general web, llm, agents, ai, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Moonshot AI menerusi laporan teknikal Kimi K3 menyatakan bahawa kemajuan AI peringkat hadapan bukan sekadar soal membina model pra-latihan yang semakin besar. Ia memerlukan dua sumber diskala serentak: kapasiti model sebelum pelancaran dan komputasi inferens selepas pelancaran — iaitu pengiraan yang digunakan ketika model membuat penaakulan panjang, memanggil alat, melayari web, menulis kod atau menyemak semula hasilnya. 1
K3 direka supaya kedua-dua bentuk skala itu lebih mampu ditanggung. Ia ialah model Mixture-of-Experts (MoE) multimodal natif dengan 2.78 trilion parameter keseluruhan, tetapi hanya 104.2 bilion parameter aktif bagi setiap token, serta tetingkap konteks sehingga 1 juta token. Dalam model MoE, tidak semua bahagian model digunakan bagi setiap token; ini membolehkan kapasiti besar disimpan tanpa menanggung kos inferens seperti model padat 2.78 trilion parameter pada setiap langkah. 1
Satu pembetulan penting ialah laporan itu mendakwa ekstrapolasi natif hingga 1 juta token, bukannya 100,000 token. Latihan bermula pada konteks 8,000 token dan kemudian 64,000 token. K3 tidak menggunakan pembenaman kedudukan eksplisit; Moonshot berhujah bahawa get berulang dan kadar pereputan dalam Kimi Delta Attention (KDA) sudah cukup untuk mengekod maklumat kedudukan, sekali gus membolehkan konteks dipanjangkan tanpa pengubahsuaian RoPE. 1
Teras seni binanya ialah gabungan KDA dan Gated MLA. KDA menggantikan sebahagian besar perhatian kuadratik dengan keadaan berulang bersaiz tetap. Secara ringkas, keadaan dan kos nyahkod bagi setiap token tidak meningkat seiring dengan keseluruhan konteks lampau seperti yang boleh berlaku dengan cache KV dalam perhatian penuh.
Moonshot menyusun tiga lapisan KDA diikuti satu lapisan Gated MLA, dalam nisbah 3:1. KDA menyediakan pemprosesan urutan yang berterusan dan lebih murah, manakala Gated MLA mengembalikan keupayaan mengambil semula maklumat global secara terpilih. 1
Had bawah bagi kadar pereputan KDA pula bukan sekadar perubahan teori pemodelan. Laporan itu menyatakannya sebagai langkah pelaksanaan untuk mengelakkan kadar pereputan yang terlalu kecil dan bermasalah dari sudut pengiraan, di samping membolehkan pengiraan berblok yang lebih mesra tensor core. 1
K3 mempunyai 93 lapisan. Untuk mengelakkan rangkaian yang sangat dalam dan banyak menggunakan perhatian linear menjadi terlalu terasing antara lapisan, Moonshot menggunakan Attention Residuals (AttnRes).
Fungsinya ialah membenarkan lapisan kemudian mendapatkan semula perwakilan termampat daripada blok lapisan terdahulu. Maka, maklumat berguna tidak perlu bergerak secara ketat satu lapisan demi satu lapisan sahaja. Hujah Moonshot ialah laluan rentas-kedalaman ini membantu mengekalkan kualiti sambil banyak perhatian global yang mahal digantikan dengan KDA. 1
Bahagian lebar model pula menggunakan Stable LatentMoE: 896 pakar dengan pemilihan 16 pakar teratas bagi sesuatu token. Reka bentuk ini meningkatkan kapasiti bersyarat — model boleh memilih subset pakar yang berlainan untuk input berlainan.
Kaedah pengimbangan berasaskan kuantil yang dihuraikan dalam laporan membingkaikan penghalaan token sebagai masalah penugasan seimbang dan menerbitkan optimum tepat di bawah andaian peringkat kelompok latihannya. Namun, ketika penggunaan, penghala menggunakan bias pakar tetap serta pemilihan top-k biasa, bukannya menjalankan penyelesai pengimbangan itu setiap kali. 1
Ini lebih kukuh daripada sekadar mendakwa semua trafik dunia sebenar akan seimbang dengan sempurna. “Keseimbangan sempurna” perlu dibaca sebagai hasil bagi masalah pengoptimuman dan andaian yang dinyatakan, bukan jaminan bahawa setiap kelompok permintaan dalam pengeluaran akan diagihkan secara sempurna.
Di sinilah MoonEP menjadi penting. MoE berskala besar hanya menjimatkan jika token boleh dihantar kepada pakar terpilih tanpa kelewatan rangkaian antara pelayan menjadi penghalang utama. MoonEP ditujukan untuk mengimbangi komunikasi all-to-all yang timbul daripada permintaan pakar yang tidak sekata. Justeru, tuntutan seni bina dan tuntutan sistem saling melengkapi; kedua-duanya tidak patut dianggap sebagai penjelasan berasingan bagi peningkatan markah penanda aras. 1
Bahagian kedua hujah K3 ialah model perlu dapat menggunakan lebih banyak langkah semasa inferens. Ini termasuk perancangan, pelayaran web, penggunaan alat, panggilan kod dan pembetulan kendiri — bukannya hanya bergantung pada model pra-latihan yang besar tetapi statik.
Moonshot menerangkan kelompok persekitaran kotak pasir mesin maya ringan yang membolehkan banyak trajektori pembelajaran pengukuhan (RL) yang boleh disahkan dan berjangka panjang dijana. Melalui syot kilat, trajektori boleh dicabang atau disambung semula dengan lebih murah. Infrastruktur ini menyediakan asas latihan untuk ejen yang belajar menggunakan lebih banyak langkah pada masa ujian. Laporan itu juga menerangkan penyulingan beberapa guru domain dan penaakulan ke dalam satu sistem, supaya tingkah laku khusus boleh dipindahkan tanpa perlu menyajikan sembilan model berasingan. 1
K3 mencatat 91.2% pada BrowseComp menurut papan pendahulu pihak ketiga bertarikh 2 September 2026. BrowseComp mengukur kebolehan penyelidikan web dan pencarian maklumat berjangka panjang, jadi keputusan itu menyokong dakwaan bahawa K3 kuat sebagai ejen pencari maklumat. 4
Namun, satu markah penanda aras menyeluruh tidak dapat mengasingkan sumbangan setiap komponen. Ia tidak dengan sendirinya membuktikan berapa banyak markah datang daripada KDA, AttnRes, penghalaan MoE, persekitaran RL, penyulingan atau komputasi masa ujian. Ia ialah hasil sistem hujung ke hujung.
Begitu juga dengan perbandingan kos. Dakwaan bahawa K3 berharga “separuh daripada GPT-5.6 Sol”, atau bahawa ia hanya empat mata di belakang “Claude Fable 5” dalam Kimi Code Bench pada 38% kos, tidak dapat disahkan daripada laporan teknikal atau sumber bebas berautoriti tinggi yang tersedia. Satu perbandingan yang dirujuk menganggarkan kos bagi setiap tugasan siap sekitar AS$0.94 untuk K3 berbanding AS$1.04 untuk GPT-5.6 Sol — jurang yang jauh daripada 50%. 8
Angka kos seperti ini sangat bergantung pada konfigurasi, jenis arahan, panjang jawapan, harga pada tarikh tertentu dan kaedah pengiraan penuh. Tanpa perincian harness penilaian serta perakaunan kos, ia wajar dibaca dengan berhati-hati.
Kesimpulannya, hujah strategik Moonshot lebih luas daripada persaingan harga. K3 mencadangkan bahawa model terbuka yang mahu melepasi ambang trilion parameter dan menjadikan inferens ejen berkonteks panjang benar-benar berguna memerlukan gabungan reka bentuk model, sistem komunikasi dan infrastruktur pascalatihan yang baharu. Namun, dakwaan lebih besar bahawa model sumber terbuka lain sudah tersekat berhampiran 1 trilion parameter, termasuk perbandingan dengan “DeepSeek V4 Pro”, tidak dibuktikan oleh kertas K3 sendiri berdasarkan bukti yang tersedia.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Kimi K3 mengemukakan dua paksi penskalaan: kapasiti model sebelum pelancaran dan komputasi inferens selepas model digunakan.
Kimi K3 mengemukakan dua paksi penskalaan: kapasiti model sebelum pelancaran dan komputasi inferens selepas model digunakan. Model MoE ini mempunyai 2.78 trilion parameter keseluruhan, tetapi mengaktifkan 104.2 bilion parameter bagi setiap token.
Seni bina KDA, Gated MLA, Attention Residuals dan Stable LatentMoE direka untuk menjadikan konteks panjang serta kapasiti besar lebih praktikal.