Inilah kisah pelancaran itu — apa yang sebenarnya mampu dilakukan oleh model ini, berapa kosnya, dan mengapa ia mewakili detik penting dalam persaingan AI antara AS dan China.
Kimi K3 mendapat skor 57.1 pada Indeks Kepintaran Analisis Buatan v4.1 bebas, meletakkannya di tempat ke-3 global di belakang Claude Fable 5 (60) dan GPT-5.6 Sol (59) . Jurang itu kira-kira 3 mata — rapat mengikut piawaian sejarah, tetapi jelas: ujian kepintaran paling luas masih memihak kepada model AS teratas
. Moonshot sendiri mengakui perkara ini, dengan menyatakan secara terbuka bahawa K3 "masih ketinggalan di belakang model proprietari paling berkuasa" daripada Anthropic dan OpenAI dalam prestasi agregat keseluruhan
.
Namun, K3 mendahului dalam penanda aras ejen dunia sebenar yang spesifik:
| Penanda Aras | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 88.3 | 84.6 | 88.8 | 84.6 |
| DeepSWE | 73.0 | 70.0 | 67.5 | 59.0 |
| BrowseComp | 91.2 | 88.0 | 90.4 | 84.3 |
| Automation Bench | 75.6 | — | — | — |
| SpreadsheetBench 2 | 34.8 | 34.7 | 32.4 | 31.6 |
Dalam enam penanda aras ejen ini serta Program Bench (77.8), K3 memenangi 5 daripada 6 secara langsung, mengatasi kedua-dua Fable 5 dan GPT-5.6 Sol dalam ujian khusus tersebut . Ia juga mengatasi prestasi Claude Opus 4.8 dengan ketara dalam setiap penanda aras yang diterbitkan — hasil yang bermakna kerana Opus 4.8 berharga $5 input / $25 output per juta token, menjadikannya pesaing kos langsung
.
Dalam Arena, platform keutamaan buta manusia yang dibina oleh penyelidik UC Berkeley, K3 mendahului papan pendahulu pengekodan sejurus selepas pelancaran . Penilaian perbandingan orang ramai Arena menunjukkan K3 menduduki tempat pertama dalam pembangunan web bahagian hadapan dengan skor 1,679, di hadapan Fable 5 (1,631) dan GPT-5.6 Sol (1,618)
.
Dalam pengoptimuman kernel GPU — teknik yang meningkatkan cara model AI berinteraksi dengan perkakasan — Moonshot melaporkan bahawa K3 "mengatasi prestasi dengan ketara" Opus 4.8, GPT-5.6 Sol, dan GPT-5.5 . Ini signifikan dari segi komersial kerana pengoptimuman kernel yang lebih baik bermakna kependaman lebih rendah dan daya pemprosesan lebih tinggi pada perkakasan yang sama.
Model ini menggunakan seni bina MoE jarang dengan 896 pakar, di mana hanya 16 diaktifkan setiap token, menjadikannya setanding dari segi kos inferens dengan GPT-5.6 Sol walaupun mempunyai 2.8 trilion parameter keseluruhan . Ia juga memperkenalkan Kimi Delta Attention (KDA) dan Attention Residuals (AttnRes) — komponen seni bina baharu yang direka untuk meningkatkan penaakulan konteks panjang
.
Salah satu aspek yang paling mengganggu pasaran Kimi K3 ialah harga APInya, yang mengatasi model utama AS dengan ketara:
| Model | Input (per 1M token) | Output (per 1M token) |
|---|---|---|
| Kimi K3 | $3.00 | $15.00 |
| GPT-5.6 Sol | $5.00 | $30.00 |
| Claude Fable 5 | $10.00 | $50.00 |
| Claude Opus 4.8 | $5.00 | $25.00 |
Kimi K3 berharga ~40% lebih murah daripada GPT-5.6 Sol dan ~70% lebih murah daripada Claude Fable 5 pada kadar senarai . Ketiga-tiga model ini terletak pada tangga 3.3× yang jelas: Fable 5 berharga 3.3 kali ganda Kimi K3 untuk input dan output, dengan GPT-5.6 Sol hampir tepat di antaranya
.
Selain itu, K3 mempunyai kadar input hit cache $0.30 per juta token — 10 kali lebih murah daripada kadar miss cache — untuk pertanyaan konteks yang telah dilayan sebelum ini . Secara per tugas, K3 dianggarkan berharga 50-65% lebih murah daripada model utama AS
.
Penetapan harga Moonshot untuk K3 menunjukkan peralihan ketara: ia kini berharga seperti model sempadan dan bukannya pilihan bajet . Model Kimi sebelumnya seperti K2.5 dan K2.6 berharga $0.60 input / $2.50-4.00 output, menjadikan K3 kira-kira 3-4 kali lebih mahal daripada pendahulunya sendiri
. Walau bagaimanapun, ia tetap lebih murah daripada model teratas AS sambil memberikan prestasi setanding atau lebih baik dalam tugas ejen tertentu.
Pada 19 Julai 2026 — kira-kira 48 jam selepas pelancaran — Moonshot AI mengumumkan ia menghentikan langganan baharu buat sementara waktu untuk Kimi K3. Syarikat itu menyiarkan di X: "Kimi K3 telah menerima lebih banyak kasih sayang daripada yang kami jangkakan, dan GPU kami merasainya. Sepanjang 48 jam yang lalu, permintaan telah menghampiri had kapasiti semasa kami" .
Syarikat itu berkata ia akan mengutamakan pengkomputeran untuk pelanggan sedia ada sambil menambah kapasiti secepat mungkin, merancang untuk membuka semula slot langganan secara berperingkat . Pengguna sedia ada mengekalkan akses penuh, dan perkhidmatan perusahaan/API diteruskan
.
Pelbagai saluran berita menyatakan bahawa insiden ini menonjolkan kekangan pengkomputeran China yang berterusan disebabkan sekatan eksport cip AS . South China Morning Post menulis bahawa keadaan ini "menekankan cabaran yang dihadapi oleh makmal AI China dalam menyajikan produk mereka kepada pengguna global"
. Pemberat penuh model, yang akan membolehkan pihak ketiga menjalankannya pada perkakasan mereka sendiri, tidak dijadualkan sehingga 27 Julai — meninggalkan Moonshot sebagai satu-satunya penyedia kapasiti inferens semasa tetingkap pelancaran
.
Moonshot menggunakan jeda itu untuk membahagikan keahliannya kepada dua pelan: Keahlian Kimi (untuk web, aplikasi, dan Kerja) dan Keahlian Kimi Code (untuk aliran kerja pengekodan), penyusunan semula yang direka untuk memperuntukkan sumber pengkomputeran dengan lebih baik .
Pelancaran Kimi K3 mempunyai kesan yang melampaui penanda aras AI. Straits Times melaporkan secara langsung bahawa K3 "mencetuskan kekacauan teknologi," dan pelbagai saluran mengaitkan pelepasan itu dengan penjualan saham semikonduktor dan AI AS . Walaupun angka khusus mengenai arah Indeks Semikonduktor Philadelphia atau pergerakan saham Nvidia tidak dapat disahkan secara bebas dalam set sumber yang tersedia, konteks pasaran yang lebih luas mengenai penjualan itu didokumentasikan dengan baik.
Di sisi korporat, Reuters melaporkan pada 20 Julai 2026 bahawa penghentian langganan "berlaku ketika syarikat mencari pembiayaan baharu, dengan sumber mengatakan ia bergerak ke arah tawaran awam permulaan di Hong Kong" . Walau bagaimanapun, tiada sumber dalam bukti yang tersedia mengesahkan resolusi pemegang saham khusus untuk sasaran penilaian $30 bilion. Laporan Reuters menyebut desakan IPO tanpa menyatakan penilaian sasaran
.
Pemberat penuh model untuk Kimi K3 dijadualkan untuk siaran awam pada 27 Julai 2026 . Ini adalah butiran kritikal kerana ia bermakna pembangun dan organisasi akhirnya boleh memuat turun, menjalankan, memeriksa, memperhalusi, dan memiliki model itu daripada hanya menyewanya melalui API
. Pelancaran dua langkah — API dahulu, berat terbuka sebelas hari kemudian — adalah bentuk keseluruhan pengumuman
.
Sebelum pelepasan berat terbuka, pembangun boleh mengakses K3 melalui kimi.com, API Kimi, atau OpenRouter . Model ini bercakap SDK OpenAI, menyokong panggilan alat, output berstruktur, dan cache konteks automatik, dan mempunyai tetingkap konteks 1 juta token tanpa caj tambahan konteks panjang
.
Walau bagaimanapun, menjalankan model 2.8 trilion parameter secara tempatan bukanlah mudah. Saiz fail dianggarkan kira-kira 1.5 TB, dan perkakasan yang disyorkan termasuk 64+ GPU NVIDIA H100 perusahaan . Bagi kebanyakan pasukan, API akan kekal sebagai titik akses praktikal.
Kimi K3 bukanlah model yang menjatuhkan GPT-5.6 Sol atau Claude Fable 5 dalam kepintaran keseluruhan — Moonshot sendiri mengatakannya. Tetapi ia adalah model yang membuktikan sistem berat terbuka boleh bersaing dengan model proprietari sempadan dalam tugas khusus yang bernilai komersial sambil berharga sebahagian kecil daripada harga. Ia adalah model berat terbuka terbesar yang pernah dikeluarkan, dan ia tiba dengan permintaan dunia sebenar yang cukup untuk meruntuhkan infrastruktur GPU syarikat dalam dua hari.
Gabungan itu — prestasi setingkat sempadan dalam penanda aras ejen, harga agresif, berat terbuka, dan isyarat jelas permintaan — menjadikan K3 sebagai peristiwa penting dalam landskap AI, tanpa mengira kedudukannya di mana-mana papan pendahulu tunggal.