Moonshot AI пропонує масштабувати ШІ у двох напрямах: нарощувати місткість моделі до розгортання та виділяти більше обчислень на міркування, інструменти й перевірку роботи під час виконання задачі. Kimi K3 має 2,8 трлн загальних параметрів, але для одного токена активує приблизно 104 млрд.
Research answer

Create a landscape editorial hero image for this Studio Global article: How does Moonshot AI’s 47-page Kimi K3 technical report argue that AI progress depends on scaling both pre-deployment model size and post-de. Article summary: K3’s core argument is that frontier progress requires scaling two complementary resources: model capacity before deployment, and the compute spent after deployment on long reasoning, tool use, and agentic rollouts. Its a. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Moonshot AI подає Kimi K3 як аргумент на користь масштабування у двох вимірах. Перший — зробити модель значно більшою ще до розгортання. Другий — після розгортання дати їй достатньо обчислень для міркувань, роботи з інструментами, вебпошуку, програмування та виправлення власних помилок.
Ключове питання тут економічне. Просто зробити мережу щільнішою та глибшою недостатньо, якщо обслуговування довгого контексту обходиться надто дорого. Архітектура K3 має збільшити загальну місткість моделі, водночас стримуючи обчислювальні витрати та потребу в пам’яті для кожного згенерованого токена. 1
Kimi K3 описують як нативну мультимодальну модель типу mixture-of-experts (MoE, «суміш експертів») із 2,8 трлн загальних параметрів, приблизно 104 млрд активованих параметрів на токен і контекстним вікном до 1 млн токенів. 1
17
Ці два числа відповідають на різні запитання:
У цьому і полягає практична привабливість MoE. K3 може бути значно більшою за щільну модель із подібним обчислювальним навантаженням на один токен. Це не робить інференс дешевим — 104 млрд активних параметрів усе одно є дуже великим обсягом, — але дає змогу не оплачувати обчислення щільної мережі на 2,8 трлн параметрів для кожного токена. 1
Отже, теза Moonshot не зводиться до «більше параметрів — краще». Ідея в тому, що умовні обчислення можуть зробити новий рівень місткості моделі придатним для тривалих і складних задач.
Контекст у мільйон токенів складний не лише з погляду навчання. У звичайних механізмах уваги зі зростанням послідовності можуть швидко наростати витрати пам’яті та обчислень. K3 застосовує гібридний підхід, поєднуючи Kimi Delta Attention (KDA) та Gated Multi-head Latent Attention (Gated MLA). У бекбоні моделі заявлено 69 шарів KDA і 24 шари Gated MLA, переважно за схемою «три KDA на один MLA». 1
12
KDA — це компонент лінійної уваги. Замість зберігати в кожному такому шарі традиційний кеш ключів і значень, який росте разом із усією історією, він використовує рекурентний стан фіксованого розміру. Очікуваний ефект: обсяг стану в пам’яті та робота під час декодування не збільшуються з попереднім контекстом так само, як за повної уваги. 1
У звіті також описано нижню межу для швидкості затухання в KDA. Це не просто архітектурне рішення: обмеження не допускає надто малих значень затухання, проблемних для ефективних чисельних обчислень, і дозволяє застосувати блокову реалізацію, придатну для tensor cores на GPU. 1
Самої лінійної рекуренції може не вистачати для вибіркового глобального пошуку за всім контекстом — поведінки, властивої повній увазі. Тому K3 зберігає шари Gated MLA по всій мережі. У цій гібридній схемі KDA забезпечує відносно недорогу постійну обробку послідовності, а MLA періодично дає механізм глобального доступу до релевантної інформації. 1
Це важливо, бо контекстне вікно на мільйон токенів має цінність лише тоді, коли модель здатна знаходити потрібні фрагменти та відповідати з прийнятною вартістю.
Другий архітектурний компонент K3 — Attention Residuals (AttnRes). Модель має 93 шари, а AttnRes дає пізнішим шарам змогу звертатися до стиснених представлень із попередніх блоків за глибиною, а не передавати всю інформацію лише послідовно від шару до шару. 1
Якщо KDA відповідає за потік інформації вздовж довжини послідовності, то AttnRes — за її рух крізь глибину моделі. Це особливо важливо для глибокої мережі, у якій значна частина стеку використовує лінійну увагу: заміна дорогої глобальної уваги корисна лише тоді, коли важлива інформація не губиться і не ізолюється під час проходження активацій через мережу. 1
У MoE-шарі K3 заявлено 896 маршрутизованих експертів, з яких для кожного токена обираються 16. 1
6 Саме цей механізм пояснює велику різницю між загальною та активною кількістю параметрів.
Підхід Stable LatentMoE зосереджений на стабільній і збалансованій маршрутизації токенів до експертів. У звіті розподіл експертів на рівні пакета даних формулюється як оптимізаційна задача й вводиться балансування на основі квантилів. Автори виводять точний оптимум за своїх припущень; однак під час розгортання маршрутизація використовує фіксовані зміщення експертів і звичайний вибір top-k, а не розв’язує задачу балансування наново для кожного пакета інференсу. 1
Ця різниця суттєва. Заявлений оптимальний стан стосується конкретної математичної постановки маршрутизації, а не гарантує, що в кожному реальному навантаженні токени будуть ідеально рівномірно розподілені між експертами.
Великі MoE-моделі створюють мережеву проблему: токени часто потрібно передавати між пристроями, щоб доставити їх обраним експертам. Якщо окремі експерти отримують непропорційно великий потік запитів, затримка на найповільнішому вузлі зв’язку може визначати швидкодію всієї системи.
Moonshot позиціонує MoonEP як системний компонент для експертно-паралельних комунікацій. Його завдання — зменшувати дисбаланс в обмінах «усі з усіма», які виникають через розріджену маршрутизацію, щоб великий пул експертів можна було навчати й обслуговувати на практиці. 1
Це важлива частина загального аргументу K3: архітектуру, маршрутизацію та мережеву взаємодію не варто оцінювати як незалежні пояснення продуктивності. Щоб перетворити теоретичну розріджену місткість на реальну пропускну здатність, потрібні всі три складові.
Інший вимір підходу K3 починається після переднавчання. Moonshot описує інфраструктуру для траєкторій навчання з підкріпленням у задачах із тривалим горизонтом: використання інструментів, програмування, вебпошук та ітеративне розв’язання проблем. У звіті також ідеться про дистиляцію кількох учителів із різних доменів і режимів міркування в одну систему. 1
Підтримувальне середовище — це система легких віртуальних машин для створення, знімків стану та відновлення робочих середовищ у великому масштабі. Заявлені показники: 51,2 млн екземплярів пісочниць, 133 мс на знімок стану та 49 мс на відновлення. 1
Логіка проста: якщо модель має витрачати більше обчислень під час виконання задачі на планування, виклики інструментів, перевірку результату чи продовження довгої роботи, то її треба навчати на подібних траєкторіях. Можливість дешево призупиняти, розгалужувати й відновлювати середовища робить більшу кількість таких навчальних запусків реалістичною.
Це не означає, що кожна відповідь K3 автоматично отримує необмежений бюджет обчислень. Натомість звіт відстоює систему, здатну перетворювати додаткові кроки та контекст на кращий результат, а не покладатися винятково на більшу попередньо навчену модель.
Для Kimi K3 заявлено 91,2% у BrowseComp — бенчмарку для довготривалого пошуку інформації. Стороння таблиця лідерів також наводить для K3 91,2%, хоча місця в рейтингах і конфігурації тестів можуть змінюватися з часом. 18
Цей результат узгоджується з продуктовою метою: модель, створену для довгого контексту, агентного донавчання та міркувань під час інференсу, логічно перевіряти на складних пошукових задачах. Проте це не є чистою абляцією окремих компонентів.
Один бал бенчмарку не показує, яка саме частка результату належить KDA, AttnRes, маршрутизації експертів, комунікаційній інфраструктурі, середовищам RL, дистиляції, промптингу чи налаштуванням інференсу. Найобережніший висновок: заявлена система добре працює як цілісний стек, а не те, що одна архітектурна інновація сама по собі пояснює 91,2%. 1
18
K3 часто подають як виклик іншим великим відкритим моделям, зокрема системам DeepSeek. Обережний висновок зі звіту не в тому, що вже існує остаточна таблиця лідерів серед відкритих моделей, а в іншому архітектурному акценті: Moonshot просуває стек, який поєднує дуже велику розріджену місткість, ефективну роботу з довгим контекстом та інфраструктуру донавчання для агентів. 1
17
Сам звіт підтверджує специфікації та дизайнерські рішення K3. Але він не встановлює, що інші відкриті моделі «застрягли», і не ізолює вирішальну перевагу над конкретним конкурентом. Для таких ринкових висновків потрібні послідовні й незалежно відтворені порівняння.
Порівняння ціни за токен або за виконану задачу легко перебільшити. На них впливають промпт, обсяг міркувань, довжина контексту, кешування, використання інструментів, припущення про пропускну здатність, дата тарифів і конкретний тестовий контур.
Одне з опублікованих порівнянь оцінює вартість завершеної задачі приблизно у $0,94 для K3 та $1,04 для GPT-5.6 Sol. Це може вказувати на невелику перевагу саме в цій конфігурації, але не підтверджує універсальне твердження, що K3 коштує «вдвічі дешевше» за Sol. 20
Більш стійкий висновок менш гучний: K3 є спробою зробити економічно реалістичними довгий контекст і агентні можливості за значно більшого загального масштабу моделі. Чи вдається це на практиці, залежить від відтворюваних тестів і розрахунку витрат для конкретного сценарію розгортання.
Технічний звіт Kimi K3 формулює аргумент про масштабування на рівні всієї системи. Масштаб до розгортання забезпечує MoE-модель із 2,8 трлн параметрів та приблизно 104 млрд параметрів, активованих на токен. Масштаб після розгортання — це навчання й обслуговування моделі, яка може використати довгий контекст, інструменти, кроки міркування та агентні траєкторії. 1
17
KDA, Gated MLA, AttnRes, Stable LatentMoE, MoonEP та інфраструктура RL-пісочниць — частини однієї тези: для агентної поведінки рівня передових моделей потрібна не тільки більша мережа, а й дизайн, що робить доступними більше контексту та більше обчислень під час інференсу. Бенчмарки дають обнадійливі свідчення на користь цього інтегрованого підходу, але їх варто читати як заявлені результати системи загалом, а не як остаточний доказ внеску кожного компонента. 1
18
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Moonshot AI пропонує масштабувати ШІ у двох напрямах: нарощувати місткість моделі до розгортання та виділяти більше обчислень на міркування, інструменти й перевірку роботи під час виконання задачі.
Moonshot AI пропонує масштабувати ШІ у двох напрямах: нарощувати місткість моделі до розгортання та виділяти більше обчислень на міркування, інструменти й перевірку роботи під час виконання задачі. Kimi K3 має 2,8 трлн загальних параметрів, але для одного токена активує приблизно 104 млрд.
Показник 91,2% у BrowseComp є сильним результатом системи загалом, але не доводить внесок кожного її компонента окремо.