Kimi K3 поєднує два напрями масштабування: місткість моделі до розгортання та обчислення після нього — для міркувань, інструментів і агентних дій. Модель має 2,78 трлн параметрів загалом, але активує 104,2 млрд на токен; заявлене вікно контексту сягає 1 млн токенів.
Research answer

Create a landscape editorial hero image for this Studio Global article: How does Moonshot AI’s 47 page Kimi K3 technical report argue that AI progress depends on scaling both pre deployment model size and post de. Article summary: K3’s core argument is that frontier progress requires scaling two complementary resources: model capacity before deployment, and the compute spent after deployment on long reasoning, tool use, and agentic rollouts.. Topic tags: general web, llm, agents, ai, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Moonshot AI у 47-сторінковому технічному звіті Kimi K3 висуває не просто тезу «більша модель — краща». Їхній аргумент полягає у спільному масштабуванні двох ресурсів: місткості моделі до розгортання та обчислень під час інференсу, коли система вже відповідає на запит. Другий ресурс потрібен для довгих ланцюгів міркувань, роботи з інструментами, вебпошуку, написання коду й агентних послідовностей дій.
Ідея K3 — зробити обидва напрями економічно досяжнішими. Це MoE-модель (Mixture of Experts, «суміш експертів»): вона має величезну загальну місткість, але для кожного токена залучає лише частину параметрів. Паралельно архітектурні та інфраструктурні рішення мають здешевити використання цієї місткості на довгих завданнях. 1
За даними звіту, Kimi K3 — нативно мультимодальна MoE-модель із 2,78 трлн параметрів загалом і 104,2 млрд активних параметрів на токен. Заявлене вікно контексту — до 1 млн токенів. 1
Різниця між загальною та активною кількістю параметрів тут принципова. 2,78 трлн параметрів — це запас спеціалізованої місткості моделі. Але під час обробки конкретного токена маршрутизатор обирає лише релевантних «експертів», тож обчислення не дорівнюють вартості щільної моделі такого самого повного розміру.
Водночас 104,2 млрд активних параметрів — усе ще дуже великий обсяг. Тому MoE не скасовує проблему вартості інференсу, а змінює її: архітектура повинна ефективно обробляти контекст, розподіляти токени між експертами та уникати того, щоб мережеві затримки стали вузьким місцем. 1
Важливе уточнення: звіт заявляє нативну екстраполяцію до 1 млн токенів, а не до 100 тис. Під час навчання K3 спершу використовували послідовності на 8 тис. токенів, а потім на 64 тис. 1
Автори також зазначають, що не застосовують явних позиційних ембедингів. На їхню думку, рекурентні шлюзи та механізм затухання в Kimi Delta Attention (KDA) достатньо кодують позиційну інформацію, щоб переносити модель на значно довші послідовності без модифікації RoPE. 1
Це технічна заява про здатність архітектури працювати за межами довжин, типових для навчання. Вона не означає, що всі завдання автоматично стають кращими від самого лише мільйонного контексту: практична користь залежить від того, чи вміє система знаходити потрібну інформацію, планувати дії та виправляти себе в такому великому обсязі даних.
Більшість стандартних механізмів уваги стають дедалі дорожчими зі зростанням контексту, зокрема через KV-кеш — накопичені ключі й значення для попередніх токенів. KDA покликана замінити значну частину такої квадратичної уваги рекурентним станом фіксованого розміру. Отже, стан на токен і витрати на декодування не зростають лінійно разом із усією попередньою історією так, як це відбувається за повного KV-кешу. 1
Moonshot не відмовляється від глобальної уваги повністю. У K3 три шари KDA чергуються з одним шаром Gated MLA — це співвідношення 3:1. У такій схемі KDA забезпечує дешевшу послідовну обробку, а Gated MLA повертає можливість вибірково діставати інформацію з усього контексту. 1
У звіті нижню межу для коефіцієнта затухання KDA описано не лише як прийом моделювання. Вона також потрібна для уникнення чисельно проблемних надто малих значень і для блокових обчислень, зручних для тензорних ядер прискорювачів. 1
Ще один компонент — Attention Residuals, або AttnRes. Його роль полягає в тому, щоб дуже глибока мережа, де переважає лінійна увага, не втрачала доступ до корисних сигналів із ранніх шарів.
Замість суворо послідовного передавання всього через кожен наступний шар, пізніші шари можуть звертатися до стиснених представлень із попередніх блоків глибини. Для 93-шарової мережі це є додатковим шляхом пошуку інформації «крізь глибину». Очікувана вигода — зберегти якість, замінюючи значну частину дорогої глобальної уваги KDA-механізмом. 1
У Stable LatentMoE K3 використовує 896 експертів із маршрутизацією top-16: для токена обираються 16 експертів. Це збільшує умовну місткість моделі — різні токени можуть активувати різні спеціалізовані підмережі. 1
Moonshot описує метод балансування через квантілі як задачу збалансованого призначення токенів експертам і виводить точний оптимум за своїх припущень на рівні батчу. Але під час розгортання балансувальний розв’язувач не запускається: маршрутизатор застосовує фіксовані зміщення експертів і звичайний вибір top-k. 1
Тому формулювання на кшталт «ідеальна рівновага» слід читати обережно. Це результат для визначеної оптимізаційної задачі та її припущень, а не гарантія ідеально рівномірного навантаження в кожному реальному запиті чи робочому батчі.
Велика MoE-модель має сенс лише тоді, коли токени можуть швидко потрапляти до призначених їм експертів. Це створює інтенсивний обмін даними типу all-to-all між пристроями, а нерівний попит на експертів може призвести до затримок.
MoonEP покликаний балансувати такий обмін, щоб мережеві «хвости» не зводили нанівець переваги 896-експертної конструкції. Це не окреме пояснення бенчмарк-результатів, а системна передумова того, щоб архітектура MoE взагалі могла ефективно навчатися й обслуговуватися у великому масштабі. 1
Друга половина тези Moonshot — не розміщувати весь інтелект у заздалегідь натренованих вагах. Частину можливостей система має здобувати, витрачаючи більше кроків уже під час виконання завдання: плануючи, переглядаючи вебсторінки, пишучи й запускаючи код, викликаючи інструменти, перевіряючи проміжні результати та коригуючи курс.
Для післятренування Moonshot описує парк легких віртуальних машин із «пісочницями». Він дає змогу дешево генерувати багато перевірюваних RL-траєкторій із довгим горизонтом, а також розгалужувати чи відновлювати їх через знімки стану. Це створює середовище навчання для моделей, які можуть ефективніше використовувати додаткові кроки на етапі інференсу. 1
Звіт також згадує дистиляцію кількох спеціалізованих учителів для доменних і міркувальних навичок в одну систему. Сенс такого підходу — передати спеціалізовану поведінку, не обслуговуючи дев’ять окремих моделей у продакшені. 1
Результат 91,2% у BrowseComp підтримує тезу, що K3 сильна у довгих агентних завданнях з пошуку інформації. Станом на 2 вересня 2026 року стороння таблиця BenchLM.ai ставить Kimi K3 на друге місце: попереду GPT-5.6 Sol із 92,2%, далі Claude Opus 5 із 90,8%. 4
Але підсумковий бал не дозволяє ізолювати внесок окремих складників. Він не доводить сам по собі, скільки саме додали KDA, AttnRes, маршрутизація MoE, RL-середовища, дистиляція або додаткові обчислення під час відповіді. Це результат роботи системи як цілого.
Точні твердження, нібито K3 коштує «вдвічі менше за GPT-5.6 Sol», або що вона відстає від «Claude Fable 5» на чотири пункти в Kimi Code Bench за 38% вартості, не підтверджені в технічному звіті чи високонадійному незалежному джерелі серед наявних матеріалів.
Одне з порівнянь наводить оцінку вартості завершеного завдання: приблизно $0,94 для K3 проти $1,04 для GPT-5.6 Sol. Це близькі значення, а не різниця у 50%. 8 Такі підрахунки залежать від конфігурації моделі, довжини й типу запитів, ціни на дату вимірювання, а також методики обліку. Без відкритого тестового середовища та повної калькуляції витрат їх не варто трактувати як універсальні.
Стратегічна теза Moonshot AI радше про архітектуру й системний дизайн, ніж про просте змагання цін. Компанія стверджує, що для переходу за трильйонний масштаб відкритим моделям потрібен комплексний стек: умовна MoE-місткість, ефективна робота з довгим контекстом, стабільне маршрутизування, швидкий обмін між експертами та післятренування для агентного виконання завдань.
Втім, сам звіт не встановлює, що відкриті моделі загалом «застрягли» біля 1 трлн параметрів, і не доводить заявлені порівняння з DeepSeek V4 Pro. Те, що він надає, — це технічний аргумент, як K3 намагається одночасно масштабувати розмір моделі та корисні обчислення під час її роботи. 1
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Kimi K3 поєднує два напрями масштабування: місткість моделі до розгортання та обчислення після нього — для міркувань, інструментів і агентних дій.
Kimi K3 поєднує два напрями масштабування: місткість моделі до розгортання та обчислення після нього — для міркувань, інструментів і агентних дій. Модель має 2,78 трлн параметрів загалом, але активує 104,2 млрд на токен; заявлене вікно контексту сягає 1 млн токенів.
Гібрид KDA та Gated MLA, Attention Residuals, маршрутизація MoE й інфраструктура MoonEP мають зменшувати практичну вартість великої моделі.