Це призначення є стратегічно вивіреним за часом. У технічному звіті DeepSeek V3 вже описано дистиляцію здатності до міркувань з моделей серії R1 A. Методологія MiniLLM, яка використовує зворотну дивергенцію Кульбака-Лейблера для генеративної дистиляції, може безпосередньо підвищити ефективність та знизити вартість майбутніх моделей.
16 червня 2026 року DeepSeek закрив свій перший в історії раунд зовнішнього фінансування, залучивши приблизно $7,4 млрд (50 млрд юанів) за оцінки після інвестицій у $52–$59 млрд RFF. Це робить DeepSeek найдорожчим AI-стартапом у Китаї F.
Ключові умови угоди:
Отриманий капітал дозволить DeepSeek наймати найкращі таланти, такі як Gu, фінансувати величезні обчислення, необхідні для навчання моделей масштабу V4 (1,6 трлн параметрів, архітектура MoE), а також утримувати ціни на API значно нижчими, ніж у OpenAI та Anthropic NO.
DeepSeek випустив попередні версії V4 — з відкритими вагами під ліцензіями MIT та Apache 2.0 — 22–24 квітня 2026 року RDA. Згідно з повідомленням Tencent News, «V4 正式版» (офіційна/фінальна версія) вийде в середині липня 2026 року N.
Обидві моделі були випущені з відкритими вагами на Hugging Face та API-доступом за цінами, значно нижчими, ніж у передових американських моделей: приблизно в 34 рази дешевше за Claude Opus 4.7 на вхід CHA.
1 травня 2026 року Центр стандартів та інновацій у сфері ШІ (CAISI) при американському NIST опублікував оцінку, яка стверджувала: «DeepSeek V4 є найпотужнішою моделлю ШІ з КНР, яку коли-небудь оцінював CAISI» у сферах кібербезпеки, програмної інженерії, природничих наук та абстрактних міркувань N. Bloomberg незалежно повідомив про той самий висновок B.
Однак в оцінці CAISI також зазначалося, що V4-Pro відстає від провідних американських передових моделей приблизно на вісім місяців у завданнях на міркування та математику NBG. За оціночними показниками Elo, V4 Pro отримав близько 800 балів, тоді як GPT-5.5 — 1260 IL.
Це є критичним нюансом: визначення «найпотужніша китайська модель» підтверджує лідерство DeepSeek у Китаї, але також публічно кількісно визначає розрив із OpenAI та Anthropic.
Усі три кроки тісно синхронізовані та взаємопідсилюються:
Наймання Gu Yuxian впроваджує світовий досвід дистиляції саме в той момент, коли DeepSeek запускає V4 — модель, яка вже використовує техніки дистиляції. Методи Gu можуть безпосередньо підвищити ефективність майбутніх моделей та знизити їхню вартість.
Залучення $7,4 млрд створює фінансову подушку для агресивного найму талантів, фінансування гігантських обчислень та утримання низьких цін на API.
Повноцінний випуск V4 — це продукт, який має довести, що DeepSeek може скоротити той 8-місячний розрив. Це публічна демонстрація того, що стратегія працює.
DeepSeek мчить, щоб стиснути свій цикл досліджень і розробок, одночасно залучаючи капітал, наймаючи найкращих фахівців з дистиляції та запускаючи V4 у продакшн — і все це з метою якомога швидше скоротити кількісно визначений розрив із передовими американськими моделями. Чи спрацює ця потрійна стратегія, залежатиме від того, наскільки швидко алгоритмічні інновації зможуть компенсувати апаратні обмеження, і чи зможе наступне покоління моделей скоротити цей восьмимісячний проміжок.