Втім, йдеться не про готовий продукт. Модель лише проходить ранній етап попереднього навчання, її остаточний розмір ще не затверджено, а незалежно підтвердити повідомлення Financial Times поки не вдалося .
Про початок навчання Financial Times повідомила 7 серпня 2026 року, посилаючись на джерела, обізнані з проєктом . За оцінками галузевих джерел, попереднє навчання моделей такого масштабу зазвичай триває від трьох до шести місяців. Після цього потрібні додаткове налаштування, тестування та підготовка до можливого релізу .
ByteDance ще оцінює, чи варто навчати модель до повної позначки у 10 трильйонів параметрів. Раніше того самого дня з’являлися повідомлення, що компанія обговорює модель із понад 5 трильйонами параметрів, тож заявлений масштаб проєкту міг зрости .
Отже, 10 трильйонів — це наразі верхня межа, а не підтверджений фінальний показник. Також немає інформації, коли саме модель стане доступною для користувачів або чи буде випущена публічно.
За галузевими оцінками, Anthropic Mythos 5 має близько 8 трильйонів параметрів. Якщо ByteDance досягне заявленої межі, її модель буде приблизно такого самого масштабу або дещо більшою .
| Модель | Орієнтовна кількість параметрів | Статус і примітки |
|---|---|---|
| Нова модель ByteDance | До 10 трильйонів | Ранній етап попереднього навчання; найбільша відома модель, яку намагається створити китайська компанія |
| Anthropic Claude Mythos 5 | Близько 8 трильйонів за галузевими оцінками | Випущена для обмеженого кола перевірених американських організацій у межах Project Glasswing; публічна версія Claude Fable 5 має запобіжники безпеки |
| Moonshot AI Kimi K3 | 2,8 трильйона | Потенційна модель ByteDance була б більш ніж утричі більшою |
| Флагманська модель OpenAI | Не розкривається; оцінюється як багатотрильйонна | Точні характеристики компанія не оприлюднила |
Ці цифри варто сприймати обережно. Кількість параметрів — це приблизний показник архітектурного масштабу, але не прямий вимір якості, швидкості чи корисності моделі.
Найважливіше уточнення стосується різниці між загальними та активними параметрами.
Сучасні великі моделі часто використовують архітектуру Mixture of Experts (MoE) — «суміш експертів». У такій системі під час обробки конкретного запиту задіюється лише частина всієї моделі. Тому модель із 10 трильйонами загальних параметрів може активувати, наприклад, лише 1–2 трильйони під час окремого обчислення.
У доступних повідомленнях не уточнюється, чи йдеться у випадку ByteDance саме про загальну кількість параметрів, активні параметри або поєднання різних показників. Це має вирішальне значення для коректного порівняння з Anthropic, OpenAI та іншими розробниками .
Засновник ByteDance Чжан Імінь доручив команді Seed не використовувати дистиляцію відповідей конкуруючих моделей для прискорення власної розробки. За повідомленнями, він готовий змиритися з тим, що компанія на певний час відставатиме від китайських конкурентів .
Дистиляція — це метод, за якого одна модель навчається на відповідях потужнішої «моделі-вчителя». Такий підхід дає змогу швидше відтворити частину можливостей передової системи або створити компактнішу модель, але водночас став предметом гострих суперечок щодо походження даних, інтелектуальної власності та допустимих меж копіювання.
Як повідомлялося, на внутрішній зустрічі 6 серпня 2026 року Чжан Імінь назвав такий підхід несумісним із довгостроковою стратегією компанії, яку описують як «довгострокове мислення» та «відкладене задоволення» . На рішення також могла вплинути складна регуляторна історія ByteDance у США, пов’язана з TikTok, а також прагнення зменшити юридичні ризики та ризики, пов’язані з експортним контролем .
Для китайської ШІ-індустрії це помітний стратегічний поворот: дистиляція широко використовується лабораторіями, які прагнуть швидко скоротити відставання від американських передових моделей .
ByteDance створила підрозділ Seed на початку 2023 року — після появи ChatGPT і різкого загострення конкуренції у сфері генеративного ШІ . За доступними повідомленнями, команда налічує приблизно 2 000 працівників у Китаї та за кордоном. До її складу входять дослідники, інженери інфраструктури, фахівці з маркування даних і перекладачі .
Ключові фігури проєкту:
У 2025 році ByteDance об’єднала в Seed свій AI Lab і робототехнічний напрям, зосередивши дослідження базових моделей в одному підрозділі .
Модель на 10 трильйонів параметрів розглядають як спробу ByteDance скоротити розрив із передовими американськими лабораторіями, зокрема Anthropic та OpenAI . Її поява стала б важливим сигналом у глобальному змаганні за обчислювальні ресурси, таланти та незалежність від іноземних технологій.
На розвиток проєкту впливають кілька чинників:
Це показує, що передові ШІ-моделі дедалі частіше сприймаються не просто як комерційні продукти, а як стратегічні технологічні активи.
ByteDance не повідомляла, чи планує випустити цю модель у відкритий доступ. Загальна стратегія компанії залишається радше закритою та орієнтованою на інтеграцію продуктів:
ByteDance робить довгострокову ставку на незалежну розробку передової ШІ-системи. Проєкт очолює команда Seed приблизно з 2 000 людей, а його масштаб потенційно наближається до Anthropic Mythos 5.
Але ключові питання залишаються відкритими: чи досягне модель повних 10 трильйонів параметрів, скільки з них буде активними під час роботи, чи зможе вона конкурувати за якістю та коли стане доступною. Тому наразі йдеться передусім про амбітний інфраструктурний і стратегічний проєкт, а не про готового конкурента Anthropic.