За повідомленнями, Seed почала обмежувати використання відповідей конкурентних моделей ще 2023 року й підтвердила цю позицію 2026 го, погодившись на тимчасове відставання в бенчмарках. Правило, як стверджують джерела, стосується і закритих систем на кшталт GPT та Claude, і моделей із відкритими вагами.
Research answer

Create a landscape editorial hero image for this Studio Global article: Why did ByteDance founder Zhang Yiming reaffirm Seed’s 2023 prohibition against training its language models on outputs from other companies. Article summary: Zhang reaffirmed the prohibition because he views competitor-output distillation as a short-term benchmark shortcut that would undermine Seed’s ability to discover its own training methods, research directions, and model. Topic tags: general, news, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
Засновник ByteDance Чжан Імін, за повідомленнями, знову підтвердив жорстке правило для команди Seed, яка займається розробкою фундаментальних моделей: не покращувати власні системи за допомогою дистиляції відповідей конкурентів — навіть якщо через це компанія втратить частину короткострокових здобутків. Reuters описує це як свідомий вибір на користь довгострокового розвитку ШІ, а не швидкого результату в рейтингах. 1
Дистиляція — це метод, за якого слабша або менша модель навчається на відповідях потужнішої. Так можна швидше відтворити окремі здібності, заощадивши час і обчислювальні ресурси. Але побоювання Seed, як стверджують джерела, полягає в іншому: копіюючи відповіді лідера, ByteDance ризикує стати лише дуже сильним послідовником, чиї дослідницькі рішення залежать від чужих методів, оцінок і уявлень про те, яким має бути інтелект. 4
9
За повідомленнями, узагальненими Pekingnology та Pandaily, ранні команди Seed експериментували з матеріалами, створеними через API GPT. Після того як ByteDance у квітні 2023 року запровадила аудит API-викликів, команда нібито ухвалила правило не додавати дані, згенеровані GPT, до навчальних наборів ByteDance. Згодом цей принцип поширили на моделі конкурентів загалом. 9
14
Це важливе уточнення. Йшлося не просто про заборону використання одного закритого API. Як стверджують джерела, правило перетворилося на ширшу позицію: модель іншої компанії — незалежно від того, чи є вона закритою, чи випущена з відкритими вагами, — не повинна ставати «вчителем» для Seed. 9
10
Внутрішня суперечка, за повідомленнями, загострилася після того, як DeepSeek-R1 у січні 2025 року продемонструвала сильні результати в міркуванні та ефективності. Частина дослідників Seed нібито пропонувала використовувати відповіді потужніших американських систем як доповнення до власного навчання ByteDance — щоб швидше покращити здатність моделей міркувати. Позиція Чжана, за цими ж повідомленнями, залишилася незмінною: це все одно означало б залежність від запозичених можливостей. 9
Твердження про те, що сама DeepSeek використовувала синтетичні дані передових американських моделей, у доступних матеріалах залишаються галузевими припущеннями, а не незалежно підтвердженим фактом. Їх не слід плутати з окремим і краще задокументованим повідомленням про внутрішнє правило Seed.
Для китайських розробників ШІ боротьба за обчислювальні ресурси, можливості моделей і позиції в бенчмарках стала особливо гострою. У такій ситуації дистиляція могла здаватися найкоротшим шляхом: навчання на відповідях сильнішої системи здатне швидко скоротити вимірюваний розрив.
У повідомленнях також згадується поява Kimi K3 від Moonshot — потужної моделі з відкритими вагами, яку конкуренти можуть досліджувати й потенційно використовувати як джерело навчальних даних. Для Seed це перетворило питання дистиляції з абстрактної дослідницької переваги на реальну стратегічну дилему. 9
14
Під час внутрішньої зустрічі Seed у 2026 році Чжан, як стверджується, сформулював вибір прямо: тимчасове відставання краще, ніж дистиляція систем конкурентів. Reuters окремо повідомило про його вказівку не покращувати моделі ByteDance за допомогою таких методів, навіть ціною короткострокових втрат. 1
10
Тут ідеться не лише про права доступу чи ліцензії. Закриту модель, до якої звертаються через API, та модель із відкритими вагами регулюють різні юридичні й технічні правила. Однак стратегічний ризик може бути схожим: розробник навчається на готових рішеннях іншої лабораторії, а не виробляє власні. 9
14
Це не означає, що всі форми передавання знань однакові або що будь-яке використання відкритих ваг є неправомірним. За доступними повідомленнями, внутрішній стандарт Seed просто був суворішим за звичайну заборону несанкціонованого збору даних із комерційного API. Команді нібито наказали не використовувати передові моделі інших компаній як учителів — зокрема й ті, чиї ваги доступні публічно. 10
14
Значущість цієї політики зросла на тлі звинувачень, висунутих проти інших китайських розробників ШІ. Anthropic заявила, що Alibaba, DeepSeek, Moonshot, MiniMax і Z.ai використовували облікові записи або посередників для вилучення відповідей Claude з метою навчання моделей. ByteDance у цьому звинуваченні не фігурувала. Окремо представник США звинуватив Moonshot у неналежному використанні моделі Anthropic для навчання Kimi K3. Це саме звинувачення, а не встановлені наведеними матеріалами факти. 6
9
Важливо, що правило Seed, за повідомленнями, з’явилося ще 2023 року — задовго до пізнішої політичної суперечки навколо дистиляції. Отже, ці звинувачення, схоже, лише посилили увагу до позиції Чжана, а не стали її першопричиною. 9
Позицію Чжана найкраще розуміти як довгострокову ставку на спосіб створення передових ШІ-систем. Дистиляція справді може швидко покращити відповіді моделі, її здатність міркувати або результат у конкретному тесті. Але якщо команда постійно навчається на відповідях конкурента, вона може непомітно підлаштовуватися під його «архітектуру інтелекту»: типові способи розкладання задач, сигнали винагороди, відповіді та критерії оцінювання. 9
10
Замість цього Seed, за повідомленнями, обирає повільніший шлях — інвестувати у власні дані, методи навчання, архітектуру та дослідницькі пріоритети. Ціна такого рішення очевидна: команда може залишатися позаду в рейтингах, поки конкуренти використовують доступні їм скорочені шляхи.
Потенційна винагорода — більша незалежність і шанс на прориви, які не обмежені конструктивними рішеннями нинішнього лідера.
Тож ByteDance не стверджує, що дистиляція технічно марна. Її позиція, судячи з повідомлень, полягає в тому, що короткостроковий приріст можливостей може не виправдати довгострокової залежності. Для Чжана цей компроміс виглядає незвично чітко: Seed готова програти сьогоднішню гонку, аби не будувати своє майбутнє на чужих відповідях. 1
9
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
За повідомленнями, Seed почала обмежувати використання відповідей конкурентних моделей ще 2023 року й підтвердила цю позицію 2026 го, погодившись на тимчасове відставання в бенчмарках.
За повідомленнями, Seed почала обмежувати використання відповідей конкурентних моделей ще 2023 року й підтвердила цю позицію 2026 го, погодившись на тимчасове відставання в бенчмарках. Правило, як стверджують джерела, стосується і закритих систем на кшталт GPT та Claude, і моделей із відкритими вагами.
Стратегічна ставка компанії полягає в тому, що самостійне створення методів і моделей може тривати довше, зате не прив’язуватиме дослідження до підходів лідера індустрії.