Na razie nie mówimy jednak o gotowym produkcie. Model znajduje się dopiero w początkowej fazie pretrainingu, a sam ByteDance nie potwierdził publicznie wszystkich szczegółów. Reuters zaznaczył, że nie był w stanie niezależnie zweryfikować informacji opublikowanych przez „Financial Times” .
Według raportu „Financial Times” z 7 sierpnia 2026 roku ByteDance rozpoczął trenowanie dużego modelu językowego o maksymalnej zakładanej liczbie 10 bilionów parametrów . Wstępne trenowanie zwykle trwa od trzech do sześciu miesięcy, zanim rozpocznie się dostrajanie i przygotowanie systemu do udostępnienia . Oznacza to, że ewentualna premiera pozostaje odległa.
Co ważne, 10 bilionów to górny pułap, a nie potwierdzona finalna wielkość modelu. ByteDance nadal ma oceniać, czy trenowanie do pełnej skali będzie uzasadnione . Tego samego dnia pojawiły się również wcześniejsze doniesienia LatePost o modelu przekraczającym 5 bilionów parametrów, co może sugerować rozszerzenie pierwotnych planów .
Jeśli podawana skala się potwierdzi, nowy model ByteDance znajdzie się w ścisłej światowej czołówce pod względem liczby parametrów — obok systemów, których szczegóły techniczne są w dużej mierze niejawne.
| Model | Szacowana liczba parametrów | Status i kontekst |
|---|---|---|
| Nowy model ByteDance | do 10 bilionów | Wczesny etap pretrainingu; największy znany projekt chińskiej firmy |
| Anthropic Claude Mythos 5 | około 8 bilionów | Dostęp do pełnych możliwości ograniczono do zweryfikowanych organizacji; publicznie udostępniono zabezpieczoną wersję Claude Fable 5 |
| Moonshot AI Kimi K3 | 2,8 biliona | Model ByteDance byłby ponad trzy razy większy pod względem całkowitej liczby parametrów |
| Flagowy model OpenAI | Nieujawniona; szacunki mówią o wielu bilionach | OpenAI nie podaje oficjalnych danych o liczbie parametrów |
Sama liczba parametrów nie jest jednak prostym miernikiem jakości. To przede wszystkim przybliżona miara rozmiaru architektury, a nie gwarancja lepszego rozumowania, niższych kosztów czy wyższej skuteczności w konkretnych zadaniach.
Raporty mówią o 10 bilionach parametrów całkowitych. W nowoczesnych modelach często stosuje się architekturę Mixture of Experts (MoE), w której przy generowaniu konkretnej odpowiedzi aktywowana jest tylko część całej sieci.
W praktyce model z 10 bilionami parametrów całkowitych może wykorzystywać przy pojedynczym zapytaniu zaledwie ułamek tej liczby — na przykład 1–2 biliony parametrów. Dlatego uczciwe porównanie z Mythos 5, Kimi K3 czy modelami OpenAI wymagałoby znajomości nie tylko całkowitej liczby parametrów, ale także liczby parametrów aktywnych oraz szczegółów architektury.
Jak dotąd nie wyjaśniono jednoznacznie, jaki udział parametrów będzie aktywowany w modelu ByteDance. To właśnie ten szczegół może w dużej mierze określić, czy jego przewaga będzie realna, czy tylko imponująca na papierze .
Założyciel ByteDance Zhang Yiming miał polecić zespołowi Seed, by nie wykorzystywał destylacji modeli konkurencji do przyspieszania prac. Destylacja polega na trenowaniu jednego modelu na wynikach generowanych przez większy lub bardziej zaawansowany system — tak, aby stosunkowo szybko odtworzyć część jego możliwości.
Według doniesień Zhang powtórzył to stanowisko podczas spotkania kierownictwa około 6 sierpnia 2026 roku. Miał podkreślać znaczenie długoterminowego podejścia i „odroczonej gratyfikacji”, nawet jeśli niezależny rozwój oznacza przejściowe pozostawanie w tyle za krajowymi konkurentami .
To istotna decyzja strategiczna. Destylacja jest szeroko wykorzystywana przez laboratoria AI jako sposób na szybkie naśladowanie możliwości bardziej zaawansowanych modeli. ByteDance chce natomiast budować własne kompetencje od podstaw, częściowo także po to, by ograniczyć ryzyko sporów prawnych i dodatkowej presji regulacyjnej w relacjach ze Stanami Zjednoczonymi .
ByteDance utworzył dział Seed na początku 2023 roku, po pojawieniu się ChatGPT. Jednostka odpowiada za badania nad modelami bazowymi i rozwój podstawowej infrastruktury AI .
Najważniejsze informacje o zespole:
Projekt ByteDance wpisuje się w szerszą rywalizację o przewagę w najbardziej zaawansowanych systemach AI. Firma próbuje zmniejszyć dystans do amerykańskich laboratoriów, zwłaszcza Anthropic i OpenAI, ale robi to w warunkach ograniczonego dostępu do najnowocześniejszych układów obliczeniowych .
Stany Zjednoczone wprowadziły ograniczenia eksportowe dotyczące zaawansowanych chipów AI do Chin. ByteDance musi więc opierać się na krajowym sprzęcie oraz zgromadzonych wcześniej zasobach obliczeniowych . Skala infrastruktury potrzebnej do wytrenowania tak dużego modelu jest ogromna, a według TechTimes Zhang Yiming osobiście angażuje się w przegląd alokacji mocy obliczeniowej .
Ważnym punktem odniesienia pozostaje DeepSeek R1, uruchomiony w styczniu 2025 roku. Jego sukces pokazał, że chińskie laboratoria mogą osiągać wyniki konkurencyjne wobec światowej czołówki mimo ograniczeń sprzętowych .
Równolegle same modele stają się przedmiotem debat o bezpieczeństwie państwowym. W czerwcu 2026 roku dostęp do najbardziej zaawansowanych możliwości Anthropic Mythos 5 został w Stanach Zjednoczonych czasowo ograniczony, a następnie częściowo przywrócony dla organizacji uznanych za zaufane . Pokazuje to, że frontierowe modele AI są traktowane nie tylko jako produkty technologiczne, lecz także jako zasoby o znaczeniu strategicznym.
ByteDance nie ujawnił, czy model z potencjalnie 10 bilionami parametrów zostanie kiedykolwiek udostępniony publicznie. Dotychczasowa strategia firmy wskazuje raczej na podejście zamknięte i silną integrację z własnymi produktami.
ByteDance stawia na długoterminową budowę własnego modelu frontierowego, zamiast szybkiego poprawiania wyników za pomocą destylacji konkurencyjnych systemów. Skala — do 10 bilionów parametrów — robi wrażenie, ale nie przesądza jeszcze o jakości ani o tym, czy model w ogóle zostanie ukończony.
Na dziś wiadomo przede wszystkim, że projekt znajduje się na wczesnym etapie, jego finalny rozmiar nie został ustalony, a publiczna premiera nie jest potwierdzona. Najważniejszym testem nie będzie więc sama liczba parametrów, lecz to, czy ByteDance zdoła przełożyć ogromne zasoby obliczeniowe, własne dane i pracę około 2000-osobowego zespołu Seed na model faktycznie konkurencyjny wobec najlepszych systemów z USA.