Ma il progetto è ancora agli inizi: il conteggio finale non è stato deciso, il modello potrebbe non arrivare a 10 trilioni di parametri e non esiste ancora una data di rilascio pubblico. Inoltre, Reuters non ha potuto verificare in modo indipendente il rapporto del Financial Times .
Secondo quanto riportato dal Financial Times il 7 agosto 2026, ByteDance ha avviato il pre-addestramento di un grande modello linguistico con una capacità massima prevista di 10 trilioni di parametri . Il pre-addestramento è la fase in cui il modello apprende da enormi quantità di dati prima delle successive operazioni di messa a punto e dei test di sicurezza.
Questa fase dura generalmente dai tre ai sei mesi, a cui si aggiungono il fine-tuning, le valutazioni e l’integrazione nei prodotti. Per questo, anche nel caso in cui il progetto proceda secondo i piani, il modello sarebbe ancora lontano da un’eventuale disponibilità pubblica .
La dimensione definitiva resta incerta. ByteDance starebbe ancora valutando se raggiungere il limite massimo di 10 trilioni; una precedente indiscrezione di LatePost parlava invece di un modello superiore ai 5 trilioni di parametri .
Sulla carta, il nuovo modello di ByteDance si collocherebbe vicino o leggermente sopra il Mythos 5 di Anthropic, la cui dimensione è stimata dall’industria in circa 8 trilioni di parametri . Il quadro, basato sulle stime disponibili, è il seguente:
| Modello | Parametri stimati | Stato o osservazioni |
|---|---|---|
| Nuovo modello ByteDance | Fino a 10 trilioni | In fase di pre-addestramento; sarebbe il più grande modello cinese noto |
| Anthropic Claude Mythos 5 | Circa 8 trilioni | Già disponibile in forma limitata a organizzazioni selezionate; la versione pubblica Claude Fable 5 è stata lanciata nel giugno 2026 con misure di sicurezza aggiuntive |
| Moonshot AI Kimi K3 | 2,8 trilioni | Il progetto ByteDance sarebbe oltre tre volte più grande |
| Modello di punta di OpenAI | Non divulgati; stimati nell’ordine dei trilioni | OpenAI, Anthropic e ByteDance sono le aziende pubblicamente associate a questa fascia dimensionale |
Il confronto, tuttavia, va preso con cautela. Il numero di parametri è una misura approssimativa dell’architettura, non un punteggio diretto di intelligenza, affidabilità o utilità del modello.
I 10 trilioni citati nelle indiscrezioni sembrano riferirsi ai parametri totali dell’architettura. Molti dei modelli più avanzati utilizzano però un’architettura Mixture of Experts (MoE): a ogni richiesta viene attivata soltanto una parte degli esperti e, quindi, solo una frazione dei parametri complessivi.
In teoria, un modello con 10 trilioni di parametri totali potrebbe utilizzarne attivamente soltanto 1 o 2 trilioni durante una singola inferenza. Le informazioni disponibili non chiariscono se la cifra di ByteDance indichi esclusivamente i parametri totali, quelli attivi o una combinazione dei due . Senza questo dettaglio, confrontare direttamente il modello con Mythos 5 o Kimi K3 può essere fuorviante.
Il fondatore di ByteDance, Zhang Yiming, avrebbe detto al team Seed di non usare la cosiddetta distillazione dei modelli per sviluppare il nuovo sistema, anche se questa scelta dovesse far perdere terreno all’azienda nel breve periodo .
La distillazione consiste nell’addestrare un modello usando le risposte generate da un sistema più potente, spesso appartenente a un’altra azienda. È una tecnica che può accelerare lo sviluppo e aiutare a replicare rapidamente alcune capacità dei modelli di frontiera.
Secondo Reuters, Zhang avrebbe ribadito questa posizione durante una riunione interna del 6 agosto 2026, descrivendo l’approccio come una strategia di lungo periodo basata sulla “gratificazione ritardata” e sulla costruzione di competenze autonome . La decisione sarebbe legata anche alla complessa relazione normativa di ByteDance con il governo statunitense, soprattutto per la vicenda TikTok, e al tentativo di ridurre i rischi legali e legati ai controlli sulle esportazioni .
È una scelta strategica significativa: rinunciare a una scorciatoia potenzialmente efficace può penalizzare i risultati nei benchmark nel breve termine, ma punta a creare un modello addestrato in modo più indipendente.
ByteDance ha creato la divisione Seed all’inizio del 2023, dopo l’impatto di ChatGPT sul settore tecnologico . Secondo le informazioni disponibili, il gruppo coinvolto nella ricerca sui modelli di base conta circa 2.000 persone tra ricercatori, ingegneri dell’infrastruttura e addetti all’etichettatura dei dati .
I principali responsabili indicati nei rapporti sono:
Nel 2025 l’azienda ha inoltre riunito in Seed il precedente AI Lab e il team di robotica, concentrando sotto la stessa divisione le attività di ricerca e sviluppo sui modelli fondamentali .
Il modello da 10 trilioni di parametri si inserisce nella competizione per ridurre il divario tra i laboratori cinesi e quelli statunitensi, in particolare Anthropic e OpenAI . La sfida non riguarda soltanto la qualità dei chatbot: i modelli più avanzati sono sempre più considerati infrastrutture strategiche, con applicazioni in cybersecurity, ricerca scientifica e industria.
Il contesto è complicato dai controlli statunitensi sulle esportazioni di chip avanzati verso la Cina. ByteDance deve quindi fare affidamento su hardware prodotto internamente nel Paese o accumulato in precedenza . Secondo TechTimes, l’azienda starebbe costruendo un’infrastruttura di calcolo su scala eccezionale, con un coinvolgimento diretto di Zhang Yiming nella valutazione delle risorse computazionali .
Il progetto arriva inoltre dopo il successo di DeepSeek R1, lanciato nel gennaio 2025 e diventato un simbolo della capacità dei laboratori cinesi di ottenere risultati competitivi nonostante i limiti nell’accesso ai chip . Dall’altra parte, anche Anthropic sta affrontando un controllo politico crescente: nel giugno 2026 l’accesso alle capacità più sensibili di Mythos 5 è stato temporaneamente sospeso dal governo statunitense e poi ripristinato parzialmente per organizzazioni considerate affidabili .
ByteDance non ha ancora chiarito se il modello da 10 trilioni di parametri verrà pubblicato. La strategia dell’azienda è stata finora prevalentemente closed source e orientata all’integrazione nei propri prodotti, a differenza di Meta con Llama e di alcuni concorrenti cinesi che hanno rilasciato modelli con licenze più aperte.
Il principale marchio AI rivolto ai consumatori è Doubao (豆包), che integra i modelli della serie Seed in funzioni di chat, assistenza e generazione di contenuti . Tra le priorità indicate da Wu Yonghui per il 2026 figurano anche i world model, con l’obiettivo di avvicinarsi alle prestazioni di Genie 3 di Google entro la fine dell’anno, un agente di programmazione chiamato Seedance e l’espansione commerciale di Doubao .
Se il modello da 10 trilioni verrà completato, è quindi plausibile che diventi il motore di Doubao e di altri servizi interni, invece di essere distribuito come modello aperto autonomo.
Il progetto rappresenta una scommessa enorme sull’AI di frontiera sviluppata internamente: ByteDance punta a una scala paragonabile a quella dei maggiori laboratori statunitensi, mentre il team Seed rinuncia almeno formalmente alla distillazione dei modelli rivali.
Per ora, però, i numeri raccontano soltanto una parte della storia. Restano da verificare la cifra finale dei parametri, la capacità effettivamente attiva per richiesta, la durata dell’addestramento, l’efficienza dell’hardware e soprattutto le prestazioni reali. Il modello è in pre-addestramento iniziale: la sfida decisiva comincerà quando ByteDance dovrà trasformare una dimensione record in un sistema utile, affidabile e competitivo.