Mais il ne s’agit pas encore d’un produit disponible. Le modèle est toujours dans les premières phases de son entraînement, et plusieurs éléments restent incertains : sa taille finale, sa date de lancement et, surtout, ses performances réelles. Reuters indique ne pas avoir pu confirmer indépendamment les informations publiées par le Financial Times .
Selon le Financial Times, ByteDance a lancé le 7 août 2026 le pré-entraînement d’un grand modèle pouvant atteindre 10 000 milliards de paramètres . Cette étape précède généralement l’affinage du modèle — ou fine-tuning — puis son éventuelle mise à disposition. Elle peut durer de trois à six mois .
Le plafond de 10 000 milliards n’est toutefois pas définitif. ByteDance évaluerait encore la possibilité d’entraîner le modèle jusqu’à cette limite. Un précédent rapport de LatePost évoquait, le même jour, un modèle de plus de 5 000 milliards de paramètres, ce qui pourrait indiquer que l’ambition du projet a été revue à la hausse .
À ce stade, il est donc plus juste de parler d’un objectif maximal que d’un modèle achevé de 10 000 milliards de paramètres.
Si cette cible est atteinte, ByteDance se rapprocherait fortement du Mythos 5 d’Anthropic, dont la taille est estimée à environ 8 000 milliards de paramètres . Les comparaisons disponibles donnent l’image suivante :
| Modèle | Nombre de paramètres estimé | Situation |
|---|---|---|
| Nouveau modèle de ByteDance | Jusqu’à 10 000 milliards | Pré-entraînement en cours ; plus grand modèle chinois connu à ce jour |
| Anthropic Claude Mythos 5 | Environ 8 000 milliards | Modèle déjà lancé, mais dont les capacités complètes restent réservées à un nombre limité d’organisations contrôlées |
| Moonshot AI Kimi K3 | 2 800 milliards | Le modèle de ByteDance serait plus de trois fois plus grand |
| Modèle phare d’OpenAI | Non communiqué | Les estimations le situent dans une gamme de plusieurs milliers de milliards de paramètres |
Ces chiffres doivent cependant être interprétés avec prudence. Le nombre de paramètres est avant tout une mesure de l’architecture, pas un classement automatique de l’intelligence d’un modèle. La qualité des données, l’entraînement, l’architecture, les outils disponibles et l’efficacité de l’inférence peuvent peser tout autant.
L’expression « 10 000 milliards de paramètres » désignerait le nombre total de paramètres du modèle. Or, les systèmes de pointe utilisent souvent une architecture dite Mixture-of-Experts — ou MoE, « mélange d’experts ».
Dans ce type de modèle, seule une partie des paramètres est activée pour traiter une requête donnée. Un modèle totalisant 10 000 milliards de paramètres pourrait ainsi n’en mobiliser qu’une fraction, par exemple 1 000 à 2 000 milliards, à chaque étape de l’inférence.
Le Financial Times et les articles qui ont suivi n’ont pas précisé si le chiffre de 10 000 milliards correspondait uniquement aux paramètres totaux, aux paramètres actifs ou à une combinaison des deux. Cette distinction est déterminante pour comparer équitablement le projet de ByteDance au Mythos 5 ou à d’autres modèles .
Le projet se distingue aussi par une consigne stratégique attribuée à Zhang Yiming, fondateur de ByteDance. D’après plusieurs rapports, il aurait demandé à l’équipe Seed de ne pas utiliser la distillation de modèles pour améliorer le futur système, même si cette décision devait faire perdre du terrain à ByteDance face à ses concurrents chinois à court terme .
La distillation consiste à entraîner un modèle à partir des réponses produites par un autre modèle, généralement plus puissant. Cette méthode peut accélérer le développement et permettre de reproduire rapidement certaines capacités, mais elle alimente aussi les débats sur la propriété intellectuelle, la provenance des données et la dépendance technologique.
Lors d’une réunion interne autour du 6 août 2026, Zhang aurait défendu une stratégie de long terme fondée sur la « gratification différée » et la construction de capacités propres . Le choix serait également lié à la relation réglementaire complexe de ByteDance avec les États-Unis, notamment autour de TikTok, ainsi qu’au souhait de limiter les risques juridiques et liés aux contrôles à l’exportation .
Cette position tranche avec l’usage répandu de la distillation dans plusieurs laboratoires chinois, qui s’en servent pour rattraper plus rapidement les modèles américains de pointe .
ByteDance a créé sa division de recherche fondamentale Seed au début de 2023, dans le sillage de l’essor de ChatGPT . L’équipe qui porte cette stratégie serait composée d’environ 2 000 personnes en Chine, notamment des chercheurs, des ingénieurs spécialisés dans les infrastructures et des équipes chargées de l’annotation des données .
Son responsable de la recherche fondamentale est Wu Yonghui, ancien vice-président de la recherche chez Google DeepMind et ancien Google Fellow. Il a rejoint ByteDance en février 2025 . Wu Yonghui rendrait directement compte au directeur général de ByteDance, Liang Rubo .
Le projet de modèle fondamental serait dirigé par Xiang Liang (项亮), responsable de Seed Foundation, avec la collaboration de Shen Ke (沈科), chargé des données de pré-entraînement .
En 2025, ByteDance a par ailleurs intégré son AI Lab et son équipe de robotique à Seed, regroupant sous une même structure la recherche et développement consacré aux modèles fondamentaux .
L’ambition de ByteDance intervient dans un contexte de rivalité technologique croissante entre la Chine et les États-Unis. Le groupe cherche à réduire l’écart avec les laboratoires américains, en particulier Anthropic et OpenAI .
Plusieurs contraintes rendent toutefois le pari particulièrement difficile :
La course ne porte donc plus seulement sur les performances affichées dans les tests. Les modèles les plus avancés sont aussi traités comme des actifs stratégiques, au même titre que les puces, les centres de données et les infrastructures cloud.
ByteDance n’a pas indiqué si ce modèle de 10 000 milliards de paramètres serait publié séparément. Jusqu’à présent, l’entreprise privilégie une approche fermée et intégrée à ses produits, contrairement à Meta avec Llama ou à certains concurrents chinois qui publient davantage de modèles en accès ouvert.
La marque d’IA grand public du groupe est Doubao (豆包). Elle s’appuie sur les modèles de la famille Seed pour proposer des fonctions de conversation, d’assistance et de génération de contenu .
Pour 2026, les priorités attribuées à Wu Yonghui incluent également les world models, avec l’objectif d’atteindre d’ici la fin de l’année un niveau comparable à Genie 3 de Google, un agent de programmation baptisé Seedance, ainsi que la poursuite de la commercialisation de Doubao .
Si le modèle géant arrive à maturité, il pourrait donc servir de socle à Doubao et à d’autres produits internes, plutôt que d’être proposé comme un modèle ouvert autonome.
Le projet de ByteDance est spectaculaire par son ambition : jusqu’à 10 000 milliards de paramètres, une équipe Seed d’environ 2 000 personnes et un investissement de long terme dans une IA développée sans distillation des modèles rivaux .
Mais le chiffre annoncé ne permet pas encore de conclure que ByteDance a rattrapé Anthropic ou OpenAI. Le modèle est au début de son pré-entraînement, sa taille finale reste incertaine et la différence entre paramètres totaux et paramètres actifs complique toute comparaison directe.
Pour l’instant, le signal le plus important est stratégique : ByteDance semble vouloir construire une capacité de pointe indépendante, même au prix d’un retard temporaire. Reste à savoir si cette ambition pourra être menée à bien avec les contraintes de calcul, de puces et de déploiement qui s’imposent aux entreprises chinoises.