Wichtig ist allerdings: Das Modell steht noch ganz am Anfang. Außerdem ist nicht geklärt, ob die genannten 10 Billionen Parameter tatsächlich erreicht werden – und wie viele davon bei einer einzelnen Anfrage überhaupt aktiviert würden.
Die Financial Times berichtete am 7. August 2026 unter Berufung auf mit dem Projekt vertraute Personen, ByteDance habe das Vortraining eines Modells mit bis zu 10 Billionen Parametern aufgenommen . Das Vortraining ist die Phase, in der ein Modell anhand großer Datenmengen grundlegende Sprach- und Wissensmuster lernt. Sie dauert typischerweise drei bis sechs Monate, bevor Feinabstimmung und eine mögliche Veröffentlichung folgen .
Der endgültige Umfang steht offenbar noch nicht fest. ByteDance prüft demnach weiterhin, ob das Modell tatsächlich bis zur Marke von 10 Billionen Parametern trainiert werden soll . Ein früherer Bericht von LatePost sprach am selben Tag zunächst von einem geplanten Basismodell mit mehr als 5 Billionen Parametern. Das könnte darauf hindeuten, dass das Vorhaben später erweitert wurde .
Reuters konnte den Bericht der Financial Times nicht unabhängig bestätigen . ByteDance hat die Angaben bislang nicht öffentlich bestätigt.
Sollte ByteDance die Obergrenze von 10 Billionen Parametern erreichen, läge das Modell nach derzeitigen Branchenschätzungen in der Nähe von Anthropic Claude Mythos 5 oder leicht darüber. Für Mythos 5 werden etwa 8 Billionen Parameter angenommen .
| Modell | Geschätzte Parameterzahl | Einordnung |
|---|---|---|
| ByteDance, neues Modell | Bis zu 10 Billionen | Frühes Vortraining; wäre das größte bekannte chinesische Modell |
| Anthropic Claude Mythos 5 | Rund 8 Billionen | Bereits veröffentlicht, aber mit besonders leistungsfähigen Funktionen nur für eine begrenzte Zahl geprüfter US-Organisationen zugänglich. Die öffentlichere Variante Claude Fable 5 wurde im Juni 2026 mit zusätzlichen Sicherheitsvorkehrungen gestartet |
| Moonshot AI Kimi K3 | 2,8 Billionen | Das ByteDance-Modell wäre mehr als dreimal so groß |
| OpenAI-Flaggschiff | Nicht veröffentlicht; Schätzungen gehen von mehreren Billionen aus | OpenAI, Anthropic und nun möglicherweise ByteDance werden öffentlich mit dieser Größenordnung in Verbindung gebracht |
Die Tabelle beschreibt jedoch vor allem die Architekturgröße. Eine größere Parameterzahl ist kein direkter Beleg für ein leistungsfähigeres Modell. Entscheidend sind unter anderem Trainingsdaten, Rechenaufwand, Architektur, Optimierung und Sicherheitsvorgaben.
Die kolportierten 10 Billionen beziehen sich auf die Gesamtzahl der Parameter. Viele moderne Modelle verwenden eine Mixture-of-Experts-Architektur, kurz MoE. Dabei wird bei einer Anfrage nicht das gesamte Modell aktiviert, sondern nur ein Teil der sogenannten Experten.
Ein Modell mit 10 Billionen Gesamtparametern könnte deshalb beispielsweise nur 1 bis 2 Billionen Parameter pro Rechenschritt nutzen. Wie hoch der aktive Anteil bei ByteDance sein soll, ist bislang nicht bekannt. Auch die bisherige Berichterstattung macht nicht eindeutig klar, ob sich die Zahl von 10 Billionen ausschließlich auf Gesamtparameter oder möglicherweise auf eine andere Zählweise bezieht. Das erschwert einen fairen Vergleich mit Anthropic oder anderen Modellen .
ByteDance-Gründer Zhang Yiming soll die Seed-Abteilung angewiesen haben, beim Aufbau des neuen Modells nicht auf die Ausgaben konkurrierender KI-Systeme zurückzugreifen – selbst dann nicht, wenn das Unternehmen dadurch kurzfristig hinter chinesischen Wettbewerbern zurückfällt .
Bei der Distillation lernt ein kleineres oder neues Modell aus den Antworten eines leistungsfähigeren „Lehrermodells“. Die Methode kann die Entwicklung beschleunigen, weil sie die Fähigkeiten eines bestehenden Systems gewissermaßen nachahmt. In der internationalen KI-Branche ist sie deshalb zugleich ein verbreitetes Verfahren und ein Streitpunkt.
Berichten zufolge bekräftigte Zhang diese Linie bei einem internen Führungstreffen um den 6. August 2026. Er soll dabei einen langfristigen Ansatz und den Verzicht auf kurzfristige Erfolge zugunsten eigener Fähigkeiten betont haben . Die Entscheidung steht auch vor dem Hintergrund von ByteDances komplizierter Beziehung zur US-Regierung rund um TikTok sowie möglicher rechtlicher und exportkontrollbezogener Risiken .
ByteDance gründete seine zentrale KI-Forschungsabteilung Seed Anfang 2023 – als Reaktion auf den Erfolg von ChatGPT . Nach Angaben aus der Berichterstattung arbeitet das Team mit rund 2.000 Beschäftigten in China und im Ausland. Dazu gehören Forschende, Infrastrukturingenieure, Datenannotatoren und Übersetzer .
Die wichtigsten Personen und organisatorischen Eckpunkte:
Das 10-Billionen-Projekt ist nicht nur ein internes Forschungsprogramm. Es fällt in eine Phase, in der KI-Modelle zunehmend als strategische Technologie betrachtet werden. ByteDance versucht damit offenbar, den Abstand zu US-Unternehmen wie Anthropic und OpenAI zu verringern .
Mehrere Faktoren prägen das Vorhaben:
Damit verschiebt sich die Diskussion: Nicht nur die Qualität eines Modells, sondern auch seine Verfügbarkeit, seine Rechenbasis und die Kontrolle über seine Nutzung werden zu geopolitischen Faktoren.
Ob ByteDance das neue Modell überhaupt öffentlich bereitstellen will, ist nicht bekannt. Die bisherige Unternehmensstrategie deutet jedoch eher auf eine enge Verbindung mit eigenen Produkten als auf eine offene Veröffentlichung hin.
ByteDance veröffentlicht seine führenden großen Modelle bislang nicht als Open Source – anders als etwa Meta mit Llama oder einige chinesische Wettbewerber wie DeepSeek. Die wichtigste Verbrauchermarke des Konzerns ist Doubao (豆包). Dort werden Seed-Modelle für Chatbots, Assistenten und Anwendungen zur Inhaltserstellung eingesetzt .
Zu den von Seed für 2026 genannten Schwerpunkten gehören außerdem Weltmodelle mit einem Zielniveau ähnlich Googles Genie 3 bis Ende des Jahres, der Coding-Agent Seedance und die weitere Vermarktung von Doubao . Sollte das 10-Billionen-Modell fertiggestellt werden, dürfte es daher eher als technologische Grundlage für Doubao und andere interne Produkte dienen als als eigenständiges frei verfügbares Modell.
ByteDance setzt mit dem Projekt auf maximale Größenordnung und auf eine eigenständige Entwicklung ohne den Abkürzungsweg der Distillation. Doch bis daraus ein nutzbares Produkt wird, sind mehrere Fragen ungeklärt: Erreicht das Modell tatsächlich 10 Billionen Gesamtparameter? Wie viele davon sind pro Anfrage aktiv? Welche Leistungswerte erzielt es in der Praxis – und wird ByteDance es überhaupt veröffentlichen?
Die Meldung markiert deshalb vor allem eine strategische Ansage. Ein fertiger Beweis für ein leistungsfähigeres KI-System ist sie noch nicht.