ByteDance soll die Nutzung von Ausgaben konkurrierender KI Modelle bereits 2023 eingeschränkt und das Verbot 2026 bekräftigt haben – zulasten kurzfristiger Benchmark Ergebnisse. Die gemeldete Regel betrifft sowohl geschlossene Systeme wie GPT und Claude als auch Modelle mit offenen Gewichten.
Forschungsantwort

Create a landscape editorial hero image for this Studio Global article: Why did ByteDance founder Zhang Yiming reaffirm Seed’s 2023 prohibition against training its language models on outputs from other companies. Article summary: Zhang reaffirmed the prohibition because he views competitor-output distillation as a short-term benchmark shortcut that would undermine Seed’s ability to discover its own training methods, research directions, and model. Topic tags: general, news, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
ByteDance-Gründer Zhang Yiming soll dem KI-Forschungsteam Seed eine klare Vorgabe gemacht haben: Die eigenen Modelle sollen nicht durch die Ausgaben konkurrierender Systeme verbessert werden – selbst dann nicht, wenn ByteDance kurzfristig bei Benchmarks zurückfällt. Reuters zufolge nimmt das Unternehmen damit bewusst kurzfristige Nachteile in Kauf, um langfristig unabhängiger forschen zu können. 1
Bei der umstrittenen Methode, der sogenannten Modelldestillation, lernt ein schwächeres Modell aus den Antworten eines leistungsfähigeren Systems. So lassen sich bestimmte Fähigkeiten oft schneller und mit weniger Rechenaufwand nachbilden. Für Seed besteht darin jedoch ein strategisches Risiko: ByteDance könnte zwar rasch zu einem starken Nachahmer werden, seine Forschung würde sich aber weiterhin an den Methoden, Bewertungen und Vorstellungen eines anderen KI-Labors orientieren. 4
9
Nach Berichten, die von Pekingnology und Pandaily zusammengefasst wurden, experimentierten frühe Seed-Teams zunächst mit Material, das über die GPT-API erzeugt worden war. Nachdem ByteDance im April 2023 Prüfungen von API-Aufrufen eingeführt hatte, soll das Team eine Regel beschlossen haben: Von GPT erzeugte Daten durften nicht in die Trainingsdatensätze des Unternehmens gelangen. Später wurde dieses Prinzip offenbar auf konkurrierende Modelle im Allgemeinen ausgeweitet. 9
14
Das ist ein wichtiger Unterschied. Demnach ging es nicht nur darum, die Nutzung einer einzelnen proprietären Schnittstelle zu untersagen. Vielmehr sollte kein Modell eines anderen Unternehmens – unabhängig davon, ob es geschlossen oder mit offenen Gewichten veröffentlicht wurde – als „Lehrer“ für Seed dienen. 9
10
Die Diskussion soll im Januar 2025 wieder aufgeflammt sein, als DeepSeek-R1 starke Ergebnisse bei anspruchsvollen Denkaufgaben und eine hohe Effizienz zeigte. Einige Seed-Forscher argumentierten Berichten zufolge, Ausgaben leistungsfähiger US-amerikanischer Systeme könnten die eigene Trainingsarbeit ergänzen und die Fähigkeiten im logischen Schlussfolgern schneller verbessern. Zhang soll dies jedoch weiterhin als Abhängigkeit von geliehener Leistung abgelehnt haben. 9
Behauptungen, DeepSeek selbst habe synthetische Daten führender US-Modelle verwendet, bleiben nach der hier verfügbaren Beleglage Spekulationen aus der Branche. Sie sind nicht unabhängig bestätigt und sollten nicht mit dem besser belegten Bericht über die interne Seed-Regel verwechselt werden.
Der Anreiz zur Destillation wurde offenbar größer, als chinesische KI-Entwickler zunehmend unter dem Wettbewerbsdruck bei Rechenhardware, Modellleistung und Ranglisten standen. Gleichzeitig beobachteten Seed-Forscher die raschen Fortschritte bei führenden Systemen sowie den Aufstieg von Moonshots Kimi K3, einem leistungsfähigen Modell mit offenen Gewichten, das Wettbewerber untersuchen und potenziell als Quelle für Trainingsdaten nutzen konnten. 9
14
Damit wurde aus einer Forschungspräferenz ein konkreter Zielkonflikt: Die Antworten eines stärkeren Modells zu destillieren, könnte eine gemessene Leistungslücke schnell verkleinern. Wer darauf verzichtet, riskiert dagegen, dass andere Labore schneller vorankommen. Bei einer internen Seed-Versammlung im Jahr 2026 soll Zhang die Entscheidung dennoch ausdrücklich formuliert haben: Vorübergehend hinterherzulaufen sei besser, als konkurrierende Systeme zu destillieren. 1
10
Die gemeldete Regel ist ungewöhnlich weit gefasst, weil sie nicht nur auf Zugangsrechte, sondern auf strategische Abhängigkeit zielt. Ein geschlossenes Modell, das über eine API genutzt wird, und ein Modell mit offenen Gewichten werfen zwar unterschiedliche technische und lizenzrechtliche Fragen auf. Beide können einen Entwickler jedoch dazu verleiten, Lösungen eines anderen Labors zu übernehmen, statt eigene Ansätze zu entwickeln. 9
14
Das bedeutet nicht, dass jede Form von Wissenstransfer gleichzusetzen wäre oder jede Nutzung offener Gewichte unzulässig ist. Es bedeutet vielmehr, dass der interne Standard von Seed Berichten zufolge strenger war als ein herkömmliches Verbot des unerlaubten API-Abfragens. Die verfügbaren Berichte sprechen von einer Anweisung, führende Modelle anderer Unternehmen – auch Veröffentlichungen mit offenen Gewichten – nicht als Lehrmodelle zu verwenden. 10
14
Zusätzliche Bedeutung erhielt die Regel im Umfeld von Vorwürfen gegen andere chinesische KI-Unternehmen. Anthropic beschuldigte Alibaba, DeepSeek, Moonshot, MiniMax und Z.ai, über Konten oder Stellvertreter Antworten von Claude für Trainingszwecke abgeschöpft zu haben. ByteDance wurde in diesem Vorwurf nicht genannt. Ein US-Regierungsvertreter warf Moonshot außerdem vor, Anthropics Modell unzulässig zum Training von Kimi K3 verwendet zu haben. Dabei handelt es sich um Anschuldigungen, nicht um durch die hier vorliegenden Belege festgestellte Tatsachen. 6
9
Entscheidend ist der zeitliche Ablauf: Die gemeldete Einschränkung bei Seed soll bereits auf das Jahr 2023 zurückgehen – also auf eine Zeit vor der späteren politischen Debatte. Die Vorwürfe scheinen Zhangs Position daher eher nachträglich hervorgehoben als ursprünglich ausgelöst zu haben. 9
Zhangs Haltung lässt sich am besten als grundsätzliche Wette darauf verstehen, wie Spitzenmodelle entstehen. Destillation kann Antworten, Denkmuster oder Benchmark-Leistung schnell verbessern. Wer jedoch wiederholt die Ausgaben eines Konkurrenten zum Training verwendet, könnte sich zugleich an dessen „Architektur der Intelligenz“ binden – an bevorzugte Lösungswege, Belohnungssignale, Antworten und Testmaßstäbe. 9
10
Seed setzt Berichten zufolge stattdessen auf den langsameren Weg: eigene Daten, eigene Trainingsverfahren, eigene Architektur und eigene Forschungsprioritäten. Der Preis dafür ist offensichtlich. Das Team könnte auf Ranglisten zunächst hinter Konkurrenten bleiben, während andere jede verfügbare Abkürzung nutzen. Die erhoffte Gegenleistung wäre größere Unabhängigkeit – und die Chance auf Durchbrüche, die nicht durch die Designentscheidungen des aktuellen Marktführers begrenzt sind.
Die Entscheidung ist deshalb kein Urteil, dass Modelldestillation technisch nutzlos sei. Sie ist eine Abwägung: Kurzfristige Leistungsgewinne seien möglicherweise den langfristigen Abhängigkeiten nicht wert. Für ByteDance macht Zhangs angebliche Vorgabe diesen Zielkonflikt ungewöhnlich deutlich: Seed nimmt lieber eine Niederlage im heutigen Rennen in Kauf, als seine Zukunft auf den Antworten eines anderen Labors aufzubauen. 1
9
Studio Global AI
Diese Seite enthält eine quellengestützte Antwort, die Sie in Studio Global fortsetzen können.
ByteDance soll die Nutzung von Ausgaben konkurrierender KI Modelle bereits 2023 eingeschränkt und das Verbot 2026 bekräftigt haben – zulasten kurzfristiger Benchmark Ergebnisse.
ByteDance soll die Nutzung von Ausgaben konkurrierender KI Modelle bereits 2023 eingeschränkt und das Verbot 2026 bekräftigt haben – zulasten kurzfristiger Benchmark Ergebnisse. Die gemeldete Regel betrifft sowohl geschlossene Systeme wie GPT und Claude als auch Modelle mit offenen Gewichten.
Hinter der Entscheidung steht eine strategische Wette: Eigenständige Forschung dauert möglicherweise länger, könnte aber Modelle hervorbringen, die nicht einfach die Fähigkeiten und Denkweisen des aktuellen Marktführe...