本プロジェクトは現在、事前学習の初期段階にあり、公開はまだ数ヶ月先とみられる。最終的なパラメータ数も確定しておらず、バイトダンス社内では上限の10兆まで学習するかどうか評価中だという。なお、ロイター通信はこのFTの報道を独自に確認できていない。
バイトダンスの新モデルが目標とする10兆パラメータは、アンソロピックの最上位モデル「Claude Mythos 5」の推定約8兆パラメータを上回る規模となる。以下が主要モデルとの比較表である。
| モデル | 推定パラメータ数 | 備考 |
|---|---|---|
| バイトダンス(新モデル) | 最大10兆 | 事前学習段階。中国企業で最大規模 |
| Anthropic Claude Mythos 5 | 約8兆(業界推定) | すでに公開済みだが、本格的な機能は米国政府認証の約200組織に制限。一般向けはClaude Fable 5として2026年6月に公開 |
| Moonshot AI Kimi K3 | 2.8兆 | 中国で公開されている最大モデル。バイトダンスの新モデルはその3倍以上の規模 |
| OpenAI(旗艦モデル) | 非公表(複数兆と推定) | 現在、数兆〜10兆クラブ(tens-of-trillions parameter club)に名を連ねるのはOpenAI、Anthropic、そして今回のバイトダンスのみとされる |
ただし、パラメータ数そのものは性能の直接的な指標ではなく、あくまでアーキテクチャの規模を示す大まかな尺度である点に注意が必要だ。
報じられている10兆という数字は、モデル全体の総パラメータ数(total parameters)である。現在の最先端モデルの多くはMixture-of-Experts(MoE) アーキテクチャを採用しており、推論ごとに活性化されるパラメータは全体の一部(例えば10兆の総パラメータでも、活性化されるのは1〜2兆程度)になる。FTの報道やその後の記事では、この10兆という数字が総パラメータなのか活性化パラメータなのか、あるいはその混在なのか明確にされていない。この点は他モデルとの公正な比較において極めて重要である。
バイトダンス創業者の**張一鳴(Zhang Yiming)氏は、AIモデルの開発において、競合他社のモデル出力を利用した蒸留(AI Distillation)**を行わないようSeedチームに指示した。報道によれば、張氏は2026年8月6日頃の経営会議でこの方針を再確認し、「長期的な視点(delayed gratification)」と「自立した能力構築」を長期戦略として位置づけた。
蒸留は中国のAIラボが米国の最先端モデルを短期間で模倣するために広く使われている手法であり、張氏のこの方針は業界の常識から見て極めて重要な戦略的転換である。この決定の背景には、バイトダンスと米国政府との複雑な規制関係(TikTok問題)や、法的・輸出管理上のリスクを回避したい意図があるとされる。
バイトダンスは、ChatGPTの登場を直接の契機として、2023年初頭に中核AI研究部門**Seed(シード)**を設立した。本件の10兆パラメータモデルを開発するのはこのチームである。
バイトダンスの10兆パラメータプロジェクトは、米国の先端ラボ(特にAnthropicやOpenAI)との差を埋めるための直接的な試みと広く見なされている。その背景には以下のような要因がある。
バイトダンスはこの10兆モデルを公開するかどうか明らかにしていない。しかし、同社の基本姿勢はクローズドソース・製品統合型である。
以上を総合すると、バイトダンスは張一鳴氏の「ショートカット(蒸留)禁止」という明確な方針のもと、呉永輝氏率いる2000人のSeedチームを中核に、米中の技術覇権競争を追い風に、独自のフロンティアAIへの巨額の長期投資を行っている。プロジェクトは事前学習の初期段階にあり、最終的なパラメータ数、完成時期、実際の性能にはまだ大きな不確実性が残されている。