根據《金融時報》2026年8月7日嘅報道,字節跳動已經開始預訓練一個大型語言模型,總參數多達10萬億。呢個係有史以來中國公司嘗試過最大嘅AI模型,而家仲喺早期預訓練階段,呢個階段通常要搞3至6個月,之後先至會做微調然後推出。最終嘅參數數量仲未定死:字節跳動仲喺度評估緊係咪真係要訓練到10萬億呢個上限。同日另一份嚟自《晚點LatePost》嘅早期報道就話,字節跳動喺傾緊一個超過5萬億參數嘅模型,即係話呢個項目可能已經擴充咗規模。
路透社就話佢哋冇辦法獨立核實《金融時報》呢個報道。
字節跳動呢個10萬億嘅上限,會令佢接近甚至略超Anthropic嘅Mythos 5,業界估算Mythos 5大約有8萬億參數。以下係一啲對比:
| 模型 | 估計參數 | 備註 |
|---|---|---|
| 字節跳動(新模型) | 高達10萬億 | 預訓練階段;已知最大嘅中國模型 |
| Anthropic Claude Mythos 5 | 業界估算約8萬億 | 已經推出。完整版本只畀大約200間經過審查嘅美國機構用,呢個計劃叫Project Glasswing;一個公開版本叫Claude Fable 5,2026年6月推出,有安全限制 |
| Moonshot AI Kimi K3 | 2.8萬億 | 字節跳動個模型會大過佢3倍有多 |
| OpenAI(旗艦模型) | 冇公開,估計係幾萬億級別 | 暫時得OpenAI、Anthropic同而家嘅字節跳動係公開知道緊搞緊「十萬億級」參數模型 |
不過要提提大家,淨計參數數量並唔直接等於模型有幾勁——佢只係一個粗略嘅架構指標。
報道所講嘅10萬億「總參數」,係指模型成個架構嘅完整參數數量。而家好多最先進嘅模型都會用**混合專家(MoE)**架構,即係每次運算只會啟動好少部分參數。舉個例,一個10萬億總參數嘅模型,可能每次實際運行嘅活躍參數得1至2萬億。《金融時報》嘅報道同之後嘅相關文章都冇講清楚呢個10萬億係總參數、活躍參數定係兩溝。呢個分別對於公平咁同其他模型做對比好重要。
字節跳動創辦人張一鳴已經話畀Seed團隊知,佢哋唔可以用AI蒸餾技術去複製對手模型嘅輸出嚟整呢個新模型,就算短期內落後畀國內競爭對手都冇所謂。報道話佢大約喺2026年8月6號嘅一個管理層會議上重申呢個立場,話呢個係一個「延遲滿足」同建立獨立能力嘅長遠策略。呢個決定某程度上係考慮到字節跳動同美國政府(因為TikTok)嗰種複雜嘅監管關係,同埋想避免法律同出口管制嘅風險。
蒸餾技術喺中國AI labs之間好流行,用嚟快速模仿美國嘅前沿模型——張一鳴呢個指令係一個好明顯嘅策略性改變。
字節跳動喺2023年初成立咗Seed部門,直接係為咗應對ChatGPT嘅出現。負責呢個10萬億參數模型嘅團隊有呢啲重點:
字節跳動呢個10萬億參數項目,普遍被視為係要直接追貼美國前沿AI labs——特別係Anthropic同OpenAI——嘅一個舉動。更闊嘅背景就包括:
字節跳動冇講呢個10萬億模型會唔會公開。不過,佢哋一向嘅態度都係唔公開源碼,主攻產品整合:
簡單嚟講:字節跳動係度賭緊一個超級巨大、長線嘅注碼,要自己搞出前沿級嘅AI。呢個策略由張一鳴親自下令唔准用蒸餾捷徑,由吳永輝帶領嘅2,000人Seed團隊主理,背後嘅燃料就係越嚟越激烈嘅中美科技競爭。呢個項目仲喺早期預訓練階段,最終嘅參數數量、時間表同能力結果仲有好大不確定性。