該模型目前處於早期預訓練階段,此階段通常耗時3至6個月,完成後還需要進行微調(fine-tuning)才能釋出,外界推測距離正式亮相仍有相當距離 。值得注意的是,最終參數規模尚未定案——字節跳動仍在評估是否要訓練到10兆的上限 。有趣的是,另一篇同日由《晚點LatePost》發出的報導指出,字節跳動先前討論的是超過5兆參數的模型,暗示專案規模可能已大幅擴張 。
路透社試圖跟進此消息,但表示無法獨立核實《金融時報》的報導 。
若以10兆參數上限訓練,這款模型將接近甚至略高於業界對Anthropic Mythos 5約8兆參數的估計 。下表整理目前已知的模型參數對照:
| 模型 | 估計參數量 | 備註 |
|---|---|---|
| 字節跳動(新模型) | 最高 10兆 | 預訓練階段;已知中國最大模型 |
| Anthropic Claude Mythos 5 | 約 8兆(業界估計) | 已釋出。完整能力僅限約200家美國審查組織(Project Glasswing);公開版本 Claude Fable 5 於2026年6月上市並設有安全護欄 |
| Moonshot AI Kimi K3 | 2.8兆 | 字節的新模型規模是其3倍以上 |
| OpenAI(旗艦模型) | 未公開,估計數兆級 | 目前全球僅OpenAI、Anthropic,以及現在的字節跳動進入「十兆參數俱樂部」 |
報導中所指的**10兆「總參數」指的是模型架構的完整參數數量。當今許多頂尖模型採用混合專家(Mixture-of-Experts, MoE)**架構,每次推理時僅啟動其中一部分參數。舉例來說,一個10兆總參數的MoE模型,每次查詢可能僅使用1至2兆的「活躍參數」。《金融時報》的報導與後續分析並未明確指出這10兆是總參數、活躍參數,還是兩者的混合敘述。這個區別對於與其他模型進行公平比較至關重要 。
字節跳動創辦人張一鳴對Seed團隊下達明確指示:這款10兆參數模型絕對不允許使用AI蒸餾(distillation)技術來複製競爭對手的模型輸出,即使這意味著短期內落後於國內競爭對手 。根據報導,他在8月6日前後的一次管理會議上重申了這個立場,將其定位為「延遲滿足」的長期策略,強調自主能力建構 。
這項決定部分受到字節跳動與美國政府(因TikTok而起的)複雜監管關係影響,旨在避免法律與出口管制風險 。蒸餾技術在中國AI實驗室中被廣泛用來快速模仿美國前沿模型——張一鳴的指令是一次顯著的戰略轉向 。
字節跳動在2023年初因應ChatGPT的崛起成立了Seed部門 。負責這一10兆參數專案的團隊關鍵資訊如下:
字節跳動的10兆參數專案被廣泛視為縮小與美國前沿實驗室——特別是Anthropic與OpenAI——差距的直接企圖 。其背景包括:
字節跳動尚未透露這款10兆模型是否會公開釋出。然而,該公司的一貫立場是封閉源碼、深度整合於產品:
總結來說:字節跳動正在下一場巨大、長期的賭注,以張一鳴「拒絕捷徑蒸餾」的個人指令為方針,由吳永輝帶領的2,000人Seed團隊執行,並在日益激烈美中科技對抗的燃料驅動下,追求自主前沿AI。此專案仍處於早期預訓練階段,最終參數規模、時間表與能力成果都存在高度不確定性。