SpaceX幾乎完成以純C語言開發的AI訓練系統,針對22萬顆Nvidia GB300 GPU叢集,馬斯克聲稱效能為Google JAX框架的10倍,但此數據目前缺乏獨立驗證 [5][6][7]。 這個直接操控硬體的「裸金屬」方案,摒棄Python抽象層,有望帶來極致效率,但也意味著團隊必須自行處理框架通常提供的各項功能 [6][7]。
研究答案

Create a landscape editorial hero image for this Studio Global article: What is SpaceX's custom AI training system written in C for 220,000 Nvidia GB300 GPUs, how does its bare-metal approach compare to framework. Article summary: Here is what the available reporting tells us as of May 28, 2026.. Topic tags: general, documentation, general web, user generated. Reference image context from search candidates: Reference image 1: visual subject "## Elon Musk reveals SpaceX's custom AI stack, promising significant performance gains over existing frameworks. AUSTIN, Texas — SpaceX has nearly completed Version 1.0 of an in-ho" source context "SpaceX Develops Custom AI Training Stack in C for Massive ..." Reference image 2: visual subject "Google argues that US attorneys are pushing a 'radical agenda' by calling for the Silicon Valley tech giant to be forced to sell Chrome internet browser due t
向來以火箭和太空探索聞名的SpaceX,正以一種極不尋常的方式,闖入人工智慧的基礎設施軍備競賽。伊隆·馬斯克在2026年5月底宣布,該公司幾乎從零開始,完成了一個專屬的AI訓練系統。這套系統並未使用業界標準的PyTorch或Google的JAX等框架,而是直接以最底層的C語言編寫,專為一個由約22萬顆Nvidia GB300加速器構成的超級電腦叢集量身打造。馬斯克更大膽宣稱,其效能將是Google廣泛使用的JAX框架的十倍以上。
這項說法非常震撼,但截至目前,它仍只是一個宣稱。沒有任何第三方基準測試、學術論文或獨立審計能佐證這個10倍的加速數據,系統也尚未在公開的生產環境中實際運作過 。
根據2026年5月28日發布的多份報導,SpaceX的訓練堆疊(training stack)1.0版,主要是以C語言編寫,實務上也用到了少量的C++ 。其架構精巧地對應到由22萬顆Nvidia GB300繪圖處理器(GPU)組成,並透過800G高速網路互聯的硬體佈局
。
馬斯克將其設計理念描述為「盡可能貼近裸金屬(bare metal)」,並透過大量運用「管線平行處理(pipeline parallelism)」來實現 。
C語言作為編譯式低階語言,其本質與當前AI業界普遍依賴的Python生態系截然不同。無論是JAX、PyTorch還是TensorFlow,這些框架透過高層次的抽象化,大幅簡化了模型的開發流程,但同時也無可避免地引入了執行時期的效能損耗。SpaceX直接使用C語言,理論上能繞過這層抽象,獲得更精細的記憶體頻寬、運算排程及GPU之間通訊的控制權 。
這項計畫的布局不僅止於訓練。馬斯克已確認,後續會規劃一個同樣以C語言編寫的推論堆疊(inference stack),目標是在大規模的GB300 GPU上,進行高速的強化學習。他表示,這項技術不僅適用於SpaceX,也將用於其創辦的xAI與特斯拉(Tesla)的AI運算任務 。最直接的近期目標,則是為xAI的下一代對話機器人模型Grok提供訓練動力
。
馬斯克提出的說法很直接:這套客製化C語言堆疊,在同等硬體上進行大規模訓練時,速度將比JAX快「超過十倍」 。若此言屬實,這將是AI訓練效率的一次歷史性飛躍。通常要達到10倍的提升,需要來自硬體、演算法或兩者兼具的根本性架構突破,鮮少能僅憑軟體優化達成。
以JAX為例,即便經過良好優化,其擴展效率也常呈現次線性成長。根據一份2026年1月的實用指南,以JAX在Nvidia Blackwell GPU上訓練一個Transformer模型時,從1顆GPU擴展到16顆,吞吐量僅提升了4.08倍,這與單顆GPU效能提升10倍的說法相去甚遠 。若真的能在22萬顆GPU的規模下實現10倍於JAX的速度,將徹底重塑尖端AI訓練的經濟學。
有幾個理由值得我們對此保持審慎態度:
此舉讓SpaceX躋身於少數但日益增長的組織之列,這些組織願意完全繞過主流的機器學習框架。多數AI實驗室接受JAX或PyTorch所帶來的生產力折衷,因為它們能快速實驗,且擁有龐大的生態系,這些優點通常超越了對硬體極致效率的追求。
SpaceX的賭注顯然是:在極大規模下,這些利弊會開始翻轉。也就是說,在一個由22萬顆GPU構成的叢集上,從頭建構一個C語言專屬技術堆疊的開發成本,會被後續節省下來的龐大訓練成本所抵銷。
這個賭注是否划算,完全取決於那「10倍速」的說法能否在嚴格的檢視下被重現。在SpaceX或xAI公布其方法論、工作負載細節,並提供可被驗證的比較結果之前,這項宣稱仍只是一個非凡的工程野心,而非既定的事實。
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
SpaceX幾乎完成以純C語言開發的AI訓練系統,針對22萬顆Nvidia GB300 GPU叢集,馬斯克聲稱效能為Google JAX框架的10倍,但此數據目前缺乏獨立驗證 [5][6][7]。
SpaceX幾乎完成以純C語言開發的AI訓練系統,針對22萬顆Nvidia GB300 GPU叢集,馬斯克聲稱效能為Google JAX框架的10倍,但此數據目前缺乏獨立驗證 [5][6][7]。 這個直接操控硬體的「裸金屬」方案,摒棄Python抽象層,有望帶來極致效率,但也意味著團隊必須自行處理框架通常提供的各項功能 [6][7]。
馬斯克表示,該系統將用於訓練下一代xAI的Grok模型,並已規劃後續的C語言推論堆疊,應用於SpaceX、xAI及特斯拉的高速強化學習任務 [8][11]。