AI 叢集的瓶頸不只在 GPU 或其他加速器的算力,也在於大量節點能否迅速、穩定地交換資料。Qualcomm 與 Cornelis Networks 在 AI Infra Summit 前宣布的合作,正是鎖定這個問題:當推論工作與異質運算叢集持續擴大時,網路能否幫助提升整體利用率與經濟效益。
不過,這項消息應先正確解讀。雙方目前公布的是策略合作與共同在 AI Infra Summit 露面,並非已推出一套由 Qualcomm 與 Cornelis 共同出貨的完整產品。Qualcomm 表示,Cornelis 所描繪的開放、可程式化網路架構,與其改善 AI 基礎設施利用率及成本效益的方向一致。
5
7
把網路從「運輸層」變成運算層
Cornelis 將其架構稱為 Active Compute Fabric(主動運算網路)。傳統上,交換器與網路介面主要負責轉送封包;Cornelis 的構想則是在網路架構中加入可程式化運算與加速能力,讓部分通訊與集體運算(collective operations)可在資料傳輸途中完成,而非全部壓在主機或 AI 加速器上。
5
15
這套架構同時涵蓋兩種互連需求:
- Scale-out(橫向擴展):連接叢集中的伺服器或節點。
- Scale-up(縱向擴展):在機架級系統內,更緊密地連接多顆加速器。
用白話說,目標是別讓昂貴的 GPU 因等待資料或等待集體通訊完成而閒置。分散式 AI 工作負載常出現多對一流量與大量集體通訊,這些情況都可能把網路推成效能瓶頸。
1
21
無損傳輸與網內運算,能帶來什麼?
Cornelis 表示,Active Compute Fabric 將三項能力整合在一起:無損傳輸、網內加速與可程式化運算。
5
在採用 Omni-Path 的 CN5000 平台上,Cornelis 提出以信用額度為基礎的無損傳輸、細粒度自適應路由、可辨識 incast(多對一匯入)流量的流量控制,以及鏈路層重播等機制。其設計訴求是避免接收端緩衝區溢位與網路壅塞,干擾資料可靠送達。
18
若通訊能更穩定完成,且加速器端不必承擔那麼多通訊處理,更多加速器時間便可留給模型執行。對訓練或大規模推論而言,這可能改善實際成本結構:網路支出若能保護更昂貴運算硬體的利用率,投資效益便可能上升。
但這仍是架構主張,而不是已經定論的通用效能結果。Cornelis 公布了效能比較與利用率相關說法,但營運商仍應依自身模型、集體通訊模式、軟體堆疊與叢集拓撲進行驗證。
15
產品路線圖:已出貨與未來承諾要分開看
Cornelis 的產品成熟度並不一致,這是評估時最重要的區別。
- CN5000:已出貨的 400 Gb/s 端到端 Omni-Path scale-out 網路,包含 SuperNIC、交換器、軟體與纜線。Cornelis 將其定位為面向 AI 與高效能運算(HPC)的無損、壅塞控制系統。
17
- CN6000:下一代智慧網路平台,鎖定 AI 訓練、推論與 HPC。報導指出,它增加 Ethernet 支援,正準備擴大供應;Cornelis 則將其列為下一代 scale-out 產品的一環。
6
8
- CN7000:規劃中的原生 scale-up 平台,也是最接近直接挑戰 NVLink 類型機架級互連的路線圖項目。它目前尚非可廣泛部署、用以取代 Nvidia scale-up 技術的產品。
2
19
因此,Cornelis 現在已有商用 scale-out 產品,但其最完整、最具挑戰性的 scale-up 論述,仍有待後續產品落地。
開放與異質化,是另一個賣點
Cornelis 將 Active Compute Fabric 定位為橫跨 scale-up 與 scale-out 的開放架構。其路線圖提及 Ethernet、Ultra Ethernet、RoCE 與 UALink 等相關技術,而非綁定單一加速器供應商的專有網路。
11
19
這對希望保有選擇權的資料中心營運商具吸引力:理論上,網路可搭配不同 GPU、CPU、客製化加速器與其他元件,而不必採用單一供應商垂直整合的運算與網路堆疊。Cornelis 也表示,CN5000 可與 AMD、Intel、Nvidia 等廠商的加速器互通。
23
代價則在執行難度。開放且異質的基礎設施,不能只做到元件層級的「相容」;還必須在整套系統上證明軟硬體互通性、產品供應量與軟體成熟度。
這如何接上 Qualcomm 的資料中心布局?
與 Cornelis 的關係,是 Qualcomm 擴張 AI 資料中心運算與連接能力策略的一部分。
Qualcomm 與 Amazon 已宣布多世代合作,為大規模 AI 推論開發客製化矽晶片,並推進最高可達 1.6 Tb/s 的光學連接方案。路透報導指出,依長期安排條款,Amazon 最多可能採購 600 億美元的 Qualcomm AI 資料中心晶片與相關產品。
33
24
此外,Qualcomm 已完成收購 Alphawave Semi,取得其高速有線連接技術;Qualcomm 表示,這些技術可與 Oryon CPU 和 Hexagon NPU 處理器互補。
44
合併來看,Qualcomm 的方向是同時參與 AI 基礎設施的運算與連接兩端。Cornelis 為此策略補上一個可能的開放網路面向,但雙方尚未宣布一個完整整合的平台。
對 Nvidia 是挑戰方向,不是已完成的替代
Cornelis 進入的是 Nvidia 已具備成熟產品與深度整合軟硬體生態系的領域。Active Compute Fabric 的差異化在於模組化:讓網路本身參與運算,並可跨異質硬體運作,而非將買方鎖入單一專有網路架構。
Cornelis 已募得 2.05 億美元,用於推進 scale-up、scale-out 產品、製造與部署,為其擴張計畫增加資源。
5
7
但資金與架構發布不等於市場地位已被驗證。Cornelis 與 Qualcomm 能否取得實質進展,仍取決於 CN6000、CN7000 的交付成果、軟體支援、互通性、供應能力,以及可重複驗證的生產環境效能。現階段,這項合作最適合被視為一項押注:更聰明的網路可提高 AI 基礎設施利用率,而客戶也可能願意為開放替代方案賦予與峰值效能同等的重要性。