AI 叢集要跑得快,唔係淨係靠更勁嘅 GPU 或其他加速器。成千上萬個運算元件之間要不停交換資料;一旦網絡塞車、延遲唔穩定,昂貴嘅加速器就可能只係喺度等資料。
Qualcomm 同 Cornelis Networks 新公布嘅合作,正正押注喺呢個樽頸:網絡唔應該只負責搬運資料,仲可以主動分擔一部分運算同通訊工作,從而改善 AI 基建嘅使用率同成本效益。要留意,現階段係策略合作,加上雙方會喺 AI Infra Summit 同台分享;並唔係已經有一套 Qualcomm–Cornelis 聯合產品開始出貨。Qualcomm 表示,Cornelis 提倡嘅開放、可編程網絡架構,與其提升 AI 使用率及經濟效益嘅方向相符。
5
7
核心概念:令網絡成為主動運算層
Cornelis 將方案命名為 Active Compute Fabric(主動運算網絡)。傳統上,交換器同網絡介面卡主要係將封包由 A 點送去 B 點;Cornelis 嘅構想係將可編程運算同加速功能放入網絡本身,令部分通訊與集體運算工作可以喺資料傳送途中完成,而唔使全部交由主機或 AI 加速器處理。
5
15
呢套架構涵蓋兩類網絡需求:
- Scale-out(橫向擴展):將叢集中唔同伺服器或節點連接起來。
- Scale-up(縱向擴展):喺同一個機櫃級系統內,將加速器更緊密地互連。
目標係避免資料傳送拖慢整個工作流程,令 GPU 或其他昂貴加速器唔使經常閒置等輸入資料。對分散式 AI 工作負載尤其重要,因為多個節點共同交換資料、多人同時向一個接收端傳送資料嘅模式,很容易形成樽頸。
1
21
無損傳輸加網絡內運算,實際想解決乜?
Active Compute Fabric 將三項元素結合:無損傳輸、網絡內加速,以及可編程運算。
5
以採用 Omni-Path 嘅 CN5000 平台為例,Cornelis 提出以信用額度為基礎嘅無損傳輸、細粒度自適應路由、識別「incast」多對一流量嘅流量控制,以及連結層重播機制。簡單講,系統希望預早知道接收端仲有幾多緩衝空間,再按情況選路,減少緩衝區爆滿、擠塞或傳輸錯誤令資料流中斷。
18
背後嘅商業邏輯唔難理解:如果通訊可以更穩定完成,並減少由加速器一方承擔嘅通訊開銷,更多加速器時間就可以用喺實際執行模型。由於運算硬件成本遠高於網絡部件,網絡若能守住加速器使用率,理論上可改善訓練模型或提供推理服務嘅整體成本效益。
不過,呢個首先係一套設計主張,唔係已被普遍獨立基準測試確認嘅結論。Cornelis 有發布性能比較同使用率聲稱,但營運商仍應以自己嘅模型、集體通訊模式、軟件堆疊同叢集拓撲作測試。
15
CN5000、CN6000、CN7000:邊樣已可用,邊樣仲係藍圖?
Cornelis 嘅產品成熟度並唔一致,呢點對評估合作特別重要:
- CN5000:已出貨嘅 400 Gb/s 端到端 Omni-Path scale-out 網絡,組成包括 SuperNIC、交換器、軟件同線纜。Cornelis 將它定位為面向 AI 同高效能運算(HPC)嘅無損、具擠塞控制系統。
17
- CN6000:下一代智能網絡平台,瞄準 AI 訓練、推理同 HPC。報道指出它加入 Ethernet 支援,並正準備擴大供應;Cornelis 亦將它列為下一代 scale-out 產品一部分。
6
8
- CN7000:規劃中嘅原生 scale-up 平台。它係最直接針對機櫃內緊密加速器互連、可視作 NVLink 類方案替代選項嘅一環,但目前未成為可廣泛部署嘅 Nvidia scale-up 技術替代品。
2
19
所以,Cornelis 而家已有商用 scale-out 產品;但最完整、最具挑戰 Nvidia 意味嘅 scale-up 論述,仍然主要係未來路線圖。
「開放」同異構硬件,係另一個賣點
Cornelis 將 Active Compute Fabric 定位為橫跨 scale-up 與 scale-out 嘅開放架構。其路線圖提及 Ethernet、Ultra Ethernet、RoCE 同 UALink 相關技術,而唔係將網絡綁死喺某一間加速器供應商。
11
19
對希望保留採購彈性嘅數據中心營運商而言,吸引力在於原則上可以將網絡配搭唔同 GPU、CPU、自研加速器同其他元件,而唔需要選擇一套由單一供應商垂直整合嘅運算加網絡堆疊。Cornelis 亦稱,CN5000 可與 AMD、Intel、Nvidia 等廠商嘅加速器互通。
23
但開放異構並非自動等於易用。真正嘅考驗係整個系統嘅互通性、硬件供應量、軟件成熟度同長期運維表現,而唔只係單一元件標示「兼容」。
Qualcomm 嘅數據中心布局:唔止做晶片,仲想做連接
Cornelis 關係亦配合 Qualcomm 更大嘅 AI 數據中心策略:同時參與運算同連接兩端。
Qualcomm 同 Amazon 已公布跨多代合作,圍繞大規模 AI 推理嘅客製化矽晶片,以及最高達 1.6 Tb/s 嘅光學連接方案。路透社報道,按長期協議條款,Amazon 可能採購最多 600 億美元嘅 Qualcomm AI 數據中心晶片及相關產品。
33
24
此外,Qualcomm 已完成收購 Alphawave Semi,納入其高速有線連接技術;公司表示,相關技術可配合 Oryon CPU 同 Hexagon NPU 處理器。
44
合併來看,Qualcomm 顯示出一個明確方向:唔單止供應 AI 運算元件,也要參與高速互連。Cornelis 可以為呢個策略增加開放網絡嘅可能性,但兩家公司尚未公布一套完整整合、共同交付嘅平台。
對 Nvidia 係方向性挑戰,未到取代時刻
Cornelis 進入嘅市場,Nvidia 已有成熟產品與深度整合嘅加速器、網絡及軟件生態。Active Compute Fabric 嘅賣點則係模組化:網絡可參與運算,又可以服務異構硬件,而唔係將買家鎖入單一專有互連架構。
Cornelis 近期籌得 2.05 億美元,用於推進 scale-up、scale-out 產品、製造及部署,令公司有更多資源實踐呢個目標。
5
7
但融資同架構發布唔等於已經有同等市場地位。Cornelis 與 Qualcomm 能否建立說服力,取決於 CN6000、CN7000 能否如期交付、軟件支援是否成熟、跨硬件互通是否可靠、供應能否跟上,以及能否交出可重複驗證嘅量產成果。現階段,呢項合作最恰當嘅理解係:雙方押注更聰明嘅網絡可以推高 AI 基建使用率,而客戶會重視開放替代方案,唔只係追求單一供應商體系下嘅峰值效能。