AWS與NVIDIA宣布擴大長期AI基礎設施合作,計劃在2027至2028年於AWS全球基礎設施部署額外200萬枚NVIDIA GPU。這項計劃是在AWS早前公布、由2026年起加入逾100萬枚NVIDIA GPU的部署之上再加碼,反映AI訓練及推理需求持續急升。369
不過,今次消息的重點並不只是「200萬」這個數字。雙方公布的是一套跨多個硬件世代、由晶片至機架級系統的AI基建藍圖,涵蓋加速器、CPU、網絡、模型、資料處理、機械人,以及安全政府工作負載。
200萬枚GPU,代表甚麼?
新增GPU預計包括NVIDIA Blackwell Ultra、Rubin及Rubin Ultra。換句話說,這不是集中採購單一款加速器,而是面向未來數代NVIDIA平台的容量部署計劃。168
AWS與NVIDIA目前沒有披露協議的財務價值。因此,200萬枚應理解為計劃在AWS基礎設施中部署的數量,而不是代表目前已經安裝完成,或即時可供客戶使用的GPU數量。14
這個規模亦顯示,雲端服務商正以更長遠的方式預留AI運算能力。今次公布距離AWS宣布由2026年起部署逾100萬枚NVIDIA GPU只有數個月;相關報道將新一輪加碼與客戶需求超出原先預期連繫起來。39
不只是GPU供應協議
AWS與NVIDIA形容,擴大後的合作目標是建立整合式AI基礎設施。除GPU外,合作範圍亦包括NVIDIA Vera CPU系統、網絡、開放模型、資料處理、機械人及AI工廠。16
大型AI部署向來不只靠加速器晶片。CPU負責協調及餵送工作負載,高速網絡連接不同處理器,而儲存及資料處理系統則要在訓練和推理流程中搬運大量資料。兩家公司現時所描繪的,是一個可整體擴展的AI平台,而非單純增加雲端GPU實例的選擇。
目標工作負載包括「代理式AI」(agentic AI),即可以自行執行多步驟任務的軟件系統,以及涉及機械人的「實體AI」(physical AI)。來源將這兩類應用列為擴大合作的重要原因。68
Vera CPU令合作延伸至GPU以外
把NVIDIA Vera CPU基礎設施引入AWS,意味著AWS未來可為代理式AI提供更多由CPU及GPU組成的整合系統。Vera會與NVIDIA GPU及網絡技術一同構成更完整的基建堆疊。1011
對客戶而言,實際影響可能是未來的AI實例會以完整CPU-GPU系統設計,而不是把GPU視為獨立配件。對需要大量工作協調、資料傳輸,以及讓模型與外部工具互動的工作負載而言,這種設計或更合適。
Trainium並沒有被放到一邊
擴大與NVIDIA合作,不代表AWS放棄自行研發的AI晶片。AWS仍會繼續發展及提供Trainium,同時深化與NVIDIA的合作。雙方表示,會延伸NVLink Fusion,並為以Trainium為基礎的系統加入NVIDIA自訂高頻寬記憶體。1113
這反映AWS採取的是「並行」策略:一方面,為需要NVIDIA軟件及硬件生態的客戶提供NVIDIA平台;另一方面,繼續發展針對AWS自家晶片優化的Trainium。換言之,客戶未必要在NVIDIA GPU與Trainium之間二選一。
未來客戶或可按效能、軟件兼容性、供應情況及基建成本,在不同配置之間作選擇。不過,現有公布只交代策略方向,未有足夠資料比較每種配置最終的成本效益或效能表現。
瞄準安全政府及國家安全工作負載
AWS與NVIDIA亦提到面向美國政府及國家安全工作的安全AI工廠基礎設施。相關報道形容,這些部署除了服務商業AI外,亦針對需要更高安全要求的聯邦政府工作負載。810
這令合作的目標市場不再局限於建立消費者或企業應用的公共雲端客戶,也包括高度重視安全、存取控制及部署要求的工作。現有資料未有交代這些環境的全部技術實施細節,因此不能把今次公布視為完整的技術規格或最終認證安排。
AWS為何要同時押注NVIDIA和自家晶片?
背後的策略相當直接:NVIDIA取得一個覆蓋多個硬件世代的大型雲端分銷渠道,而AWS則可取得更多容量及更多整合NVIDIA技術的系統,向客戶提供更廣泛的AI基建選擇。26
對AWS來說,這亦有助它把自己定位成較有彈性的AI基礎設施供應商。客戶可以使用針對NVIDIA優化的系統、以Trainium為基礎的系統,或連接兩個生態的配置。隨著AI工作負載由大型模型訓練,逐步擴展至推理、自治代理、資料處理及機械人,這種選擇彈性可能愈來愈重要。
但要留意,今次公布的是計劃,並不等於200萬枚GPU會在2028年完結前全部上線。實際供應仍會取決於硬件生產、數據中心建設、電力、網絡及客戶需求。來源確認了雙方的部署規模及合作方向,但沒有按地區、產品或AWS個別服務交代具體推出時間表。
總結:AI競爭進入「整個機架」的階段
AWS與NVIDIA計劃在2027至2028年部署額外200萬枚NVIDIA GPU,加上AWS早前公布、由2026年起部署的逾100萬枚GPU,合作規模進一步擴大。計劃涵蓋Blackwell Ultra、Rubin及Rubin Ultra,亦包括Vera CPU、網絡、AI工廠、資料處理及機械人基礎設施。136
更大的訊息是,雲端AI競爭正由單一晶片,轉向完整的機架級系統。AWS一邊利用NVIDIA完整平台,一邊保留Trainium的發展路線;NVIDIA則透過AWS,把GPU、CPU及網絡等技術帶到更多需要大規模運行代理式AI及實體AI的基建環境。