ShuffleBox(被動光學裝置):這是一個能從內部攪亂(shuffle)光纖端點的被動式光學元件。它徹底簡化了佈線的複雜度,讓 RNG 的纜線鋪設難度降到與傳統肥樹架構相近的水準。更關鍵的是,它 完全不耗電,是一個徹底的被動式光纖管理裝置。
這三項技術的結合,讓 AWS 能用單層扁平結構取代多層的 Clos 階層,大幅減少了所需的路由器與交換器層級數量。
| 指標 | 改善幅度 |
|---|---|
| 吞吐量 | 相較同等級肥樹提升了 最高 33% |
| 所需路由器/交換器 | 減少約 69% 的硬體設備 |
| 成本節省 | 視規模與配置而定,可節省 9% 至 45% |
| 網路設備功耗 | 降低約 40%(主要來自於減少了需要供電的交換器層級) |
| 佈線複雜度 | 因採用了 ShuffleBox,與肥樹架構相當 |
這是一項漸進、透明的基礎架構升級,全球所有區域並不會一夜之間全部更換,但 RNG 架構已成為新建與翻新 AWS 資料中心的標準規格。
RNG 是實體層與路由層的變革,對客戶來說完全透明。它運作在虛擬化層之下,EC2 執行個體、VPC、負載平衡器以及所有既有的 AWS 服務,看到的依然是相同的邏輯網路介面。客戶不需要修改任何 API、執行個體類型、安全群組、網路組態或是應用程式碼。 AWS 自行在基礎設施內部完成了這項轉換,對使用者而言,這就像是「你完全不會察覺,但一切都變得更快、更便宜了」的無感升級。
成本護城河:以 AWS 的營運規模,網路成本降低 9% 至 45% 形成了一道巨大的結構性定價優勢。AWS 可以藉此以更低的價格打擊競爭對手,或是維持更高的利潤率,並將資金重新投入運算與 AI 容量的擴張。
加速 AI/ML 工作負載:AI 訓練(如多節點 GPU/TPU 叢集)是極度消耗頻寬且對網路瓶頸非常敏感的任務。RNG 帶來的 33% 吞吐量提升與更豐富的路徑多樣性,直接嘉惠了分散式訓練、模型平行化與大規模推論,不僅縮短了任務完成時間,也提高了 GPU 的利用率。
能源效率:網路設備功耗降低 40%,對於正競相達成永續目標、應對高漲能源成本的超大規模業者而言意義重大,尤其是在 AI 叢集已成為吃電怪獸的時代。
可靠性與復原力:隨機擴展圖本質上提供大量不相交的路徑,顯著提升了對交換器或鏈路故障的容錯能力,而且不需要為了冗餘而超額配置備援層級。
對競爭對手的壓力:Google Cloud、Microsoft Azure 及其他雲端業者目前多數仍採用 Clos/肥樹的變體。AWS 率先展示了隨機圖網路在量產規模上的可行性,這不僅拉高了業界門檻,也迫使競爭對手要嘛跟進投入類似的扁平化技術,要嘛就得默默承受較高的網路成本。