微软有意将其下一代 AI 基础设施在 AMD Helios 与 NVIDIA Vera Rubin 之间进行拆分,目的是降低供应链风险并避免对单一供应商的依赖 。这与其在 Azure 和 Copilot 中采取的模型无关策略一脉相承 。CEO 萨提亚·纳德拉确认:“我们将成为首批基于 AMD Helios 和 NVIDIA Vera Rubin 部署下一代机架级 AI 基础设施的云服务商之一。”这使微软在谈判中拥有更多筹码,并且当某一供应商出现产能限制时仍能保持运营灵活性 。业内普遍将这一策略形容为在 AI 基础设施采购上“对冲押注” 。
AMD 和微软均未公开具体定价,但 Futurum Group 的分析师给出了清晰的对比:
按机架对机架计算,Helios 大约贵出 40% 。这一溢价反映了 Helios 更高的内存容量、开放的架构以及 AMD 集成的 CPU-GPU-网络全栈方案 。
AMD 认为,Helios 较高的初始成本可以通过卓越的性能效率来弥补。根据 AMD 自家的实验室数据,Helios 相比 Vera Rubin NVL72 可实现 :
AMD CEO 苏姿丰在 Advancing AI 2026 大会上公布了这些数据,称 Helios 在最大规模模型上性能领先 15% 或更多,HBM 容量多出 50%,每美元 Token 数最多高出 30% 。
然而,分析师提醒这些均为量产前预估。Futurum Group 指出:“AMD 声称的 15% 性能优势和 30% 每美元 Token 优势,目前仍是针对尚未发货的竞争对手所做的厂商推算,未来两个季度内将在实际生产中接受检验” 。
AMD Helios 是一款专为 AI 设计、采用液冷散热的机架级系统,也是 AMD 迄今为止最全面的 AI 硬件产品 :
| 组件 | 规格 |
|---|---|
| GPU | 72 块 AMD Instinct MI455X |
| GPU 架构 | CDNA 5(台积电 2nm/3nm 混合小芯片封装) |
| 每颗 GPU 晶体管数 | 3200 亿 |
| CPU | 18 颗第六代 AMD EPYC "Venice"(每计算托盘一颗,单 CPU 最多 256 核) |
| 网络 | AMD Pensando "Vulcano" 800 AI 网卡(800 Gbps 以太网,每 GPU 最高 2.4 Tbps 扩展带宽) |
| 纵向扩展互联 | UALink(Ultra Accelerator Link,运行于以太网之上) |
| 横向扩展互联 | 兼容超以太网联盟(UEC)规范 |
| 总 HBM4 内存 | 每机架 31 TB |
| 每颗 GPU 内存 | 432 GB(12 组 HBM4 堆栈,每组 36 GB) |
| 每颗 GPU 内存带宽 | 19.6 TB/s |
| 聚合内存带宽 | 每机架 1.7 PB/s |
| FP4 性能 | 每机架 2.9 exaFLOPS |
| FP8 性能 | 每机架 1.4 exaFLOPS |
| 纵向扩展带宽 | 260 TB/s |
| 横向扩展带宽 | 43 TB/s |
| 物理形态 | 18 个液冷计算托盘(每个 4 块 GPU)+ 6 个交换托盘,兼容 OCP Open Rack Wide 标准 |
| 单 GPU 性能 | 40 PFLOPS FP4,20 PFLOPS FP8 |
每个计算托盘包含四块 MI455X GPU,搭配一颗 EPYC Venice CPU 和 Pensando 网络芯片,通过 UALink 协议连接,使 72 块 GPU 作为一个统一计算单元运行 。
AMD 已获得以下已确认的早期 Helios 客户 :
值得注意的是,Anthropic 截至 2026 年 7 月尚未在任何重大公告中被公开列为 Helios 早期客户 。
微软同时部署 AMD Helios 和 NVIDIA Vera Rubin 的决定,标志着 AI 硬件市场进入新阶段。超大规模云服务商不再依赖单一供应商,而是投资于平台多样化,以确保供应、增强议价能力并获得差异化的性能特性 。
AMD Helios 凭借其庞大的 31 TB HBM4 内存和基于以太网的开放互联架构,特别适合大规模推理工作负载——在这些场景中,内存容量和带宽直接驱动吞吐量和每 Token 成本 。Helios 预计于 2026 年下半年开始出货,真正的考验将来自量产后的基准测试结果,届时各家厂商的竞争主张将在规模化环境中得到验证 。