AI 集群需要的并不只是更快的 GPU 或其他加速器,还需要让它们以足够快、足够稳定的方式交换数据。高通与 Cornelis Networks 最新公布的合作,瞄准的正是这一约束:随着 AI 推理和异构集群规模扩大,网络要帮助提升基础设施效率。
不过需要先明确边界:目前公布的是战略合作,以及双方将在 AI Infra Summit 共同亮相;这并不等同于一款已经由高通与 Cornelis 联合出货的产品。高通表示,Cornelis 对开放、可编程网络织构的愿景,与其通过更一体化方式改善 AI 利用率和经济性的目标相契合。
5
7
核心思路:让网络从“管道”变成主动计算层
Cornelis 将其方案称为 Active Compute Fabric(主动计算网络织构)。传统上,交换机和网卡的主要工作是转发数据包;而在这一架构中,可编程计算与加速能力被放进网络织构本身。Cornelis 称,部分通信处理和集合通信工作可以在数据穿越网络时完成,而不是全部压在服务器主机或 AI 加速器上。
5
15
它覆盖两类相互关联的网络任务:
- 横向扩展(scale-out):连接集群中的服务器或节点;
- 纵向扩展(scale-up):在机架级系统内更紧密地连接加速器。
其目标是减少数据移动导致昂贵 GPU 或其他加速器“等数据”的情况。对于分布式 AI 工作负载,这一点尤为关键:集合通信以及多对一流量模式都可能成为瓶颈。
1
21
无损传输与网络内计算,能带来什么
Cornelis 的 Active Compute Fabric 结合了三项能力:无损传输、网络内加速和可编程计算。
5
在基于 Omni-Path 的 CN5000 平台上,Cornelis 描述了一套以信用额度为基础的无损传输设计,并配合细粒度自适应路由、感知突发汇聚流量(incast)的流量控制,以及链路级重放。通俗地说,这些机制旨在避免缓冲区溢出和网络拥塞打断数据交付。
18
潜在收益并不难理解:如果通信完成得更可靠,同时减少加速器侧的通信开销,那么更多加速器时间就能用于真正执行模型。由于网络层帮助保护更昂贵计算硬件的利用率,这有望改善训练和模型服务的实际经济性。
但这首先是一种设计主张,而非已经被普遍验证的基准结论。Cornelis 发布了性能对比和利用率相关说法;实际运营者仍应结合自身模型、集合通信模式、软件栈和集群拓扑进行评估。
15
产品路线图:已出货、待扩展与仍在规划
理解 Cornelis 的产品成熟度很重要,因为其架构的各个部分并不处于同一阶段。
- CN5000:已出货的 400Gb/s 端到端 Omni-Path 横向扩展网络织构,包含 SuperNIC、交换机、软件和线缆。Cornelis 将其定位为面向 AI 和高性能计算(HPC)的无损、拥塞可控系统。
17
- CN6000:面向 AI 训练、推理和 HPC 的下一代智能网络平台。报道显示,它增加了对以太网的支持,Cornelis 正准备扩大其可用范围;该公司也将其列为下一代横向扩展产品的一部分。
6
8
- CN7000:规划中的原生纵向扩展平台。它是路线图中最接近直接替代 NVLink 式机架级紧耦合互连的部分,但尚未成为可广泛部署的 Nvidia 纵向扩展技术替代品。
2
19
这一差别至关重要:Cornelis 已有可商用的横向扩展产品,但其最完整的纵向扩展方案仍更多属于未来路线图。
“开放”与异构,为什么是卖点
Cornelis 将 Active Compute Fabric 定位为横向扩展和纵向扩展环境均可使用的开放架构。其路线图提及以太网、Ultra Ethernet、RoCE 与 UALink 相关技术,而不是把网络绑定在单一加速器供应商上。
11
19
这对追求灵活性的基础设施运营者具有吸引力:原则上,他们可以将该网络织构与不同的 GPU、CPU、定制加速器及其他组件搭配,而不必选择一整套由单一厂商垂直整合的计算与网络栈。Cornelis 还表示,CN5000 可与 AMD、Intel、Nvidia 等厂商的加速器互操作。
23
代价则在于落地执行。开放、异构的基础设施需要证明的是整个系统的可靠互操作、硬件供应能力和软件成熟度,而不仅仅是组件层面的“兼容”。
放在高通的数据中心战略中看
与 Cornelis 的关系,是高通尝试成为 AI 数据中心计算与连接供应商这一更大布局的补充。
高通与亚马逊已宣布围绕定制化芯片开展多代合作,服务大规模 AI 推理,并开发速率最高可达 1.6Tb/s 的光互连方案。路透社报道,根据长期安排的条款,亚马逊可能采购最高 600 亿美元的高通 AI 数据中心芯片及相关产品。
33
24
高通还已完成对 Alphawave Semi 的收购,获得其高速有线连接技术;高通称,这些技术可与其 Oryon CPU 和 Hexagon NPU 处理器形成互补。
44
综合来看,高通正试图同时参与 AI 基础设施中的计算和连接两端。Cornelis 为这一战略增加了一个潜在的开放网络维度,但双方尚未公布完整的一体化平台。
竞争现实:方向可信,但谈不上取代
Cornelis 进入的是 Nvidia 已拥有成熟产品和深度整合的加速器、网络与软件生态的领域。Active Compute Fabric 的吸引力在于模块化:网络被设计为能够贡献计算能力,并能跨异构硬件运行,而非把客户锁定在单一专有网络织构中。
Cornelis 已筹集 2.05 亿美元,用于推进横向扩展和纵向扩展产品、制造与部署,为实现这一目标增添了资源。
5
7
但融资和架构发布并不意味着已具备市场等价性。Cornelis 与高通的论点能否成立,仍取决于 CN6000、CN7000 的实际交付,软件支持、互操作性、供应能力,以及可复现的生产环境结果。现阶段,更准确的理解是:双方在押注,更好的网络能够提高 AI 基础设施利用率;并且客户会像看重峰值性能一样,看重一个开放的替代选择。