Når AI-modeller trænes eller køres i store klynger, er hurtige acceleratorer ikke nok. GPU'er og andre acceleratorer skal konstant udveksle data, og hvis netværket halter, ender den dyreste hardware med at vente.
Det er problemet, Qualcomm og Cornelis Networks vil adressere med deres nye samarbejde. Målet er at forbedre udnyttelsen og økonomien i AI-infrastruktur ved at give netværket en mere aktiv rolle. Men der er en vigtig begrænsning: Det annoncerede er et strategisk samarbejde og en fælles optræden på AI Infra Summit – ikke et færdigt, fælles Qualcomm-Cornelis-produkt.
5
7
Netværket som et aktivt regnelag
Cornelis kalder sin arkitektur Active Compute Fabric. Tanken er, at switches og netværkskort ikke kun skal videresende datapakker. I stedet bygges programmerbar regnekraft og acceleration ind i selve netværkslaget, så dele af kommunikationsarbejdet og de såkaldte kollektive operationer kan behandles, mens data er undervejs.
5
15
Det retter sig mod to forskellige opgaver i AI-infrastruktur:
- Scale-out: forbindelser mellem servere eller noder i en klynge.
- Scale-up: meget tætte forbindelser mellem acceleratorer i et rackskala-system.
Formålet er at undgå, at GPU'er står stille, mens de afventer input fra andre dele af klyngen. Det er særligt relevant ved distribuerede AI-opgaver, hvor mange acceleratorer skal udveksle og samle data samtidig.
1
21
Tabsfri transport skal holde data i bevægelse
Active Compute Fabric samler tre elementer: tabsfri transport, acceleration i netværket og programmerbar regnekraft.
5
På den Omni-Path-baserede CN5000-platform beskriver Cornelis blandt andet kreditbaseret tabsfri transport, finkornet adaptiv routing, flowstyring til såkaldt incast-trafik – hvor mange afsendere rammer samme modtager – samt gentagelse af data på linkniveau ved fejl. Ifølge Cornelis skal det forhindre overfyldte buffere og trængsel i at afbryde dataleveringen.
18
Den økonomiske idé er enkel: Kan kommunikationen afsluttes mere stabilt og med mindre arbejde på selve acceleratoren, kan en større del af acceleratorens tid bruges på modelberegninger. Det kan forbedre udnyttelsen af hardware, der typisk er langt dyrere end netværksudstyret.
Det er dog en teknologisk påstand – ikke et endeligt, uafhængigt benchmarkresultat. Cornelis offentliggør egne sammenligninger og udnyttelsespåstande, men datacenteroperatører bør vurdere dem mod deres egne modeller, kommunikationsmønstre, softwarestak og netværkstopologi.
15
Hvad produktplanen faktisk siger
Cornelis' produkter er ikke lige modne, og den forskel er afgørende.
- CN5000 er en kommercielt tilgængelig 400 Gb/s Omni-Path-fabric til scale-out. Platformen omfatter SuperNICs, switches, software og kabling og markedsføres til AI og HPC med tabsfri drift og trængselskontrol.
17
- CN6000 er næste generation af intelligent netværk til AI-træning, inferens og HPC. Den tilføjer Ethernet-understøttelse og forberedes til bredere tilgængelighed.
6
8
- CN7000 er den planlagte, native scale-up-platform. Det er den del af planen, der mest direkte kan udfordre tætte rackforbindelser i stil med Nvidias NVLink, men den er endnu ikke en bredt udrullet erstatning.
2
19
Cornelis har altså allerede et salgbart scale-out-produkt. Den fulde vision for scale-up er derimod fortsat afhængig af kommende produkter.
Åbenhed og blandet hardware er en central del af argumentet
Cornelis positionerer Active Compute Fabric som en åben arkitektur på tværs af scale-up og scale-out. Produktplanen peger på Ethernet, Ultra Ethernet, RoCE og UALink-relaterede teknologier frem for et netværk bundet til én acceleratorleverandør.
11
19
Det kan være attraktivt for operatører, der vil kunne kombinere GPU'er, CPU'er og specialbyggede acceleratorer fra flere leverandører. Cornelis oplyser også, at CN5000 kan fungere sammen med acceleratorer fra blandt andre AMD, Intel og Nvidia.
23
Men åben, heterogen infrastruktur skal bevise mere end komponentkompatibilitet. Den skal levere moden software, robust interoperabilitet, tilgængeligt hardwarevolumen og forudsigelig drift i hele systemet.
Sådan passer Cornelis ind i Qualcomms datacenterstrategi
Samarbejdet med Cornelis ligger i forlængelse af Qualcomms bredere satsning på AI-datacentre, hvor selskabet vil levere både beregning og forbindelser.
Qualcomm og Amazon har annonceret et samarbejde over flere produktgenerationer om skræddersyet silicium til AI-inferens og optisk konnektivitet på op til 1,6 Tb/s. Reuters har rapporteret, at Amazon under den langsigtede aftale kan købe Qualcomm-produkter til AI-datacentre for op til 60 mia. dollar, afhængigt af aftalens vilkår.
33
24
Qualcomm har desuden afsluttet købet af Alphawave Semi. Det tilfører højhastighedsteknologi til kablede forbindelser, som ifølge Qualcomm supplerer selskabets Oryon-CPU'er og Hexagon-NPU'er.
44
Tilsammen peger det mod en strategi, hvor Qualcomm vil være med på både regne- og forbindelsessiden af AI-infrastrukturen. Cornelis tilfører en mulig åben netværksdimension, men selskaberne har ikke præsenteret en komplet, integreret platform.
En troværdig retning – endnu ikke en erstatning for Nvidia
Cornelis bevæger sig ind på et område, hvor Nvidia allerede har produkter og et tæt integreret økosystem af acceleratorer, netværk og software. Active Compute Fabrics styrke på papiret er modularitet: Netværket skal kunne bidrage med beregning og fungere på tværs af forskellige typer hardware i stedet for at låse køberen til én proprietær fabric.
Cornelis har rejst 205 mio. dollar til at udvikle sine scale-up- og scale-out-produkter, udbygge produktionen og understøtte implementeringer hos kunder.
5
7
Men finansiering og arkitekturannonceringer skaber ikke i sig selv markedsmæssig ligestilling med Nvidia. Casen for Cornelis og Qualcomm afhænger nu af leverede CN6000- og CN7000-produkter, softwareunderstøttelse, interoperabilitet, leveringssikkerhed og reproducerbare resultater i drift. Indtil videre bør samarbejdet ses som et væddemål på, at et bedre netværk kan løfte udnyttelsen i AI-datacentre – og at kunder vil tillægge et åbent alternativ næsten lige så stor værdi som topydelse.