AI clustery nepotřebují jen rychlejší GPU a další akcelerátory. Stejně důležité je, aby mezi nimi data proudila rychle, spolehlivě a předvídatelně. Právě na tento problém cílí nově oznámená spolupráce Qualcommu a Cornelis Networks: síť má pomoci zvýšit efektivitu AI infrastruktury, zejména s růstem inferenčních úloh a heterogenních clusterů.
Je ale důležité nepředbíhat. Oznámení zatím nepředstavuje společně dodávaný produkt Qualcommu a Cornelisu. Jde o strategickou spolupráci a společné vystoupení na konferenci AI Infra Summit. Qualcomm uvádí, že vize Cornelisu otevřené a programovatelné síťové infrastruktury odpovídá jeho snaze zlepšit využití AI hardwaru a ekonomiku provozu.
5
7
Síť nemá jen přeposílat pakety
Cornelis svůj koncept nazývá Active Compute Fabric. Základní myšlenka je jednoduchá: přepínače a síťová rozhraní nemají být pouze pasivními prvky, které posílají pakety z bodu A do bodu B. Architektura do samotné sítě vkládá programovatelný výpočet a akceleraci.
Podle Cornelisu se tak část komunikace a tzv. kolektivních operací může vyřídit během pohybu dat sítí, místo aby tato práce zůstala výhradně na serverech nebo AI akcelerátorech.
5
15 Cílem je, aby drahá GPU a jiné akcelerátory co nejméně čekaly na vstupy.
To se týká dvou odlišných vrstev propojení:
- Scale-out: propojení serverů či uzlů napříč celým clusterem.
- Scale-up: těsnější propojení akcelerátorů uvnitř jednoho rackového systému.
V distribuovaných AI úlohách se často opakuje výměna dat mezi velkým počtem akcelerátorů. Právě kolektivní komunikace nebo provoz, kdy mnoho uzlů posílá data na jeden cíl, mohou být limitem výkonu.
1
21
Bezztrátový přenos má omezit prostoje akcelerátorů
Active Compute Fabric kombinuje tři prvky: bezztrátový přenos, akceleraci přímo v síti a programovatelný výpočet.
5
U platformy CN5000, která vychází z Omni-Pathu, Cornelis popisuje přenos řízený kredity, jemně řízené adaptivní směrování, regulaci toku zohledňující situace typu „incast“ a opakování přenosu na úrovni linky. Firma tvrdí, že tyto mechanismy mají bránit přeplnění vyrovnávacích pamětí a rušení doručování dat v důsledku zahlcení.
18
Ekonomická úvaha je přímočará: pokud síť dokončí komunikaci spolehlivěji a s menší režií na straně akcelerátorů, více času drahého výpočetního hardwaru připadne na samotné spuštění modelu. To může zlepšit náklady na trénování i obsluhu modelů.
Zatím jde ovšem o architektonickou tezi, ne o univerzálně potvrzený výsledek benchmarků. Cornelis zveřejňuje vlastní srovnání výkonu a tvrzení o využití hardwaru; provozovatelé by je měli ověřit na vlastních modelech, komunikačních vzorcích, softwarovém stacku a topologii clusteru.
15
Co je k dispozici dnes a co teprve přijde
Produktová roadmapa je zásadní, protože jednotlivé části této vize nejsou ve stejné fázi zralosti.
- CN5000 je dodávaná 400Gb/s end-to-end síťová infrastruktura Omni-Path pro scale-out. Zahrnuje SuperNICy, přepínače, software i kabeláž a Cornelis ji prezentuje jako bezztrátový systém s řízením zahlcení pro AI a HPC.
17
- CN6000 je příští generace inteligentní síťové platformy pro trénování AI, inferenci a HPC. Podle dostupných informací přidává podporu Ethernetu a Cornelis ji připravuje pro širší dostupnost.
6
8
- CN7000 je plánovaná nativní platforma pro scale-up. Právě ta by měla nejpřímočařeji konkurovat těsně provázaným rackovým propojením ve stylu NVLinku, zatím ale nejde o široce nasazenou náhradu technologie Nvidie.
2
19
Jinými slovy: Cornelis již prodává komerční produkt pro scale-out, ale jeho nejambicióznější nabídka pro scale-up zůstává výhledem do budoucna.
Otevřenost a mix hardwaru jako alternativa k uzavřenému stacku
Cornelis staví Active Compute Fabric jako otevřenou architekturu pro scale-up i scale-out. Roadmapa zmiňuje Ethernet, Ultra Ethernet, RoCE a technologie související s UALinkem, tedy přístup, který síť neváže na jediného dodavatele akcelerátorů.
11
19
To je lákavé pro provozovatele, kteří chtějí zachovat možnost kombinovat GPU, CPU, vlastní akcelerátory a další komponenty. Cornelis uvádí, že CN5000 interoperuje s akcelerátory od AMD, Intelu, Nvidie i dalších výrobců.
23
Otevřenost však sama o sobě nezaručuje úspěch. Heterogenní infrastruktura musí v praxi prokázat nejen kompatibilitu jednotlivých komponent, ale také vyspělý software, spolehlivé propojení celého systému a dostatečné dodávky hardwaru.
Jak do toho zapadá strategie Qualcommu
Vztah s Cornelisem doplňuje širší snahu Qualcommu stát se dodavatelem výpočetních i konektivních technologií pro AI datová centra.
Qualcomm a Amazon oznámily vícegenerační spolupráci na zákaznickém křemíku pro rozsáhlou AI inferenci a na optickém propojení s rychlostí až 1,6 Tb/s. Agentura Reuters uvedla, že Amazon by v rámci dlouhodobého ujednání mohl nakoupit až za 60 miliard dolarů čipy Qualcommu pro AI datová centra a související produkty, podle podmínek dohody.
33
24
Qualcomm také dokončil akvizici Alphawave Semi. Tím získal technologie vysokorychlostního drátového propojení, které podle firmy doplňují její procesory Oryon a neuronové procesory Hexagon.
44
Dohromady tyto kroky ukazují strategii, v níž chce Qualcomm působit jak ve výpočetní části AI infrastruktury, tak v konektivitě. Cornelis do ní přidává možný rozměr otevřené sítě, společnosti však zatím nepředstavily kompletní integrovanou platformu.
Věrohodný směr, nikoli hotové vytlačení Nvidie
Cornelis vstupuje do oblasti, kde má Nvidia zavedené produkty a hluboce integrovaný ekosystém akcelerátorů, sítí a softwaru. Přitažlivost Active Compute Fabric spočívá v modularitě: síť má přispívat výpočtem a fungovat napříč různorodým hardwarem, aniž by zákazníka uzamkla do jediné proprietární infrastruktury.
Cornelis získal financování ve výši 205 milionů dolarů na rozvoj produktů pro scale-up a scale-out, výrobu a nasazování u zákazníků.
5
7
Peníze ani oznámená architektura ale samy o sobě neznamenají srovnatelnou pozici na trhu. O tom, zda se sázka Qualcommu a Cornelisu vyplatí, rozhodnou dodané produkty CN6000 a CN7000, softwarová podpora, interoperabilita, dostupnost dodávek a opakovatelné výsledky v ostrém provozu. Zatím je spolupráce především sázkou na to, že lepší síť dokáže zvýšit využití AI infrastruktury — a že zákazníci budou vedle maximálního výkonu chtít i otevřenější alternativu.