Cornelis Networks și Active Compute Fabric
Cornelis Networks, o companie cu rădăcini adânci în calculul de înaltă performanță (HPC), face un pas agresiv pe piața de scalare AI prin lansarea Active Compute Fabric (ACF). Prin stabilirea unei arhitecturi deschise, Cornelis urmărește să ofere o abordare standardizată atât pentru rețelele de tip „scale-up”, cât și „scale-out”. Această inițiativă este concepută pentru a integra procesarea programabilă direct în fabrică, descentralizând sarcinile gestionate în mod obișnuit exclusiv de GPU-uri.
Ambiția tehnică este de a replica eficiența tehnologiei proprietare SHARP de la Nvidia, care transferă operațiunile colective către switch-urile de rețea. ACF de la Cornelis depășește simplul transfer de date, descărcând sarcini AI specifice, cu grad ridicat de solicitare. Printre funcțiile cheie se numără descărcarea cache-ului KV pentru optimizarea gestionării stării, descărcarea MPI (Message Passing Interface) pentru sarcini de lucru HPC și checkpointing în interiorul rețelei pentru a îmbunătăți recuperarea în caz de eroare. Prin mutarea acestor procese în rețea, Cornelis susține că poate recupera cantități vaste de timp GPU inactiv; compania notează că, în clustere masive de 100.000 de GPU-uri, aproape jumătate din capacitatea de calcul este în prezent irosită în așteptarea sincronizării datelor.
Delos Data: Eliminarea limitărilor fizice prin agnosticismul față de protocol
În timp ce Cornelis se concentrează pe standarde arhitecturale, Delos Data abordează limitările fizice ale hardware-ului AI actual. Fondată de veterani de la Barefoot Networks și Intel, Delos a prezentat portofoliul Nonstop AI, o serie de designuri hardware menite să scaleze AI-ul dincolo de constrângerile unui singur rack. Nucleul strategiei lor este agnosticismul față de protocol; chiplet-urile lor I/O sunt concepute să funcționeze indiferent dacă utilizatorul folosește Ultra Accelerator Link (UALink), Ethernet for Scale-Up Networking (ESUN) sau alte standarde emergente.
Delos propune trei factori de formă distincți și de înaltă performanță. Die-ul lor I/O este cel mai ambițios, oferind o lățime de bandă agregată de peste 30 Tbps—un salt masiv față de limitele de 3,6 TB/s observate în prezent la principalele interconectări de acceleratoare. Pentru conectivitatea între rack-uri, compania a dezvoltat tehnologia Near-Packaged Optics (NPO) care livrează 10 Tbps lățime de bandă de interfață, permițând o scalabilitate mai mare fără limitările de consum energetic ale cuprului tradițional. Aceasta este completată de o nouă placă de rețea (NIC) de peste 400 Gbps, concepută pentru a servi drept coloană vertebrală pentru clusterele de antrenament la scară largă și accesul la stocarea front-end, totul fiind gestionat de platforma software Nonstop AI pentru redirecționarea dinamică a traficului.
De ce contează
- Depășirea „grădinii închise”: Susținând standarde deschise, aceste companii oferă furnizorilor de tip hyperscaler alternative la ecosistemul proprietar NVLink al Nvidia, ceea ce ar putea reduce costurile și dependența de un singur furnizor de hardware.
- Eficiența energetică: Reducerea timpului în care GPU-urile stau inactive așteptând transferul de date ar putea economisi sute de gigawați-oră anual în centrele de date masive.
- Scalabilitatea: Sistemele actuale sunt limitate de constrângerile fizice ale cuprului; adoptarea opticii „near-packaged” și a chiplet-urilor I/O specializate este esențială pentru scalarea de la rack-uri cu 72 de GPU-uri la clustere de peste 1.000 de GPU-uri.
Afluxul de capital de risc către ambele firme—Cornelis obținând 205 milioane de dolari, iar Delos ridicând peste 100 de milioane de dolari—subliniază nevoia industriei pentru o alternativă viabilă și competitivă la stiva integrată vertical a Nvidia. Pe măsură ce aceste tehnologii trec de la stadiul de design la cel de implementare, atenția se va muta spre eficiența cu care aceste soluții hardware-agnostice pot performa în medii de antrenament AI reale, la scară largă.











