Provocarea antrenării distribuite a modelelor AI
Antrenarea modelelor AI la scară largă a depășit, în mod efectiv, limitele unei singure clădiri. Pe măsură ce cererea de putere de calcul crește, giganții precum Google, Microsoft și AWS distribuie tot mai des sarcinile de antrenare în mai multe locații geografice. Deși această strategie permite companiilor să ocolească limitările de spațiu și energie ale unei singure facilități, ea introduce o provocare monumentală la nivel de rețea: cum să sincronizezi mii de GPU-uri separate prin sute de kilometri fără ca rețeaua să devină un blocaj catastrofal.
În antrenarea modernă a modelelor AI, blocajul nu este, de regulă, volumul brut de date procesate, ci procesul de sincronizare. Între fiecare etapă de calcul, mii de acceleratoare trebuie să partajeze matrici vaste de gradienți și rezultate intermediare. Dacă un singur nod întârzie, întregul cluster stagnează, irosind milioane de dolari în timp de calcul. Pe măsură ce aceste sarcini se extind pe distanțe regionale, echipamentele tradiționale de tip Data Center Interconnect (DCI) – concepute pentru trafic asincron – se dovedesc insuficiente pentru natura sincronă și fluctuantă a antrenării AI.
Optica conectivității între locații
Tranziția de la o structură locală de tip „scale-out” la o arhitectură regională de tip „scale-across” necesită o regândire radicală a hardware-ului fizic. Cercetătorii Cisco notează că cerințele de lățime de bandă pentru aceste supercomputere AI distribuite pot fi de până la 14 ori mai mari decât în configurațiile DCI convenționale. Pentru a gestiona acest lucru, operatorii renunță la transponderele standard în favoarea opticii coerente de înaltă performanță.
Prin integrarea modulelor optice coerente direct în routere și switch-uri, operatorii pot genera lungimi de undă DWDM fără a mai avea nevoie de bănci masive de transpondere independente. Această abordare este esențială pentru fabricile AI limitate de consumul energetic, reducând semnificativ amprenta la sol și consumul de electricitate al stratului de rețea. Conform Cisco, conectarea a două centre AI de 100 MW poate necesita până la 32.000 de porturi coerente, ceea ce impune un nou nivel de densitate și eficiență la nivelul stratului optic fizic.
Rolul siliciului cu buffer extins
Distanța introduce o realitate fizică inevitabilă: latența. Atunci când o conexiune de rețea acoperă 100 de kilometri (aprox. 62 mile), bucla de feedback necesară pentru gestionarea congestiei devine considerabil mai lungă. Pe o conexiune de mare viteză de 800 Gbps, aproape 100 de megabytes de date pot fi în tranzit înainte ca emițătorul să primească măcar un semnal de reducere a vitezei. Comutarea tradițională cu buffer redus, care funcționează optim în interiorul unui centru de date, eșuează aici deoarece nu poate absorbi traficul în acel interval de feedback, ducând la pierderi de pachete și retransmisii.
Pentru a atenua acest lucru, Cisco pledează pentru utilizarea de siliciu cu buffere substanțial mai mari. Arhitectura Silicon One P200 a companiei este concepută special pentru a gestiona aceste tipare masive și fluctuante de trafic de sincronizare. Prin utilizarea unui buffer complet partajat, hardware-ul poate aloca dinamic capacitatea către anumite porturi care se confruntă cu congestie, acționând ca o plasă de siguranță care menține fluxul până când software-ul de gestionare a traficului poate redirecționa sarcina. Această abordare de co-design asigură faptul că rețeaua este la fel de programabilă pe cât este de robustă, permițând dezvoltatorilor să actualizeze protocoalele prin software, în loc să fie forțați să schimbe constant hardware-ul.
De ce contează
- Performanță: Antrenarea sincronă AI este la fel de rapidă precum cea mai lentă conexiune de rețea; reducerea latenței previne inactivitatea GPU-urilor.
- Sustenabilitate: Consolidarea transponderelor coerente în switch-uri economisește spațiu prețios în rack-uri și reduce consumul de energie în centrele de date AI.
- Flexibilitate: Siliciul programabil permite infrastructurii să evolueze odată cu peisajul în schimbare rapidă al topologiilor de antrenare pentru modelele LLM.









