Nvidia și Cerebras au prezentat recent noi tehnologii de accelerare AI, stârnind controverse privind revendicările lor de performanță. Nvidia afirmă că rack-urile LPX bazate pe Groq-3 pot atinge viteze de până la 3.400 de tokeni pe secundă, susținând că aceasta este de patru ori mai rapid decât soluțiile oferite de Cerebras. Totuși, experții din industrie avertizează că aceste rezultate impresionante s-ar putea să nu reflecte pe deplin aplicațiile tipice din lumea reală din cauza limitărilor de memorie și a variațiilor operaționale.
Puncte Cheie
- Rack-urile LPX ale Nvidia oferă, conform declarațiilor, 3.400 de tokeni pe secundă pentru o dimensiune a lotului de unu.
- Cerebras revendică, de asemenea, capabilități de performanță similare cu acceleratoarele sale CS-4, vizând aceeași dimensiune a lotului.
- Ambele sisteme se confruntă cu constrângeri semnificative de memorie, Nvidia necesitând 64 de LPUs pentru a susține un model cu 31 miliarde de parametri, limitând astfel debitul la doar 12 solicitări la lungimi de 100.000 de tokeni.
- Cifrele de referință ridicate prezentate de ambele companii se aplică probabil doar în scenarii izolate și nu reflectă condițiile tipice întâlnite în medii operaționale.
- Investiția masivă a Nvidia în achiziționarea tehnologiei Groq sugerează o tendință către calculul heterogen avansat pentru optimizarea performanței în inferență, în timp ce Cerebras colaborează cu AWS și AMD.
- Variabilele precum dimensiunea lotului, utilizarea memoriei și arhitectura sistemului au un impact semnificativ asupra performanței percepute în aplicațiile cu latență scăzută, ceea ce contrazice afirmațiile promoționale.
Această competiție subliniază o tendință în creștere către abordări de calcul heterogen, pe măsură ce companiile își propun să optimizeze performanța în condiții practice. Cu ambele părți făcând afirmații robuste, concentrarea pe utilizabilitatea din lumea reală rămâne esențială pentru potențialii cumpărători care iau în considerare aceste tehnologii avansate.






