Intel a lansat oficial AutoRound, un algoritm de cuantificare a ponderilor (weight-only quantization - WOQ) de înaltă performanță, menit să îmbunătățească semnificativ eficiența modelelor de limbaj mari (LLM) și a modelelor viziune-limbaj (VLM). Pe măsură ce modelele de AI generativ continuă să crească în dimensiune, cererea pentru tehnici de compresie eficiente, care să păstreze acuratețea reducând în același timp cerințele hardware, a devenit critică.
Precizie prin optimizare avansată
AutoRound se distinge de metodele tradiționale de rotunjire printr-o abordare mult mai nuanțată a cuantificării. Spre deosebire de tehnicile standard de tip „rotunjire la cel mai apropiat întreg”, AutoRound utilizează un proces de reglare automatizat pentru a găsi valorile optime de rotunjire pentru ponderile modelului. Acest lucru asigură faptul că modelele comprimate mențin un nivel ridicat de performanță și precizie, chiar și atunci când sunt reduse la formate de biți mici, cum ar fi întregii pe 4 sau 8 biți.
Compatibilitate extinsă și performanță
Conceput pentru a fi versatil, AutoRound suportă o gamă largă de arhitecturi populare, inclusiv Llama, Mistral și diverse modele integrate cu funcții de viziune computerizată. Prin reducerea amprentei de memorie a acestor modele, Intel permite cercetătorilor și dezvoltatorilor să implementeze soluții AI de ultimă generație pe o varietate mai mare de echipamente hardware, inclusiv dispozitive edge și procesoare (CPU) sau plăci grafice (GPU) de larg consum, fără degradarea tipică a performanței asociată cu compresia masivă.

