Microsoft Research a introdus Differential Transformer V2 (DiffTransformer2), o evoluție a arhitecturii bazate pe atenție, concepută pentru a aborda limitările sistemului standard Softmax. Prin utilizarea unui mecanism diferențial, modelul urmărește să amplifice atenția asupra informațiilor relevante, eliminând în același timp zgomotul redundant din date.
O focalizare sporită a atenției
Inovația centrală a modelului Differential Transformer V2 constă în capacitatea sa de a scădea două hărți de atenție separate. Acest proces ajută modelul să filtreze zgomotul de mod comun, ascuțind eficient ponderile de atenție asupra celor mai critice unități de text (tokens). Această rafinare este deosebit de benefică pentru sarcinile cu context lung, unde modelele standard întâmpină adesea dificultăți în recuperarea informațiilor și tind să genereze halucinații.
Scalabilitate și performanță
Benchmark-urile inițiale sugerează că arhitectura V2 oferă o stabilitate îmbunătățită în timpul antrenării și legi de scalare superioare comparativ cu predecesorul său și cu modelele Transformer tradiționale. Concentrându-se pe diferența dintre capetele de atenție (attention heads), modelul obține un raport semnal-zgomot mai ridicat, ceea ce duce la rezultate mai precise în raționamente complexe și sarcini lingvistice dificile.




