Google DeepMind a anunțat oficial lansarea SigLIP 2, o evoluție a modelului revoluționar Sigmoid Loss pentru Pre-antrenare Limbaj-Imagine (SigLIP). Această versiune actualizată se concentrează pe extinderea capacităților codificatorilor viziune-limbaj, făcându-i mai eficienți în înțelegerea relației dintre conținutul vizual și limbajul natural în diverse dialecte globale.
Performanță multilingvă îmbunătățită
Punctul forte al SigLIP 2 constă în metodologia sa de antrenare rafinată. Prin utilizarea unei funcții de pierdere sigmoidale optimizate, în locul abordărilor tradiționale de învățare contrastivă, modelul obține o scalare și o performanță superioară pe seturi de date diverse. Acest lucru îl face deosebit de abil în gestionarea interogărilor multilingve, permițând o aliniere imagine-text mult mai precisă pentru alte limbi în afară de engleză.
Îmbunătățiri tehnice și versatilitate
SigLIP 2 introduce mai multe optimizări de arhitectură care îi permit să își depășească predecesorul în testele de clasificare zero-shot și în cele de recuperare imagine-text. Modelul este proiectat pentru a fi extrem de versatil, servind ca o structură de bază robustă pentru sisteme multimodale mai mari. Eficiența sa sporită înseamnă că poate oferi rezultate de înaltă calitate cu un consum de resurse computaționale mai redus, fiind o opțiune atractivă pentru dezvoltatorii care creează aplicații globale de inteligență artificială.








