E-BUZZ ME Logo
Inteligenta ArtificialaAnaliza tehnica

Google DeepMind lansează SigLIP 2: Un nou standard în procesarea multilingvă viziune-limbaj

Publicat
Google DeepMind lansează SigLIP 2: Un nou standard în procesarea multilingvă viziune-limbaj
1 min de citit196 cuvinte

Pe scurt

Google DeepMind a prezentat SigLIP 2, un codificator viziune-limbaj de ultimă generație, conceput să îmbunătățească semnificativ performanța în sarcinile multilingve și cross-modale.

Google DeepMind a anunțat oficial lansarea SigLIP 2, o evoluție a modelului revoluționar Sigmoid Loss pentru Pre-antrenare Limbaj-Imagine (SigLIP). Această versiune actualizată se concentrează pe extinderea capacităților codificatorilor viziune-limbaj, făcându-i mai eficienți în înțelegerea relației dintre conținutul vizual și limbajul natural în diverse dialecte globale.

Performanță multilingvă îmbunătățită

Punctul forte al SigLIP 2 constă în metodologia sa de antrenare rafinată. Prin utilizarea unei funcții de pierdere sigmoidale optimizate, în locul abordărilor tradiționale de învățare contrastivă, modelul obține o scalare și o performanță superioară pe seturi de date diverse. Acest lucru îl face deosebit de abil în gestionarea interogărilor multilingve, permițând o aliniere imagine-text mult mai precisă pentru alte limbi în afară de engleză.

Îmbunătățiri tehnice și versatilitate

SigLIP 2 introduce mai multe optimizări de arhitectură care îi permit să își depășească predecesorul în testele de clasificare zero-shot și în cele de recuperare imagine-text. Modelul este proiectat pentru a fi extrem de versatil, servind ca o structură de bază robustă pentru sisteme multimodale mai mari. Eficiența sa sporită înseamnă că poate oferi rezultate de înaltă calitate cu un consum de resurse computaționale mai redus, fiind o opțiune atractivă pentru dezvoltatorii care creează aplicații globale de inteligență artificială.

Articole similare

Articole asemanatoare, ordonate semantic dupa subiect si actualitate.

Google lansează PaliGemma 2 Mix: Modele avansate de limbaj vizual optimizate prin instrucțiuni
Inteligenta Artificiala77%

Google lansează PaliGemma 2 Mix: Modele avansate de limbaj vizual optimizate prin instrucțiuni

Google și-a extins portofoliul de modele de limbaj vizual cu PaliGemma 2 Mix, o nouă serie optimizată pentru a urma instrucțiuni vizuale complexe.

SmolVLM2: Înțelegere video avansată pentru dispozitive Edge
Inteligenta Artificiala76%

SmolVLM2: Înțelegere video avansată pentru dispozitive Edge

Hugging Face a lansat SmolVLM2, o familie de modele compacte de limbaj vizual concepute pentru a aduce analiza video și de imagine de înaltă performanță pe hardware-ul de consum.

Multiverse Computing vizează o evaluare de 1,7 miliarde de dolari în cea mai recentă rundă de finanțare
Tech si Gadgeturi61%

Multiverse Computing vizează o evaluare de 1,7 miliarde de dolari în cea mai recentă rundă de finanțare

Compania spaniolă de tehnologie Multiverse Computing caută o investiție de 570 de milioane de dolari pentru a-și extinde soluțiile menite să reducă costurile ridicate asociate inteligenței artificiale.

Extinderea ecosistemului de inferență Serverless: Hyperbolic, Nebius AI Studio și Novita se alătură pieței
Inteligenta Artificiala61%

Extinderea ecosistemului de inferență Serverless: Hyperbolic, Nebius AI Studio și Novita se alătură pieței

Peisajul inteligenței artificiale serverless se extinde prin adăugarea a trei noi furnizori de inferență: Hyperbolic, Nebius AI Studio și Novita.

Optimizarea performanței LLM prin gestionarea eficientă a cozilor de așteptare
Inteligenta Artificiala60%

Optimizarea performanței LLM prin gestionarea eficientă a cozilor de așteptare

Noile strategii de gestionare a solicitărilor ajută dezvoltatorii să maximizeze capacitatea de procesare a modelelor de limbaj mari, minimizând în același timp latența.

NVIDIA Cosmos-H-Dreams: Simulare Generativă în Timp Real pentru Robotica Chirurgicală
Inteligenta Artificiala59%

NVIDIA Cosmos-H-Dreams: Simulare Generativă în Timp Real pentru Robotica Chirurgicală

Noul cadru Cosmos-H-Dreams de la NVIDIA utilizează inteligența artificială generativă pentru a crea simulări de înaltă fidelitate în timp real, destinate instruirii roboților chirurgicali avansați.

Un implant ocular inovator și ochelari high-tech primesc aprobare europeană pentru combaterea pierderii vederii
Stiinta58%

Un implant ocular inovator și ochelari high-tech primesc aprobare europeană pentru combaterea pierderii vederii

Un sistem revoluționar compus dintr-un implant ocular și ochelari inteligenți a primit aprobarea autorităților de reglementare europene, oferind speranță pacienților cu pierderi severe de vedere cauzate de vârstă.

OpenAI dezvăluie Project Camellia: Un nou hub de infrastructură AI în Georgia
Inteligenta Artificiala57%

OpenAI dezvăluie Project Camellia: Un nou hub de infrastructură AI în Georgia

OpenAI a anunțat o inițiativă majoră de infrastructură în comitatul Effingham, Georgia, punând accent pe energia responsabilă și dezvoltarea economică locală.