Inteligenta ArtificialaAnaliza tehnica

Pollen-vision: un nou framework open-source pentru percepția robotică zero-shot

Publicat
RRedactia ElectricBuzz
Pollen-vision: un nou framework open-source pentru percepția robotică zero-shot
4 min de citit625 cuvinteRedactia ElectricBuzz

Pe scurt

Pollen Robotics a lansat „pollen-vision”, o bibliotecă open-source care unifică modele de viziune computerizată zero-shot pentru a oferi roboților capacitatea de a identifica și apuca obiecte în timp real.

Eliminarea prăpastiei dintre viziune și robotică

Pentru a funcționa eficient în medii dinamice, roboții au nevoie de mai mult decât mișcări preprogramate; ei trebuie să își perceapă și să își înțeleagă mediul înconjurător. Pollen Robotics, echipa din spatele robotului umanoid open-source Reachy, a făcut un pas important în această direcție prin lansarea pollen-vision. Această nouă bibliotecă open-source oferă o interfață unificată pentru modelele de viziune zero-shot, acționând ca un motor perceptiv care permite roboților să identifice, să localizeze și să interacționeze cu obiecte pe care nu le-au mai întâlnit anterior.

Utilizarea modelelor zero-shot elimină necesitatea unor seturi de date de antrenament laborioase, specifice fiecărei sarcini. Dezvoltatorii pot furniza sistemului o descriere textuală, iar robotul poate încerca localizarea obiectului corespondent în spațiul 3D. Această tranziție către o inteligență „gata de utilizare” reprezintă o evoluție vitală pentru robotică, unde capacitatea de a generaliza între medii diferite determină utilitatea unei mașini.

Motorul: modelele de bază din pollen-vision

Biblioteca se bazează pe trei modele fundamentale, selectate pentru versatilitatea lor și pentru capacitatea de a rula pe hardware de consum standard. Fiecare model joacă un rol specific în crearea unui flux de lucru (pipeline) robust pentru detecție 3D:

1. OWL-VIT (Open World Localization)

Dezvoltat de Google Research, OWL-VIT servește drept principal instrument de localizare în stiva pollen-vision. Acesta efectuează localizarea obiectelor 2D de tip zero-shot, condiționată de text. Atunci când un utilizator introduce o comandă precum „pahar de hârtie”, modelul scanează o imagine RGB și returnează casete de delimitare care identifică poziția obiectului, funcționând similar algoritmilor de detecție tradiționali, dar cu flexibilitatea adăugată a inputului în limbaj natural.

2. Mobile SAM (Segment Anything Model)

Pentru a depăși limitările simplelor casete de delimitare, Pollen Robotics a integrat o versiune ușoară a modelului Segment Anything de la Meta AI. Odată ce OWL-VIT identifică o regiune de interes, Mobile SAM generează măști de segmentare precise. Acest nivel de granularitate este crucial pentru robotică, deoarece permite sistemului să distingă obiectul de fundal, asigurând că calculele de adâncime se bazează strict pe obiectul vizat, nu pe zgomotul din jur.

3. RAM (Recognize Anything Model)

Pentru a optimiza performanța, biblioteca include modelul RAM al OPPO Research Institute. Deoarece timpul de inferență al OWL-VIT crește odată cu numărul de comenzi textuale, interogarea sistemului pentru fiecare obiect posibil este ineficientă. RAM acționează ca un filtru de preprocesare, determinând rapid ce obiecte sunt prezente efectiv în cadru, permițând fluxului de lucru să își concentreze resursele computaționale doar pe interogările relevante.

De ce este important

Inovația centrală a pollen-vision constă în capacitatea de a sintetiza aceste modele într-un flux de lucru 3D funcțional. Calculând centrul unei măști de segmentare și corelându-l cu datele de adâncime ale camerei și matricile intrinseci, biblioteca poate traduce o coordonată de pixel 2D într-o locație precisă (x, y, z) în lumea reală. Această capacitate permite unui efector final robotic să se deplaseze către coordonatele spațiale ale unui obiect și să încerce o prindere fără calibrare prealabilă pe acel articol specific.

Deși în prezent este limitat la poziționare spațială de bază — spre deosebire de estimarea completă a poziției 6D — acest framework pune bazele pentru manipulări robotice complexe. Prin oferirea unui API modular și curat, Pollen Robotics permite cercetătorilor și dezvoltatorilor să implementeze AI vizual sofisticat pe roboți cu doar câteva linii de cod, scăzând semnificativ bariera de intrare pentru construirea agenților fizici autonomi.

Privind spre viitor

Pollen Robotics a precizat că această lansare inițială reprezintă doar un punct de plecare. Provocări actuale, precum detecția inconsistentă a obiectelor, lipsa consistenței temporale între cadre și nevoia unor tehnici de prindere mai avansate, rămân domenii active de dezvoltare. Actualizările viitoare vor include soluții de urmărire a punctelor și metode îmbunătățite pentru generarea unor posturi complexe de prindere, extinzând și mai mult utilitatea bibliotecii în domeniul manipulării autonome.

The 5 Best Over-Ear ANC Headphones of 2026, Tested & Ranked
Ghid Cumpărături Recomandat
92/100
Tech si Gadgeturi12 min de citit

The 5 Best Over-Ear ANC Headphones of 2026, Tested & Ranked

We locked five over-ear ANC picks for 2026 — Sony WH-1000XM6, Bose QuietComfort Ultra 2, Soundcore Space One, Sennheiser Momentum 5, and Apple AirPods Max 2 — then stress-tested them on lab metrics, long-term owner truth, and live street prices.

Articole similare

Articole asemanatoare, ordonate semantic dupa subiect si actualitate.

Demistificarea performanței AI: Cum să îți construiești propriul clasament pe Hugging Face
Inteligenta Artificiala

Demistificarea performanței AI: Cum să îți construiești propriul clasament pe Hugging Face

Hugging Face a lansat un ghid complet pentru crearea de clasamente personalizate, oferind dezvoltatorilor posibilitatea de a evalua modele AI specializate, precum instrumentul Vectara pentru detectarea halucinațiilor.

Unsloth și TRL de la Hugging Face: o nouă eră pentru fine-tuning-ul accelerat al modelelor LLM
Inteligenta Artificiala

Unsloth și TRL de la Hugging Face: o nouă eră pentru fine-tuning-ul accelerat al modelelor LLM

Hugging Face și Unsloth și-au unit forțele pentru a optimiza procesul de fine-tuning, permițând dezvoltatorilor să antreneze modele lingvistice mari de două ori mai rapid.

Manus își recapătă independența: startup-ul de AI țintește o evaluare de 4 miliarde de dolari după blocarea fuziunii cu Meta
Inteligenta Artificiala

Manus își recapătă independența: startup-ul de AI țintește o evaluare de 4 miliarde de dolari după blocarea fuziunii cu Meta

După eșecul achiziției de către Meta, startup-ul chinez de AI Manus își trasează un nou drum printr-o rundă de finanțare masivă de 500 de milioane de dolari și planuri pentru o posibilă listare la bursa din Hong Kong.

Google transformă agentul AI „CC” într-un administrator al gospodăriei
Inteligenta Artificiala

Google transformă agentul AI „CC” într-un administrator al gospodăriei

Google repoziționează agentul său AI, „CC”, pentru a funcționa ca un centru de comandă centralizat al gospodăriei, conceput pentru a sincroniza calendarele, a gestiona logistica școlară și a automatiza sarcinile administrative ale familiei.

Controlul avansului AI: Pot giganții tehnologici să se autoregleze?
Inteligenta Artificiala

Controlul avansului AI: Pot giganții tehnologici să se autoregleze?

CEO-ul Anthropic, Dario Amodei, a propus un nou cadru pentru încetinirea dezvoltării AI, punând siguranța pe primul loc, însă industria rămâne profund divizată în privința implementării și aplicării acestuia.

Schimbare strategică: Disney numește primul CTO din istoria companiei
Inteligenta Artificiala

Schimbare strategică: Disney numește primul CTO din istoria companiei

Într-o mișcare îndrăzneață ce marchează o nouă eră tehnologică pentru gigantul din divertisment, Disney l-a cooptat pe fostul CEO al Character.AI, Karandeep Anand, în funcția de Chief Technology Officer.

Hugging Face Spaces permite acum rularea fluxurilor de lucru ComfyUI
Inteligenta Artificiala

Hugging Face Spaces permite acum rularea fluxurilor de lucru ComfyUI

Hugging Face a introdus o modalitate simplă de a găzdui și rula fluxuri de lucru ComfyUI direct în browser prin Gradio, oferind acces gratuit la instrumente generative avansate.

Miza ridicată a siguranței în AI: control, competiție sau haos?
Inteligenta Artificiala

Miza ridicată a siguranței în AI: control, competiție sau haos?

În timp ce giganții tehnologici se străduiesc să definească siguranța în domeniul AI, se dă o luptă acerbă pentru a stabili dacă eforturile de reglementare vizează protejarea umanității sau consolidarea hegemoniei corporative.