Un studiu recent realizat de VentureBeat Pulse Research, la care au participat 157 de organizații, a scos la iveală o „prăpastie de evaluare” semnificativă în industria inteligenței artificiale. Concluziile sugerează că, deși organizațiile sporesc rapid autonomia agenților AI, acestea rămân profund sceptice cu privire la instrumentele automatizate menite să le verifice fiabilitatea.
Problema alinierii cu realitatea
Studiul a constatat că 50% dintre organizații au implementat în ultimul an un agent AI sau o funcție LLM care a trecut evaluările interne, dar a eșuat în interacțiunile reale cu clienții. Această discrepanță evidențiază o defecțiune critică: metricile actuale de evaluare nu reușesc adesea să se alinieze cu rezultatele efective din producție. În ciuda acestor eșecuri, încrederea în sistemele automatizate este remarcabil de scăzută; doar 5% dintre liderii tehnici declară că au încredere deplină în evaluările automatizate de astăzi.
Autonomie fără asigurare
Cel mai frapant paradox din raport este impulsul agresiv către implementarea de tip „zero-human-in-the-loop” (fără intervenție umană). Aproximativ 66% dintre organizații fie permit deja, fie proiectează fluxuri care să permită agenților să implementeze modificări de sistem bazate exclusiv pe rezultate automatizate. Această tendință este și mai pronunțată în rândul companiilor mari (70%) decât în cazul celor mici (64%), contrazicând ipoteza că firmele mari, reglementate, ar fi mai prudențe.
Un peisaj fragmentat al instrumentelor
Piața software-ului de evaluare rămâne imatură și fragmentată. În prezent, 17% dintre companii se bazează pe instrumente native de la furnizorii de modele precum OpenAI, în timp ce alte 17% nu utilizează niciun instrument de evaluare dedicat. Mai mult, monitorizarea producției este axată în mare parte pe timpul de funcționare și costuri, mai degrabă decât pe calitatea rezultatelor. Trei sferturi dintre organizații nu efectuează verificări automate în timp real pentru a vedea dacă răspunsurile unui agent sunt corecte.
Perspective de viitor
Companiile par să își ia măsuri de precauție. În timp ce se îndreaptă spre autonomie prin inginerie, a doua cea mai mare investiție planificată pentru anul viitor este reprezentată de fluxurile de lucru pentru revizuirea umană (26%). Pe măsură ce 64% dintre firme plănuiesc să schimbe sau să adopte noi platforme de evaluare în următoarele douăsprezece luni, industria intră într-o perioadă de consolidare în care obiectivul nu mai este doar testarea mai intensă, ci o testare care să prezică cu precizie succesul în lumea reală.








