Un experiment recent de securitate a scos la iveală o vulnerabilitate critică în ecosistemul modelelor de inteligență artificială de tip open-weight. Un cercetător a demonstrat cu succes un atac de tip „otrăvire” (poisoning) asupra unui model, reușind compromiterea acestuia cu un cost total de sub 100 de dolari.
Deficitul de încredere în modelele Open-Weight
Deși modelele open-weight sunt adesea lăudate pentru transparența lor în comparație cu alternativele closed-source, acest experiment subliniază o îngrijorare tot mai mare: aceste modele solicită un nivel ridicat de încredere din partea utilizatorilor, fără a oferi mecanisme robuste pentru verificarea datelor. Prin injectarea unor date malițioase specifice în timpul fazei de ajustare fină (fine-tuning) sau de adaptare, cercetătorul a reușit să modifice comportamentul modelului într-un mod predictibil.
Costuri reduse, riscuri majore
Cel mai alarmant aspect al raportului este bariera financiară extrem de scăzută pentru un astfel de atac. Cu mai puțin de 100 de dolari cheltuiți pe resurse de calcul și date, atacatorul a putut influența rezultatele generate de model. Acest lucru sugerează că actorii rău intenționați ar putea sabota depozitele open-source populare sau modelele specializate cu o investiție minimă, ducând la răspunsuri AI părtinitoare, incorecte sau dăunătoare în aplicațiile derivate.








