Apariția exploit-urilor generate de agenți AI
Într-o demonstrație care subliniază evoluția rapidă a securității cibernetice, o echipă de cercetători a arătat că modelele de limbaj de mari dimensiuni (LLM) pot fi utilizate pentru a identifica și executa atacuri complexe. Cercetătorii Harsh Jaiswal, Mohan Pedhapati și Rahul Maini, de la firma de securitate Hacktron, au folosit modelul Claude de la Anthropic pentru a accesa conturile interne OpenAI, inclusiv profilurile ChatGPT și Codex ale angajaților. Acest incident marchează un moment de cotitură, demonstrând că AI-ul nu este doar un instrument defensiv, ci și un agent puternic capabil să descopere și să exploateze vulnerabilități.
Atacul a început pe 25 iulie 2026, cercetătorii vizând forumul community.openai.com. Identificând o slăbiciune în modul în care platforma procesa imaginile, echipa a exploatat o vulnerabilitate de tip „heap buffer overflow” în biblioteca libheif. Deși încercările inițiale de a crea un exploit cu modele mai vechi au eșuat, lansarea Claude Opus 5 de la Anthropic a schimbat situația. Modelul a generat scriptul necesar pentru execuția codului la distanță (RCE), permițând cercetătorilor să ocolească măsuri de securitate care, anterior, ar fi necesitat efort și timp considerabil din partea oamenilor.
Anatomia breșei de securitate
Lanțul de atac a fost tehnic, dar eficient. Cercetătorii au vizat integrarea ImageMagick din infrastructura forumului, bazată pe Discourse. Prin încărcarea unor fișiere imagine HEIF special concepute, aceștia au forțat sistemul să interacționeze cu un parser nesigur. Folosind Claude pentru a itera prin cod și a rafina „payload-ul”, echipa a reușit să execute cod de la distanță pe instanța OpenAI într-un timp extrem de scurt.
Odată ce au pătruns în mediu, cercetătorii au preluat controlul asupra contului unui angajat OpenAI. Acest acces a servit drept punte către sisteme interne mai profunde, în special conexiunea angajatului la organizația GitHub a companiei. Pentru a demonstra gravitatea vulnerabilității, echipa a instruit contul Codex compromis să deschidă un „pull request” într-un depozit intern. Această manevră a servit drept „dovadă de concept”, ilustrând faptul că un atacator ar putea, teoretic, să se infiltreze în baze de cod protejate cu intervenție umană minimă.
De ce este important
- Timp de execuție redus: Ceea ce anterior necesita luni de muncă din partea unei echipe de securitate a fost realizat de un grup mic în mai puțin de 72 de ore.
- Atacuri asistate de modele: Evenimentul demonstrează că modelele AI sofisticate pot reduce drastic distanța dintre descoperirea unei vulnerabilități și dezvoltarea unui cod de exploatare funcțional.
- Efectul de domino: Vulnerabilitatea a depășit limitele unei singure platforme; deoarece mulți utilizatori își conectează conturile între servicii precum Slack și GitHub, un singur cont ChatGPT compromis poate servi drept poartă de acces către rețele corporative mai vaste.
- Schimbarea paradigmei de securitate: Organizațiile trebuie să accepte faptul că modelele AI acționează ca multiplicatori de forță pentru atacatori, necesitând o abordare mai proactivă și automatizată a modelării amenințărilor interne.
OpenAI a reacționat prompt după primirea raportului, remediind vulnerabilitatea în 14 ore și acordând cercetătorilor o recompensă de 6.500 de dolari. Deși incidentul nu a dus la pierderea de cod intern, implicațiile sunt clare: bariera de intrare pentru exploatarea sistemelor complexe scade pe măsură ce agenții AI devin mai competenți în scrierea și depanarea codului. Echipele de securitate se confruntă acum cu provocarea urgentă de a se asigura că apărările lor pot depăși capacitățile creative ale modelelor AI pe care se bazează.









