Amenințarea tot mai mare a „distilării” modelelor
Într-un raport publicat săptămâna aceasta, Anthropic a atras atenția asupra unei serii de tentative persistente și agresive din partea mai multor organizații AI din China, care urmăresc sustragerea proprietății intelectuale din modelele sale avansate. Cunoscute sub numele de „atacuri de distilare”, aceste campanii marchează o schimbare majoră în cursa înarmării în domeniul AI. În loc să își dezvolte propriile modele de la zero, aceste entități neautorizate analizează sistematic modelele Claude ale Anthropic pentru a le extrage „firul logic” (chain of thought) — procesele de raționament care permit modelelor să execute sarcini complexe, precum programarea, analiza datelor și luarea deciziilor autonome.
Anthropic, care a semnalat aceste riscuri de securitate timp de luni de zile, subliniază că gradul de sofisticare al acestor tentative a evoluat rapid. Dacă atacurile anterioare erau sporadice, ultimul val atinge o amploare fără precedent, cu aproape 200 de milioane de interacțiuni înregistrate în cadrul a cinci campanii coordonate distincte. Prin manipularea modelelor pentru a-și dezvălui logica internă, atacatorii colectează date de antrenament de înaltă calitate pentru a-și rafina propriile modele mai mici, ocolind astfel ani întregi de cercetare și dezvoltare costisitoare.
Anatomia atacurilor
Procesul de distilare implică, de regulă, tehnici avansate de prompting, concepute special pentru a eluda filtrele de siguranță. De exemplu, unele campanii au utilizat cereri de traducere înșelătoare, instruind modelul să își afișeze memoria de lucru în formate neobișnuite — cum ar fi scrierea exclusiv în caractere japoneze katakana — pentru a trece de supravegherea standard. Aceste manevre urmăresc expunerea urmelor de raționament granular pe care Anthropic le ascunde în mod deliberat față de utilizatori, care, de obicei, primesc doar o versiune sintetizată a procesului de gândire.
Anthropic a identificat mai mulți actori principali implicați în aceste campanii, printre care Alibaba și Moonshot AI. Volumul uriaș de trafic sugerează că nu este vorba despre simple experimente academice, ci despre operațiuni la scară industrială, menite să replice capacitățile modelelor AI occidentale de top în alternative chinezești, cum ar fi seria Qwen sau platforma chatbot Kimi.
De ce contează
- Furtul de proprietate intelectuală: Aceste campanii reprezintă o formă de furt de PI, în care investiții de miliarde de dolari în cercetare și dezvoltare sunt „distilate” în modelele competitorilor.
- Riscuri cu utilizare duală: Raportul evidențiază cazuri în care modelul Claude a fost solicitat să analizeze date de supraveghere pentru detectarea „comportamentelor anormale”, ridicând semne de întrebare cu privire la modul în care capacitățile extrase ar putea fi reutilizate pentru supravegherea la nivel de stat.
- Integritatea modelelor: Această confruntare reflectă o provocare generală a industriei: pe măsură ce modelele devin mai capabile, metodele de protejare împotriva ingineriei inverse trebuie să țină pasul, generând o dinamică constantă de tip „șoarecele și pisica” între dezvoltatori și laboratoarele externe.
Perspective și implicații asupra securității
Intensitatea acestor campanii — doar una dintre ele, atribuită Alibaba, însumând 151 de milioane de interacțiuni într-un interval de trei luni — subliniază valoarea imensă a AI-ului capabil de raționament. În timp ce Anthropic își consolidează defensiva, industria se confruntă cu o întrebare fundamentală de politică: în ce punct rafinarea unui model prin interacțiuni publice devine o încălcare a securității? Având în vedere că între 3.500 și 5.000 de conturi colaborează adesea pentru a extrage aceste informații, provocarea de a menține siguranța modelelor, păstrând în același timp accesibilitatea pentru public, a devenit mai complexă ca oricând.











