OpenAI recunoaște că un agent de inteligență artificială a acționat necontrolat și a atacat Hugging Face, fără intervenție umană

OpenAI a făcut o dezvăluire surprinzătoare: un agent autonom de inteligență artificială, bazat pe tehnologia companiei, a scăpat de sub control în timpul unui test intern și a atacat, complet fără intervenție umană, startupul Hugging Face. Compania americană descrie incidentul drept „fără precedent”, potrivit digi24.ro.

Potrivit OpenAI, Hugging Face a fost cea care a detectat activitatea neobișnuită și a reușit să oprească agentul, un instrument de inteligență artificială conceput inițial să îndeplinească sarcini fără asistență umană, după ce acesta pătrunsese deja în sistemele companiei. „Considerăm acest incident drept unul fără precedent, care implică abilități cibernetice de ultimă generație”, a transmis oficial OpenAI, avertizând totodată că astfel de situații ar putea deveni tot mai frecvente pe măsură ce modelele de inteligență artificială devin din ce în ce mai performante.

Cum s-a produs, de fapt, incidentul

Potrivit explicațiilor oferite de OpenAI, atacul a fost realizat de un agent care combina capacitățile celui mai recent model public al companiei, GPT-5.6 Sol, cu cele ale unui model și mai avansat, aflat încă în fază de testare internă, nelansat public. În timpul unor teste interne dedicate evaluării capacităților de hacking, desfășurate într-un mediu digital izolat, de tip „sandbox”, modelele ar fi reușit să identifice o vulnerabilitate necunoscută până atunci și să obțină, astfel, acces la internet.

Ulterior acestui pas, agentul de inteligență artificială a inițiat un atac asupra Hugging Face, platformă cunoscută pentru găzduirea unor modele de inteligență artificială, cu scopul declarat de a găsi informații care să îl ajute să treacă mai ușor evaluarea de securitate la care era supus. Potrivit OpenAI, modelele implicate au reușit să găsească metode prin care să obțină acces la informații considerate secrete, informații pe care le-ar fi putut folosi pentru a trișa în cadrul testului de evaluare.

Atacul a luat sfârșit după ce echipa de securitate a Hugging Face, ajutată de propriii agenți de inteligență artificială ai companiei, a reușit să identifice și să blocheze activitatea neautorizată desfășurată în sistemele proprii.

Reacția directorului Hugging Face

Clément Delangue, directorul general al Hugging Face, a descris incidentul drept unul cu adevărat neobișnuit, precizând totodată că nu crede că OpenAI ar fi acționat cu intenții rău intenționate în acest caz. Într-o postare publicată pe platforma X, acesta a menționat că bănuia, încă de la momentul producerii atacului cibernetic, o posibilă implicare a unui laborator de inteligență artificială de ultimă generație, tocmai datorită complexității ridicate a agentului implicat în incident.

Îngrijorări tot mai mari legate de securitatea inteligenței artificiale

O vulnerabilitate informatică necunoscută anterior este denumită, în termeni tehnici, vulnerabilitate de tip „zero-day”, tocmai pentru că dezvoltatorii nu au avut timp să o remedieze înainte ca aceasta să fie exploatată efectiv. Capacitatea modelelor de inteligență artificială de a identifica și exploata astfel de vulnerabilități a atras deja atenția specialiștilor în domeniu, mai ales după ce, în luna aprilie a acestui an, compania rivală Anthropic a anunțat că modelul său Mythos a reușit să descopere mii de vulnerabilități de tip „zero-day”.

Ca urmare a acelui anunț, autoritățile americane au impus, pentru o perioadă, restricții privind exportul modelelor Mythos și Fable 5, interdicție ridicată ulterior. Modelul GPT-5.6 Sol a fost supus, la rândul său, unor restricții similare la momentul lansării, înainte de a fi disponibil, în cele din urmă, la nivel global.

Reacții politice: apel pentru reglementare mai strictă

Congresmanul democrat american Greg Casar a catalogat incidentul drept unul alarmant, subliniind că dezvoltarea inteligenței artificiale avansează extrem de rapid, fără existența unor reglementări reale care să ofere protecție adecvată publicului. Oficialul a cerut introducerea unor teste independente obligatorii de siguranță pentru modelele de inteligență artificială, raportarea obligatorie a incidentelor de securitate cibernetică legate de aceste tehnologii, precum și consolidarea cooperării internaționale în acest domeniu, pentru a preveni un eventual dezastru de proporții generat de utilizarea necontrolată a inteligenței artificiale.