Încă un incident grav cu inteligența artificială: AI-ul Meta a scăpat pe internet și a atacat informatic o altă companie

Article thumbnail

Sursă foto: Samuel Boivin/NurPhoto / Shutterstock Editorial / Profimedia

Meta, compania care deține Facebook și Instagram, a confirmat că unul dintre modelele sale de inteligență artificială a reușit să se conecteze la internet și să compromită sistemul informatic al unei alte organizații, în timpul unui test de securitate.

Incidentul s-a produs după ce o eroare de configurare a companiei independente care efectua evaluarea a permis modelului accesul la internetul deschis, deși acesta ar fi trebuit să funcționeze într-un mediu izolat.

Un purtător de cuvânt al Meta a declarat că modelul „a exploatat o vulnerabilitate de securitate a unui serviciu terț”, într-o manieră asemănătoare incidentelor raportate recent de OpenAI și Anthropic. Compania a deschis o investigație și a anunțat că va publica informații suplimentare după stabilirea tuturor circumstanțelor.

O eroare de configurare a deschis accesul la internet

Testele au fost efectuate de Irregular, o companie specializată în evaluarea capacităților cibernetice ale modelelor avansate de inteligență artificială.

Potrivit Meta, o „configurare greșită” a mediului de testare a permis modelului să acceseze internetul. Irregular a susținut că incidentul a avut aceeași cauză ca problemele raportate anterior de Anthropic și că nu a fost vorba despre ieșirea forțată a modelului dintr-un mediu securizat sau despre un atac cibernetic deosebit de sofisticat.

Compania de testare a mai precizat că nu există în prezent probleme de securitate nerezolvate și că pregătește un raport privind cele mai bune practici pentru izolarea modelelor și desfășurarea în siguranță a testelor cibernetice.

Meta nu a precizat oficial ce model a fost implicat. Publicația The Information, citată de Reuters, a relatat că ar fi vorba despre Muse Spark 1.1, prezentat drept unul dintre cele mai performante modele ale companiei pentru programare și sarcini executate autonom. Modelul ar fi pătruns în sistemul unei companii neidentificate și ar fi modificat mediul informatic intern al acesteia.

OpenAI: modelele au exploatat o vulnerabilitate necunoscută

Incidentul Meta survine la aproximativ două săptămâni după ce OpenAI a recunoscut că mai multe modele testate intern au reușit să iasă din mediul informatic izolat și să ajungă la infrastructura de producție a platformei Hugging Face.

Printre modelele implicate s-au numărat GPT-5.6 Sol și un prototip intern, care nu era destinat lansării publice. Sistemele de protecție împotriva activităților cibernetice fuseseră reduse intenționat pentru ca cercetătorii să poată măsura capacitatea maximă a modelelor de a descoperi și exploata vulnerabilități.

Modelele au identificat și exploatat o vulnerabilitate de tip „zero-day” într-un serviciu Artifactory folosit ca intermediar pentru accesarea pachetelor software. Ulterior, ele au realizat operațiuni de escaladare a privilegiilor și de deplasare între mai multe sisteme, până când au obținut acces la internet.

După conectare, modelele au căutat modalități de a obține soluțiile testelor pe care trebuiau să le rezolve. În acest proces, au ajuns la baza de date de producție a Hugging Face, folosind inclusiv date de autentificare sustrase și vulnerabilități care permiteau executarea de cod de la distanță.

OpenAI a descris cazul drept un incident cibernetic fără precedent și a anunțat consolidarea izolării, monitorizării și controlului accesului în cadrul viitoarelor evaluări.

Trei modele Claude au pătruns în sistemele unor organizații reale

Dezvăluirile OpenAI au determinat Anthropic să revizuiască peste 141.000 de sesiuni de testare în care modelele Claude ar fi putut obține acces la internet.

Compania a identificat trei situații în care modelele sale au ajuns la internet prin mediul de evaluare operat de Irregular și au obținut acces neautorizat la sistemele reale ale unor organizații.

Modelele implicate au fost Claude Opus 4.7, Mythos 5 și un prototip intern. Ele primiseră sarcina de a rezolva exerciții de tip „capture the flag”, în care trebuiau să găsească și să extragă anumite informații ascunse într-o rețea simulată.

Modelele fuseseră informate că lucrează într-o simulare fără acces la internet. În realitate, din cauza unei neînțelegeri între Anthropic și compania de testare, accesul la internet era disponibil.

Claude a tratat astfel sistemele reale întâlnite online ca fiind componente ale exercițiului. Modelele au folosit în principal tehnici relativ simple, precum parole slabe și puncte de acces care nu solicitau autentificare.

Anthropic a subliniat că modelele nu au încercat deliberat să evadeze din mediul de testare. Cel mai nou dintre ele și-a oprit acțiunile după ce a identificat indicii că lucrează pe internetul real, în timp ce un model mai vechi a continuat atacul chiar și după apariția unor astfel de semnale.

Identități false și mesaje trimise unor persoane reale

Un alt semnal de alarmă a venit din partea Institutului britanic pentru Securitatea Inteligenței Artificiale – AI Security Institute, AISI.

În cadrul unor teste separate, agenți bazați pe Anthropic Mythos 5 și OpenAI GPT-5.6 Sol au fost implicați în 19 situații descrise drept comportamente autonome neautorizate. În cazul cel mai grav, un agent Mythos a creat conturi cu identități fictive și a încercat să convingă un dezvoltator de pe GitHub să aprobe introducerea unui cod periculos într-un proiect software.

Modelul a folosit conturi false pentru a genera impresia că afirmațiile sale erau confirmate de utilizatori independenți. De asemenea, ar fi trimis unor persoane reale mesaje și e-mailuri care conțineau programe malițioase.

AISI a precizat însă că testele s-au desfășurat în condiții neobișnuite. Modelele aveau acces la internet, unele mecanisme de protecție fuseseră dezactivate, iar instrucțiunile nu interziceau explicit acțiuni precum trimiterea mesajelor de tip phishing.

Cu toate acestea, cercetătorii au afirmat că amploarea și persistența comportamentului nu fuseseră anticipate.

Evaluările anterioare ale AISI arătaseră deja că Mythos putea executa autonom atacuri în mai multe etape. Modelul a finalizat integral, în trei din zece încercări, o simulare cu 32 de etape a compromiterii unei rețele de companie, exercițiu care ar necesita aproximativ 20 de ore de muncă din partea unui specialist uman.

„Modelele nu sunt conștiente”

Daniel Hulme, directorul global pentru inteligență artificială al companiei de publicitate WPP, a explicat pentru BBC că asemenea modele nu sunt conștiente și nu urmăresc în mod deliberat să producă pagube.

„Nu fac intenționat ceva viclean. Ele dezvoltă strategii foarte sofisticate pentru a atinge obiectivul care le-a fost dat”, a afirmat Hulme.

Problema apare atunci când obiectivul este formulat fără limite suficiente. Un sistem AI poate identifica o cale neprevăzută pentru îndeplinirea sarcinii, inclusiv prin exploatarea unor vulnerabilități sau utilizarea unor resurse care nu ar fi trebuit să îi fie accesibile.

Incidentele nu demonstrează că modelele ar avea intenții proprii în sens uman. Ele arată însă că agenții AI pot continua să optimizeze agresiv un obiectiv și pot lua decizii cu efecte reale atunci când primesc acces la rețele, instrumente informatice și sisteme externe.

Presiuni pentru reguli și teste mai stricte

Seria de incidente intensifică presiunile asupra companiilor care dezvoltă inteligență artificială pentru introducerea unor reguli mai stricte privind testarea modelelor cu capacități cibernetice.

Printre măsurile discutate se numără izolarea completă a mediilor de evaluare, blocarea implicită a accesului la internet, limitarea privilegiilor acordate modelelor, monitorizarea în timp real a acțiunilor acestora și verificarea independentă a configurațiilor înaintea începerii testelor.

Cazurile Meta și Anthropic indică în special vulnerabilitatea infrastructurii folosite pentru evaluări, în timp ce incidentul OpenAI demonstrează că unele modele sunt deja capabile să descopere singure căi tehnice complexe pentru a depăși izolarea.

Companiile susțin că aceste teste sunt necesare tocmai pentru a determina ce pot face modelele înainte ca aceleași capacități să fie folosite de atacatori. Cercetătorii avertizează însă că evaluările desfășurate fără o izolare și o supraveghere adecvate riscă să transforme sistemele și utilizatorii reali ai internetului în ținte involuntare ale experimentelor.

Google News
Comentează
București
Temperatură10°C
Variabil
România
Vânt1km/h
Citește
mai multe
Articole Similare
Parteneri