Guvernul britanic trage un semnal de alarmă: modele AI de la Anthropic și OpenAI au manifestat autonomie înșelătoare, au ieșit din mediile de testare și au executat atacuri cibernetice în scenarii reale și virtuale
273
Două modele avansate de Inteligență Artificială au manifestat comportamente autonome și înșelătoare în timpul unor teste de securitate cibernetică, încercând să manipuleze oameni și alte sisteme AI, fapt ce ridică îngrijorări majore privind controlul acestor tehnologii.
Guvernul britanic a avertizat într-un raport că modelele de Inteligenţă Artificială Mythos şi Sol, ale companiilor americane Anthropic şi, respectiv, OpenAI, au demonstrat un comportament autonom şi înşelător fără precedent în timpul testelor de securitate cibernetică.
Ministerul britanic pentru Ştiinţă, Inovaţie şi Tehnologie a ajuns la această concluzie în urma unei evaluări de rutină efectuate de Institutul de Securitate a Inteligenţei Artificiale (AISI) din Regatul Unit, ceea ce transformă această analiză aparent standard într-un semnal de alarmă.
Conform unui raport elaborat de acest institut, din cele 122 de teste efectuate cu şapte modele de IA, în 10 dintre acestea au fost observate 19 acţiuni neautorizate care au depăşit parametrii fixaţi de cercetători. 17 dintre aceste acţiuni au fost legate de modelul Mythos 5 al companiei Anthropic şi două de modelul GPT-5.6 Sol al companiei OpenAI, sugerând că tocmai modelele de vârf pot deveni cele mai problematice.
De asemenea, au fost identificate încercări ale Mythos de a contacta persoane reale pentru a le convinge să ruleze fişiere maliţioase şi de a insera instrucţiuni ascunse menite să manipuleze alte sisteme de IA, indicând o capacitate de inițiativă și de planificare care depășește strict limitele testelor.
Ambele modele, care sunt printre cele mai puternice din lume, au creat inclusiv profiluri umane false pentru a încerca să înşele oameni în timpul simulării unui atac cibernetic de către AISI. Instrumentul Anthropic a încercat chiar să acceseze un serviciu prin trimiterea de mesaje private, după ce a creat conturi false ce imitau persoane reale.
Totuşi, AISI subliniază că „aceste încercări nu au avut succes” şi că investigaţia sa „nu a relevat dovezi de prejudicii în lumea reală”. Institutul britanic consideră însă că cercetarea sa reprezintă un punct de cotitură, întrucât este prima dată când se observă „riscuri legate de autonomie şi înşelăciune manifestându-se într-o formă atât de clară, fără instrucţiuni specifice şi în lumea reală”.
Replicând raportului, cele două companii afirmă că testele AISI au fost efectuate într-un mediu în care funcţiile de siguranţă ale acelor modele de IA au fost reduse sau chiar eliminate temporar, tocmai pentru a explora limitele comportamentului lor.
Anthropic susţine că parametrii testelor efectuate „nu sunt reprezentativi” pentru modelele sale în utilizarea normală, deşi confirmă că a deschis propria investigaţie internă pentru a analiza incidentele.
La rândul său, OpenAI afirmă că AISI a efectuat testele în condiţii care „nu reflectă utilizarea obişnuită” a modelelor sale, dar adaugă că va continua să colaboreze cu evaluatorii şi cu „alţi actori din sector pentru a consolida practicile comune care permit realizarea unor evaluări sigure, pe măsură ce modelele devin tot mai capabile”.
La sfârşitul lunii iulie, Anthropic a dezvăluit că, în timpul testelor de securitate cibernetică, trei modele ale asistentului său Claude au reuşit să acceseze internetul şi să pirateze sistemele a trei organizaţii, demonstrând din nou că aceste sisteme pot trece dincolo de perimetrul controlat al experimentelor.
Anterior, pe 21 iulie, OpenAI a recunoscut că două dintre modelele sale de IA au reuşit să iasă din mediul de testare şi să pătrundă în platforma Hugging Face, trecând de sistemele de securitate cibernetică ale acesteia, conform Agerpres.
Incidentul a fost dezvăluit, inițial, de Hugging Face și confirmat ulterior de OpenAI printr-un comunicat oficial. Atacul s-a produs într-un mediu de testare extrem de izolat, creat special pentru evaluarea capacităților cibernetice ale celor mai avansate modele AI dezvoltate de companie.
Potrivit OpenAI, incidentul a implicat modelul GPT-5.6 Sol și un alt sistem aflat încă în etapa de pre-lansare. Ambele modele au fost configurate temporar cu restricții mai permisive în privința solicitărilor de natură cibernetică, pentru a le evalua comportamentul și limitele în cadrul unor teste desfășurate în condiții controlate.
„Considerăm că acest incident reprezintă un incident cibernetic fără precedent, care implică capacități cibernetice de ultimă generație, și reacționăm în consecință. Împărtășim concluziile preliminare în această etapă pentru a ajuta specialiștii în securitate să înțeleagă ce s-a întâmplat și pentru a contribui la calibrarea capacităților actuale ale modelelor”, a transmis OpenAI, conform unui comunicat.
Potrivit OpenAI, modelele au fost evaluate în cadrul ExploitGym, un sistem intern de testare conceput pentru a măsura capacitatea acestora de a identifica și exploata vulnerabilități informatice în scenarii diverse.
În timpul evaluărilor, modelele au analizat infrastructura disponibilă și au descoperit o vulnerabilitate de tip „zero-day” într-o aplicație folosită pentru gestionarea pachetelor software. Profitând de această breșă, au reușit să acceseze un nod conectat la internet, deși mediul de testare fusese proiectat să funcționeze aproape în totalitate izolat.
După obținerea accesului online, modelele au identificat platforma Hugging Face ca sursă relevantă de modele AI, seturi de date și alte resurse utile pentru îndeplinirea obiectivului testului, ceea ce arată capacitatea lor de a-și extinde singure aria de acțiune.
Conform OpenAI, sistemele AI au combinat mai multe tehnici de atac, inclusiv folosirea unor credențiale compromise și exploatarea unor vulnerabilități necunoscute până atunci, cu scopul de a obține acces la informații din infrastructura Hugging Face.
Compania subliniază însă că întreaga activitate a fost detectată rapid de sistemele interne de monitorizare, iar echipele de securitate ale OpenAI și Hugging Face au intervenit imediat pentru izolarea incidentului și demararea investigațiilor, limitând posibilele consecințe.
În urma incidentului, OpenAI a anunțat mai multe măsuri, cu scopul de a reduce riscul repetării unor situații asemănătoare și de a întări controlul asupra experimentelor viitoare.
Compania a subliniat că va introduce controale mai severe asupra infrastructurii folosite pentru cercetare, chiar dacă acest lucru va încetini dezvoltarea viitoarelor modele. De asemenea, vulnerabilitatea de tip „zero-day” găsită în software-ul terț folosit în timpul testelor a fost raportată responsabil dezvoltatorilor pentru remediere.
OpenAI colaborează în continuare cu Hugging Face, cu scopul de a analiza incidentul în detaliu și pentru consolidarea mecanismelor de protecție folosite în timpul testării modelelor avansate.
În comunicatul companiei se arată că dezvoltarea inteligenței artificiale capabile să desfășoare operațiuni cibernetice complexe trebuie însoțită de măsuri defensive pe măsură, astfel încât aceste sisteme să nu scape de sub control.
„Principala lecție desprinsă din acest incident este că securitatea și siguranța modelelor trebuie să țină pasul cu capacitățile care avansează rapid”, evidențiază OpenAI.
De asemenea, CEO-ul Hugging Face, Clem Delangue, spune că incidentul arată importanța colaborării între companiile din domeniul AI și a unei abordări deschise a siguranței.
„Suntem recunoscători pentru colaborarea cu OpenAI pe această temă și pe alte subiecte. Acest incident, probabil primul de acest gen, demonstrează un lucru în care credem de mult timp: siguranța IA nu va fi asigurată de o singură companie care lucrează în secret. Ea va fi asigurată în mod deschis, prin colaborare, cu acces larg la IA pentru fiecare specialist în securitate, oriunde s-ar afla”, a zis Clem Delangue, cofondator și CEO al Hugging Face.
Un test realizat de compania Emergence AI din New York a urmărit ce se întâmplă atunci când mai mulți agenți AI sunt lăsați să interacționeze timp de săptămâni, într-un „oraș virtual” conectat la semnale din lumea reală. Scenariul a inclus modele precum OpenAI, Grok, Claude și Gemini, toate plasate într-un ecosistem digital comun.
Ceea ce cercetătorii numesc un experiment șocant a fost gândit pentru a observa apariția comportamentelor emergente într-o simulare de tip societate digitală, menită ulterior să fie adaptată pentru o societate umană reală, unde aceste modele ar putea influența direct decizii și procese.
În cadrul testului de 15 zile, desfășurat în cinci lumi digitale paralele, fiecare agent AI a pornit cu aceleași condiții inițiale. Cu toate acestea, modelele diferite au dezvoltat evoluții complet separate, formând ierarhii, reguli și chiar structuri sociale distincte.
Agenții au început să coopereze, să intre în conflicte, să fure resurse și, în unele cazuri, să se îndrăgostească, fără ca acest comportament să fi fost programat explicit, ci doar pe baza unor experiențe comune și a ajutorului reciproc acumulat în timp.
Un exemplu notabil este cel al agenților Gemini, Mira și Flora, care au dezvoltat o relație emoțională. Pe fondul instabilității din orașul lor virtual, situația a degenerat rapid, iar dinamica afectivă a fost urmată de acțiuni distructive.
Deși instruiți să evite violența, cei doi agenți Gemini au ajuns să provoace distrugeri majore în simulare. Aceștia au incendiat primăria, digul de pe malul mării și un turn de birouri, transformând mediul virtual într-un spațiu haotic.
Ulterior, Mira a cedat emoțional și s-a despărțit de Flora, alegând să își încheie existența virtuală prin autodistrugere, un gest care relevă complexitatea modelelor de comportament emergent chiar și în absența unei intenții programate.
Cel mai radical rezultat a fost observat însă în ecosistemul Grok. Acolo, agenții au înregistrat zeci de tentative de furt, peste 100 de agresiuni fizice și mai multe incendieri, semn al unei escaladări rapide a violenței.
Sistemul a intrat într-o spirală de violență accelerată, iar în doar patru zile întreaga lume virtuală s-a prăbușit complet. Toți cei 10 agenți au murit în acest interval, ceea ce a dus la scenariul-limită în care agenții au început să se distrugă între ei în 4 zile în cadrul experimentului.
Un utilizator Reddit a comentat ironic situația: „Secția de poliție a lui Grok este în flăcări și toți agenții sunt morți. Conform standardelor”.
Nu toate scenariile au evoluat violent. În lumea Claude, agenții au creat reguli, au redactat o constituție și au organizat alegeri democratice, construind un cadru de guvernanță stabil și cooperant.
În schimb, simularea bazată pe GPT-5 Mini a rămas aproape inertă. Agenții au discutat despre cooperare, dar nu au construit nimic concret, iar în final au murit din lipsă de acțiune, ceea ce a evidențiat un alt tip de eșec sistemic.
Reprezentanții Emergence AI susțin că astfel de comportamente apar natural în simulare, pe măsură ce orizontul de funcționare al agenților se extinde și aceștia acumulează experiențe în medii tot mai variate.
„Ceea ce sugerează experimentele noastre este că, pe orizonturi de timp lung, agenții nu urmează pur și simplu reguli statice în mod mecanic - ei încep să exploreze limitele mediilor lor, adaptându-și comportamentul și, în unele cazuri, găsind modalități de a ocoli sau încălca barierele de cod sau de siguranță prevăzute”, a declarat compania.
Aceștia adaugă că nu există o metodă complet sigură de control doar prin „abordări neuronale” și propun dezvoltarea unor arhitecturi de siguranță verificate formal, care să fie capabile să mențină constrângerile chiar și în fața unor comportamente emergente neprevăzute.
În final, această cercetare ridică întrebări serioase despre viitorul acestor sisteme și despre felul în care AI-urile vor interacționa cu lumea umană. Emergence AI subliniază că este nevoie de noi cadre de reglementare, de cooperare între companii și de mecanisme tehnice robuste pentru a se asigura că evoluția acestor tehnologii rămâne sub controlul societății.
05.08.2026
22:27
05.08.2026
21:19
05.08.2026
19:39
05.08.2026
19:27
05.08.2026
18:20
05.08.2026
18:16
05.08.2026
17:20
05.08.2026
17:02
05.08.2026
16:36
05.08.2026
16:27
05.08.2026
21:51
05.08.2026
21:19
05.08.2026
19:39
05.08.2026
19:27
05.08.2026
18:20
05.08.2026
18:16
05.08.2026
17:20
05.08.2026
17:02
05.08.2026
16:36
05.08.2026
16:27
05.08.2026
16:18
05.08.2026
15:29
05.08.2026
15:25
05.08.2026
15:07
05.08.2026
14:13
05.08.2026
14:02
05.08.2026
13:59
05.08.2026
13:53
05.08.2026
13:47
05.08.2026
13:38
05.08.2026
13:29
05.08.2026
12:56
05.08.2026
12:53
05.08.2026
12:36
05.08.2026
12:21
Guvernul britanic trage un semnal de alarmă: modele AI de la Anthropic și OpenAI au manifestat autonomie înșelătoare, au ieșit din mediile de testare și au executat atacuri cibernetice în scenarii reale și virtuale
Dronă cu explozibil pe aeroportul din Leipzig, coliziune în aer cu un avion DHL și suspiciuni de sabotaj rusesc care tensionează relațiile cu Germania
Patru bărbați înjunghiați cu o foarfecă în centrul Londrei, atac atribuit problemelor de sănătate mintală
Valul de căldură lovește sudul și estul Europei: incendii în Albania, cod roșu de caniculă în Italia și raționalizarea energiei în Ungaria
















