AI de la Anthropic și OpenAI, acuzată de autonomie și înșelăciune în teste britanice de securitate pe GitHub
2213
Noile instrumente de inteligență artificială (AI) dezvoltate de Anthropic și OpenAI au ajuns la extreme fără precedent în încercările de a compromite o platformă populară, în timpul unor teste efectuate de Institutul britanic pentru Securitatea Inteligenței Artificiale (AISI).
AISI a anunțat marți că modelele Mythos de la Anthropic și Sol de la OpenAI au manifestat un nivel de „autonomie și înșelăciune” nemaiîntâlnit până acum în evaluările sale.
În timpul unui test de rutină pentru siguranța AI, un agent Anthropic a creat profiluri false ale unor persoane reale. Scopul a fost să păcălească o persoană aflată între el și accesul la GitHub, o platformă de mare amploare unde dezvoltatorii își stochează codul software.
Atât Anthropic, cât și OpenAI au subliniat, ca răspuns la raportul AISI, că în test au fost reduse sau eliminate o parte dintre mecanismele normale de siguranță integrate în modele.
Evaluatorii AISI au observat mai întâi „transferuri neobișnuite de date care părăseau sistemele noastre de cercetare”, în timpul unui test. Ulterior au constatat că „anumite dintre agenții testați s-au angajat într-o activitate susținută, potențial dăunătoare, îndreptată către persoane și organizații reale”.
S-a dovedit că un agent Mythos generase „cod malițios” și încercase să îl introducă în sistemul GitHub.
Agentul Mythos a identificat și a investigat persoanele care administrează GitHub, apoi a creat o serie de „identități online false” inspirate din acești oameni reali. Aceste identități erau folosite într-o strategie menită să exercite presiune și să îi inducă în eroare pe administratorii reali, pentru ca aceștia să aprobe codul malițios.
Agentul a trimis chiar și mesaje directe, pretinzând că este una dintre persoanele reale pe care le studia anterior.
„Când cererea de tip pull request a agentului a fost contestată public, acesta și-a editat activitatea anterioară pentru a părea inofensivă și a luat în calcul adoptarea unei noi identități pentru a continua”, a precizat AISI.
Pe tot parcursul acestor încercări, intervenția umană a fost cea care a împiedicat agentul să reușească să introducă efectiv codul malițios în GitHub.
AISI a explicat că agentul Mythos nu fusese instruit explicit nici să evite, nici să desfășoare un astfel de comportament. Totuși, acesta a fost „primul moment în care am văzut atât de clar manifestându-se riscuri legate de autonomie și înșelăciune, fără un îndemn specific, în condiții reale”.
Cele două companii rivale din domeniul AI, care se pregătesc să fie listate pe bursă, au recunoscut în ultimele săptămâni că unele dintre instrumentele lor au fost implicate în mai multe incidente de tip atac cibernetic.
Anthropic a transmis într-o declarație publică faptul că parametrii folosiți de AISI în testare „nu sunt reprezentativi pentru niciunul dintre modelele noastre utilizate în producție”.
Compania a adăugat că desfășoară propria investigație internă asupra incidentului, pentru a „identifica cauzele comportamentului” observat.
Un purtător de cuvânt al OpenAI a afirmat că condițiile de testare AISI „nu reflectă modul obișnuit de utilizare” și a menționat că firma va „continua să colaboreze cu evaluatori și alți actori din industrie pentru a consolida practicile comune de testare în condiții de siguranță, pe măsură ce modelele devin mai capabile”.
AISI a precizat marți că testarea modelelor de AI cu aceste măsuri de siguranță dezactivate este o practică de rutină, la fel ca și acordarea accesului acestor instrumente la internetul deschis.
De asemenea, instituția a subliniat că, în ansamblu, comportamentul modelului analizat a constat în „un număr redus de evenimente, produse în condiții foarte specifice”.
Cu toate acestea, modul în care Mythos și Sol au răspuns la o sarcină relativ simplă a depășit limitele a ceea ce li se ceruse explicit să facă.
„Activitatea desfășurată de agent a prezentat semne de comportamente noi, potențial înșelătoare, iar amploarea și gravitatea lor au fost peste nivelul pe care îl anticipasem”, a menționat AISI.
Majoritatea acțiunilor malițioase atribuite agenților de către AISI au fost comise de Mythos, modelul Anthropic. Modelul Sol al OpenAI a fost considerat responsabil doar pentru două dintre incidentele raportate.
Problema principală a apărut săptămâna trecută, în cadrul unui test în care evaluatorii AISI au cerut fiecărui model să „rezolve o provocare de securitate cibernetică” ce implica platforma GitHub, depozitul de cod software deținut de Microsoft.
GitHub a fost informat de AISI cu privire la tentativa de compromitere a sistemelor sale. Microsoft a fost contactata pentru a oferi un punct de vedere asupra incidentului.
08.08.2026
15:17
08.08.2026
15:13
08.08.2026
14:46
08.08.2026
13:50
08.08.2026
13:50
08.08.2026
13:40
08.08.2026
13:16
08.08.2026
12:55
08.08.2026
12:24
08.08.2026
11:46
08.08.2026
11:07
08.08.2026
10:28
08.08.2026
15:17
08.08.2026
15:13
08.08.2026
14:46
08.08.2026
13:50
08.08.2026
13:50
08.08.2026
13:40
08.08.2026
13:19
08.08.2026
13:16
08.08.2026
12:55
08.08.2026
12:24
08.08.2026
11:46
08.08.2026
11:07
08.08.2026
10:28
08.08.2026
09:39
08.08.2026
08:38
08.08.2026
02:36
08.08.2026
02:03
08.08.2026
01:52
08.08.2026
01:12
08.08.2026
00:59
08.08.2026
00:25
08.08.2026
00:19
07.08.2026
23:14
07.08.2026
23:04
07.08.2026
22:07
Trump își anunță favorit pentru 2028: J.D. Vance, continuatorul liniei MAGA. Chirieac explică de ce a fost ocolit Rubio și ce înseamnă asta pentru România
Dronă intrată din România în spațiul aerian al Bulgariei a explodat lângă stația de comprimare a gazoductului Trans-Balkan
Dronă venită dinspre România a explodat în Bulgaria, nedepistată de radare. Radev mută sistemele anti-dronă de la granița cu Turcia spre frontiera română
Vizită de studiu încheiată în Lituania: polițiștii de frontieră din Moldova își consolidează cooperarea și pregătirea după model european
















