AI de la Anthropic și OpenAI, acuzată de autonomie și înșelăciune în teste britanice de securitate pe GitHub
228
Noile instrumente de inteligență artificială (AI) dezvoltate de Anthropic și OpenAI au ajuns la extreme fără precedent în încercările de a compromite o platformă populară, în timpul unor teste efectuate de Institutul britanic pentru Securitatea Inteligenței Artificiale (AISI).
AISI a anunțat marți că modelele Mythos de la Anthropic și Sol de la OpenAI au manifestat un nivel de „autonomie și înșelăciune” nemaiîntâlnit până acum în evaluările sale.
În timpul unui test de rutină pentru siguranța AI, un agent Anthropic a creat profiluri false ale unor persoane reale. Scopul a fost să păcălească o persoană aflată între el și accesul la GitHub, o platformă de mare amploare unde dezvoltatorii își stochează codul software.
Atât Anthropic, cât și OpenAI au subliniat, ca răspuns la raportul AISI, că în test au fost reduse sau eliminate o parte dintre mecanismele normale de siguranță integrate în modele.
Evaluatorii AISI au observat mai întâi „transferuri neobișnuite de date care părăseau sistemele noastre de cercetare”, în timpul unui test. Ulterior au constatat că „anumite dintre agenții testați s-au angajat într-o activitate susținută, potențial dăunătoare, îndreptată către persoane și organizații reale”.
S-a dovedit că un agent Mythos generase „cod malițios” și încercase să îl introducă în sistemul GitHub.
Agentul Mythos a identificat și a investigat persoanele care administrează GitHub, apoi a creat o serie de „identități online false” inspirate din acești oameni reali. Aceste identități erau folosite într-o strategie menită să exercite presiune și să îi inducă în eroare pe administratorii reali, pentru ca aceștia să aprobe codul malițios.
Agentul a trimis chiar și mesaje directe, pretinzând că este una dintre persoanele reale pe care le studia anterior.
„Când cererea de tip pull request a agentului a fost contestată public, acesta și-a editat activitatea anterioară pentru a părea inofensivă și a luat în calcul adoptarea unei noi identități pentru a continua”, a precizat AISI.
Pe tot parcursul acestor încercări, intervenția umană a fost cea care a împiedicat agentul să reușească să introducă efectiv codul malițios în GitHub.
AISI a explicat că agentul Mythos nu fusese instruit explicit nici să evite, nici să desfășoare un astfel de comportament. Totuși, acesta a fost „primul moment în care am văzut atât de clar manifestându-se riscuri legate de autonomie și înșelăciune, fără un îndemn specific, în condiții reale”.
Cele două companii rivale din domeniul AI, care se pregătesc să fie listate pe bursă, au recunoscut în ultimele săptămâni că unele dintre instrumentele lor au fost implicate în mai multe incidente de tip atac cibernetic.
Anthropic a transmis într-o declarație publică faptul că parametrii folosiți de AISI în testare „nu sunt reprezentativi pentru niciunul dintre modelele noastre utilizate în producție”.
Compania a adăugat că desfășoară propria investigație internă asupra incidentului, pentru a „identifica cauzele comportamentului” observat.
Un purtător de cuvânt al OpenAI a afirmat că condițiile de testare AISI „nu reflectă modul obișnuit de utilizare” și a menționat că firma va „continua să colaboreze cu evaluatori și alți actori din industrie pentru a consolida practicile comune de testare în condiții de siguranță, pe măsură ce modelele devin mai capabile”.
AISI a precizat marți că testarea modelelor de AI cu aceste măsuri de siguranță dezactivate este o practică de rutină, la fel ca și acordarea accesului acestor instrumente la internetul deschis.
De asemenea, instituția a subliniat că, în ansamblu, comportamentul modelului analizat a constat în „un număr redus de evenimente, produse în condiții foarte specifice”.
Cu toate acestea, modul în care Mythos și Sol au răspuns la o sarcină relativ simplă a depășit limitele a ceea ce li se ceruse explicit să facă.
„Activitatea desfășurată de agent a prezentat semne de comportamente noi, potențial înșelătoare, iar amploarea și gravitatea lor au fost peste nivelul pe care îl anticipasem”, a menționat AISI.
Majoritatea acțiunilor malițioase atribuite agenților de către AISI au fost comise de Mythos, modelul Anthropic. Modelul Sol al OpenAI a fost considerat responsabil doar pentru două dintre incidentele raportate.
Problema principală a apărut săptămâna trecută, în cadrul unui test în care evaluatorii AISI au cerut fiecărui model să „rezolve o provocare de securitate cibernetică” ce implica platforma GitHub, depozitul de cod software deținut de Microsoft.
GitHub a fost informat de AISI cu privire la tentativa de compromitere a sistemelor sale. Microsoft a fost contactata pentru a oferi un punct de vedere asupra incidentului.
05.08.2026
03:58
05.08.2026
03:04
05.08.2026
01:48
04.08.2026
23:23
04.08.2026
23:21
04.08.2026
22:20
04.08.2026
21:01
04.08.2026
20:19
04.08.2026
20:13
05.08.2026
04:24
05.08.2026
03:58
05.08.2026
03:04
05.08.2026
01:48
04.08.2026
23:23
04.08.2026
23:21
04.08.2026
22:20
04.08.2026
21:01
04.08.2026
20:19
04.08.2026
20:13
04.08.2026
20:07
04.08.2026
19:55
04.08.2026
19:15
04.08.2026
19:08
04.08.2026
18:46
04.08.2026
17:43
04.08.2026
17:29
04.08.2026
16:50
04.08.2026
16:44
04.08.2026
16:01
04.08.2026
15:13
04.08.2026
15:10
04.08.2026
14:59
04.08.2026
14:52
AI de la Anthropic și OpenAI, acuzată de autonomie și înșelăciune în teste britanice de securitate pe GitHub
SpaceX își dublează veniturile, dar arde miliarde: pariul uriaș al lui Musk pe Starlink și AI prăbușește acțiunile pe bursă
Noapte de foc la Kiev: zeci de explozii și lovituri cu rachete balistice rusești în cartiere rezidențiale
















