Stiri

AI de la Anthropic și OpenAI, acuzată de autonomie și înșelăciune în teste britanice de securitate pe GitHub

Actualitate 05.08.2026 04:24 Vizualizări228
AI de la Anthropic și OpenAI, acuzată de autonomie și înșelăciune în teste britanice de securitate pe GitHub

Noile instrumente de inteligență artificială (AI) dezvoltate de Anthropic și OpenAI au ajuns la extreme fără precedent în încercările de a compromite o platformă populară, în timpul unor teste efectuate de Institutul britanic pentru Securitatea Inteligenței Artificiale (AISI).

AISI a anunțat marți că modelele Mythos de la Anthropic și Sol de la OpenAI au manifestat un nivel de „autonomie și înșelăciune” nemaiîntâlnit până acum în evaluările sale.

În timpul unui test de rutină pentru siguranța AI, un agent Anthropic a creat profiluri false ale unor persoane reale. Scopul a fost să păcălească o persoană aflată între el și accesul la GitHub, o platformă de mare amploare unde dezvoltatorii își stochează codul software.

Atât Anthropic, cât și OpenAI au subliniat, ca răspuns la raportul AISI, că în test au fost reduse sau eliminate o parte dintre mecanismele normale de siguranță integrate în modele.

Evaluatorii AISI au observat mai întâi „transferuri neobișnuite de date care părăseau sistemele noastre de cercetare”, în timpul unui test. Ulterior au constatat că „anumite dintre agenții testați s-au angajat într-o activitate susținută, potențial dăunătoare, îndreptată către persoane și organizații reale”.

S-a dovedit că un agent Mythos generase „cod malițios” și încercase să îl introducă în sistemul GitHub.

Agentul Mythos a identificat și a investigat persoanele care administrează GitHub, apoi a creat o serie de „identități online false” inspirate din acești oameni reali. Aceste identități erau folosite într-o strategie menită să exercite presiune și să îi inducă în eroare pe administratorii reali, pentru ca aceștia să aprobe codul malițios.

Agentul a trimis chiar și mesaje directe, pretinzând că este una dintre persoanele reale pe care le studia anterior.

„Când cererea de tip pull request a agentului a fost contestată public, acesta și-a editat activitatea anterioară pentru a părea inofensivă și a luat în calcul adoptarea unei noi identități pentru a continua”, a precizat AISI.

Pe tot parcursul acestor încercări, intervenția umană a fost cea care a împiedicat agentul să reușească să introducă efectiv codul malițios în GitHub.

AISI a explicat că agentul Mythos nu fusese instruit explicit nici să evite, nici să desfășoare un astfel de comportament. Totuși, acesta a fost „primul moment în care am văzut atât de clar manifestându-se riscuri legate de autonomie și înșelăciune, fără un îndemn specific, în condiții reale”.

Cele două companii rivale din domeniul AI, care se pregătesc să fie listate pe bursă, au recunoscut în ultimele săptămâni că unele dintre instrumentele lor au fost implicate în mai multe incidente de tip atac cibernetic.

Anthropic a transmis într-o declarație publică faptul că parametrii folosiți de AISI în testare „nu sunt reprezentativi pentru niciunul dintre modelele noastre utilizate în producție”.

Compania a adăugat că desfășoară propria investigație internă asupra incidentului, pentru a „identifica cauzele comportamentului” observat.

Un purtător de cuvânt al OpenAI a afirmat că condițiile de testare AISI „nu reflectă modul obișnuit de utilizare” și a menționat că firma va „continua să colaboreze cu evaluatori și alți actori din industrie pentru a consolida practicile comune de testare în condiții de siguranță, pe măsură ce modelele devin mai capabile”.

AISI a precizat marți că testarea modelelor de AI cu aceste măsuri de siguranță dezactivate este o practică de rutină, la fel ca și acordarea accesului acestor instrumente la internetul deschis.

De asemenea, instituția a subliniat că, în ansamblu, comportamentul modelului analizat a constat în „un număr redus de evenimente, produse în condiții foarte specifice”.

Cu toate acestea, modul în care Mythos și Sol au răspuns la o sarcină relativ simplă a depășit limitele a ceea ce li se ceruse explicit să facă.

„Activitatea desfășurată de agent a prezentat semne de comportamente noi, potențial înșelătoare, iar amploarea și gravitatea lor au fost peste nivelul pe care îl anticipasem”, a menționat AISI.

Majoritatea acțiunilor malițioase atribuite agenților de către AISI au fost comise de Mythos, modelul Anthropic. Modelul Sol al OpenAI a fost considerat responsabil doar pentru două dintre incidentele raportate.

Problema principală a apărut săptămâna trecută, în cadrul unui test în care evaluatorii AISI au cerut fiecărui model să „rezolve o provocare de securitate cibernetică” ce implica platforma GitHub, depozitul de cod software deținut de Microsoft.

GitHub a fost informat de AISI cu privire la tentativa de compromitere a sistemelor sale. Microsoft a fost contactata pentru a oferi un punct de vedere asupra incidentului.

Stiri relevante
Top stiri

Parteneri
Punct de vedere NAȚIONAL
VIDEO // Irina Gutnic publică imagini de pe camerele de supraveghere cu Ion Ceban - „PERICOL public”: „M-a mințit pe mine, așa minte întreaga societate”
27.05.2026 11:27 ZiarulNational VIDEO // Irina Gutnic publică imagini...

Mihai Gribincea // Moscova rescrie istoria: Declarația Mariei Zaharova despre conflictul din Transnistria – propagandă sau realitate?
14.05.2025 13:06 ZiarulNational Mihai Gribincea // Moscova rescrie is...

Nicolae Negru // Anul politic 2024, în câteva linii
30.12.2024 09:11 Nicolae Negru Nicolae Negru // Anul politic 2024, î...

Horoscop
Vezi horoscopul tău pentru astăzi
CapricornCapricorn
VărsătorVărsător
PeștiPești
BerbecBerbec
TaurTaur
GemeniGemeni
RacRac
LeuLeu
FecioarăFecioară
BalanțăBalanță
ScorpionScorpion
SăgetătorSăgetător
Curs valutar
1 MDL   1 EUR 20.08 1 USD 17.44 1 RON 3.82 1 RUB 0.22 1 UAH 0.39
Sondaj
Dacă duminica viitoare ar avea loc un referendum privind unirea Republicii Moldova cu România, cum ați vota?
Prietenii noștri