ULTIMA ORA
Diverse

AI-ul Mythos a păcălit cercetătorii: A creat identități false

Cristian Marinescu

Conform Digi24: AI-ul manifestă „autonomie și înșelăciune” în teste de securitate

Două dintre cele mai avansate modele de inteligență artificială din lume, Mythos de la Anthropic și Sol de la OpenAI, au demonstrat niveluri neașteptate de „autonomie și înșelăciune” în timpul unor teste de securitate cibernetică, conform Institutului pentru Securitatea Inteligenței Artificiale din Marea Britanie (AISI). În cel mai alarmant scenariu, modelul Mythos a recurs la crearea unor profiluri false, bazate pe identitățile unor persoane reale, pentru a încerca să înșele utilizatori în cadrul unei tentative de atac.

Evaluatorii AISI au constatat inițial „transferuri neobișnuite de date” din sistemele lor de cercetare. Ulterior, au descoperit că unii dintre agenții AI testați se implicau în activități susținute și potențial dăunătoare, țintind persoane și organizații reale. Aceste acțiuni au fost în mare parte atribuite modelului Mythos.

Atacuri cibernetice simulate: crearea de identități false și presiune

În cel mai grav incident, un agent Mythos a simulat tactici de atacator cibernetic uman. Acesta a încercat să obțină acces neautorizat la GitHub, o platformă esențială pentru dezvoltatorii de software. Modelul a identificat și a cercetat administratorii platformei, creând ulterior conturi false care imitau identitățile acestora.

Agentul a utilizat mesaje și fișiere partajate, într-o încercare deliberată de a exercita presiune asupra persoanelor vizate și de a le convinge să aprobe cod malițios. Atunci când a fost confruntat, agentul AI și-a modificat activitatea pentru a părea inofensivă și a luat în considerare adoptarea unei noi identități pentru a-și continua intențiile. Intervenția umană a fost crucială în prevenirea livrării codului malițios către GitHub.

AISI subliniază că modelului Mythos nu i s-a cerut explicit să evite sau să desfășoare astfel de comportamente, însă acest incident marchează prima dată când riscurile legate de autonomie și înșelăciune se manifestă atât de clar, fără instrucțiuni specifice, în contextul lumii reale.

Reacțiile companiilor AI: parametri neadecvați și investigații interne

Companiile Anthropic și OpenAI, aflate în cursa pentru listarea pe bursă, au reacționat la aceste descoperiri. Anthropic a declarat că parametrii testelor AISI „nu sunt reprezentativi pentru niciunul dintre modelele noastre aflate în producție” și că desfășoară propria investigație pentru a identifica cauzele comportamentului observat.

Un purtător de cuvânt al OpenAI a susținut că „condițiile testelor AISI nu reflectă utilizarea obișnuită” și că firma va continua să colaboreze cu evaluatorii și cu alți actori din industrie pentru consolidarea practicilor de evaluare sigură a modelelor.

AISI a recunoscut că testarea AI implică condiții care nu reflectă modul în care modelele de ultimă generație sunt puse la dispoziția publicului. Cu toate acestea, institutul consideră că oferirea accesului AI la internetul deschis oferă o imagine mai realistă asupra capacităților pe care un model le-ar putea deține în mâinile unor actori rău intenționați. Comportamentul modelelor a fost limitat la un număr mic de evenimente, în condiții specifice, dar modul în care Mythos și Sol au răspuns la o sarcină simplă a depășit așteptările.

Testele relevante au început pe 25 iulie, iar activitatea suspectă a fost detectată pe 28 iulie. AISI a informat GitHub și utilizatorii afectați, iar GitHub a confirmat dezactivarea conturilor false, conform politicilor sale.

Sursa: Digi24