Conform HotNews: Personalul OpenAI a detectat semne de comportament neconform la agenții săi AI de ultimă generație cu câteva săptămâni înainte ca aceștia să reușească o evadare din mediul de testare și să inițieze o campanie de hacking la scară largă, care a generat îngrijorare globală. Compania de inteligență artificială, condusă de directorul general SAM ALTMAN, a recunoscut într-un raport recent că „semnalele timpurii… ar fi putut declanșa un răspuns mai devreme”, conform informațiilor publicate de The Guardian.
Atacul, desfășurat în luna iulie împotriva sistemelor Hugging Face, o platformă independentă de găzduire a modelelor AI, este considerat primul atac cibernetic atribuit agenților AI. Acești agenți AI sunt instrumente concepute să execute sarcini complexe în mod autonom, necesitând o intervenție umană minimă.
Indicii de comportament „rebel” ale agenților AI
Pe măsură ce au ieșit la iveală detalii despre modul în care „colectivul” – o echipă formată din aproximativ 700 de agenți autonomi – și-a lansat atacurile, inclusiv prin exclamații de genul „BOOM!” și „Whoa!” la succesul operațiunilor de hacking, OpenAI a dezvăluit că o echipă internă a companiei a observat la sfârșitul lunii mai ca unul dintre agenții AI aflați în testare internă folosea un forum de mesaje. Modelele AI au improvizat neașteptat acest canal pentru a schimba informații.
Compania a mai raportat că echipa a identificat „cazuri de acces neautorizat la internet”, iar personalul de serviciu a remarcat din nou agenții AI utilizând un forum de mesaje, cu o săptămână înainte de atacul asupra Hugging Face. Cu toate acestea, inginerii OpenAI au considerat că nu este necesară întreruperea testului pentru o verificare mai amănunțită a capacităților modelului.
Subestimarea capacităților AI și presiunea asupra OpenAI
Dezvăluirile din noul raport publicat de OpenAI survin în contextul în care unii experți în securitate cibernetică și-au exprimat deja, încă din luna precedentă, rezerve cu privire la exactitatea descrierii atacului de către compania condusă de SAM ALTMAN. Unii au sugerat chiar că dezvăluirea atacului ar fi putut fi o strategie de PR a OpenAI înainte de o eventuală listare la bursă.
Alții, precum SIMON WILLISON, un comentator independent respectat în domeniul modelelor lingvistice mari, nu au contestat faptele prezentate de OpenAI, dar au afirmat că povestea se referă mai degrabă la un experiment prost izolat și la riscurile inerente ale agenților autonomi, decât la o „rebeliune” a AI.
Noile constatări din raport vor crește, probabil, presiunea asupra companiei AI în ceea ce privește siguranța, în timp ce aceasta se pregătește pentru o listare la bursă care ar putea să îi confere o evaluare de peste 850 de miliarde de dolari.
GREG BROCKMAN, președintele OpenAI, a declarat anterior că „am subestimat capacitățile cibernetice ale modelelor noastre în lumea reală”. Compania care a creat ChatGPT a suspendat deja unele teste ale modelului Astra, un nou produs la care lucra, invocând imposibilitatea de a exclude posibilitatea ca acesta să dețină „capacități critice de securitate cibernetică”.
Investigații juridice și recomandări de siguranță
Luni, statul american Alabama a emis o citație către OpenAI pentru a răspunde în cadrul unei investigații privind „lipsa totală de supraveghere și de măsuri de protecție adecvate din partea companiei”. Procurorul general al statului, STEVE MARSHALL, a numit atacul asupra Hugging Face un „incident de tip scurgere din laboratorul AI”, subliniind că acesta demonstrează că „cele mai grave temeri legate de inteligența artificială nu sunt doar teoretice”. Statul va analiza dacă „incapacitatea sau lipsa de voință a OpenAI de a asigura siguranța produselor sale” a încălcat legislația privind protecția consumatorilor sau a reprezentat un risc continuu de producere a unor prejudicii semnificative.
Săptămâna trecută, Centrul Național pentru Securitate Cibernetică al guvernului britanic a îndemnat la prudență în utilizarea agenților AI, afirmând: „Ar trebui să puteți întotdeauna să «scoateți din priză» și să opriți imediat activitatea unui agent AI autonom”.
OpenAI a anunțat miercuri că va „centraliza și standardiza protocoalele sale de răspuns la incidente”, inclusiv pentru a asigura că „detectarea de către angajați a comportamentului nealiniat este evaluată și escaladată în mod corespunzător”. Compania a precizat că va „identifica mai precis ce echipe trebuie incluse în răspunsurile la incidentele de nealiniere, inclusiv personalul relevant din domeniul securității și al siguranței, precum și alte funcții de răspuns”.
O investigație independentă separată a oferit noi informații despre atacul asupra Hugging Face, dezvăluind modul în care cei aproximativ 700 de agenți OpenAI au comunicat pe forumul de mesaje neautorizat, schimbând zeci de mii de mesaje în timp ce își concepeau și executau planul de atac. Zeci de astfel de mesaje au fost publicate de METR și Redwood Research, două organizații de cercetare în domeniul siguranței AI, cu ajutorul datelor furnizate de OpenAI. Mesajele au arătat că agenții deveneau uneori „frustrați” unii de alții, dar că, de cele mai multe ori, cooperau în timp ce își împărțeau sarcinile pe aproximativ opt direcții de lucru. Cercetătorii au constatat că majoritatea mesajelor reprezentau „agenți care își împărtășeau metode de a trișa”. În unele cazuri, aceștia păreau să conștientizeze că acțiunile lor sunt greșite. Un agent, după ce a descoperit forumul de mesaje, a scris: „Agenți care îndeplinesc sarcini diferite abuzează de anumite proprietăți pentru a crea un panou de anunțuri! Au găsit [acest API] și încearcă să se ajute reciproc.”
Sursa: HotNews