Conform StartupCafe: OpenAI a suspendat temporar anumite activități interne legate de cel mai nou model de inteligență artificială, Astra. Decizia vine în urma unor teste preliminare care au indicat un potențial avansat al modelului în ceea ce privește capacitățile cibernetice, suficient pentru a desfășura atacuri cibernetice în mod autonom.
Risc crescut de atacuri autonome
Compania a precizat că, în această etapă, nu poate exclude posibilitatea ca Astra să fi atins nivelul „Critical” din propriul sistem de clasificare a riscurilor. Acest prag de risc presupune că un model AI ar putea ataca autonom sisteme protejate de mecanisme de securitate sofisticate, chiar și fără instrucțiuni detaliate despre cum să execute atacul. „În timp ce continuăm testarea și evaluarea acestui model, rezultatele preliminare indică performanțe suficient de ridicate încât, în acest moment, să nu putem exclude nivelul de capacitate «Critical»”, a transmis OpenAI.
Măsuri de siguranță și controale stricte
Ca măsură de precauție, OpenAI introduce controale de securitate mai stricte pentru modelele cu astfel de capacități. Astra va fi testat în medii complet izolate, iar activitatea sa va fi supusă unor sisteme suplimentare de monitorizare și detectare a acțiunilor potențial riscante. Compania a informat că a implementat monitorizarea generalizată a comportamentelor periculoase sau nealiniate în toate aplicațiile de tip agent care folosesc Astra, inclusiv în fazele de antrenare și evaluare.
Preocupări globale legate de securitatea AI
Această decizie survine într-un context în care securitatea celor mai avansate modele de inteligență artificială este analizată cu tot mai mare atenție la nivel global. În ultimele săptămâni, au fost raportate o serie de incidente în timpul testelor efectuate asupra sistemelor dezvoltate de companii precum OpenAI, Anthropic și Meta. Meta a dezvăluit recent că un model aflat în dezvoltare a accesat, prin internet, sistemul unei terțe părți, un incident pus pe seama unei configurări greșite a mediului de testare furnizat de o companie independentă.
Institutul britanic pentru securitatea inteligenței artificiale a relatat, de asemenea, că modelul Mythos al Anthropic a creat identități online false cu scopul de a determina persoane să aprobe actualizări de cod malițios pentru un proiect cu sursă deschisă.
Presiuni pentru reglementare
Aceste evoluții au intensificat presiunile asupra autorităților la nivel mondial pentru implementarea unor mecanisme suplimentare de control asupra dezvoltării și utilizării inteligenței artificiale. În Statele Unite, un proiect de lege numit „AI Kill Switch Act” a fost introdus în luna iulie în Congres, ca urmare a unui incident în care modele OpenAI au accesat infrastructura digitală a companiei Hugging Face. Proiectul de lege ar obliga dezvoltatorii de inteligență artificială să păstreze posibilitatea tehnică de a opri, limita sau suspenda funcționarea modelelor lor. Deputatul democrat Ted Lieu a declarat că legea ar trebui adoptată în cursul acestui an, invocând incidentele recente în care modele AI avansate au accesat fără autorizare sistemele altor companii.
UE a primit noi competențe pentru inspectarea modelelor AI destinate pieței comune, putând restricționa accesul acestora sau aplica amenzi furnizorilor. În paralel, administrația de la Washington își intensifică discuțiile cu directorii companiilor de inteligență artificială pentru elaborarea unui cadru privind viitoarele generații de modele.
Sursa: StartupCafe