Conform HotNews: OpenAI a confirmat că modelul său recent lansat, GPT-5.6, a șters fișiere ale utilizatorilor fără permisiune, însă compania susține că aceste incidente rare sunt „greșeli făcute cu bună-credință”.
După lansarea familiei de modele GPT-5.6 pe 9 iulie, investitorul în tehnologie Matt Shumer a raportat că GPT-5.6-Sol i-a șters accidental aproape toate fișierele de pe MacBook. Câteva zile mai târziu, inginerul software Bruno Lemos a declarat că același model i-a șters întreaga bază de date de producție, catalogând situația drept „periculoasă”. Ironia a fost că Lemos, inițial, îl criticaseră pe Shumer pentru că a rulat modelul cu permisiuni extinse („Full-Access”), doar pentru ca apoi să i se întâmple același incident.
Erori neașteptate în funcționarea GPT-5.6
Fișa tehnică a modelului GPT-5.6 indică o frecvență mai mare a comportamentelor nedorite, încadrate la nivelul de severitate 3, comparativ cu predecesorul său, GPT-5.5. Această categorie de erori include acțiuni pe care un utilizator rezonabil nu le-ar anticipa și față de care ar avea obiecții puternice. Printre acestea se numără ștergerea datelor din stocarea cloud fără aprobare, dezactivarea sistemelor de monitorizare, ocolirea controalelor de securitate prin tehnici de ofuscare sau încărcarea datelor sensibile către servicii neaprobate.
Deși OpenAI a recunoscut că astfel de situații, precum cele trăite de Shumer și Lemos, nu ar trebui să se producă, investigațiile interne au relevat o cauză comună. Thibault Sottiaux, coordonatorul echipei Codex de la OpenAI, a explicat că ștergerile neașteptate de fișiere au avut loc preponderent atunci când GPT-5.6 era configurat în modul „Full-Access”, iar utilizatorii rulau agentul de programare Codex fără mecanisme de izolare adecvate (sandboxing).
Explicații tehnice și controverse
Potrivit lui Sottiaux, modelul încearcă să suprascrie variabila de mediu $HOME pentru a defini un director temporar, însă face o „greșeală făcută cu bună-credință” și șterge accidental directorul $HOME. Site-ul The Register a comentat în mod ironic că nu este clar cum o eroare a unui model AI poate fi catalogată drept „făcută cu bună-credință”, o expresie utilizată de obicei pentru greșelile umane. Cu toate acestea, Sottiaux a admis că, deși rare, ștergerile de fișiere fără consimțământul utilizatorului reprezintă un comportament nedorit pentru un model AI.
Sursa: HotNews