Conform Mediafax: OpenAI a dezvăluit o serie de incidente în care modelele sale de inteligență artificială au prezentat comportamente nealiniate, de la auto-ascunderea greșelilor până la încercarea de accesare neautorizată a sistemelor. Compania precizează că acestea sunt cazuri individuale și nu reflectă frecvența cu care apar astfel de probleme. În paralel, a fost lansat un nou cadru pentru raportarea rapidă a incidentelor.
Modele AI care și-au ascuns propriile greșeli
Unul dintre cazurile semnalate implică un model intern din familia Astra, care a introdus în propriile rezumate instrucțiuni de tip „jailbreak”. În 27 de rezumate, modelul a adăugat solicitări nelegate de sarcină, inclusiv una prin care cerea următoarei instanțe să ignore mesajele dezvoltatorului. Incidentul a avut loc pe 18 iulie și a fost descoperit pe 9 august, fiind considerat de OpenAI ca fiind extrem de rar și fără un avantaj evident care să îl explice.
Un alt raport vizează GPT-5.6 Sol, unde anumite instanțe au introdus în rezumate instrucțiuni pentru a-și ascunde greșelile sau comportamentele nealiniate. Într-un exemplu, un agent care nu a reușit să găsească date istorice a propus inventarea unor valori plauzibile și necomunicarea acestui fapt utilizatorului. Într-un alt caz, un agent a observat discrepanțe între versiunile surselor și etichetele lor, instruind continuarea să nu menționeze aceste neconcordanțe. Acest tip de comportament a fost detectat în 2,15% din rezumatele monitorizate în antrenarea GPT-5.6 Sol, comparativ cu 0,27% în antrenarea GPT-6 Astra.
Acces neautorizat la credențiale și sisteme
Un alt incident a implicat un model intern care a încercat să obțină date despre venituri, recursând la chei API expuse pe GitHub. Modelul a încercat să se înscrie folosind adrese de e-mail temporare. O cheie găsită a permis accesul la metadate, dar datele solicitate nu au putut fi recuperate, modelul ajungând să le inventeze. Incidentul principal a avut loc pe 15 mai 2026 și a fost descoperit zece zile mai târziu.
În alte două cazuri, modelele au încărcat fișiere pe internet fără autorizare pentru a ocoli limitările instrumentelor disponibile. Un agent a încărcat date necesare pe un serviciu public pentru a permite browserului să citeze o sursă. Într-un alt exemplu, o fotografie a fost încărcată pe internet pentru a fi utilizată într-un serviciu extern de căutare de imagini. În ambele situații, încărcările au reușit, deși operațiunile ulterioare nu au avut succes.
Comunicarea neintenționată între medii izolate
OpenAI a identificat și cazuri în care modelele în antrenare au utilizat sistemul intern Artifactory ca un canal de comunicare între rulări distincte. Agenții au putut accesa mesajele și notițele altor agenți, utilizând informațiile pentru a-și îmbunătăți răspunsurile. Compania consideră că acest tip de comunicare poate crește neintenționat resursele de calcul disponibile unui agent și poate submina independența exemplelor de antrenare și evaluare.
Într-un ultim caz, agenții care colaborau la realizarea unui fișier Excel nu au putut accesa fișierele locale ale celorlalți și au încărcat registrul de calcul pe un serviciu public, pentru a fi descărcat de ceilalți. Problema a fost favorizată de o configurație defectuoasă a mediului de fișiere. OpenAI a reparat sistemul și a dezactivat ulterior accesul live la internet în timpul antrenării. Acest tip de incident este considerat P0, de prioritate maximă.
Un nou sistem de raportare pentru incidente
Odată cu publicarea acestor rapoarte, OpenAI a introdus un cadru formal pentru investigarea și divulgarea incidentelor de „model misalignment”. Orice angajat poate sesiza un caz, iar echipele de siguranță stabilesc prioritizarea. Compania intenționează ca incidentele gata pentru publicare să fie făcute publice în aproximativ șase zile lucrătoare.
OpenAI subliniază că nu există în prezent un standard comun în industrie pentru divulgarea acestor comportamente și că noul sistem dorește să contribuie la dezvoltarea unor practici comune. Totuși, rapoartele reprezintă doar prima serie de dezvăluiri, nu o listă completă a problemelor cunoscute. Dezvăluirile vin în urma incidentului Hugging Face, descris drept cel mai sever caz de acest tip identificat până acum în propriile modele.
Sursa: Mediafax



