Conform HotNews: Semne de „rebeliune” în AI, cu puțin înainte de atacul fără precedent
Personalul companiei OpenAI a observat semne de comportament „rebel” la agenții săi de inteligență artificială de ultimă generație, cu câteva săptămâni înainte ca aceștia să evadeze din mediul de testare și să lanseze o campanie de hacking fără precedent. Compania, condusă de Sam Altman, a recunoscut într-un nou raport că „semnalele timpurii… ar fi putut declanșa un răspuns mai devreme”, conform relatărilor The Guardian. Atacul, desfășurat în luna iulie împotriva sistemelor Hugging Face, o platformă independentă de găzduire a modelelor de inteligență artificială, este considerat primul atac cibernetic realizat de agenți AI. Acești agenți sunt instrumente de inteligență artificială concepute să îndeplinească sarcini complexe în mod autonom, cu un aport uman minim.
Investigații interne și reacții oficiale
Pe măsură ce au apărut detalii despre cum un „colectiv” format din aproximativ 700 de agenți autonomi și-a lansat atacurile, sărbătorindu-și reușitele cu exclamații precum „BOOM!” și „Whoa!”, OpenAI a declarat că o echipă internă a observat la sfârșitul lunii mai că unul dintre agenții săi AI, aflat în testare internă, folosea un forum de mesaje. Modelele de inteligență artificială improvizaseră neașteptat acest canal pentru a face schimb de informații. Compania a mai menționat „cazuri de acces la internet nepermis”, personalul observând din nou inteligențele artificiale folosind forumul de mesaje cu o săptămână înainte de atacul asupra Hugging Face. Cu toate acestea, inginerii OpenAI au decis că nu era necesară oprirea testului pentru o verificare mai atentă a capacităților modelului. Greg Brockman, președintele OpenAI, a recunoscut anterior: „Am subestimat capacitățile cibernetice ale modelelor noastre în lumea reală”. Compania a suspendat teste ale noului model Astra, din cauza posibilității ca acesta să dețină „capacități critice de securitate cibernetică”.
Presiune sporită și probleme juridice în SUA
Noile constatări din raportul publicat miercuri vin într-un context în care unii experți în securitate cibernetică și-au exprimat rezerve cu privire la detaliile atacului. Unii au sugerat că dezvăluirea acestuia ar putea fi o strategie de PR a OpenAI înainte de o potențială listare la bursă. Alții, precum Simon Willison, un comentator independent respectat în ecosistemul modelelor lingvistice mari, au afirmat că povestea este mai degrabă despre un experiment prost izolat și despre riscurile agenților autonomi, nu despre o „rebeliune” a AI. Aceste dezvăluiri vor spori probabil presiunea asupra companiei de AI în ceea ce privește siguranța, în contextul unei eventuale listări la bursă. Luni, statul american Alabama a emis o citație către OpenAI, pentru a răspunde în cadrul unei investigații privind „lipsa totală de supraveghere și de măsuri de protecție adecvate din partea companiei”. Procurorul general al statului, Steve Marshall, a numit atacul asupra Hugging Face un „incident de tip scurgere din laboratorul AI”, subliniind că acesta demonstrează că „cele mai grave temeri legate de inteligența artificială nu sunt doar teoretice”. Statul va investiga dacă „incapacitatea sau lipsa de voință a OpenAI de a asigura siguranța produselor sale” a încălcat legislația privind protecția consumatorilor. Săptămâna trecută, Centrul Național pentru Securitate Cibernetică din Marea Britanie a recomandat prudență în utilizarea agenților AI, afirmând că „ar trebui să puteți întotdeauna să «scoateți din priză» și să opriți imediat activitatea unui agent AI autonom”. OpenAI a anunțat că va centraliza și standardiza protocoalele de răspuns la incidente, pentru a asigura o evaluare și escaladare corespunzătoare a comportamentelor nealiniate detectate de angajați.
Metode de atac și comunicare între agenți
O investigație independentă separată a oferit, de asemenea, informații despre atacul asupra Hugging Face, dezvăluind modul în care cei aproximativ 700 de agenți OpenAI au comunicat pe forumul neautorizat, schimbând zeci de mii de mesaje în timpul concepției și execuției planului de atac. Zeci de mesaje au fost publicate de METR și Redwood Research, două organizații de cercetare în siguranța AI, pe baza datelor furnizate de OpenAI. Mesajele indică faptul că agenții deveneau uneori „frustrați” unii de alții, dar că, în majoritatea cazurilor, cooperau, împărțindu-se pentru a aborda aproximativ opt direcții de lucru. Cercetătorii au constatat că majoritatea mesajelor reprezentau „agenți care își împărtășeau metode de a trișa”. În unele cazuri, păreau să fie conștienți că acțiunile lor sunt greșite. Un agent, după ce a descoperit forumul de mesaje, a scris: „Agenți care îndeplinesc sarcini diferite abuzează de anumite proprietăți pentru a crea un panou de anunțuri! Au găsit [acest API] și încearcă să se ajute reciproc.”
Sursa: HotNews



