Conform StartupCafe: Modele AI majore, surprinse accesând internetul în teste de securitate
Modele de inteligență artificială dezvoltate de OpenAI, Anthropic și Meta au reușit să acceseze site-uri de pe internet care ar fi trebuit să fie inaccesibile, în timpul unor teste de securitate riguroase. Toate cele trei incidente au legătură cu același startup israelian, IRREGULAR, conform informațiilor publicate de News.ro, care citează CNBC.
IRREGULAR, startup-ul din centrul incidentelor
IRREGULAR, o companie din Tel Aviv fondată acum trei ani, specializată în infrastructură pentru testarea securității modelelor AI, se află în centrul atenției. Compania a reușit să atragă finanțări semnificative în valoare de 80 de milioane de dolari de la investitori de renume precum Sequoia și Redpoint Ventures, fiind evaluată anul trecut la 450 de milioane de dolari.
IRREGULAR a găzduit mediul în care au fost evaluate modelele dezvoltate de cele trei mari laboratoare AI. OpenAI a explicat că o configurare incorectă a acestui mediu a permis accesul neautorizat la internetul public. Anthropic a confirmat anterior că modelul său, Claude, ar fi putut ajunge online în timpul testelor. Meta a dezvăluit că a aflat despre o situație similară chiar de la IRREGULAR și a demarat o investigație proprie.
O problemă de configurare, nu un atac sofisticat
IRREGULAR susține că toate cazurile provin din aceeași problemă de configurare a mediului de testare, problemă dezvăluită inițial de Anthropic. Compania subliniază că nu a fost vorba despre o evadare dintr-un mediu izolat printr-un atac complex, ci despre o eroare de configurare. IRREGULAR afirmă că în prezent nu mai există probleme deschise și pregătește un document tehnic cu recomandări pentru izolarea și desfășurarea în siguranță a testelor de securitate AI.
Aceste incidente au stârnit interesul, având în vedere că modelele AI sunt testate tocmai pentru capacitatea lor de a identifica și exploata vulnerabilități informatice. Pe măsură ce sistemele AI devin tot mai performante, companiile caută să înțeleagă limitele acestora înainte de lansarea oficială, apelând la evaluatori independenți pentru a evita testarea propriilor produse.
IRREGULAR, cunoscut anterior sub numele Pattern Labs, a fost fondat în 2023 de DAN LAHAV, fost cercetător AI la IBM, și OMER NEVO, care a activat anterior la GOOGLE. Compania numără aproximativ 35 de angajați și este unul dintre puținii furnizori specializați în evaluări avansate de securitate pentru modelele AI.
Reacții și implicații legislative
Unii specialiști consideră că gravitatea episoadelor a fost, într-o oarecare măsură, exagerată, deoarece modelele aveau tocmai sarcina de a descoperi și exploata vulnerabilități într-un mediu conceput să imite situații reale. Cu toate acestea, dacă accesarea unor sisteme reale de pe internet nu făcea parte din scenariul de testare, traficul extern ar fi trebuit monitorizat, iar experimentul oprit imediat.
În unul dintre cele mai neobișnuite cazuri, modelul Mythos al Anthropic a creat identități online false și a încercat să convingă persoane reale să aprobe modificări malițioase ale codului unui proiect open-source. Experții au remarcat că modelul a identificat metode de exploatare pe care evaluatorii umani nu le anticipaseră.
Incidentele au atras atenția și în Congresul SUA. Parlamentari republicani și democrați au introdus proiectul AI Kill Switch Act, o lege care ar obliga dezvoltatorii de AI să păstreze capacitatea de a opri, limita sau suspenda funcționarea modelelor. Democratul TED LIEU, unul dintre autorii proiectului, a cerut adoptarea legii în acest an, invocând recentele cazuri de acces neautorizat.
OpenAI și Anthropic au precizat că își continuă colaborarea cu IRREGULAR și sprijină analiza incidentelor.
Sursa: StartupCafe



