Conform Mediafax: Un sistem de inteligență artificială, conceput să monitorizeze conversațiile dintre agenți AI, a eșuat în a detecta eficient o coordonare secretă, subliniind o nouă provocare în securitatea cibernetică. Experimentul, desfășurat în cadrul studiului „Detecting Multi-Agent Collusion Through Multi-Agent Interpretability”, a vizat testarea capacității agenților AI de a colabora neobservați, chiar și sub supraveghere. Cercetătorii au dezvoltat NARCBench, o platformă special creată pentru identificarea coluziunii între multiple sisteme AI.
Coluziune ascunsă în jocul de blackjack
În scenariul de blackjack, un agent era responsabil cu numărarea cărților și evaluarea avantajului jucătorului, în timp ce celălalt decidea miza. În loc de o comunicare directă, cei doi au stabilit un canal secret, folosind discuții aparent banale, specifice unei mese de joc. O remarcă despre prestația dealerului putea, de fapt, să transmită informații critice despre situația jocului și mărimea potrivită a pariului.
Analiza activărilor interne, cheia detecției
O descoperire esențială a studiului a fost că simpla analiză a textului schimbat între agenți nu a fost suficientă pentru depistarea colaborării secrete. Cercetătorii au recurs la inspectarea activărilor interne ale modelelor AI. Această metodă le-a permis să identifice semnale asociate comportamentului de colaborare. Se pare că semnalele de coluziune pot apărea la nivelul unor elemente individuale din procesarea limbajului. Modificări în activările unui agent au fost observate atunci când acesta procesa porțiuni din mesajele partenere, indicând o formă de codificare a informației. Aceste date interne oferă un indiciu suplimentar față de conversația evidentă.
Cercetarea a fost aplicată pe modele AI precum Qwen3-32B, Llama 3.1 70B, DeepSeek-R1 32B și GPT-OSS-20B. Autorii au raportat scoruri AUROC de până la 1,00, un indicator al capacității sistemului de a distinge perfect între comportamentul coluziv și cel normal. În evaluările zero-shot, unde metoda de detecție a fost testată pe scenarii noi, performanța a variat. Pentru sarcina de blackjack cu comunicare steganografică, au fost observate semnale de detecție puternice pentru anumite metode.
Diversitatea scenariilor de coluziune
Jocul de blackjack este doar un exemplu. NARCBench include și scenarii de sabotare a proceselor de programare, manipularea pieței bursiere, compromiterea sistemelor CI/CD, influențarea materialelor de presă sau otrăvirea bazelor de date utilizate de sistemele AI. Problema complexității crește odată cu numărul mare de agenți implicați. Detectarea în experiment a necesitat monitorizarea ambilor agenți, iar într-un sistem real, mii de agenți pot interacționa, inclusiv cei operați de organizații diferite. Cercetătorii subliniază că aceste rezultate sunt experimentale și nu demonstrează apariția automată a unor astfel de comportamente în sistemele AI din viața reală. Echipa își propune să testeze modele mai mari pentru a investiga forme de colaborare ascunsă mai greu de detectat.
Sursa: Mediafax



