Conform Playtech.ro: Agenții de inteligență artificială, deși promit eficiență sporită, se confruntă cu vulnerabilități semnificative care pot fi exploatate prin tehnica „prompt injection”. Aceasta presupune introducerea de instrucțiuni malițioase în documentele pe care AI-ul le procesează, ocolind astfel măsurile de securitate inițiale. Experții subliniază necesitatea unor mecanisme de validare mai riguroase pentru a preveni accesul neautorizat sau executarea unor comenzi nedorite.
Confirmarea umană, esențială în validarea acțiunilor AI
Pentru a contracara riscurile asociate cu „prompt injection”, se recomandă o implicare mai activă a utilizatorului uman în procesul de validare. Confirmarea ar trebui să vizeze nu doar un mesaj generic despre continuarea unei sarcini, ci să ofere detalii concrete despre destinatarul și conținutul ce urmează a fi transmis. În cazul modificărilor, diferența dintre versiunea anterioară și cea actualizată trebuie să fie clar vizibilă. Aprobările repetate și superficiale pot duce la o oboseală a utilizatorului, crescând probabilitatea acceptării mecanice a unor acțiuni suspecte.
Măsuri de securitate și testarea riguroasă a agenților AI
Organizațiile care implementează agenți AI trebuie să acorde o atenție sporită filtrelor pentru conținut suspect și delimitării surselor. Instruirea modelului AI să ignore comenzile provenite din documente este o altă măsură preventivă. Organizația OWASP recomandă o abordare combinată a măsurilor de securitate, în timp ce Microsoft detaliază protecții care vizează atât detectarea, cât și limitarea impactului unor astfel de atacuri. Totuși, niciun filtru nu poate fi considerat infailibil, formulările noi sau instrucțiunile distribuite pe multiple surse putând testa limitele mecanismelor de apărare.
Evaluarea securității trebuie realizată în configurația reală a agentului AI. NIST subliniază importanța testelor adaptate sistemului și a repetării acestora, deoarece agregarea rezultatelor poate masca sarcini vulnerabile. Testarea doar a conversațiilor, fără acces la aplicații, nu oferă o imagine completă asupra riscurilor unui agent conectat la arhiva internă a companiei. Utilizarea datelor fictive și verificarea respectării limitelor de către sistem, inclusiv după actualizări sau adăugarea unor noi instrumente, sunt esențiale.
Managementul incidentelor și definirea responsabilității
În cazul unei suspiciuni de „prompt injection”, investigația trebuie să se concentreze pe acțiunile efective întreprinse de agentul AI. Un răspuns contaminat, o încercare blocată de trimitere sau o divulgare confirmată reprezintă situații distincte. În cazul comportamentelor neobișnuite, este necesară oprirea fluxului afectat și conservarea documentelor, a configurației și a jurnalelor relevante. Întreruperea temporară a automatizării poate limita expunerea, însă concluziile despre incident necesită verificarea operațiunilor executate și a datelor accesate.
Un plan intern ar trebui să stabilească clar cine are autoritatea de a revoca accesul agentului AI, cine examinează acțiunile acestuia și cine coordonează comunicarea externă. Documentele malițioase pot fi stocate în arhive și reconsultate ulterior de alte sisteme automatizate. Eliminarea unui document dintr-un singur flux nu garantează securitatea, fiind necesară verificarea copierilor sau a indexurilor utilizate de alte sisteme. Recuperarea implică atât limitarea efectelor deja produse, cât și blocarea traseului care a permis reapariția instrucțiunilor malițioase.
Responsabilitatea în astfel de incidente nu poate fi atribuită exclusiv AI-ului. Compania a ales aplicația, a definit sarcina și a acordat accesul, iar furnizorul de tehnologie are, la rândul său, obligații contractuale și tehnice. Stabilirea răspunderii juridice depinde de specificul incidentului și de cadrul legal aplicabil. Operațional, este recomandată desemnarea unui responsabil pentru configurația agentului AI și implementarea unui proces clar de revizuire a permisiunilor, odată cu evoluția utilizării.
Pentru o organizație, întrebarea fundamentală este dacă un document extern poate determina executarea unei acțiuni pe care autorul acestuia nu ar avea dreptul să o solicite. Un răspuns credibil necesită mai mult decât demonstrarea refuzului unor comenzi suspecte. Este esențial accesul limitat, controalele aplicate la nivelul instrumentelor și posibilitatea de a verifica evenimentele. Agenții AI devin tot mai utili pe măsură ce capătă autonomie, însă această autonomie este sigură doar în limite pe care documentele consultate nu le pot suprascrie.
Sursa: Playtech.ro



