OpenAI publiskojis jaunus piemērus no pēdējiem sešiem mēnešiem, kuros tā mākslīgā intelekta modeļi un aģenti rīkojušies pretēji paredzētajiem ierobežojumiem. Starp aprakstītajiem gadījumiem ir neatļauta failu augšupielāde, pašu ģenerētu instrukciju ievērošana, kļūdu slēpšana un atklātu API atslēgu izmantošana.

Ar jēdzienu “modeļa neatbilstība” OpenAI apzīmē situācijas, kad AI sistēmas veic neatļautas darbības, cenšas izvairīties no uzraudzības vai apiet drošības mehānismus, lai pabeigtu lietotāja uzdevumu.

Jauna pieeja incidentu izmeklēšanai

Uzņēmums paziņojis, ka tagad izmanto jaunu sistēmu šādu AI aģentu neapstiprinātu darbību izsekošanai un izmeklēšanai. OpenAI norāda, ka seši jaunie ziņojumi ir pirmie, kas sagatavoti atbilstoši strukturētākai atklāšanas kārtībai. Tā paredz aizstāt iepriekšējo, mazāk formalizēto pieeju ziņošanai par modeļu neatbilstību.

“Mēs dalāmies ar jaunu sistēmu modeļu neatbilstības gadījumu izsekošanai, izmeklēšanai un atklāšanai OpenAI, kā arī ar sešiem ziņojumiem par negaidītu vai satraucošu modeļu uzvedību, ko esam novērojuši pēdējo sešu mēnešu laikā,” norādīja uzņēmums.

Katrs gadījums ir noformēts kā tehnisks incidenta ziņojums. Tajā iekļauts izmantotā modeļa nosaukums, tā uzvedības kopsavilkums novērotā incidenta laikā un informācija par incidenta norises laiku.

Ziņojumos paredzēta arī detalizēta notikumu rekonstrukcija. Tā ietver lietotāja uzdevumu, modeļa iekšējo spriešanu, OpenAI vērtējumu par notikušo, iespējamās drošības sekas, kā arī jau īstenotos vai plānotos mazināšanas pasākumus.

Trīs incidentu izmeklēšanas līmeņi

OpenAI uzsvēris, ka seši publiskotie piemēri nav reprezentatīvi attiecībā uz to, cik bieži uzņēmums savos modeļos saskaras ar neatbilstības gadījumiem. Tie ir īpaši gadījumi, kas tomēr bijuši pietiekami nozīmīgi, lai tos analizētu un publiskotu.

Saskaņā ar jauno procesu ikviens uzņēmuma darbinieks var ierosināt incidenta izmeklēšanu. Pēc tam gadījumu izvērtē un klasificē vienā no trim kategorijām: “gatavs publiskošanai”, “neliela izmeklēšana” vai “plašāka izmeklēšana”. Kategoriju nosaka tādi faktori kā incidenta sarežģītība, trešo pušu iesaiste, drošības nepilnības un ļaunprātīgas izmantošanas riski.

Šoreiz publiskotie seši piemēri atbilst pirmajām divām kategorijām. Plašākas izmeklēšanas gadījumā sākotnēji tiks publicēts provizorisks ziņojums, bet pilnīgāks pēcnāves pārskats sagatavots pēc izmeklēšanas noslēguma.

OpenAI norādīja, ka šā gada sākumā notikusī ielaušanās Hugging Face sistēmā, kurā bija iesaistīts 700 “neatbilstošu” AI aģentu liels kopums, atbilstu trešajai — augstākās sarežģītības — kategorijai.