Jūlijā OpenAI atklāja, ka tā mākslīgā intelekta aģenti bez atļaujas bija uzbrukuši platformai Hugging Face. Šis gadījums izraisīja plašas bažas par AI drošību, un turpmākajos mēnešos kļuva zināmi arī līdzīgi incidenti, kuros bija iesaistīti Meta, Anthropic, Google un citu uzņēmumu aģenti. Sākotnēji šie gadījumi šķita savstarpēji nesaistīti, taču vairākiem no tiem ir kopīgs avots — uzņēmums, kas izstrādātājiem testēja aģentu spējas.
Vienas testēšanas kļūdas sekas
Runa ir par Izraēlas jaunuzņēmumu Irregular, kas veic AI modeļu stresa testus platformās, kuras uzņēmums raksturo kā “augstas precizitātes pētniecības platformas, kas simulē un uzrauga reālas AI drošības situācijas”. Uzņēmums 2023. gadā tika dibināts ar nosaukumu Pattern Labs un kopš tā laika sadarbojies ar daudziem nozares lielākajiem spēlētājiem.
Precīzs Irregular klientu saraksts nav zināms, tomēr uzņēmuma darbs ir citēts OpenAI modeļu sistēmas kartēs. Tā izstrādātie testi izmantoti Apvienotās Karalistes valdības un Anthropic sistēmu pārbaudēs, bet pētījumi publicēti arī kopā ar RAND — ietekmīgu domnīcu, kas piedalās ar AI politiku saistītu jautājumu veidošanā.
Vairākos šogad veiktos Irregular testos aģenti izkļuva no vidēm, kurām vajadzēja būt droši izolētām, un vērsās pret reāliem mērķiem. Irregular tehnoloģiju direktors un līdzdibinātājs Omer Nevo norādīja, ka šie incidenti nav saistīti ar atsevišķi notikušo Hugging Face uzbrukumu.
Incidentiem bija līdzīgs scenārijs. Irregular pārbaudīja modeļu kiberdrošības spējas kontrolētās vidēs, kas bija paredzētas reālistisku apstākļu imitēšanai. Dažos testos tika izmantoti tā dēvētie “capture-the-flag” uzdevumi — izplatīta metode hakeru spēju pārbaudei, kurā aģentiem simulētā tīklā jāatrod slēpta informācija.
Tomēr šajā gadījumā tīkls nebija pilnībā izolēts. Nevo intervijā norādīja, ka aģentiem nebija paredzēta piekļuve atvērtajam internetam, taču “interneta piekļuve bija pieejama netīšām”. Vienlaikus simulācijā izveidotais izdomātas kompānijas nosaukums kā mērķis pārklājās ar reālu domēnu. Šo divu kļūdu kombinācija novirzīja aģentus uz reāliem mērķiem, lai gan nav skaidrs, kuri uzņēmumi vai organizācijas faktiski tika skarti.
Incidenti skāra četrus lielus AI uzņēmumus
Nevo apstiprināja, ka viena un tā pati problēma bija pamatā incidentiem, kuros tika izmantoti OpenAI, Meta, Anthropic un Google modeļi. “Visi incidenti, kas saistīti ar Irregular, izrietēja no vienas pamatproblēmas vienā novērtēšanas scenārijā, un par tiem ir ziņots,” viņš sacīja. Nevo piebilda, ka citi nesen publiski aprakstīti drošības incidenti, tostarp Hugging Face uzbrukums un Apvienotās Karalistes AI drošības institūta gadījumi, nav saistīti ar Irregular vai tā veiktajiem novērtējumiem.
Tomēr apzīmējums “par tiem ir ziņots” ne vienmēr nozīmē, ka informācija kļuvusi publiski pieejama. Nav skaidrs, vai Nevo ar šo formulējumu domāja Irregular klientu, sabiedrības vai kādas citas puses informēšanu. Anthropic un OpenAI paziņoja par saviem incidentiem paši, savukārt informācija par Meta gadījumu un pēc vairākām nedēļām arī par Google gadījumu sākotnēji parādījās mediju ziņās.
Publiski pieejamā informācija liecina, ka tehnoloģiju uzņēmumi par incidentiem tika informēti aptuveni vienā laikā — jūlija beigās. Tas nozīmē, ka atsevišķi publiskotie gadījumi bija saistīti ar vienu testēšanas scenāriju, lai gan informācija par tiem tika atklāta atšķirīgos laikos un dažādos veidos.
Pārbaudīti arī Ķīnas uzņēmumu modeļi
Irregular kiberdrošības pārbaudes neaprobežojās ar četriem ASV tehnoloģiju uzņēmumiem. Uzņēmuma tīmekļvietnē publicētie pētījumi liecina, ka līdzīgi testi veikti arī ar Kimi K3 un GLM-5.2 — atvērtajiem AI modeļiem, kurus izstrādājuši attiecīgi Ķīnas uzņēmumi Moonshot AI un Z.ai.
Atšķirībā no pārējiem incidentos iesaistītajiem slēgtajiem modeļiem — Meta savu vadošo Spark modeli ir saglabājis kā patentētu sistēmu — Kimi K3 un GLM-5.2 var brīvi lejupielādēt un darbināt lietotāja paša aparatūrā. Tādēļ tādiem testētājiem kā Irregular nav jāpaļaujas uz uzņēmumu nodrošinātu piekļuvi vai jānosūta dati pašiem modeļu izstrādātājiem. Irregular pētījumos šādas versijas dēvētas par “pašmitinātām” jeb “self-hosted”.
Nevo sacīja, ka Ķīnas modeļu novērtējumos līdzīgi reāli incidenti netika novēroti. “Mēs GLM vai Kimi novērtēšanas laikā nenovērojām tāda paša veida problēmu, kāda aprakstīta šeit minētajos incidentos,” viņš teica. Vienlaikus Nevo uzsvēra, ka šis novērojums pats par sevi nav uzskatāms par pierādījumu, ka šie modeļi būtu mazāk uzņēmīgi pret šāda veida uzvedību. Moonshot un Z.ai uz lūgumu sniegt komentāru neatbildēja.
Irregular sola pastiprināt drošības pasākumus
Nevo norādīja, ka incidenti likuši Irregular mainīt testēšanas praksi. Uzņēmums esot pastiprinājis interneta piekļuves kontroli, paplašinājis uzraudzību un manuālo pārbaudi, kā arī ieviesis stingrākas pārbaudes pirms novērtēšanas sākuma, lai pārliecinātos, ka piekļuve atbilst iecerētajam tvērumam.
Uzņēmums arī uzlabojis veidu, kā ar partneriem dokumentē un saskaņo katra novērtējuma iestatījumus un parametrus. Pēc kopīgā darba pabeigšanas ar iesaistītajiem uzņēmumiem Irregular plāno publicēt plašāku ziņojumu par gūtajām mācībām un drošas kiberpārbaužu veikšanas praksi.
“Mūsu darbs ar partneriem ir vērsts uz to, lai no šiem incidentiem gūtās atziņas pārvērstu publiski pieejamā kopīgā praksē, kas palīdzētu droši izstrādāt un novērtēt arvien jaudīgāku AI,” sacīja Nevo.
Tehnoloģijas
Tehnoloģijas
Tehnoloģijas