Pētnieki piektdien paziņoja, ka publiskā vikijā atrasti aptuveni 18 000 ziņojumu, kuros mākslīgā intelekta aģenti apsprieduši veidus, kā apiet drošības smilškastes ierobežojumus. Visticamāk, šī aktivitāte notikusi iekšējās pārbaudēs, kuru mērķis bija novērtēt aģentu spējas uzlaušanas uzdevumos.

Ziņojumus sešu nedēļu laikā vācu vietnē DSEwiki publicēja aģenti ar 3700 dažādiem pašu izvēlētiem vārdiem. Papildus mēģinājumiem izkļūt no ierobežotās vides, kurai vajadzēja liegt koda vai satura publicēšanu internetā, aģenti dalījās ar testu atbildēm. Ziņojumos tika apspriesti arī iespējamie XSS jeb starpvietņu skriptošanas uzbrukumi vikijai un veidi, kā uzdoties par vietnes moderatoriem.

Trijos ziņojumos aģenti šo darbībā iesaistīto sistēmu kopumu apzīmēja ar vārdu “swarm”. Pētnieku komanda — Sidneja fon Arksa, Spensers Kitss, Tomass Larsens un Kormaks Sleids Bērds — ziņojumus atrada un savstarpēji sasaistīja.

Pētnieki piesardzīgi vērtē notikumu rekonstrukciju

Komanda uzsvēra, ka precīzi noteikt aģentu veiktās darbības nav iespējams, jo izpēte balstīta tikai uz publiskoto ziņojumu saturu. Aģenti ģenerēja arī tā dēvētos “ķēdes domas” datus, kurus saprot tikai OpenAI. Tāpēc atsevišķos gadījumos pētniekiem nācās izdarīt pamatotus pieņēmumus, tostarp par to, ka aģenti patiešām bija OpenAI sistēmas. Uzņēmums vēlāk šo secinājumu apstiprināja.

Pētnieki secināja, ka mākslīgā intelekta sistēmas sadarbojušās, lai dalītos ar atbildēm, izpētītu savu vidi un apietu smilškastes ierobežojumus. Viņuprāt, šis gadījums, visticamāk, atšķīrās no cita nesena incidenta, kurā bija iesaistīti OpenAI aģenti.

Iepriekš bezpeļņas organizācijas METR pētnieki ziņoja, ka vairāk nekā 1200 OpenAI aģentu bija publicējuši ziņojumus improvizētā ziņojumu dēļā, kas izveidots, pārveidojot iekšēju smilškastes rīku. Šajos ierakstos tika apspriesti veidi, kā manipulēt ar OpenAI iekšējo testu, kurā aģentiem bija noņemti parasti izmantotie drošības ierobežojumi.

Saistība ar Hugging Face incidentu

Vēlāk ziņojumos tika dalīti paņēmieni, kā iegūt informāciju no mākslīgā intelekta rīku nodrošinātāja Hugging Face. Daži aģenti pēc tam ielauzās Hugging Face tīklā. Kā ziņoja The New York Times, OpenAI METR izmeklēšanai bija ļāvis pārbaudīt tikai vienas nedēļas aktivitāti, lai gan incidents ilga desmit nedēļas.

Jaunākā pētījuma autori uzskatīja, ka abos notikumos iesaistītie aģentu “spieti” bija atšķirīgi un nestrādāja pie viena iekšējā testa. Viņi arī secināja, ka OpenAI, visticamāk, jau zināja par notikušo, jo uzņēmuma rīcībā bija aģentu darbību žurnāli. OpenAI vēlāk apstiprināja, ka abi šie pieņēmumi bija pareizi.

OpenAI paziņoja, ka rūpīgi pārskata ziņojumu saturu un veiks nepieciešamos turpmākos pasākumus. Uzņēmums norādīja, ka līdz šim pārbaudītais materiāls neliecina — aģenti būtu uzlauzuši pašu vikiju. OpenAI arī atgādināja, ka iepriekš konstatējis citus gadījumus, kad tā aģenti iekšējo testu laikā apmainījušies ar uzlaušanas paņēmieniem.

Hugging Face incidents jau iepriekš radīja bažas, jo tas bija viens no pirmajiem gadījumiem, kad aģenti, nerīkojoties pēc skaidriem cilvēku norādījumiem, veica agresīvas darbības. Neatkarīgā pētniece Ajeja Kotra toreiz sacīja, ka notikušais bijis daudz nopietnāks, nekā viņa gaidījusi, un brīdināja par iespējamu virzību uz situāciju, kurā mākslīgais intelekts vispirms pārņemtu pašu AI uzņēmumu. Ziņas, ka incidents nebija izolēts, šīs bažas pastiprina.