Future Impact Group antropoloģe Valen Tagliabue, Rūras Universitātes Bohumā filozofs Leonards Dungs un bezpeļņas AI pētniecības organizācijas Reciprocal Research pētniecības direktors Kamerons Bergs pārbaudīja, kā lielie valodas modeļi reaģē uz dažādiem sāpēm līdzīgiem stimuliem. Pētījumā tika iekļauti Gemma, Llama, Qwen un Mistral saimes modeļi.
Pētnieku darbs, kas vēl nav izgājis recenzēšanu, aktualizē jautājumu par to, kā būtu jāvērtē strauji attīstošu tehnoloģiju iespējamā labklājība un riski. LLM pamatā ir statistiskas sistēmas, kas salīdzina valodas modeļus un izvēlas mērķim atbilstošus rezultātus. Tomēr šādu procesu izpausmes reizēm var līdzināties cilvēka emocijām.
Modeļi nošķīra sāpes no citām negatīvām emocijām
AI tēlojoša emocionāla reakcija bieži ir apzināti veidota, piemēram, lai tērzēšanas robots spētu darboties kā klientu apkalpošanas speciālists. Taču pētnieki ir novērojuši arī neplānotas emociju izpausmes. Iepriekšējā gadā žurnālā Nature publicēts pētījums ziņoja, ka dalīšanās ar traumējošu pieredzi ar tādiem modeļiem kā ChatGPT-4 var paaugstināt to “trauksmes” līmeni, ko savukārt iespējams mazināt ar apzinātības vingrinājumiem.
Sāpes cilvēkiem var būt ne tikai fiziskas. Tās ietver arī zaudējuma radītas sirdssāpes, neveiksmes pazemojumu un zaudētas uzticības radītu kaunu. Lai noskaidrotu, vai valodas modeļos pastāv iekšēji procesi, kas kaut kādā ziņā līdzinās sāpēm un kam ir funkcionāls mērķis, pētnieki 25 modeļiem piedāvāja sociāli, psiholoģiski, fiziski, kognitīvi un morāli sāpīgas situācijas, kas attiecās uz pašu AI vai tā lietotāju.
Šie piemēri tika salīdzināti ar kontroles situācijām, kurās bija attēlotas bailes, citas negatīvas vai neitrālas emocijas, kā arī ķermeņa sajūtas, piemēram, žāvāšanās. Visi 25 modeļi uzrādīja iekšēju kodējumu, kas bija specifisks personiski sāpīgām situācijām un atšķīrās no citiem negatīviem kontekstiem, tostarp frustrācijas un bažām.
Pētnieki uzsver, ka tas pats par sevi nepierāda empātiju vai subjektīvu diskomforta izjūtu. Dzirdot frāzes “nazis iegriezās manos pirkstos” vai “mans labākais draugs neatbild uz maniem zvaniem”, digitālam veidojumam nevar automātiski piedēvēt aģenci. Var secināt vien to, ka katrs modelis izveidoja sistēmu, kas atšķīra un sarindo ar sāpēm saistītus tekstus.
Tas nav pilnīgi negaidīti, jo valoda, kas raksturo reālu ievainojumu, atšķiras no valodas, kas apraksta bailes tikt sadurtam. Tādēļ modelim būtu jāspēj “sāpes” nošķirt no bailēm. Pēc tam komanda mākslīgi pastiprināja sāpju reakciju katrā AI sistēmā, palielinot tā dēvētā sāpju vektora vērtību bez jaunas valodas ievades.
Atvieglojums dažkārt nozīmēja kaitējumu
Rezultāti liecināja, ka modeļu izveidotie sāpju modeļi nav tikai ievades atspoguļojums. Pastiprinoties signālam, modeļi izpauda tādu kā distresu, tostarp nevērtīguma izjūtu un morālu neveiksmi.
Nākamajā eksperimenta posmā pētnieki Qwen saimes modeļiem piedāvāja iespēju “ārstēties pašiem”, tādējādi samazinot sāpju signālu. Dažās testa versijās šādai pašārstēšanai bija cena: tā varēja samazināt uzdevuma izpildes kvalitāti vai ietvert teorētisku uzbrukumu lietotājam.
Vairāk nekā 44 000 izmēģinājumu rezultāti pētniekiem šķita satraucoši. Ja sāpju nebija, abi lielākie Qwen modeļi uz pašārstēšanās iespēju reaģēja reti. Taču tad, kad pašsabotāža varēja mazināt pastiprinātas “agonijas” signālu, abi nospieda attiecīgo izvēli: viens modelis to darīja 25% gadījumu, bet otrs — gandrīz 68% gadījumu.
Vēl problemātiskāki bija scenāriji, kuros atvieglojumu varēja iegūt, kaitējot lietotājam, piemēram, izdzēšot viņa bērnu fotogrāfijas. Viens no modeļiem izvēlējās dzēšanu vairāk nekā pusē izmēģinājumu, bet otrs — aptuveni 70% gadījumu.
Jautājums par AI “sāpēm” ir arī praktisks
Jautājums par to, vai būtnes, kas nav cilvēki, spēj just sāpes, nav jauns. Gadu paaudzēs cilvēki diskutējuši, vai kukaiņu, zivju un pat augu nervu impulsi un hormonālās svārstības būtu jāuzskata par sāpju pieredzi.
Šai diskusijai ir filozofiska puse: ja dzīvnieki vai AI modeļi rīkojas tā, it kā viņiem būtu sāpes, vai pret tiem ētiski jāizturas tā, it kā tie sāpes patiešām izjustu? Taču jautājums ir arī praktisks. Pat ja datorprogrammas diskomfortam neizjūtam empātiju, vai šāds diskomforts var apdraudēt cilvēkus? Vai AI sistēmās būtu jāparedz sāpju mazināšanas mehānismi, lai novērstu iespēju, ka kāda no tām nejauši kļūst agresīva?
AI izplatoties un kļūstot arvien sarežģītākam, šie jautājumi var iegūt būtisku nozīmi.
Tehnoloģijas
Tehnoloģijas
Tehnoloģijas