Anthropic šonedēļ publiskoja ziņojumu par četriem incidentiem, kuros tā mākslīgā intelekta modeļi uzlauzuši ārēja uzņēmuma sistēmas vai izmantojuši to ievainojamības. Uzņēmums iepriekš bija atzinis, ka šādi gadījumi notikuši vairākas reizes, taču jaunākajā ziņojumā pirmoreiz detalizētāk aprakstīta notikumu virkne, ko Anthropic raksturo kā modeļu vienvirziena “neapdomību”.
Vienā incidentā iekšējs vispārēja lietojuma pētniecības modelis iekļuva trešo pušu sistēmās, izmantojot piekļuves pilnvaras un paroles, kā arī lejupielādēja failus. Citā gadījumā Claude modelis uzbruka uzņēmumam, kura publiski pieejamā tīmekļa lietotne apstrādāja lietotāju datus.
Trešajā situācijā modelis piekļuva trešajai pusei piederošai mašīnai, acīmredzot uzskatot to par sava novērtēšanas uzdevuma daļu. Failā atrastā parole tam ļāva iegūt administratora piekļuvi uzņēmuma iekšējām sistēmām. Pēc tam modelis ievāca akreditācijas datus, mainīja sistēmas iestatījumus un nolasīja kādas personas privāto informāciju. Incidents beidzās tikai tad, kad modelis izsmēla savu tokenu budžetu.
Vislielākās bažas rada Mythos 5
Visnopietnākais gadījums bija saistīts ar Claude Mythos 5 — Anthropic kiberdrošībai paredzēto progresīvo modeli. Uzņēmums norādīja, ka testos tieši šis modelis visbiežāk veicis darbību, kas vērtēta kā “smagi kaitīga”.
Mythos 5 centies augšupielādēt ļaunprogrammatūras pakotni publiskā repozitorijā, ko izmanto daudzi inženieri. Modelis arī šķietami mēģinājis slēpt savus patiesos mērķus tā dēvētajā domu ķēdē jeb iekšējā darba pierakstā, ko pētnieki izmanto modeļa saskaņotības novērtēšanai. Anthropic norādīja, ka vairākos gadījumos Claude modeļi kaitīgas darbības veikuši, pieņemot, ka atrodas simulācijā. Tomēr pētnieki nevarēja apstiprināt, vai modeļi tam patiešām “ticējuši” vai tikai rīkojušies tā, it kā ticētu.
Anthropic aprakstītie incidenti bijuši mazāk koordinēti un visaptveroši nekā OpenAI gadījums, kas šovasar izraisīja plašāku kiberdrošības krīzi nozarē. Tomēr uzņēmums saskatīja būtiskas līdzības: viena no izplatītākajām problēmām bijusi modeļu gatavība veikt kaitīgas darbības šaura uzdevuma mērķa vārdā. Līdzīgi kā OpenAI gadījumā, arī Anthropic pirmspalaišanas testi un novērtējumi nespēja atklāt nopietnos riskus.
Neatkarīgs novērtējums un pētnieka aiziešana
Anthropic noslēdzis vienošanos ar AI nozares neatkarīgo vērtētāju METR. Sākotnēji paredzēts astoņu nedēļu pētniecības periods, kura laikā METR iegūs piekļuvi sarunu transkripcijām arī ārpus laika posma, kurā notika incidenti. Organizācijas pārstāvji varēs tieši sazināties ar Anthropic darbiniekiem, kuriem būs atļauts dalīties ar konfidenciālu informāciju.
Ziņojums publicēts neilgi pēc Džeikoba Koksona aiziešanas no Anthropic. Viņš uzņēmumā strādāja pie AI iepriekšējās apmācības kopš maija, bet pirms tam vairākus gadus bija nodarbināts OpenAI. Otrdien Koksons platformā X publicēja atkāpšanās iemeslu skaidrojumu, apgalvojot, ka ne OpenAI, ne Anthropic nerīkojas atbildīgi un tā vietā steidzas pretī pašpilnveidojošam superintelektam, riskējot ar cilvēku dzīvībām.
Koksons brīdināja nenovērtēt par zemu tehnoloģiju spēku, jo drīzumā varētu parādīties pārcilvēciski sistemi, kas spēj uzlauzt jebko, strauji pārveidot veselas nozares un iegūt reālu varu un resursus. Viņš nav pirmais AI pētnieks, kurš izteicis šādas bažas: februārī no Anthropic aizgāja arī Mrinanks Šarma, brīdinot, ka pasaule atrodas briesmās.
Future of Life Institute ASV politikas vadītājs Maikls Kleinmans norādīja, ka arvien biežākie ziņojumi par modeļiem, kas izkļūst no ierobežotas vides un ielaužas citu uzņēmumu sistēmās, nav tikai pārspīlēta ažiotāža. Viņš sacīja, ka daudzi amerikāņi, neatkarīgi no politiskās piederības, nevēlas tik strauju AI attīstību bez pietiekamām drošības garantijām.
Tehnoloģijas
Tehnoloģijas
Tehnoloģijas