Anthropic vadītājs Dario Amodei ierosinājis frontier jeb attīstītāko mākslīgā intelekta sistēmu izstrādātājos pastāvīgi iesaistīt trešo pušu vērtētājus. Viņiem būtu jāspēj ziņot par drošības incidentiem, pārbaudīt, vai modeļi patiešām ir saskaņoti ar cilvēku noteiktajiem mērķiem, un publiskot savus secinājumus bez uzņēmuma redakcionālas kontroles. OpenAI vadītājs Sems Altmans norādījis, ka arī viņa uzņēmums būtu gatavs šādu praksi ieviest.
Vērtētāji, kuri komentējuši ieceri, to lielākoties uzskata par nozīmīgu soli, taču uzsver, ka vēl nav zināms, kā sistēma darbotos praksē. Anthropic un OpenAI nav atklājuši, ar kuriem vērtētājiem sadarbosies, kad viņi tiks iesaistīti, cik organizāciju piedalīsies un kādiem uzņēmumu datiem būs pieejama. Tāpat nav skaidrs, kādu informāciju vērtētāji drīkstēs publiskot.
Pārbaudei jāaptver arī modeļa apmācība
Ārējie eksperti līdz šim galvenokārt pārbaudīja jau pabeigtus modeļus neilgi pirms to izlaišanas. Taču modeļi kļūst labāki, atpazīstot situācijas, kurās tos vērtē, un tādēļ var testēšanas laikā uzvesties droši, vienlaikus slēpjot problemātisku uzvedību. Pētnieki uzskata, ka būtiskas pazīmes var parādīties agrāk, modeļa apmācības laikā.
Apollo Research vadītājs Aleksandrs Meinke norādījis, ka uzņēmumiem vajadzētu spēt skaidri atbildēt, vai modelis apmācības laikā mēģinājis apdraudēt paša saskaņošanas procesu. Pēc viņa teiktā, šobrīd sabiedrībai lielā mērā jāpaļaujas uz to, ka uzņēmumi šādu rīcību paši pārbaudīs un godīgi par to ziņos.
FAR.AI vadītājs Adams Glīvs ierosinājis vērtētājiem piešķirt piekļuvi ne tikai gala modelim, bet arī starpposma versijām jeb kontrolpunktiem, kas tapuši apmācības gaitā. Salīdzinot šīs versijas, būtu iespējams noteikt, kad radusies satraucoša uzvedība. Vērtētāji varētu pārbaudīt arī pēcapmācības vidi, kurā modelis tiek apbalvots par noteiktu rīcību, izvērtēšanas žurnālus un sarunāties ar darbiniekiem, lai salīdzinātu publisko informāciju ar uzņēmuma iekšējo praksi.
Palisade Research stratēģijas vadītājs Džons Steidli brīdinājis, ka labs rezultāts drošības testā vēl nepierāda modeļa drošumu, ja tas ir īpaši apmācīts konkrētajam testam. Viņš to salīdzināja ar Volkswagen emisiju skandālu, kad automašīnas atpazina pārbaudes apstākļus un tajos darbojās citādi. Līdzīgs risks pastāv, piemēram, testos, kuros pārbauda, vai mākslīgais intelekts konkrētās situācijās pretojas izslēgšanai.
Iepriekšējā pieredze rada šaubas
Neatkarīgu vērtētāju darbu līdz šim ierobežojuši piekļuves, laika, konfidencialitātes un publiskošanas nosacījumi. Izmeklējot incidentu, kurā bija iesaistīta platforma Hugging Face, OpenAI METR un Redwood Research komandām nodrošināja aptuveni nedēļu darbu uzņēmuma telpās. Abas organizācijas vēlāk norādīja, ka laika un izmeklēšanas tvēruma ierobežojumu dēļ nespēja izdarīt pārliecinošus secinājumus.
Līdzīga situācija bija GPT-6 Astra pirmsizlaides pārbaudēs. Apollo Research modeļa kartes materiālā norādīja, ka uzņēmumam bija tikai trīs dienas Astra testēšanai. Organizācija secināja, ka modeļa spēja apzināties izvērtēšanu un ierobežotais pārbaudes laiks neļauj zemo problemātiskas uzvedības līmeni uzskatīt par būtisku pierādījumu modeļa saskaņotībai vai nesaskaņotībai.
Glīvs sacījis, ka FAR.AI nācies atteikties no līgumiem ar vairākiem attīstīto modeļu izstrādātājiem, jo tie vēlējušies pārāk lielu kontroli pār vērtēšanas procesu. Pēc noklusējuma vērtētāji bieži tiek uztverti kā parasti darbuzņēmēji, kurus saista stingri neizpaušanas līgumi un noteikumi par to, ko drīkst publicēt.
Pētnieki aicina izveidot publisku un pārskatāmu sistēmu, kas noteiktu gan vērtētāju kvalifikāciju, gan minimālo piekļuves apjomu un laiku. Safer AI izpilddirektors Henrijs Papadatos uzskata, ka ar brīvprātīgu apņemšanos vien nepietiks, jo uzņēmums pēc krīzes var mainīt savus solījumus. Viņaprāt, nepieciešams regulējums, kas liktu visiem uzņēmumiem ievērot vienotus noteikumus.
Pašlaik Meta, SpaceXAI un Google DeepMind nav apņēmušies ieviest iestrādātus trešās puses vērtētājus. DeepMind vadītājs Demiss Hasabis gan ierosinājis atsevišķu nozares standartu institūciju frontier modeļu neatkarīgai pārbaudei. Google, OpenAI un Anthropic vairākas nedēļas privāti apspriežot mākslīgā intelekta drošības plānus.
Atsevišķi regulējuma elementi jau tiek veidoti. Kalifornijas likums SB 53 lielajiem frontier AI izstrādātājiem paredz publicēt drošības ietvarus un ziņot par kritiskiem incidentiem, bet šomēnes pieņemtais SB 813 veido valsts atzītu neatkarīgas pārbaudes organizāciju sistēmu. Eiropas Savienības Mākslīgā intelekta akts prasa frontier izstrādātājiem dokumentēt modeļu izvērtēšanu un pretinieka jeb adversarial testus, ziņot par nopietniem incidentiem, kā arī ļauj ES AI birojam veikt savas pārbaudes un piesaistīt neatkarīgus ekspertus.
Tomēr pašreizējie likumi dod uzņēmumiem mazāku ārējās uzraudzības apjomu, nekā paredz Amodei priekšlikums. Papadatos uzsvēris, ka uzņēmumi nevar vienlaikus pieprasīt pilnīgu kontroli pār saviem drošības noteikumiem un sagaidīt, ka sabiedrība bez neatkarīgas atbildības tiem uzticēsies.
Tehnoloģijas
Tehnoloģijas
Tehnoloģijas