Matemātiķis Andreass Toms publiski apšaubījis, vai OpenAI savos jaunākajos matemātiskajos sasniegumos nav izmantojusi nepublicētu pētnieku darbu vai sarakstes ar ChatGPT. Viņš uzņēmumu apsūdzējis neētiskā un “negodīgā” rīcībā, kā arī nepietiekamā pārredzamībā par savu modeļu apmācības datu izcelsmi.
Tomam bažas radušās pēc tam, kad Ņujorkas Universitātes matemātikas profesors Tristans Bakmasters publiski jautāja, vai OpenAI modeļi nav guvuši labumu no viņa darba ar uzņēmuma programmēšanas rīku Codex. Drīz pēc tam OpenAI ar lielu publicitāti paziņoja par 10 matemātiskiem rezultātiem, no kuriem viens bija saistīts ar Toma specializācijas jomu — tā dēvētajām ne-sofiskajām grupām.
OpenAI atzina, ka šis rezultāts lielā mērā balstījies uz Toma un matemātiķa Gābora Kuna iepriekšējo darbu. Ne-sofiskās grupas aptuveni var raksturot kā bezgalīgas matemātiskas struktūras, kuras nav iespējams tuvināt ar galīgām struktūrām. Pēc kritikas matemātikas aprindās uzņēmums savu aprakstu klusi papildināja, jo sākotnēji nebija pienācīgi atzinis Toma un Kuna neseno ieguldījumu.
Jautājumi par ChatGPT sarakstu izmantošanu
Ziņās platformā Mastodon Toms rakstīja, ka viņu pārsteigusi OpenAI “detalizētā izpratne par mūsu metodēm”. Viņaprāt, uzņēmums bija izmantojis pieeju, kas konkrētajā laikā nebija ne acīmredzamākais, ne daudzsološākais ceļš uz risinājumu.
Toms nosūtīja e-pastus OpenAI pētniekiem Sebastjēnam Bībakam un Hārvardas statistiķim Markam Sellkem, vaicājot, vai viņa un kolēģu sarakstes ar ChatGPT varētu būt daļa no modeļu apmācības datiem vai pieejamas modeļu spriešanas procesam. Viņš vēlējās noskaidrot, vai šīs sarakstes varēja veicināt paziņotā rezultāta iegūšanu.
Pēc Toma teiktā, atbilde uz viņa jautājumu neesot bijusi pietiekama. Tā skārusi tikai iespēju, vai sarunas varēja tikt tieši piekļūtas, bet ne to, vai tās nonākušas plašajos apmācības datu kopumos, ko uzņēmums izmanto savu modeļu uzlabošanai. “Es to uzskatu vismaz par negodīgu,” rakstīja Toms.
Viņš norādīja, ka pētniekiem nav iespēju pašu spēkiem “atpakaļinženierēt” OpenAI apmācības procesu un noskaidrot, vai viņu darbs ir izmantots. Tā kā attiecīgie dati ir tikai uzņēmuma rīcībā, Toms uzskata, ka tieši OpenAI būtu jāpierāda pretējais — jāatklāj nepieciešamās datu kopas un jāizskaidro iestatījumi un noteikumi, kas regulē lietotāju datu izmantošanu.
Strīds saasinās pēc paziņojuma par Navjē–Stoksa problēmu
OpenAI nevēlēšanās pilnībā izslēgt jebkādu netiešu lietotāju datu ietekmi atgādina uzņēmuma skaidrojumus par neseno paziņojumu saistībā ar vienu no Milēnija balvas problēmām — Navjē–Stoksa vienādojumu, kas apraksta šķidrumu kustību.
Paziņojumā OpenAI kategoriski noliedza, ka konkrēti lietotāju dati būtu izmantoti, lai atrisinātu šo problēmu. Vienlaikus uzņēmums piebilda, ka, lai gan tas esot maz ticams, nevar izslēgt iespēju, ka anonimizēti dati, kas iegūti no produktu lietošanas, ir palīdzējuši uzlabot tā modeļus.
Toms uzskata, ka šī atšķirība ir maldinoša, jo anonimizācija var noņemt personas vārdu, bet ne matemātiskas idejas intelektuālo saturu. Viņš Sellkes iepriekš pausto kategorisko atbildi nodēvējis par nepamatoti plašu un būtiski maldinošu, vēlāk to raksturojot kā negodīgu.
Pēc Toma domām, būtu ētiski nepieņemami, ja lietotāju sniegts nepublicēts pētījums palīdzētu uzlabot modeļus, kurus uzņēmums pēc tam izmantotu sacensībā ar tiem pašiem pētniekiem par prioritāti un publikāciju — bez piekrišanas, pienācīgas atklāšanas vai atzinības.
OpenAI uz komentāru nekavējoties neatbildēja. Strīds ir pastiprinājis neapmierinātību matemātiķu aprindās. Lai gan uzņēmuma paziņotais Milēnija balvas problēmas risinājums, ja tas tiks pārbaudīts, būtu izcils sasniegums, pētniekus satrauc neparastie apstākļi, kādos OpenAI pievērsās šai problēmai. Uzņēmums norādīja, ka tiešsaistē bija dzirdējis baumas par citu pētnieku būtisku progresu un nolēmis mēģināt pats.
Pētnieki bažījas, ka šāda rīcība var padarīt nozari slepenāku: ja pat baumas par tuvošanos nozīmīgam atklājumam var izraisīt sacensību ar labi finansētu tehnoloģiju uzņēmumu, matemātiķi var kļūt piesardzīgāki un retāk dalīties ar vēl nepublicētiem rezultātiem.
Tehnoloģijas
Tehnoloģijas
Tehnoloģijas
Tehnoloģijas