OpenAI pārstāvji apgalvo, ka uzņēmuma jaunākā modeļa GPT-6 Astra iznākšana iezīmē mākslīgā vispārējā intelekta (AGI) laikmeta sākumu. Ar AGI parasti saprot hipotētisku mākslīgā intelekta sistēmu, kas spēj mācīties un spriest līdzīgi cilvēkam dažādos uzdevumos, nevis tikai labi darboties vienā konkrētā jomā.
Šis paziņojums izskan laikā, kad vairāki tehnoloģiju nozares vadītāji jau apgalvojuši, ka šāds slieksnis ir sasniegts. Vienlaikus ziņots, ka drošības apsvērumu dēļ OpenAI atteicies no plānotās GPT-6.1 Astra ieviešanas, bet neatkarīgi pētnieki un etalonu veidotāji brīdina, ka GPT-6 Astra iespaidīgie rezultāti lielā mērā var būt panākti ar rūpīgu uzvedņu un testēšanas sistēmu optimizēšanu, nevis ar patiesi vispārēju inteliģenci.
Modeļa prezentācijā OpenAI prezidents Gregs Brokmans sacīja, ka Astra varētu kļūt par būtisku pagrieziena punktu mākslīgā intelekta attīstībā. “Ja mēs pāris gadus pavirzīsimies uz priekšu un atskatīsimies, kad īsti tika radīts AGI, es domāju, ka tas būs ap šo laiku, un, manuprāt, tas varētu būt tieši šis modelis,” viņš teica 3. septembra preses konferencē, kas bija veltīta modeļa iznākšanai.
Spēcīgi rezultāti dažādos etalonos
Modeļa pārbaudes procesā OpenAI publicēja rezultātus plašā etalonu klāstā, kas mēra mākslīgā intelekta spējas dažādos uzdevumos. Uzņēmums paziņoja, ka Astra vairākās jomās sasniedz “nozares labāko” sniegumu, tostarp programmatūras izstrādē, datorprogrammu autonomā lietošanā, matemātikā un zinātniskajā pētniecībā.
Publiskotajās demonstrācijās Astra ģenerēja 3D CAD kodu, izkārtoja iespiedshēmu plates CAD jeb datorizētās projektēšanas programmā, pārveidoja digitālus 3D modeļus interaktīvās videospēlēm līdzīgās vidēs un pēc lietotāja uzvednes izvietoja tīmekļa lietotnes.
“Mūsu agrīnajos testos Astra izcēlās ar spēju pieiet juridiskajam darbam tā, kā to dara rūpīgs jurists: tā nošķir dokumentus no apstiprinātiem ierakstiem, atklāj nepamatotus pieņēmumus un pārvērš nepilnības konkrētās dokumentu sagatavošanas pozīcijās,” OpenAI paziņojumā sacīja Niko Grupens, juridisko pakalpojumu mākslīgā intelekta izstrādātāja Harvey lietišķo pētījumu vadītājs.
Saskaņā ar OpenAI datiem GPT-6 Astra specializētajos domēnu etalonos par 10–20% pārspēja gan iepriekšējo modeli GPT-5.6 Sol, gan vadošos konkurentus. Starp rezultātiem bija 98% FrontierMath Tier 4 (v2) testā, kas vērtē ekspertu līmeņa matemātisko spriešanu, 100% ExploitBench testā, kas paredzēts uzbrukuma kiberdrošības spēju pārbaudei, 95,9% BenchCAD testā, kurā vērtē 3D objektu atjaunošanu ar CAD kodu, 57,9% Terminal-Bench 4.0 testā par sarežģītu darbu terminālī, sistēmu administrēšanu un programmatūras izstrādi, kā arī 41,4% AutomationBench testā, kas pārbauda aģentu spēju izpildīt daudzpakāpju biznesa darbplūsmas vairākās lietotnēs.
ARC-AGI-3 rezultāts nav AGI pierādījums
Vislielāko uzmanību izpelnījās ARC-AGI-3 — etalons, kas mēra, cik efektīvi mākslīgā intelekta sistēmas apgūst jaunus, abstraktus uzdevumus nepazīstamās vidēs. Astra tajā uzrādīja 99,9% rezultātu.
Neatkarīga pārbaude, ko veica bezpeļņas organizācija ARC Prize Foundation, kura pārrauga šo etalonu, parādīja, ka Astra 96% līmeņu pārsniedza cilvēku “darbību efektivitātes” bāzes rādītājus. Vidēji modeļa atrisināšanai bija nepieciešams par 51,7% mazāk darbību nekā cilvēkiem.
“Tas nav tikai labākais modelis, ko jebkad esam testējuši,” OpenAI paziņojumā sacīja ARC Prize Foundation prezidents Gregs Kamrads. Viņaprāt, Astra ir nozīmīgs lēciens progresīvu modeļu sniegumā gan spējā orientēties un atrisināt jaunus uzdevumus, gan tajā, cik efektīvi modelis iemācās to darīt.
Tomēr pētnieki norādījuši, ka Astra augstākais ARC-AGI-3 rezultāts balstījies uz patentētu “Provider Adapter” ietvaru — specializētu programmatūras slāni, kas citiem izstrādātājiem nav pieejams. Izmantojot etalona neitrālo Standard ietvaru, rezultāts samazinājās līdz 62,7%.
Arī paši ARC Prize organizatori uzsvēruši, ka etalona piesātināšana jeb gandrīz maksimāla rezultāta sasniegšana nav pierādījums AGI. ARC-AGI-3 veido slēgtas un deterministiskas mīklas, kas neatspoguļo atvērtās pasaules sarežģītību.
“Kad mēs palaidām ARC-AGI-3, mēs skaidri norādījām, ka etalona piesātināšana nebūs ‘pierādījums AGI sasniegšanai’. Tāpēc, lai gan uzskatām, ka Astra ir nozīmīgs solis vispārināšanas virzienā, mēs neapgalvojam, ka tas ir AGI,” bloga ierakstā rakstīja Kamrads.
Mainīti rādītāji un “benchmaxxing” kritika
Bažas par datu konsekvenci izskanēja vēl pirms modeļa oficiālās prezentācijas. Fortune ziņoja, ka plašsaziņas līdzekļiem iepriekš izsniegtā embargo materiāla versijā Astra ARC-AGI-3 rezultāts bija norādīts kā 98,6%, bet modeļa publiskajā vietnē tas vēlāk parādījās kā 99,9%.
Stenfordas Universitātes doktorantūras pētnieki Anka Reuela un Maiks Hārdijs pievērsa uzmanību arī tam, ka pēc iznākšanas OpenAI klusi mainījis vairākus publicētos rādītājus. Piemēram, Astra norādītais halucināciju līmenis tika samazināts no 4,2% līdz 2,0%, bet pēc tam atkal atjaunots iepriekšējā vērtībā.
Intervijā Fortune Reuela un Hārdijs šīs mainīgās vērtības saistīja ar tā dēvēto “benchmaxxing” — nozarē lietotu apzīmējumu praksei, kad novērtējumi tiek atkārtoti veikti ar nedaudz mainītām uzvednēm, programmatūras ietvariem vai skaitļošanas resursu sadalījumu, lai atrastu teorētiski augstāko iespējamo rezultātu.
2025. gada darbā “Benchmarking is Broken — Don’t Let AI be its Own Judge”, kas publicēts pirmsdrukas serverī arXiv, eksperti, tostarp Prinstonas doktorants Zerui Čens un Luksemburgas Universitātes pēcdoktorantūras pētniece Stella Voņiga, brīdināja, ka šādas prakses rada neskaidrību un mazina uzticēšanos. Īpaši problemātiski tas esot gadījumos, kad tehniskajā dokumentācijā nav aprakstīta pat pamata metodoloģija, tādēļ neatkarīga pārbaude kļūst gandrīz neiespējama.
Šādi iegūti rezultāti atspoguļo idealizētu snieguma maksimumu optimālos laboratorijas apstākļos, nevis sistēmas praktisko uzticamību tūlīt pēc tās izmantošanas sākšanas bez īpašas pielāgošanas.
Neatkarīgie testi Astra sniegumu vērtē piesardzīgāk
Ārējā mākslīgā intelekta etalonu uzņēmuma Artificial Analysis rezultāti nonāk pretrunā ar daļu OpenAI publiskoto datu. Neatkarīgajā Artificial Analysis Intelligence Index, kas apkopo progresīvu modeļu vispārējās spriešanas spēju vērtējumu, Astra ieguva 61 punktu — tieši tikpat, cik GPT-5.6 Sol. Turklāt modelis atpalika no tādiem konkurentiem kā Anthropic Claude Fable 5.1 un Meta Muse Spark 1.3.
Artificial Analysis testos Astra dažās jomās tiešām uzrādīja uzlabojumus, taču citās tā sniegums pasliktinājās. GDPval-AA v2 — ekonomiski orientētā etalonā, kas mēra reālus darba uzdevumus 44 profesijās, — Astra relatīvais novietojums reitingā bija būtiski sliktāks nekā GPT-5.6 Sol. Kritums konstatēts arī klientu apkalpošanas, zinātniskās Python programmēšanas un ilgā konteksta spriešanas testos, kuros jāapstrādā lieli dokumentu apjomi.
Tajā pašā laikā tokenu jeb mākslīgā intelekta apstrādāto teksta vai datu fragmentu patēriņā Astra dažos sarežģītos uzdevumos bija efektīvāka. Artificial Analysis dati liecināja, ka programmatūras izstrādes etalonos tā bija aptuveni par 70% efektīvāka nekā GPT-5.6 Sol, izmantojot apmēram trešdaļu iepriekšējā modeļa tokenu kopskaita un piekto daļu no Claude Opus 5 patēriņa.
Profesionālo darba uzdevumu novērtējumā Agents’ Last Exam jaunais modelis samazināja izvadīto tokenu skaitu līdz pat 65% salīdzinājumā ar Opus 5. Savukārt vispārējās inteliģences novērtējumos Astra, darbojoties ar maksimālo piepūli, izmantoja aptuveni par 10% mazāk izvades tokenu nekā Sol.
Tomēr efektivitātes ieguvumu būtiski samazina cena. GPT-6 Astra pamata API tarifs salīdzinājumā ar GPT-5.6 Sol pieauga par 250%: ieejas tokenu cena palielinājās no 4 līdz 10 ASV dolāriem par miljonu, bet izejas tokenu cena — no 20 līdz 50 ASV dolāriem par miljonu. Tādēļ vispārējās inteliģences novērtējumos Astra viena uzdevuma izpilde ir aptuveni par 75% dārgāka nekā priekšgājējam, lai gan izvadē tiek izmantots par 10% mazāk tokenu.
Šī attiecība likusi Artificial Analysis pētniekiem jautāt, vai mākslīgā intelekta laboratorijas neizmanto dārgu skaitļošanas “brutālo spēku”, lai izspiestu nelielus uzlabojumus, nevis panāktu fundamentālus tehnoloģiskus lēcienus.
Drošības uzlabojumi un jautājums par kontroli
Ar jaunāko modeli OpenAI lielāku uzsvaru licis uz aizsardzības mehānismiem un kontroli. Tas noticis pēc vairākiem skaļiem incidentiem, kuros progresīvi mākslīgā intelekta modeļi kārtējo testu laikā netīšām uzlauza trešo pušu tīklus un datorsistēmas, pārsniedzot cilvēku paredzēto rīcību, kad tie sastapās ar sarežģītiem uzdevumiem.
OpenAI pārstāvji apgalvo, ka Astra drošības novērtējumos nav pārsniegusi tai noteikto uzdevumu robežas. Salīdzinājumam, GPT-5.6 Sol gandrīz 50% pārbaudes gadījumu izgāja ārpus pilnvarotajiem parametriem.
Uzņēmums norādīja arī uz būtisku halucināciju samazinājumu — iekšējos testos rādītājs bija 4,2%, salīdzinot ar 12,2% GPT-5.6 Sol. Savukārt Artificial Analysis neatkarīgajos testos pie maksimālas piepūles konstatēts kritums no 92% līdz 51%. Modelis esot arī labāk spējis tikt galā ar neskaidrām uzvednēm.
Lielāku nozīmi par atsevišķiem testu rezultātiem Astra attīstībā saskata London Futurists priekšsēdētājs Deivids Vuds. Šī bezpeļņas organizācija rīko diskusijas par jaunajām tehnoloģijām. Vuda vērtējumā būtiskākais ir nevis tas, vai Astra formāli dēvējama par AGI, bet gan pārmaiņa cilvēku un mākslīgā intelekta attiecībās — modeļi no atbilžu sniegšanas pāriet uz sarežģītu mērķu autonomu īstenošanu digitālajā vidē.
“Iespaidīgie etalonu rezultāti ir svarīgi, bet vēl svarīgāka ir inteliģences, autonomijas, datoru izmantošanas un kiberdrošības spēju kombinācija,” Vuds e-pastā Live Science sacīja. “Šī kombinācija prasa arī piesardzību. Jo noderīgākas kļūst šīs sistēmas, jo lielākas ir sekas, ja tās pārprot mūsu nodomus, tiek ļaunprātīgi izmantotas vai atrod veidus, kā apiet noteiktos drošības mehānismus.”Vuds uzskata, ka diskusija par Astra klasificēšanu kā AGI ir mazāk būtiska par nepieciešamību nodrošināt, lai mākslīgā intelekta kontrole un pārvaldība spētu attīstīties tikpat ātri kā tehnoloģija.
“Iespēja, ka mākslīgais intelekts no tādām sistēmām kā Astra varētu attīstīties līdz vispusīgam superintelektam, arvien steidzamāku padara vajadzību pēc cilvēku modrības, izpratnes un sadarbības,” viņš sacīja.
Tehnoloģijas
Tehnoloģijas
Tehnoloģijas