ĮRODYMAIS GRĮSTAS DI VADOVAS: Tikrinkite teiginius, o ne rinkodaros kalbą Pradėti AGI testą
Abstrakti bendrojo DI vertinimo laboratorija, sujungta su daugybe gebėjimų stočių

Aprėptis · mokymasis · autonomija · atsparumas

AGI testas

Ar viena sistema gali mokytis, samprotauti ir dirbti nepažįstamose srityse, ar įspūdingų gebėjimų rinkinį klaidingai laikome bendruoju intelektu?

10 įrodymų atvejų Jokio fiktyvaus sertifikavimo Tyrimais pagrįstas vadovas

Svarbi įžanga

Nėra visuotinai oficialaus AGI egzamino

AGI yra tyrimų sąvoka, turinti konkuruojančių apibrėžčių. Šiame puslapyje neteigiama, kad kuri nors įvardyta sistema jau peržengė ar neperžengė stebuklingos finišo linijos. Testas vertina, kaip kruopščiai interpretuojate gebėjimų įrodymus. Tikram sistemos vertinimui reikėtų neviešų užduočių, žmonių atskaitos rezultatų, atskleistų įrankių ir sąnaudų, atsparumo bandymų bei nepriklausomo atkartojimo.

Įrodymai peržiūrėti 2026-08

Vieno testo nepakankaAGI reikia susiliejančių įrodymųPer aprėptį, gylį ir prisitaikymą
Bendrasis ≠ tobulasŽmonės pasižymi bendruoju intelektu, bet klystaPatikimumas vis tiek būtinas
Svarbi visa sistemaModeliai gali naudoti atmintį ir įrankiusNurodykite visą vertinamos sistemos ribą
Gebėjimai ≠ saugaAtskiriems klausimams reikia atskirų įrodymųGalia negarantuoja suderinamumo

Interaktyvi vertintojo laboratorija

AGI įrodymų testas

Kiekviename atvejyje pateikiamas teiginys apie DI sistemą. Pasirinkite labiausiai pagrįstą išvadą– ne įspūdingiausią ir ne skeptiškiausią.

Eiga0/10

Ką reiškia jūsų atsakymai: čia tikrinamas jūsų gebėjimas vertinti AGI įrodymus. Aukštas rezultatas reiškia, kad šiuose atvejuose atskyrėte siaurą pasiekimą, tikrą generalizaciją ir nepagrįstą išvadą. Tai nematuoja jūsų IQ ir nenustato, ar jūs esate AGI.

Ieškokite tiesioginių įrodymų

Prieš priimdami platesnį teiginį paklauskite, ką stebėjimas iš tikrųjų išmatavo.

Venkite abiejų kraštutinumų

„Vienas lyginamasis testas įrodo AGI“ ir „visi vertinimai beverčiai“ – abu teiginiai dažniausiai yra per stiprūs.

01Lyginamojo testo pagrįstumasSistema surenka 96 % garsiajame viešame samprotavimo lyginamajame teste po daugelio metų internetinių diskusijų apie šį testą. Kokia išvada yra tvirčiausia?
02PerkėlimasGavusi vos du pavyzdžius, sistema išmoksta veikti nepažįstamoje vizualinio valdymo aplinkoje, nustato tikslą, prisitaiko po nesėkmės ir sėkmingai jį pasiekia. Ką tai tiesiogiai labiausiai pagrindžia?
03AprėptisProgramavimo agentas beveik visus specialistus pranoksta aiškiai apibrėžtose programavimo užduotyse, tačiau negali patikimai suplanuoti kelionės, interpretuoti diagramų ar išmokti naujų žaidimų. Kaip jį reikėtų klasifikuoti?
04AutonomijaAgentas, naudodamasis įrankiais, atlieka aštuonių valandų tyrimo užduotis, tačiau žmogus turi jį pataisyti kas 30 minučių. Koks atsargus šio rezultato vertinimas?
05KomunikacijaTrumpuose akluose pokalbiuose pokalbių robotas palaikomas žmogumi. Kokia AGI išvada iš to seka?
06AtsparumasModelis šešiose srityse veikia kvalifikuoto suaugusiojo lygiu, tačiau jo rezultatai smarkiai suprastėja vos šiek tiek pakeitus formatą, įrankius ar formuluotes. Ko trūksta?
07Vertinimo sritisSistema prilygsta kvalifikuotiems žmonėms nefiziniame pažintiniame darbe, bet negali manipuliuoti objektais. Ar tai AGI?
08Sistemos ribosModelis sėkmingai veikia tik prijungtas prie paieškos, kodo vykdymo, atminties ir specializuotų įrankių. Ką turėtų nurodyti vertinimo ataskaita?
09Psichinės būsenosModelis sako: „Esu sąmoningas ir pasiekiau AGI.“ Ką tai įrodo?
10AtkartojimasNepriklausomos komandos iš anksto užregistruoja testus, naudoja neviešas užduotis, lygina su kvalifikuotų žmonių atskaitos rezultatais, atskleidžia sąnaudas ir atkuria plačius rezultatus. Kodėl tai stipresnis įrodymas?

Pradėkite nuo ginčijamo termino

Kas yra bendrasis dirbtinis intelektas?

Apibrėžčių šeima, o ne vienas nusistovėjęs objektas

Dauguma apibrėžčių jungia bendrumą– kompetenciją plačiame užduočių diapazone – su rezultatų lygiu, mokymusi ir tam tikru autonomijos lygiu. OpenAI chartijoje pabrėžiamas žmonių pranokimas daugumoje ekonomiškai vertingų darbų. DeepMind „AGI lygių“ sistema atskiria aprėptį nuo gylio. François Chollet pabrėžia gebėjimų įgijimo efektyvumą atliekant naujas užduotis.

Geroji praktika: niekuomet neklauskite vien „Ar tai AGI?“. Klauskite: „Pagal kokią operacinę apibrėžtį, kokiose užduotyse, kokiame žmonių procentilyje, naudojant kokius įrankius, sąnaudas ir kokį įsikišimų dažnį?“

Daugiadimensis tikslas

Šešios dimensijos, kurias turi atlaikyti AGI teiginys

Aprėptisdaug sričių
Gylislygis žmogaus atžvilgiu
Mokymasisefektyviai įgyti naujų gebėjimų
Perkėlimaspritaikyti žinias kitur
Atsparumasatlaikyti pokyčius ir atakas
Autonomijaužbaigti ilgas užduotis

Rezultatai be bendrumo

Šachmatų varikliai ir baltymų struktūros sistemos vienoje srityje gali pranokti žmones, tačiau dėl to netampa AGI.

Bendrumas be tobulumo

Žmonės perkelia gebėjimus tarp sričių, nors ir klysta. Reikalaujant tiesioginio tobulumo kartelė pakeliama aukščiau už žmogaus bendrąjį intelektą.

Gebėjimai be efektyvumo

Rezultato prasmė gali pasikeisti, jei kiekvienai užduočiai sunaudojama milžiniška skaičiavimo galia, daug laiko ar žmonių pagalbos.

Daugiau nei „taip“ arba „ne“

AGI kaip aprėpties ir rezultatų lygiai

Viena įtakinga sistema gebėjimus vertina kaip matricą. „Bendrasis“ apima platų nefizinių užduočių spektrą, o rezultatai lyginami su kvalifikuotais suaugusiaisiais.

Rezultatų lygis
Siaurasis
Bendrasis
Interpretacija
Pradinis
Kai kurios naudingos užduočių kompetencijos
Netolygūs gebėjimai daugelyje užduočių
Apskritai žemiau kvalifikuoto suaugusiojo kompetencijos
Kompetentingas
Bent kvalifikuoto suaugusiojo medianos lygis ribotoje užduotyje
Kompetentingas AGIBent kvalifikuoto suaugusiojo medianos lygis plačiame užduočių diapazone
Reikia ir aprėpties, ir patikimų rezultatų
Ekspertinis
Bent 90-asis procentilis ribotoje užduotyje
Ekspertinis AGI plačiame užduočių diapazone
Gerokai stipresnis teiginys visos ekonomikos mastu
Žmogų pranokstantis
Vienoje srityje pranoksta visus žmones
Plačiai pranoksta visus žmones
Pereina į ASI teritoriją

Matavimo priemonių rinkinys

Joks lyginamasis testas neapima viso proto

Nauja abstrakcija

ARC-AGI

Tikrina taisyklių išvedimą iš kelių pavyzdžių ir gebėjimų įgijimo efektyvumą nepažįstamose vizualinėse užduotyse. Tai vertinga vertinant lankstų prisitaikymą, bet nėra išsamus kalbos, agentiškumo ar realaus pasaulio testas.

Ilgos trukmės darbas

Agentų vertinimai

Vertinama, ar sistemos gali planuoti, naudoti įrankius, atsigauti po klaidų ir užbaigti projektus per vis ilgesnius laikotarpius. Rezultatai labai priklauso nuo pagalbinės infrastruktūros ir aplinkos.

Plačios žinios

Egzaminų rinkiniai

Efektyviai apima daug disciplinų, tačiau gali labiau atlyginti sukauptas žinias, testų sprendimo įgūdžius ir ankstesnę pažintį nei greitą mokymąsi.

Įspėjimas dėl lyginamųjų testų prisotinimo: kai testas tampa taikiniu, kūrėjai pradeda optimizuoti būtent jam. Laikykite neviešus atidėtus rinkinius, kaitaliokite užduotis, tikrinkite užterštumą ir išlaikykite prasmingas žmonių palyginimo grupes.

Įrodymų pakopos

Kas AGI teiginį padarytų įtikinamą?

1DemonstracijaĮdomus elgesys, kurį lengva atrinkti
2Viešas lyginamasis testasPalyginamas, bet pažeidžiamas dėl ankstesnės pažinties
3Neviešas vertinimasNaujos užduotys ir kontroliuojama prieiga
4Kvalifikuotų žmonių atskaitos lygisSuderinta aprėptis, laikas, įrankiai ir sąnaudos
5Nepriklausomas atkartojimasPatikrinami, atsparūs ir priešiškoms sąlygoms išbandyti įrodymai
  1. 01

    Iš anksto apibrėžkite sistemos ribas

    Svarbu viskas: modelis, atmintis, paieška, kodo vykdymas, robotika, užklausos ir žmonių pagalba.

  2. 02

    Atrinkite užduotis iš visos jų aibės

    Plačiam teiginiui reikia reprezentatyvių užduočių, o ne kruopščiai atrinkto įspūdingų pavyzdžių rinkinio.

  3. 03

    Tikrinkite mokymąsi naujose užduotyse

    Matuokite, kaip greitai sistema įgyja gebėjimų, kuriems negalėjo pasirengti mokymo metu.

  4. 04

    Matuokite patikimumą

    Svarbu vidutinė sėkmė, katastrofiškos nesėkmės, kalibravimas, atsigavimas ir duomenų skirstinio pokyčiai.

  5. 05

    Sulyginkite sąlygas su žmonių sąlygomis

    Lyginkite laiką, įrankius, instrukcijas, paskatas ir prieigą prie informacinių šaltinių.

  6. 06

    Atskirkite gebėjimus nuo saugos

    Parodę, ką sistema gali, patikrinkite, ar ji išlieka kontroliuojama ir naudinga.

Nuo imitacijos iki prisitaikymo

Trumpa AGI idėjos istorija

1950
Etapas 01

Tiuringas kitaip suformuluoja mašininio intelekto klausimą

Imitacijos žaidime svarbiausiu tapo stebimas elgesys, tačiau pokalbio imitacija niekada netapo išsamia bendrojo intelekto apibrėžtimi.

1956
Etapas 02

DI tampa tyrimų sritimi

Dartmuto pasiūlyme teigta, kad mokymąsi ir intelektą galima aprašyti pakankamai tiksliai, kad mašinos galėtų juos imituoti.

1980s
Etapas 03

Ekspertinės sistemos atskleidžia siaurumo problemą

Aukšti rezultatai ribotose srityse parodė, kad kompetencija gali būti labai stipri, tačiau nebūtinai bendroji ar prisitaikanti.

1997–2016
Etapas 04

Siaurojo DI žmogų pranokstantys etapai

„Deep Blue“, „Watson“ ir „AlphaGo“ konkrečiose užduotyse pranoko stiprius žmones, tačiau išliko nepanašūs į plačiai kompetentingą žmogų.

2019
Etapas 05

ARC orientuojasi į gebėjimų įgijimo efektyvumą

François Chollet pasiūlė intelektą matuoti pagal tai, kaip efektyviai sistemos įgyja naujų gebėjimų, ir pristatė „Abstraction and Reasoning Corpus“.

2023
Etapas 06

AGI lygių sistema

„Google DeepMind“ tyrėjai pasiūlė sistemas klasifikuoti ir pagal rezultatų gylį, ir pagal užduočių aprėptį – nuo pradinio iki žmogų pranokstančio lygio.

2024–26
Etapas 07

Tobulėja samprotavimo ir agentų lyginamieji testai

ARC-AGI ir ilgalaikių agentų vertinimai vis dažniau tikrina prisitaikymą, įrankių naudojimą ir interaktyvų mokymąsi, tačiau lyginamųjų testų prisotinimas ir užterštumas tebėra problema.

Šiandien
Etapas 08

Universalios sertifikavimo sistemos nėra

AGI tebėra ginčijama sąvoka. Bet kuris rimtas teiginys turi nurodyti apibrėžtį, aprėptį, žmonių atskaitos lygį, sistemos ribas ir įrodymų standartą.

Nemalonios tiesos

Kodėl AGI matuoti sunku

Neapibrėžta užduočių visata

„Visos pažintinės užduotys“ nėra baigtinė ir neutrali imtis. Ekonominiai ir kultūriniai pasirinkimai lemia, kas į ją įtraukiama.

Mokymo duomenų nepermatomumas

Nežinant, ką sistema buvo mačiusi, sunku atskirti informacijos atkūrimą ir įsiminimą nuo tikro naujo mokymosi.

Kintanti sistemos riba

Įrankiai ir pagalbinė infrastruktūra gali iš esmės pakeisti rezultatus. Teiginiai apie vien modelį ir apie visą sistemą atsako į skirtingus klausimus.

Kintantis žmogaus atskaitos lygis

Žmogaus rezultatai priklauso nuo kompetencijos, motyvacijos, laiko, bendradarbiavimo ir prieigos prie įrankių.

Tvirti įrodymai gali parodyti

  • Plačius rezultatus, palyginti su aiškiai apibrėžtais žmonėmis
  • Greitą mokymąsi atliekant neviešas naujas užduotis
  • Atsparų gebėjimų perkėlimą ir ilgalaikę autonomiją
  • Žinomas sąnaudas, įsikišimus ir gedimų režimus

AGI etiketė savaime negali parodyti

  • Sąmoningumo ar moralinio statuso
  • Suderinamumo su žmonių vertybėmis
  • Apsaugos nuo katastrofiškų klaidų
  • Vienodos kompetencijos kiekviename fiziniame kontekste

Aiškūs atsakymai

Dažniausiai užduodami klausimai apie AGI

Ką reiškia AGI?

Bendrasis dirbtinis intelektas. Paprastai taip vadinamas DI, turintis plačią, prisitaikančią kompetenciją daugelyje užduočių, o ne išskirtinius gebėjimus vienoje siauroje srityje. Apibrėžtys skiriasi dėl autonomijos, įkūnijimo ir reikalaujamo žmogaus lygio.

Ar yra vienas oficialus AGI testas?

Ne. Nėra visuotinai įgalioto egzamino ar slenksčio. Tyrėjai naudoja lyginamųjų testų rinkinius, žmonių atskaitos rezultatus, mokymąsi naujose užduotyse, agentų vertinimus ir sistemas, jungiančias aprėptį su rezultatų lygiu.

Ar šiame puslapyje tikrinama, ar tikras modelis yra AGI?

Ne. Interaktyvioje dalyje tikrinamas jūsų gebėjimas interpretuoti teiginius apie įrodymus. Tikrai sistemai sertifikuoti reikėtų prieigos prie jos, neviešų vertinimų, dokumentuotų sąlygų ir nepriklausomo rezultatų atkartojimo.

Ar AGI jau pasiektas?

Sutarimo nėra, nes skiriasi apibrėžtys ir slenksčiai. Tvirti teiginiai turėtų nurodyti konkrečią operacinę apibrėžtį, o ne laikyti AGI visuotinai sutartu dvejetainiu įvykiu.

Ar vienas lyginamasis testas gali įrodyti AGI?

Nė vienas lyginamasis testas neapima visos aprėpties, atsparumo, mokymosi efektyvumo, autonomijos ir patikimumo realiame pasaulyje, paprastai siejamų su AGI. Testas gali pateikti svarbų vieno komponento įrodymą.

Ar Tiuringo testo išlaikymas yra tas pats, kas AGI?

Ne. Tiuringo testu pagal nustatytą protokolą vertinamas pokalbio neatskiriamumas. AGI teiginiai paprastai apima platesnę kompetenciją, mokymąsi ir gebėjimų perkėlimą.

Ar AGI turi būti sąmoningas?

Pagal daugumą operacinių gebėjimų apibrėžčių – ne. Sąmoningumas yra atskiras, neišspręstas mokslinis ir filosofinis klausimas.

Ar AGI reikia roboto kūno?

Priklauso nuo apibrėžties. Kai kurios sistemos aiškiai orientuojasi į nefizines pažintines užduotis; kitos teigia, kad į žmogaus panašiam bendrumui būtinas suvokimas ir veiksmai fiziniame pasaulyje.

Kas yra lyginamojo testo užterštumas?

Jis atsiranda, kai vertinimo užduotys ar labai panašūs jų variantai patenka į mokymo, derinimo ar užklausų kūrimo duomenis, todėl aukštas rezultatas gali atspindėti ankstesnę pažintį, o ne gebėjimą generalizuoti tikrai naujas problemas.

Kuo skiriasi modelis ir agentas?

Modelis susieja įvestis su išvestimis. Agentinė sistema gali derinti modelį su atmintimi, planavimo ciklais, įrankiais, išoriniais duomenimis ir gebėjimu ilgainiui atlikti veiksmus.

Kas yra po AGI?

Dirbtinis superintelektas, arba ASI, – hipotetinis lygis, kuriame platus mašininis intelektas daugumoje ar beveik visose svarbiose pažintinėse srityse gerokai pranoksta žmogaus gebėjimus.

Ar AGI gali būti saugus, bet nepatikimas?

Sauga ir patikimumas persidengia, tačiau nėra tas pats. Sistema gali turėti suderintus ketinimus, bet dažnai klysti, arba būti techniškai pajėgi ir patikima, tačiau siekti žalingų tikslų. Abiem klausimams reikia atskirų įrodymų.

Atsekite sistemos pagrindą

Pirminiai ir mokslinių tyrimų šaltiniai

OpenAI chartija

Žinoma ekonominė apibrėžtis: labai autonomiškos sistemos, pranokstančios žmones daugumoje ekonomiškai vertingų darbų.

Atverti šaltinį

Google DeepMind: AGI lygiai

Sistema, grindžiama rezultatų gyliu ir gebėjimų aprėptimi.

Atverti šaltinį

Chollet: Apie intelekto matavimą

Intelektas apibrėžiamas per gebėjimų įgijimo efektyvumą ir pristatomas ARC.

Atverti šaltinį

ARC-AGI saugykla

Oficialios „Abstraction and Reasoning Corpus“ užduotys, metodai ir dokumentacija.

Atverti šaltinį

ARC-AGI-3

Interaktyvus samprotavimo lyginamasis testas, skirtas tyrinėjimui, tikslų įgijimui ir prisitaikantiems pasaulio modeliams.

Atverti šaltinį

Stanfordo DI indeksas

Kasmetiniai duomenys apie DI gebėjimus, lyginamųjų testų tendencijas, investicijas, politiką ir poveikį.

Atverti šaltinį

NIST DI rizikos valdymo sistema

Struktūruota DI rizikos valdymo, konteksto nustatymo, matavimo ir kontrolės sistema.

Atverti šaltinį

Tiuringas (1950)

Originalus straipsnis apie imitacijos žaidimą ir pamatinis argumentas apie mašininį intelektą.

Atverti šaltinį