PRZEWODNIK PO AI OPARTY NA DOWODACH: Sprawdzaj twierdzenia, nie język marketingowy Rozpocznij test AGI
Abstrakcyjne laboratorium oceny ogólnej AI połączone z wieloma stanowiskami badania zdolności

Zakres · uczenie się · autonomia · odporność

Test AGI

Czy jeden system potrafi uczyć się, rozumować i pracować w nieznanych dziedzinach — czy też mylimy zbiór imponujących umiejętności z inteligencją ogólną?

10 przypadków dowodowych Bez fałszywej certyfikacji Przewodnik oparty na badaniach

Ważny kontekst

Nie istnieje powszechnie oficjalny egzamin AGI

AGI jest pojęciem badawczym o konkurencyjnych definicjach. Ta strona nie stwierdza, że jakikolwiek konkretny system przekroczył — lub nie przekroczył — magiczną linię mety. Test mierzy, jak uważnie interpretujesz dowody dotyczące zdolności. Ocena rzeczywistego systemu wymagałaby prywatnych zadań, ludzkich poziomów odniesienia, ujawnionych narzędzi i kosztów, testów odporności oraz niezależnej replikacji.

Dowody zweryfikowano August 2026

Nie ma jednego testuAGI wymaga zbieżnych dowodówW zakresie, poziomie i adaptacji
Ogólna ≠ doskonałaLudzie są ogólni, ale omylniNiezawodność nadal jest kluczowa
Liczy się systemModele mogą korzystać z pamięci i narzędziPodawaj pełną granicę ewaluowanego systemu
Zdolność ≠ bezpieczeństwoOdrębne pytania wymagają odrębnych dowodówPotęga nie gwarantuje zgodności z celami człowieka

Interaktywne laboratorium ewaluacji

Test dowodów na AGI

Każdy przypadek opisuje twierdzenie dotyczące systemu AI. Wybierz najlepiej uzasadniony wniosek — nie najbardziej ekscytujący ani najbardziej sceptyczny.

Postęp0/10

Co oznaczają Twoje odpowiedzi: ten test sprawdza Twoją umiejętność oceny dowodów dotyczących AGI. Wysoki wynik oznacza, że w tych przypadkach rozróżniasz wąskie osiągnięcia, rzeczywistą generalizację i nieuzasadnione wnioski. Nie mierzy on Twojego IQ ani tego, czy jesteś AGI.

Szukaj bezpośrednich dowodów

Zanim zaakceptujesz szersze twierdzenie, zapytaj, co dana obserwacja faktycznie mierzyła.

Unikaj obu skrajności

„Jeden benchmark dowodzi AGI” i „każda ewaluacja jest bezwartościowa” to zwykle dwa zbyt daleko idące stwierdzenia.

01Wiarygodność benchmarkuSystem uzyskuje 96% w znanym publicznym benchmarku rozumowania po latach internetowych dyskusji na jego temat. Jaki wniosek jest najlepiej uzasadniony?
02TransferPo zaledwie dwóch demonstracjach system uczy się nieznanego środowiska sterowania wizualnego, wnioskuje cel, dostosowuje się po niepowodzeniu i skutecznie osiąga rezultat. Czego jest to najbardziej bezpośrednim dowodem?
03ZakresAgent programistyczny przewyższa niemal każdego specjalistę w precyzyjnie określonych zadaniach programistycznych, ale nie potrafi niezawodnie planować podróży, interpretować diagramów ani uczyć się nowych gier. Jak należy go sklasyfikować?
04AutonomiaAgent wykonuje ośmiogodzinne zadania badawcze z użyciem narzędzi, lecz człowiek musi go korygować co 30 minut. Jaka interpretacja jest ostrożna i uzasadniona?
05KomunikacjaW krótkich, zaślepionych rozmowach chatbot zostaje uznany za człowieka. Jaki wniosek dotyczący AGI z tego wynika?
06OdpornośćModel osiąga poziom wykwalifikowanej osoby dorosłej w sześciu dziedzinach, po czym jego wyniki załamują się przy niewielkiej zmianie formatów, narzędzi i sformułowań. Czego brakuje?
07Zakres definicjiSystem dorównuje wykwalifikowanym ludziom w niefizycznej pracy poznawczej, ale nie potrafi manipulować przedmiotami. Czy jest AGI?
08Granica systemuModel odnosi sukces tylko po podłączeniu do wyszukiwarki, wykonywania kodu, pamięci i specjalistycznych narzędzi. Co powinien zawierać raport z ewaluacji?
09Stany umysłoweModel mówi: „Jestem świadomy i osiągnąłem AGI”. Czego to dowodzi?
10ReplikacjaNiezależne zespoły prerejestrują testy, używają prywatnych zadań, porównują wyniki z poziomem wykwalifikowanych ludzi, ujawniają koszty i odtwarzają szerokie rezultaty. Dlaczego taki dowód jest mocniejszy?

Zacznij od spornego pojęcia

Czym jest sztuczna inteligencja ogólna?

Rodzina definicji, a nie jedno ustalone pojęcie

Większość definicji łączy ogólność — kompetencje w szerokim zakresie zadań — z poziomem osiągów, uczeniem się oraz pewnym stopniem autonomii. Karta OpenAI podkreśla przewyższanie ludzi w większości prac o wartości ekonomicznej. Ramy DeepMind „Poziomy AGI” rozdzielają szerokość zakresu od poziomu osiągów. François Chollet kładzie nacisk na efektywność nabywania umiejętności w nowych zadaniach.

Dobra praktyka: nigdy nie pytaj tylko „Czy to AGI?”. Zapytaj: „Według jakiej definicji operacyjnej, w jakich zadaniach, na jakim ludzkim percentylu, przy użyciu jakich narzędzi, kosztów i jakiej częstotliwości interwencji?”

Cel wielowymiarowy

Sześć wymiarów, które powinno przetrwać twierdzenie o AGI

Zakreswiele dziedzin
Poziompoziom względem człowieka
Uczenie sięefektywne nabywanie nowych umiejętności
Transferwykorzystanie wiedzy gdzie indziej
Odpornośćodporność na zmiany i ataki
Autonomiawykonywanie długich zadań

Wysoka skuteczność bez ogólności

Silniki szachowe i systemy przewidujące strukturę białek mogą mieć ponadludzkie zdolności w jednej dziedzinie, nie stając się AGI.

Ogólność bez doskonałości

Ludzie przenoszą umiejętności między dziedzinami mimo popełniania błędów. Wymaganie dosłownej doskonałości ustawia poprzeczkę wyżej niż ludzka inteligencja ogólna.

Zdolność bez efektywności

Znaczenie wyniku może się zmienić, jeśli każde zadanie wymaga ogromnych zasobów obliczeniowych, czasu lub pomocy człowieka.

Więcej niż etykieta „tak/nie”

AGI jako poziomy szerokości zakresu i osiągów

Jedne z wpływowych ram traktują zdolności jako macierz. „Ogólna” obejmuje szeroki zakres niefizycznych zadań; poziom osiągów porównuje się z wykwalifikowanymi dorosłymi.

Poziom osiągów
Wąska
Ogólna
Interpretacja
Wyłaniająca się
Pewna użyteczna kompetencja zadaniowa
Nierówny poziom w wielu zadaniach
Ogólnie poniżej poziomu wykwalifikowanej osoby dorosłej
Kompetentna
Co najmniej mediana wykwalifikowanych dorosłych w ograniczonym zadaniu
Kompetentna AGICo najmniej mediana wykwalifikowanych dorosłych w szerokim zakresie zadań
Wymaga szerokiego zakresu i niezawodnych osiągów
Ekspercka
Co najmniej 90. percentyl w ograniczonym zadaniu
Ekspercka AGI w szerokim zakresie zadań
Znacznie mocniejsze twierdzenie obejmujące całą gospodarkę
Ponadludzka
Przewyższa wszystkich ludzi w jednej dziedzinie
Szeroko przewyższa wszystkich ludzi
Wchodzi na obszar ASI

Zestaw narzędzi pomiarowych

Żaden benchmark nie mierzy całego umysłu

Nowa abstrakcja

ARC-AGI

Bada wnioskowanie reguł z niewielu przykładów i efektywność nabywania umiejętności w nieznanych zadaniach wizualnych. Jest wartościowy dla płynnej adaptacji, ale nie stanowi pełnego testu języka, sprawczości ani świata rzeczywistego.

Praca w długim horyzoncie

Ewaluacje agentów

Mierzą, czy systemy potrafią planować, korzystać z narzędzi, wychodzić z błędów i kończyć projekty w coraz dłuższym horyzoncie czasowym. Wyniki silnie zależą od rusztowania i środowiska.

Szeroka wiedza

Zestawy egzaminacyjne

Efektywnie obejmują wiele dziedzin, ale mogą bardziej premiować zapamiętaną wiedzę, umiejętność rozwiązywania testów i wcześniejszy kontakt niż szybkie uczenie się.

Ostrzeżenie przed nasyceniem benchmarku: gdy test staje się celem optymalizacji, twórcy dostosowują system do niego. Zachowuj prywatne zbiory kontrolne, rotuj zadania, audytuj zanieczyszczenie i utrzymuj sensowne grupy porównawcze ludzi.

Drabina dowodów

Co sprawiłoby, że twierdzenie o AGI byłoby przekonujące?

1DemonstracjaCiekawe zachowanie, łatwe do wyselekcjonowania
2Publiczny benchmarkPorównywalny, ale podatny na wcześniejszy kontakt
3Prywatna ewaluacjaNowe zadania i kontrolowany dostęp
4Poziom odniesienia: wykwalifikowany człowiekDopasowany zakres, czas, narzędzia i koszty
5Niezależna replikacjaAudytowalne, odporne dowody z testów konfrontacyjnych
  1. 01

    Z góry określ granicę systemu

    Model, pamięć, wyszukiwanie, wykonywanie kodu, robotyka, prompty i pomoc człowieka — wszystko to się liczy.

  2. 02

    Dobierz próbę z przestrzeni zadań

    Szerokie twierdzenie wymaga reprezentatywnych zadań, a nie ręcznie dobranego zestawu najlepszych przykładów.

  3. 03

    Testuj uczenie się nowych rzeczy

    Mierz, jak szybko system nabywa umiejętności, do których nie mógł przygotować się podczas treningu.

  4. 04

    Mierz niezawodność

    Liczą się średnia skuteczność, katastrofalne awarie, kalibracja, odzyskiwanie sprawności i przesunięcie rozkładu.

  5. 05

    Dopasuj warunki po stronie ludzi

    Porównuj czas, narzędzia, instrukcje, bodźce i dostęp do materiałów referencyjnych.

  6. 06

    Oddziel zdolności od bezpieczeństwa

    Po wykazaniu, co system potrafi, sprawdź, czy pozostaje kontrolowalny i korzystny.

Od imitacji do adaptacji

Krótka historia idei AGI

1950
Kamień milowy 01

Turing na nowo ujmuje inteligencję maszynową

Gra w naśladownictwo postawiła obserwowalne zachowanie w centrum uwagi, ale imitacja konwersacyjna nigdy nie stała się pełną definicją inteligencji ogólnej.

1956
Kamień milowy 02

AI staje się dziedziną badań

W propozycji z Dartmouth argumentowano, że uczenie się i inteligencję można opisać na tyle precyzyjnie, aby maszyny mogły je symulować.

1980s
Kamień milowy 03

Systemy ekspertowe ujawniają problem wąskiej specjalizacji

Wysoka skuteczność w ograniczonych dziedzinach pokazała, że specjalistyczna biegłość może być potężna, nie będąc ogólną ani adaptacyjną.

1997–2016
Kamień milowy 04

Ponadludzkie osiągnięcia w wąskich dziedzinach

Deep Blue, Watson i AlphaGo przewyższyły bardzo dobrych ludzi w konkretnych zadaniach, pozostając jednak czymś innym niż ogólnie kompetentny człowiek.

2019
Kamień milowy 05

ARC koncentruje się na efektywności nabywania umiejętności

François Chollet zaproponował mierzenie inteligencji poprzez efektywność, z jaką systemy nabywają nowe umiejętności, wprowadzając Abstraction and Reasoning Corpus.

2023
Kamień milowy 06

Ramy „Poziomy AGI”

Badacze Google DeepMind zaproponowali klasyfikowanie systemów zarówno według poziomu osiągów, jak i szerokości zakresu zadań — od poziomu wyłaniającego się po ponadludzki.

2024–26
Kamień milowy 07

Ewoluują benchmarki rozumowania i agentów

ARC-AGI i ewaluacje agentów w długim horyzoncie coraz częściej badają adaptację, użycie narzędzi i interaktywne uczenie się, choć nasycenie benchmarków i zanieczyszczenie danych pozostają problemem.

Dzisiaj
Kamień milowy 08

Nie istnieje powszechna certyfikacja

AGI pozostaje pojęciem spornym. Każde poważne twierdzenie musi określać definicję, zakres, ludzki poziom odniesienia, granicę systemu i standard dowodowy.

Trudne fakty

Dlaczego pomiar AGI jest trudny

Nieokreślona przestrzeń zadań

„Wszystkie zadania poznawcze” nie są skończoną, neutralną próbą. To wybory ekonomiczne i kulturowe kształtują to, co jest uwzględniane.

Nieprzejrzystość treningu

Bez wiedzy o tym, co system widział, trudno oddzielić odtwarzanie i zapamiętywanie od nowego uczenia się.

Zmieniająca się granica systemu

Narzędzia i rusztowania mogą radykalnie zmieniać wyniki. Twierdzenia o samym modelu i o pełnym systemie odpowiadają na różne pytania.

Zmieniający się ludzki poziom odniesienia

Wyniki ludzi zależą od wiedzy specjalistycznej, motywacji, czasu, współpracy i dostępu do narzędzi.

Mocne dowody mogą wykazać

  • Szerokie osiągi względem określonej grupy ludzi
  • Szybkie uczenie się na prywatnych, nowych zadaniach
  • Odporny transfer i autonomia w długim horyzoncie
  • Znane koszty, interwencje i tryby awarii

Etykieta AGI nie może automatycznie dowieść

  • Świadomości ani statusu moralnego
  • Zgodności z ludzkimi wartościami
  • Braku ryzyka katastrofalnego błędu
  • Równych kompetencji w każdym kontekście fizycznym

Jasne odpowiedzi

Najczęstsze pytania o AGI

Co oznacza skrót AGI?

Artificial general intelligence, czyli sztuczna inteligencja ogólna. Zwykle oznacza AI o szerokich, adaptacyjnych kompetencjach w wielu zadaniach, a nie wyjątkową skuteczność w jednej wąskiej dziedzinie. Definicje różnią się pod względem autonomii, ucieleśnienia i wymaganego poziomu względem człowieka.

Czy istnieje jeden oficjalny test AGI?

Nie. Nie istnieje powszechnie uznany egzamin ani próg. Badacze korzystają z zestawów benchmarków, ludzkich poziomów odniesienia, uczenia się nowych zadań, ewaluacji agentów i ram łączących szerokość zakresu z poziomem osiągów.

Czy ta strona sprawdza, czy rzeczywisty model jest AGI?

Nie. Sekcja interaktywna sprawdza Twoją umiejętność interpretowania twierdzeń opartych na dowodach. Certyfikacja rzeczywistego systemu wymagałaby dostępu do niego, prywatnych ewaluacji, udokumentowanych warunków i niezależnej replikacji.

Czy AGI zostało już osiągnięte?

Nie ma konsensusu, ponieważ definicje i progi są różne. Mocne twierdzenia powinny wskazywać dokładną definicję operacyjną zamiast traktować AGI jako powszechnie uzgodnione zdarzenie zero-jedynkowe.

Czy jeden benchmark może dowieść AGI?

Żaden pojedynczy benchmark nie obejmuje szerokości zakresu, odporności, efektywności uczenia się, autonomii i niezawodności w świecie rzeczywistym, zwykle kojarzonych z AGI. Benchmark może dostarczać ważnych dowodów dotyczących jednego składnika.

Czy zdanie testu Turinga oznacza to samo co AGI?

Nie. Test Turinga mierzy nierozróżnialność w rozmowie w ramach określonego protokołu. Twierdzenia o AGI zazwyczaj dotyczą szerszych kompetencji, uczenia się i transferu.

Czy AGI musi być świadoma?

Nie według większości operacyjnych definicji zdolności. Świadomość jest odrębnym, nierozstrzygniętym problemem naukowym i filozoficznym.

Czy AGI potrzebuje ciała robota?

To zależy od definicji. Niektóre ramy wyraźnie koncentrują się na niefizycznych zadaniach poznawczych; inne zakładają, że ogólność podobna do ludzkiej wymaga percepcji i działania w świecie fizycznym.

Czym jest zanieczyszczenie benchmarku?

Występuje wtedy, gdy zadania ewaluacyjne lub ich bliskie warianty trafiają do danych treningowych, danych do dostrajania lub tworzenia promptów, przez co wysoki wynik może odzwierciedlać wcześniejszy kontakt zamiast generalizacji na naprawdę nowe problemy.

Jaka jest różnica między modelem a agentem?

Model odwzorowuje dane wejściowe na wyjściowe. System agentowy może łączyć model z pamięcią, pętlami planowania, narzędziami, danymi zewnętrznymi i zdolnością podejmowania działań w czasie.

Co następuje po AGI?

Sztuczna superinteligencja, czyli ASI, to hipotetyczny poziom, na którym szeroka inteligencja maszynowa znacznie przewyższa ludzkie możliwości w większości lub zasadniczo wszystkich istotnych dziedzinach poznawczych.

Czy AGI może być bezpieczna, ale zawodna?

Bezpieczeństwo i niezawodność częściowo się pokrywają, ale nie są tym samym. System może mieć zgodne intencje, a jednocześnie często się mylić, albo być technicznie zdolny i niezawodny, lecz realizować szkodliwe cele. Obie kwestie wymagają osobnych dowodów.

Prześledź podstawy

Źródła pierwotne i badawcze

Karta OpenAI

Wpływowa definicja ekonomiczna: wysoce autonomiczne systemy przewyższające ludzi w większości prac o wartości ekonomicznej.

Otwórz źródło

Google DeepMind: Poziomy AGI

Ramy oparte na poziomie osiągów i szerokości zakresu zdolności.

Otwórz źródło

Chollet: O mierze inteligencji

Definiuje inteligencję przez efektywność nabywania umiejętności i wprowadza ARC.

Otwórz źródło

Repozytorium ARC-AGI

Oficjalne zadania, metody i dokumentacja Abstraction and Reasoning Corpus.

Otwórz źródło

ARC-AGI-3

Interaktywny benchmark rozumowania dotyczący eksploracji, przyswajania celów i adaptacyjnych modeli świata.

Otwórz źródło

Stanford AI Index

Coroczny przegląd danych o zdolnościach AI, trendach benchmarkowych, inwestycjach, polityce i skutkach.

Otwórz źródło

Ramy zarządzania ryzykiem AI NIST

Uporządkowane ramy zarządzania, mapowania, pomiaru i ograniczania ryzyka związanego z AI.

Otwórz źródło

Turing (1950)

Oryginalna praca o grze w naśladownictwo i fundamentalny argument dotyczący inteligencji maszynowej.

Otwórz źródło