Orientamento importante
Non esiste un esame AGI ufficiale universale
L’AGI è un concetto di ricerca con definizioni concorrenti. Questa pagina non dichiara che un sistema specifico abbia, o non abbia, superato una magica linea del traguardo. Il test misura con quanta attenzione interpreti le prove sulle capacità. La valutazione di un sistema reale richiederebbe compiti privati, baseline umane, strumenti e costi dichiarati, test di robustezza e replica indipendente.
Prove riesaminate 08/2026
Laboratorio interattivo di valutazione
Test delle prove sull’AGI
Ogni caso descrive un’affermazione su un sistema di IA. Scegli la conclusione più difendibile—non quella più entusiasmante né quella più scettica.
Che cosa significano le tue risposte: questo test valuta la tua capacità di interpretare una valutazione dell’AGI. Un punteggio alto significa che, in questi casi, hai distinto risultati ristretti, vera generalizzazione e inferenze non supportate. Non misura il tuo QI né stabilisce se tu sia un’AGI.
Chiediti che cosa abbia effettivamente misurato l’osservazione prima di accettare un’affermazione più ampia.
“Un benchmark dimostra l’AGI” e “ogni valutazione è inutile” sono in genere entrambe affermazioni eccessive.
Il tuo profilo di valutatore
Che cosa significa davvero questo risultato
Non certifica un sistema di IA come AGI. Hai valutato affermazioni fittizie basate su prove; non è stato testato alcun modello reale.
Parti dal termine controverso
Che cos’è l’intelligenza artificiale generale?
Una famiglia di definizioni, non un concetto definitivamente stabilito
La maggior parte delle definizioni combina generalità—competenza in un’ampia gamma di compiti—con prestazioni, apprendimento e un certo grado di autonomia. La carta di OpenAI enfatizza il superamento degli esseri umani nella maggior parte del lavoro economicamente utile. Il quadro “Levels of AGI” di DeepMind separa ampiezza e profondità. François Chollet pone l’accento sull’efficienza nell’acquisizione di abilità su compiti nuovi.
Un obiettivo multidimensionale
Sei dimensioni che un’affermazione sull’AGI dovrebbe superare
Prestazioni senza generalità
I motori scacchistici e i sistemi per la struttura delle proteine possono essere sovrumani in un ambito senza diventare AGI.
Generalità senza perfezione
Gli esseri umani trasferiscono competenze tra ambiti nonostante gli errori. Pretendere una perfezione letterale pone un’asticella più alta dell’intelligenza generale umana.
Capacità senza efficienza
Un risultato può cambiare significato se per ogni compito consuma enormi risorse di calcolo, tempo o assistenza umana.
Oltre un’etichetta sì/no
L’AGI come livelli di ampiezza e prestazione
Un quadro influente tratta la capacità come una matrice. “Generale” copre un’ampia gamma di compiti non fisici; le prestazioni vengono confrontate con quelle di adulti competenti.
Strumenti di misurazione
Nessun benchmark rappresenta l’intera mente
ARC-AGI
Mira all’induzione di regole a partire da pochi esempi e all’efficienza nell’acquisizione di abilità su compiti visivi non familiari. È utile per l’adattamento fluido, ma non è un test completo del linguaggio, dell’agentività o del mondo reale.
Valutazioni degli agenti
Misurano se i sistemi sanno pianificare, usare strumenti, recuperare dagli errori e completare progetti su orizzonti temporali crescenti. I risultati dipendono fortemente dallo scaffolding e dall’ambiente.
Suite di esami
Coprono molte discipline in modo efficiente, ma possono premiare la conoscenza memorizzata, l’abilità nel sostenere test e l’esposizione precedente più dell’apprendimento rapido.
La scala delle prove
Che cosa renderebbe convincente un’affermazione sull’AGI?
- 01
Definisci in anticipo il confine del sistema
Modello, memoria, ricerca, esecuzione di codice, robotica, prompt e assistenza umana contano tutti.
- 02
Campiona l’universo dei compiti
Un’affermazione ampia richiede compiti rappresentativi, non una selezione di casi scelti ad arte.
- 03
Testa l’apprendimento su compiti nuovi
Misura quanto rapidamente il sistema acquisisce abilità per cui non poteva prepararsi durante l’addestramento.
- 04
Misura l’affidabilità
Contano il successo medio, i fallimenti catastrofici, la calibrazione, il recupero e i cambiamenti di distribuzione.
- 05
Allinea le condizioni umane
Confronta tempo, strumenti, istruzioni, incentivi e accesso al materiale di riferimento.
- 06
Separa capacità e sicurezza
Dopo aver mostrato che cosa sa fare un sistema, verifica se rimane controllabile e benefico.
Dall’imitazione all’adattamento
Una breve storia dell’idea di AGI
Turing riformula l’intelligenza delle macchine
Il gioco dell’imitazione rese centrale il comportamento osservabile, ma l’imitazione conversazionale non divenne mai una definizione completa di intelligenza generale.
L’IA diventa un campo di ricerca
La proposta di Dartmouth sosteneva che apprendimento e intelligenza potessero essere descritti con sufficiente precisione da permettere alle macchine di simularli.
I sistemi esperti mostrano il problema della ristrettezza
Prestazioni elevate in domini circoscritti mostrarono che una competenza specialistica poteva essere potente senza essere generale o adattabile.
Traguardi sovrumani ma ristretti
Deep Blue, Watson e AlphaGo superarono esseri umani molto capaci in compiti specifici, pur restando diversi da una persona dotata di capacità generali.
ARC mira all’efficienza nell’acquisizione di abilità
François Chollet propose di misurare l’intelligenza attraverso l’efficienza con cui i sistemi acquisiscono nuove abilità, introducendo l’Abstraction and Reasoning Corpus.
Quadro dei livelli di AGI
I ricercatori di Google DeepMind proposero di classificare i sistemi sia per profondità delle prestazioni sia per ampiezza dei compiti, dal livello emergente a quello sovrumano.
Evolvono i benchmark di ragionamento e degli agenti
ARC-AGI e le valutazioni degli agenti su orizzonti lunghi testano sempre più adattamento, uso di strumenti e apprendimento interattivo, mentre saturazione e contaminazione dei benchmark restano motivo di preoccupazione.
Non esiste una certificazione universale
L’AGI rimane un concetto controverso. Qualsiasi affermazione seria deve specificare definizione, ambito, baseline umana, confine del sistema e standard probatorio.
Verità difficili
Perché misurare l’AGI è difficile
Universo dei compiti non definito
“Tutti i compiti cognitivi” non costituiscono un campione finito e neutrale. Le scelte economiche e culturali determinano che cosa viene conteggiato.
Opacità dell’addestramento
Senza sapere che cosa ha visto un sistema, è difficile distinguere recupero e memorizzazione da nuovo apprendimento.
Confine del sistema variabile
Strumenti e scaffold possono trasformare le prestazioni. Le affermazioni sul solo modello e quelle sul sistema completo rispondono a domande diverse.
Baseline umana variabile
Le prestazioni umane dipendono da competenza, motivazione, tempo, collaborazione e accesso agli strumenti.
Prove solide possono mostrare
- Prestazioni ampie rispetto a esseri umani definiti
- Apprendimento rapido su compiti nuovi e privati
- Trasferimento robusto e autonomia su orizzonti lunghi
- Costi, interventi e modalità di guasto noti
Un’etichetta AGI non può dimostrare automaticamente
- Coscienza o status morale
- Allineamento con i valori umani
- Assenza di errori catastrofici
- Uguale competenza in ogni contesto fisico
Risposte chiare
Domande frequenti sull’AGI
Che cosa significa AGI?
Intelligenza artificiale generale. Di solito indica un’IA con competenze ampie e adattabili in molti compiti, anziché prestazioni eccezionali in un singolo ambito ristretto. Le definizioni differiscono per autonomia, incarnazione e livello umano richiesto.
Esiste un test AGI ufficiale?
No. Non esiste un esame o una soglia autorizzati universalmente. I ricercatori usano suite di benchmark, baseline umane, apprendimento su compiti nuovi, valutazioni di agenti e quadri che combinano ampiezza e prestazioni.
Questa pagina verifica se un modello reale è AGI?
No. La sezione interattiva verifica la tua capacità di interpretare affermazioni basate su prove. Certificare un sistema reale richiederebbe accesso al sistema, valutazioni private, condizioni documentate e replica indipendente.
L’AGI è stata raggiunta?
Non c’è consenso, perché definizioni e soglie differiscono. Le affermazioni forti dovrebbero indicare l’esatta definizione operativa invece di trattare l’AGI come un evento binario universalmente concordato.
Un solo benchmark può dimostrare l’AGI?
Nessun singolo benchmark copre l’ampiezza, la robustezza, l’efficienza di apprendimento, l’autonomia e l’affidabilità nel mondo reale solitamente associate all’AGI. Un benchmark può fornire prove importanti su una componente.
Superare il Test di Turing equivale all’AGI?
No. Un Test di Turing misura l’indistinguibilità conversazionale secondo un protocollo. Le affermazioni sull’AGI riguardano di solito competenze più ampie, apprendimento e trasferimento.
L’AGI deve essere cosciente?
Non secondo la maggior parte delle definizioni operative basate sulle capacità. La coscienza è una questione scientifica e filosofica separata e irrisolta.
L’AGI ha bisogno di un corpo robotico?
Dipende dalla definizione. Alcuni quadri si concentrano esplicitamente su compiti cognitivi non fisici; altri sostengono che una generalità simile a quella umana richieda percezione e azione nel mondo fisico.
Che cos’è la contaminazione dei benchmark?
Si verifica quando compiti di valutazione o varianti molto simili entrano nei dati di addestramento, tuning o sviluppo dei prompt, così un punteggio elevato può riflettere un’esposizione precedente anziché la generalizzazione a problemi realmente nuovi.
Qual è la differenza tra un modello e un agente?
Un modello trasforma input in output. Un sistema agentico può combinare un modello con memoria, cicli di pianificazione, strumenti, dati esterni e la capacità di compiere azioni nel tempo.
Che cosa viene dopo l’AGI?
La superintelligenza artificiale, o ASI, è un livello ipotetico in cui un’intelligenza artificiale ampia supera di gran lunga le capacità umane nella maggior parte o sostanzialmente in tutti i domini cognitivi rilevanti.
L’AGI può essere sicura ma inaffidabile?
Sicurezza e affidabilità si sovrappongono, ma non sono la stessa cosa. Un sistema può essere allineato nelle intenzioni ma incline agli errori, oppure tecnicamente capace e affidabile mentre persegue obiettivi dannosi. Entrambe richiedono prove dedicate.
Ripercorri il quadro
Fonti primarie e di ricerca
Carta di OpenAI
Una definizione economica di rilievo: sistemi altamente autonomi che superano gli esseri umani nella maggior parte del lavoro economicamente utile.
Apri la fonteGoogle DeepMind: livelli di AGI
Un quadro basato sulla profondità delle prestazioni e sull’ampiezza delle capacità.
Apri la fonteChollet: sulla misura dell’intelligenza
Definisce l’intelligenza in termini di efficienza nell’acquisizione di abilità e introduce ARC.
Apri la fonteRepository ARC-AGI
Compiti, metodi e documentazione ufficiali dell’Abstraction and Reasoning Corpus.
Apri la fonteARC-AGI-3
Benchmark interattivo di ragionamento per esplorazione, acquisizione degli obiettivi e modelli del mondo adattivi.
Apri la fonteStanford AI Index
Rassegna annuale di dati sulle capacità dell’IA, le tendenze dei benchmark, gli investimenti, le politiche e gli impatti.
Apri la fonteQuadro NIST per la gestione dei rischi dell’IA
Un quadro strutturato per governare, mappare, misurare e gestire i rischi dell’IA.
Apri la fonteTuring (1950)
L’articolo originale sul gioco dell’imitazione e l’argomentazione fondamentale sull’intelligenza delle macchine.
Apri la fonte
