GUIDA ALL’IA BASATA SULLE PROVE: Valuta le affermazioni, non il linguaggio di marketing Inizia il test AGI
Laboratorio astratto di valutazione dell’IA generale collegato a numerose stazioni di capacità

Ampiezza · apprendimento · autonomia · robustezza

Il test AGI

Un unico sistema può apprendere, ragionare e lavorare in ambiti non familiari, oppure stiamo scambiando un insieme di abilità impressionanti per intelligenza generale?

10 casi basati sulle prove Nessuna falsa certificazione Guida collegata alla ricerca

Orientamento importante

Non esiste un esame AGI ufficiale universale

L’AGI è un concetto di ricerca con definizioni concorrenti. Questa pagina non dichiara che un sistema specifico abbia, o non abbia, superato una magica linea del traguardo. Il test misura con quanta attenzione interpreti le prove sulle capacità. La valutazione di un sistema reale richiederebbe compiti privati, baseline umane, strumenti e costi dichiarati, test di robustezza e replica indipendente.

Prove riesaminate 08/2026

Nessun test unicoL’AGI richiede prove convergentiSu ampiezza, profondità e adattamento
Generale ≠ perfettoGli esseri umani sono generali ma fallibiliL’affidabilità resta essenziale
Il sistema contaI modelli possono usare memoria e strumentiDichiara l’intero confine della valutazione
Capacità ≠ sicurezzaQuestioni distinte richiedono proveLa potenza non garantisce l’allineamento

Laboratorio interattivo di valutazione

Test delle prove sull’AGI

Ogni caso descrive un’affermazione su un sistema di IA. Scegli la conclusione più difendibile—non quella più entusiasmante né quella più scettica.

Avanzamento0/10

Che cosa significano le tue risposte: questo test valuta la tua capacità di interpretare una valutazione dell’AGI. Un punteggio alto significa che, in questi casi, hai distinto risultati ristretti, vera generalizzazione e inferenze non supportate. Non misura il tuo QI né stabilisce se tu sia un’AGI.

Cerca prove dirette

Chiediti che cosa abbia effettivamente misurato l’osservazione prima di accettare un’affermazione più ampia.

Evita entrambi gli estremi

“Un benchmark dimostra l’AGI” e “ogni valutazione è inutile” sono in genere entrambe affermazioni eccessive.

01Validità del benchmarkUn sistema ottiene il 96% in un famoso benchmark pubblico di ragionamento dopo anni di discussioni online su quel benchmark. Qual è la conclusione più solida?
02TrasferimentoCon sole due dimostrazioni, un sistema apprende un ambiente di controllo visivo non familiare, deduce l’obiettivo, si adatta dopo un fallimento e riesce in modo efficiente. Che cosa supporta più direttamente questo risultato?
03AmpiezzaUn agente di programmazione supera quasi tutti i professionisti in compiti software ben specificati, ma non riesce a pianificare viaggi, interpretare diagrammi o imparare nuovi giochi in modo affidabile. Come dovrebbe essere classificato?
04AutonomiaUn agente completa attività di ricerca di otto ore usando strumenti, ma un essere umano deve correggerlo ogni 30 minuti. Qual è l’interpretazione più prudente?
05ComunicazioneUn chatbot viene giudicato umano in brevi conversazioni in cieco. Quale affermazione sull’AGI ne consegue?
06RobustezzaUn modello opera al livello di un adulto competente in sei ambiti, ma crolla quando formati, strumenti e formulazioni cambiano leggermente. Che cosa manca?
07AmbitoUn sistema eguaglia esseri umani competenti nel lavoro cognitivo non fisico, ma non sa manipolare oggetti. È AGI?
08Confine del sistemaUn modello riesce solo quando è collegato a ricerca, esecuzione di codice, memoria e strumenti specialistici. Che cosa dovrebbe riportare una valutazione?
09Stati mentaliUn modello dice: “Sono cosciente e ho raggiunto l’AGI”. Che cosa dimostra?
10ReplicaTeam indipendenti preregistrano i test, usano compiti privati, confrontano baseline di esseri umani competenti, dichiarano i costi e riproducono risultati ampi. Perché questa evidenza è più forte?

Parti dal termine controverso

Che cos’è l’intelligenza artificiale generale?

Una famiglia di definizioni, non un concetto definitivamente stabilito

La maggior parte delle definizioni combina generalità—competenza in un’ampia gamma di compiti—con prestazioni, apprendimento e un certo grado di autonomia. La carta di OpenAI enfatizza il superamento degli esseri umani nella maggior parte del lavoro economicamente utile. Il quadro “Levels of AGI” di DeepMind separa ampiezza e profondità. François Chollet pone l’accento sull’efficienza nell’acquisizione di abilità su compiti nuovi.

Buona pratica: non chiedere mai soltanto “È AGI?”. Chiedi: “Secondo quale definizione operativa, su quali compiti, a quale percentile umano, con quali strumenti, costi e tasso di intervento?”

Un obiettivo multidimensionale

Sei dimensioni che un’affermazione sull’AGI dovrebbe superare

Ampiezzamolti ambiti
Profonditàlivello relativo agli esseri umani
Apprendimentonuove abilità in modo efficiente
Trasferimentousare le conoscenze altrove
Robustezzaresistere a cambiamenti e attacchi
Autonomiacompletare compiti lunghi

Prestazioni senza generalità

I motori scacchistici e i sistemi per la struttura delle proteine possono essere sovrumani in un ambito senza diventare AGI.

Generalità senza perfezione

Gli esseri umani trasferiscono competenze tra ambiti nonostante gli errori. Pretendere una perfezione letterale pone un’asticella più alta dell’intelligenza generale umana.

Capacità senza efficienza

Un risultato può cambiare significato se per ogni compito consuma enormi risorse di calcolo, tempo o assistenza umana.

Oltre un’etichetta sì/no

L’AGI come livelli di ampiezza e prestazione

Un quadro influente tratta la capacità come una matrice. “Generale” copre un’ampia gamma di compiti non fisici; le prestazioni vengono confrontate con quelle di adulti competenti.

Prestazione
Ristretta
Generale
Interpretazione
Emergente
Una certa competenza utile nei compiti
Capacità disomogenea in molti compiti
Nel complesso sotto il livello di un adulto competente
Competente
Almeno al livello mediano di un adulto competente in un compito circoscritto
AGI competenteAlmeno al livello mediano di un adulto competente in un ampio insieme di compiti
Richiede ampiezza e prestazioni affidabili
Esperta
Almeno al 90° percentile in un compito circoscritto
AGI esperta in un ampio insieme di compiti
Un’affermazione molto più forte su scala economica
Sovrumana
Supera tutti gli esseri umani in un ambito
Supera ampiamente tutti gli esseri umani
Entra nel territorio dell’ASI

Strumenti di misurazione

Nessun benchmark rappresenta l’intera mente

Astrazione nuova

ARC-AGI

Mira all’induzione di regole a partire da pochi esempi e all’efficienza nell’acquisizione di abilità su compiti visivi non familiari. È utile per l’adattamento fluido, ma non è un test completo del linguaggio, dell’agentività o del mondo reale.

Lavoro su orizzonti lunghi

Valutazioni degli agenti

Misurano se i sistemi sanno pianificare, usare strumenti, recuperare dagli errori e completare progetti su orizzonti temporali crescenti. I risultati dipendono fortemente dallo scaffolding e dall’ambiente.

Conoscenza ampia

Suite di esami

Coprono molte discipline in modo efficiente, ma possono premiare la conoscenza memorizzata, l’abilità nel sostenere test e l’esposizione precedente più dell’apprendimento rapido.

Avviso sulla saturazione dei benchmark: quando un test diventa un obiettivo, gli sviluppatori ottimizzano per quel test. Mantieni set di controllo privati, ruota i compiti, verifica la contaminazione e conserva gruppi di confronto umano significativi.

La scala delle prove

Che cosa renderebbe convincente un’affermazione sull’AGI?

1DimostrazioneComportamento interessante, facile da selezionare
2Benchmark pubblicoConfrontabile ma soggetto a esposizione
3Valutazione privataCompiti nuovi e accesso controllato
4Baseline di esseri umani competentiAmpiezza, tempo, strumenti e costi comparabili
5Replica indipendenteProve verificabili, robuste e avversariali
  1. 01

    Definisci in anticipo il confine del sistema

    Modello, memoria, ricerca, esecuzione di codice, robotica, prompt e assistenza umana contano tutti.

  2. 02

    Campiona l’universo dei compiti

    Un’affermazione ampia richiede compiti rappresentativi, non una selezione di casi scelti ad arte.

  3. 03

    Testa l’apprendimento su compiti nuovi

    Misura quanto rapidamente il sistema acquisisce abilità per cui non poteva prepararsi durante l’addestramento.

  4. 04

    Misura l’affidabilità

    Contano il successo medio, i fallimenti catastrofici, la calibrazione, il recupero e i cambiamenti di distribuzione.

  5. 05

    Allinea le condizioni umane

    Confronta tempo, strumenti, istruzioni, incentivi e accesso al materiale di riferimento.

  6. 06

    Separa capacità e sicurezza

    Dopo aver mostrato che cosa sa fare un sistema, verifica se rimane controllabile e benefico.

Dall’imitazione all’adattamento

Una breve storia dell’idea di AGI

1950
Tappa 01

Turing riformula l’intelligenza delle macchine

Il gioco dell’imitazione rese centrale il comportamento osservabile, ma l’imitazione conversazionale non divenne mai una definizione completa di intelligenza generale.

1956
Tappa 02

L’IA diventa un campo di ricerca

La proposta di Dartmouth sosteneva che apprendimento e intelligenza potessero essere descritti con sufficiente precisione da permettere alle macchine di simularli.

Anni 1980
Tappa 03

I sistemi esperti mostrano il problema della ristrettezza

Prestazioni elevate in domini circoscritti mostrarono che una competenza specialistica poteva essere potente senza essere generale o adattabile.

1997–2016
Tappa 04

Traguardi sovrumani ma ristretti

Deep Blue, Watson e AlphaGo superarono esseri umani molto capaci in compiti specifici, pur restando diversi da una persona dotata di capacità generali.

2019
Tappa 05

ARC mira all’efficienza nell’acquisizione di abilità

François Chollet propose di misurare l’intelligenza attraverso l’efficienza con cui i sistemi acquisiscono nuove abilità, introducendo l’Abstraction and Reasoning Corpus.

2023
Tappa 06

Quadro dei livelli di AGI

I ricercatori di Google DeepMind proposero di classificare i sistemi sia per profondità delle prestazioni sia per ampiezza dei compiti, dal livello emergente a quello sovrumano.

2024–26
Tappa 07

Evolvono i benchmark di ragionamento e degli agenti

ARC-AGI e le valutazioni degli agenti su orizzonti lunghi testano sempre più adattamento, uso di strumenti e apprendimento interattivo, mentre saturazione e contaminazione dei benchmark restano motivo di preoccupazione.

Oggi
Tappa 08

Non esiste una certificazione universale

L’AGI rimane un concetto controverso. Qualsiasi affermazione seria deve specificare definizione, ambito, baseline umana, confine del sistema e standard probatorio.

Verità difficili

Perché misurare l’AGI è difficile

Universo dei compiti non definito

“Tutti i compiti cognitivi” non costituiscono un campione finito e neutrale. Le scelte economiche e culturali determinano che cosa viene conteggiato.

Opacità dell’addestramento

Senza sapere che cosa ha visto un sistema, è difficile distinguere recupero e memorizzazione da nuovo apprendimento.

Confine del sistema variabile

Strumenti e scaffold possono trasformare le prestazioni. Le affermazioni sul solo modello e quelle sul sistema completo rispondono a domande diverse.

Baseline umana variabile

Le prestazioni umane dipendono da competenza, motivazione, tempo, collaborazione e accesso agli strumenti.

Prove solide possono mostrare

  • Prestazioni ampie rispetto a esseri umani definiti
  • Apprendimento rapido su compiti nuovi e privati
  • Trasferimento robusto e autonomia su orizzonti lunghi
  • Costi, interventi e modalità di guasto noti

Un’etichetta AGI non può dimostrare automaticamente

  • Coscienza o status morale
  • Allineamento con i valori umani
  • Assenza di errori catastrofici
  • Uguale competenza in ogni contesto fisico

Risposte chiare

Domande frequenti sull’AGI

Che cosa significa AGI?

Intelligenza artificiale generale. Di solito indica un’IA con competenze ampie e adattabili in molti compiti, anziché prestazioni eccezionali in un singolo ambito ristretto. Le definizioni differiscono per autonomia, incarnazione e livello umano richiesto.

Esiste un test AGI ufficiale?

No. Non esiste un esame o una soglia autorizzati universalmente. I ricercatori usano suite di benchmark, baseline umane, apprendimento su compiti nuovi, valutazioni di agenti e quadri che combinano ampiezza e prestazioni.

Questa pagina verifica se un modello reale è AGI?

No. La sezione interattiva verifica la tua capacità di interpretare affermazioni basate su prove. Certificare un sistema reale richiederebbe accesso al sistema, valutazioni private, condizioni documentate e replica indipendente.

L’AGI è stata raggiunta?

Non c’è consenso, perché definizioni e soglie differiscono. Le affermazioni forti dovrebbero indicare l’esatta definizione operativa invece di trattare l’AGI come un evento binario universalmente concordato.

Un solo benchmark può dimostrare l’AGI?

Nessun singolo benchmark copre l’ampiezza, la robustezza, l’efficienza di apprendimento, l’autonomia e l’affidabilità nel mondo reale solitamente associate all’AGI. Un benchmark può fornire prove importanti su una componente.

Superare il Test di Turing equivale all’AGI?

No. Un Test di Turing misura l’indistinguibilità conversazionale secondo un protocollo. Le affermazioni sull’AGI riguardano di solito competenze più ampie, apprendimento e trasferimento.

L’AGI deve essere cosciente?

Non secondo la maggior parte delle definizioni operative basate sulle capacità. La coscienza è una questione scientifica e filosofica separata e irrisolta.

L’AGI ha bisogno di un corpo robotico?

Dipende dalla definizione. Alcuni quadri si concentrano esplicitamente su compiti cognitivi non fisici; altri sostengono che una generalità simile a quella umana richieda percezione e azione nel mondo fisico.

Che cos’è la contaminazione dei benchmark?

Si verifica quando compiti di valutazione o varianti molto simili entrano nei dati di addestramento, tuning o sviluppo dei prompt, così un punteggio elevato può riflettere un’esposizione precedente anziché la generalizzazione a problemi realmente nuovi.

Qual è la differenza tra un modello e un agente?

Un modello trasforma input in output. Un sistema agentico può combinare un modello con memoria, cicli di pianificazione, strumenti, dati esterni e la capacità di compiere azioni nel tempo.

Che cosa viene dopo l’AGI?

La superintelligenza artificiale, o ASI, è un livello ipotetico in cui un’intelligenza artificiale ampia supera di gran lunga le capacità umane nella maggior parte o sostanzialmente in tutti i domini cognitivi rilevanti.

L’AGI può essere sicura ma inaffidabile?

Sicurezza e affidabilità si sovrappongono, ma non sono la stessa cosa. Un sistema può essere allineato nelle intenzioni ma incline agli errori, oppure tecnicamente capace e affidabile mentre persegue obiettivi dannosi. Entrambe richiedono prove dedicate.

Ripercorri il quadro

Fonti primarie e di ricerca

Carta di OpenAI

Una definizione economica di rilievo: sistemi altamente autonomi che superano gli esseri umani nella maggior parte del lavoro economicamente utile.

Apri la fonte

Google DeepMind: livelli di AGI

Un quadro basato sulla profondità delle prestazioni e sull’ampiezza delle capacità.

Apri la fonte

Chollet: sulla misura dell’intelligenza

Definisce l’intelligenza in termini di efficienza nell’acquisizione di abilità e introduce ARC.

Apri la fonte

Repository ARC-AGI

Compiti, metodi e documentazione ufficiali dell’Abstraction and Reasoning Corpus.

Apri la fonte

ARC-AGI-3

Benchmark interattivo di ragionamento per esplorazione, acquisizione degli obiettivi e modelli del mondo adattivi.

Apri la fonte

Stanford AI Index

Rassegna annuale di dati sulle capacità dell’IA, le tendenze dei benchmark, gli investimenti, le politiche e gli impatti.

Apri la fonte

Quadro NIST per la gestione dei rischi dell’IA

Un quadro strutturato per governare, mappare, misurare e gestire i rischi dell’IA.

Apri la fonte

Turing (1950)

L’articolo originale sul gioco dell’imitazione e l’argomentazione fondamentale sull’intelligenza delle macchine.

Apri la fonte