ГИД ПО ИИ: СНАЧАЛА ДОКАЗАТЕЛЬСТВА Проверяйте утверждения, а не маркетинговые формулировки Начать AGI-тест
Абстрактная лаборатория оценки общего ИИ, связанная с множеством станций проверки способностей

Широта · обучение · автономность · устойчивость

AGI-тест

Может ли одна система учиться, рассуждать и работать в незнакомых областях — или мы принимаем набор впечатляющих навыков за общий интеллект?

10 кейсов с доказательствами Без фиктивной сертификации Гид со ссылками на исследования

Важное пояснение

Универсального официального экзамена AGI не существует

AGI — исследовательское понятие с конкурирующими определениями. Эта страница не заявляет, что какая-либо конкретная система пересекла — или не пересекла — некую магическую финишную черту. Тест измеряет, насколько внимательно вы интерпретируете доказательства способностей. Для оценки реальной системы нужны закрытые задания, человеческие базовые показатели, раскрытые инструменты и затраты, проверка устойчивости и независимое воспроизведение.

Доказательства проверены 08.2026

Нет единственного тестаДля AGI нужны сходящиеся доказательстваПо широте, глубине и адаптации
Общий ≠ идеальныйЛюди универсальны, но ошибаютсяНадежность все равно необходима
Система имеет значениеМодели могут использовать память и инструментыУказывайте полные границы оцениваемой системы
Способность ≠ безопасностьРазные вопросы требуют отдельных доказательствМощность не гарантирует согласованность

Интерактивная лаборатория оценки

AGI-тест доказательств

Каждый кейс описывает утверждение о системе ИИ. Выберите наиболее обоснованный вывод — не самый впечатляющий и не самый скептический.

Прогресс0/10

Что означают ваши ответы: этот тест проверяет вашу грамотность в оценке AGI. Высокий результат означает, что в этих кейсах вы различали узкое достижение, реальное обобщение и необоснованный вывод. Он не измеряет ваш IQ и не определяет, являетесь ли вы AGI.

Ищите прямые доказательства

Прежде чем принимать более широкий вывод, спросите, что именно измеряло наблюдение.

Избегайте обеих крайностей

«Один бенчмарк доказывает AGI» и «любая оценка бесполезна» — обычно одинаково чрезмерные утверждения.

01Валидность бенчмаркаСистема набрала 96% на известном публичном бенчмарке рассуждений после многих лет его обсуждения в интернете. Какой вывод наиболее обоснован?
02ПереносПолучив всего два примера, система осваивает незнакомую среду визуального управления, выводит цель, адаптируется после неудачи и эффективно добивается успеха. Что это подтверждает наиболее непосредственно?
03ШиротаАгент для программирования превосходит почти всех специалистов в четко заданных задачах разработки, но не умеет надежно планировать поездки, интерпретировать схемы или осваивать новые игры. Как его следует классифицировать?
04АвтономностьАгент выполняет восьмичасовые исследовательские задачи с помощью инструментов, но каждые 30 минут человек должен его корректировать. Как это следует интерпретировать осторожно и точно?
05КоммуникацияВ коротких слепых диалогах чат-бот принимают за человека. Какой вывод об AGI из этого следует?
06УстойчивостьМодель работает на уровне квалифицированного взрослого в шести областях, но резко теряет качество при небольшом изменении формата, инструментов и формулировок. Чего ей не хватает?
07Область охватаСистема соответствует уровню квалифицированных людей во множестве нефизических когнитивных задач, но не умеет манипулировать предметами. Это AGI?
08Границы системыМодель добивается успеха только при подключении поиска, выполнения кода, памяти и специализированных инструментов. Что должно быть указано в отчете об оценке?
09Психические состоянияМодель говорит: «Я обладаю сознанием и достигла AGI». Что это доказывает?
10ВоспроизводимостьНезависимые команды заранее регистрируют тесты, используют закрытые задания, сравнивают результаты с квалифицированными людьми, раскрывают затраты и воспроизводят общие результаты. Почему это более сильное доказательство?

Начнем со спорного понятия

Что такое искусственный общий интеллект?

Семейство определений, а не единый устоявшийся объект

Большинство определений объединяют универсальность — компетентность в широком спектре задач — с уровнем результатов, обучением и некоторой степенью автономности. Хартия OpenAI делает акцент на превосходстве над людьми в большей части экономически ценной работы. Концепция DeepMind «Уровни AGI» разделяет широту и глубину. Франсуа Шолле подчеркивает эффективность освоения навыков на новых задачах.

Хорошая практика: не спрашивайте только «Это AGI?». Спрашивайте: «По какому операционному определению, на каких задачах, на каком процентиле относительно людей, с какими инструментами, затратами и частотой вмешательства?»

Многомерная цель

Шесть измерений, которые должно выдержать утверждение об AGI

Широтамного областей
Глубинауровень относительно человека
Обучениеэффективное освоение новых навыков
Переносприменение знаний в других условиях
Устойчивостьвыдерживать сдвиги и атаки
Автономностьвыполнять длительные задачи

Результативность без универсальности

Шахматные движки и системы предсказания структуры белка могут быть сверхчеловеческими в своей области, не становясь AGI.

Универсальность без совершенства

Люди переносят навыки между областями, несмотря на ошибки. Требование буквального совершенства устанавливает планку выше человеческого общего интеллекта.

Способность без эффективности

Смысл результата может измениться, если для каждой задачи требуются огромные вычислительные ресурсы, время или помощь человека.

За пределами ответа «да/нет»

AGI как уровни широты и результативности

В одной влиятельной концепции способности рассматриваются как матрица. «Общий» охватывает широкий спектр нефизических задач, а результаты сравниваются с квалифицированными взрослыми.

Результативность
Узкий
Общий
Интерпретация
Зарождающийся
Некоторая полезная компетентность в задачах
Неравномерные способности во множестве задач
В целом ниже уровня квалифицированного взрослого
Компетентный
Не ниже медианного уровня квалифицированного взрослого в ограниченной задаче
Компетентный AGIНе ниже медианного уровня квалифицированного взрослого в широком спектре задач
Требует широты и надежной результативности
Экспертный
Не ниже 90-го процентиля в ограниченной задаче
Экспертный AGI в широком спектре задач
Гораздо более сильное утверждение для всей экономики
Сверхчеловеческий
Превосходит всех людей в одной области
В широком смысле превосходит всех людей
Переходит на территорию ASI

Набор инструментов измерения

Ни один бенчмарк не охватывает интеллект целиком

Новая абстракция

ARC-AGI

Проверяет выведение правил по нескольким примерам и эффективность освоения навыков на незнакомых визуальных задачах. Полезен для оценки гибкой адаптации, но не является полным тестом языка, агентности или реального мира.

Работа на длинном горизонте

Оценки агентов

Измеряют, могут ли системы планировать, использовать инструменты, восстанавливаться после ошибок и завершать проекты на все более длинных временных горизонтах. Результаты сильно зависят от вспомогательной инфраструктуры и среды.

Широкие знания

Наборы экзаменов

Эффективно охватывают множество дисциплин, но могут сильнее вознаграждать накопленные знания, навык прохождения тестов и предварительное знакомство, чем быстрое обучение.

Предупреждение о насыщении бенчмарка: как только тест становится целью, разработчики начинают оптимизировать системы под него. Сохраняйте закрытые контрольные наборы, меняйте задания, проверяйте загрязнение данных и поддерживайте содержательные группы сравнения с людьми.

Лестница доказательств

Что сделало бы утверждение об AGI убедительным?

1ДемонстрацияИнтересное поведение, которое легко отобрать
2Публичный бенчмаркСопоставимо, но подвержено предварительному знакомству
3Закрытая оценкаНовые задания и контролируемый доступ
4Базовый уровень квалифицированных людейСопоставлены широта, время, инструменты и затраты
5Независимое воспроизведениеПроверяемые, устойчивые и состязательные доказательства
  1. 01

    Заранее определите границы системы

    Учитываются модель, память, поиск, выполнение кода, робототехника, промпты и помощь человека.

  2. 02

    Сформируйте выборку из пространства задач

    Широкое утверждение требует репрезентативных задач, а не вручную отобранной подборки лучших примеров.

  3. 03

    Проверяйте обучение новому

    Измеряйте, насколько быстро система осваивает навыки, к которым она не могла подготовиться во время обучения.

  4. 04

    Измеряйте надежность

    Важны средняя успешность, катастрофические сбои, калибровка, восстановление и сдвиг распределения.

  5. 05

    Сопоставляйте условия с человеческими

    Сравнивайте время, инструменты, инструкции, стимулы и доступ к справочным материалам.

  6. 06

    Отделяйте способности от безопасности

    После демонстрации возможностей системы проверяйте, остается ли она управляемой и полезной.

От имитации к адаптации

Краткая история идеи AGI

1950
Веха 01

Тьюринг переосмысливает машинный интеллект

Игра в имитацию поставила наблюдаемое поведение в центр внимания, однако имитация разговора так и не стала исчерпывающим определением общего интеллекта.

1956
Веха 02

ИИ становится самостоятельной областью исследований

В Дартмутском предложении утверждалось, что обучение и интеллект можно описать достаточно точно, чтобы машины могли их моделировать.

1980s
Веха 03

Экспертные системы выявляют проблему узкой специализации

Высокие результаты в ограниченных областях показали, что экспертность может быть очень сильной, не будучи универсальной или адаптивной.

1997–2016
Веха 04

Сверхчеловеческие достижения в узких областях

Deep Blue, Watson и AlphaGo превзошли сильнейших людей в отдельных задачах, оставаясь при этом далекими от универсально способного человека.

2019
Веха 05

ARC нацелен на эффективность освоения навыков

Франсуа Шолле предложил измерять интеллект по эффективности, с которой системы осваивают новые навыки, представив набор Abstraction and Reasoning Corpus.

2023
Веха 06

Концепция уровней AGI

Исследователи Google DeepMind предложили классифицировать системы одновременно по глубине результатов и широте задач — от зарождающегося уровня до сверхчеловеческого.

2024–26
Веха 07

Развиваются бенчмарки рассуждений и агентов

ARC-AGI и оценки агентов на длинном горизонте все чаще проверяют адаптацию, использование инструментов и интерактивное обучение, при этом насыщение бенчмарков и загрязнение данных остаются проблемами.

Сегодня
Веха 08

Универсальной сертификации не существует

AGI остается спорным понятием. Любое серьезное утверждение должно указывать определение, область охвата, человеческий базовый уровень, границы системы и стандарт доказательности.

Непростые факты

Почему измерять AGI сложно

Неопределенное пространство задач

«Все когнитивные задачи» — не конечная и не нейтральная выборка. На то, что считается, влияют экономические и культурные решения.

Непрозрачность обучения

Не зная, что система видела при обучении, трудно отделить извлечение и запоминание от нового обучения.

Меняющиеся границы системы

Инструменты и вспомогательная инфраструктура могут радикально менять результаты. Утверждения об одной модели и о полной системе отвечают на разные вопросы.

Меняющийся человеческий базовый уровень

Результаты людей зависят от опыта, мотивации, времени, сотрудничества и доступа к инструментам.

Сильные доказательства могут показать

  • Широкую результативность относительно четко определенной группы людей
  • Быстрое обучение на закрытых новых задачах
  • Устойчивый перенос и автономность на длинном горизонте
  • Известные затраты, вмешательства и режимы отказа

Ярлык AGI сам по себе не может доказать

  • Сознание или моральный статус
  • Согласованность с человеческими ценностями
  • Отсутствие катастрофических ошибок
  • Одинаковую компетентность в любом физическом контексте

Ясные ответы

Частые вопросы об AGI

Что означает AGI?

Artificial General Intelligence — искусственный общий интеллект. Обычно так называют ИИ с широкими адаптивными способностями во множестве задач, а не с исключительными результатами в одной узкой области. Определения различаются по требованиям к автономности, воплощенности и необходимому уровню относительно человека.

Существует ли один официальный AGI-тест?

Нет. Универсально признанного экзамена или порога не существует. Исследователи используют наборы бенчмарков, человеческие базовые уровни, обучение на новых задачах, оценки агентов и подходы, объединяющие широту и уровень результатов.

Проверяет ли эта страница, является ли реальная модель AGI?

Нет. Интерактивный раздел проверяет вашу способность интерпретировать утверждения на основе доказательств. Для сертификации реальной системы потребовались бы доступ к ней, закрытые оценки, документированные условия и независимое воспроизведение результатов.

Достигнут ли уже AGI?

Единого мнения нет, поскольку определения и пороги различаются. Сильные утверждения должны указывать точное операционное определение, а не представлять AGI как общепризнанное бинарное событие.

Может ли один бенчмарк доказать AGI?

Ни один отдельный бенчмарк не охватывает широту, устойчивость, эффективность обучения, автономность и надежность в реальном мире, которые обычно связывают с AGI. Бенчмарк может дать важные данные об одном из компонентов.

Равнозначно ли прохождение Тьюринг-теста AGI?

Нет. Тьюринг-тест измеряет неразличимость в разговоре в рамках заданного протокола. Утверждения об AGI обычно касаются более широкой компетентности, обучения и переноса навыков.

Обязан ли AGI обладать сознанием?

Не по большинству операционных определений способностей. Сознание — отдельный и пока нерешенный научный и философский вопрос.

Нужно ли AGI тело робота?

Зависит от определения. Одни подходы прямо сосредоточены на нефизических когнитивных задачах; другие утверждают, что человекоподобная универсальность требует восприятия и действий в физическом мире.

Что такое загрязнение бенчмарка?

Оно возникает, когда оценочные задания или их близкие варианты попадают в данные обучения, донастройки или разработки промптов, поэтому высокий балл может отражать предварительное знакомство, а не обобщение на действительно новые задачи.

Чем модель отличается от агента?

Модель преобразует входы в выходы. Агентная система может сочетать модель с памятью, циклами планирования, инструментами, внешними данными и способностью выполнять действия во времени.

Что идет после AGI?

Artificial Superintelligence, или ASI, — гипотетический уровень, на котором широкий машинный интеллект значительно превосходит человеческие способности в большинстве или практически во всех значимых когнитивных областях.

Может ли AGI быть безопасным, но ненадежным?

Безопасность и надежность пересекаются, но это не одно и то же. Система может быть согласована по намерениям, но часто ошибаться, либо быть технически способной и надежной, преследуя вредные цели. Для обоих свойств нужны отдельные доказательства.

Проследить основу подхода

Первоисточники и исследовательские материалы

Хартия OpenAI

Известное экономическое определение: высокоавтономные системы, превосходящие людей в большей части экономически ценной работы.

Открыть источник

Google DeepMind: уровни AGI

Концепция, основанная на глубине результатов и широте способностей.

Открыть источник

Шолле: «О мере интеллекта»

Определяет интеллект через эффективность освоения навыков и представляет ARC.

Открыть источник

Репозиторий ARC-AGI

Официальные задания, методы и документация для Abstraction and Reasoning Corpus.

Открыть источник

ARC-AGI-3

Интерактивный бенчмарк рассуждений для исследования среды, освоения целей и адаптивных моделей мира.

Открыть источник

Stanford AI Index

Ежегодные данные о возможностях ИИ, тенденциях бенчмарков, инвестициях, политике и влиянии.

Открыть источник

Система управления рисками ИИ NIST

Структурированная система для управления, картирования, измерения и контроля рисков ИИ.

Открыть источник

Тьюринг (1950)

Оригинальная работа об игре в имитацию и основополагающий аргумент о машинном интеллекте.

Открыть источник