
Новый бенчмарк оценил AI-модели почти в ноль баллов
Спустя три дня после заявления Дженсена Хуанга о достижении AGI, ARC-AGI-3 показал результат ниже одного процента у всех передовых моделей на новых интерактивных задачах, которые люди решали безупречно.
Примечание: В этой статье рассматривается спорная дискуссия со спекулятивными элементами. Описанные события отражают позиции, занятые названными лицами; интерпретации статуса AGI остаются предметом активных споров.
Краткое содержание
23 марта 2026 года генеральный директор Nvidia Дженсен Хуанг заявил Лексу Фридману, что искусственный общий интеллект уже достигнут. 26 марта — три дня спустя — фонд ARC Prize представил ARC-AGI-3: 135 новых интерактивных сред, которые ни одна модель ИИ не видела во время обучения. Люди решали их с эффективностью 100%. Лучшая протестированная модель ИИ набрала 0,37%. Grok-4.20 набрал ровно ноль. Спор идёт не о возможностях. Он о том, что означает слово «общий».
Результаты
| Система | Результат ARC-AGI-3 (RHAE) |
|---|---|
| Люди | 100% |
| Google Gemini 3.1 Pro | 0,37% |
| OpenAI GPT-5.4 | 0,26% |
| Anthropic Claude Opus 4.6 | 0,25% |
| xAI Grok-4.20 | 0,00% |
| Приз ARC за прохождение | $2 000 000 |
Что сказал Дженсен Хуанг
23 марта Хуанг сделал самое определённое публичное заявление в своей карьере по этой теме:
«Я думаю, что это уже сейчас. Я думаю, мы достигли AGI». — Дженсен Хуанг, генеральный директор Nvidia, подкаст Lex Fridman, 23 марта 2026 года
Определение AGI у Хуанга носит операциональный характер: ИИ, способный выполнять сложные многоэтапные рабочие процессы, писать код промышленного уровня и — в принципе — управлять технологической компанией до оценки в $1 миллиард без необходимости человеческого контроля на каждом этапе. По этому стандарту, утверждает он, Claude Code, GPT-5.4 с использованием инструментов и мультиагентные конфигурации Grok уже соответствуют этим требованиям.
Заявление появилось на CNBC, Forbes, Fortune и Yahoo Finance в течение нескольких часов. Реакция исследовательского сообщества была скептической.
Три дня спустя: ARC-AGI-3
Франсуа Шолле — создатель оригинального бенчмарка ARC-AGI и сооснователь фонда ARC Prize — опубликовал ARC-AGI-3 26 марта. Выбор времени относительно заявления Хуанга не был случайным.
ARC-AGI-3 создан для проверки именно того, что определение Хуанга игнорирует: подлинной генерализации. Бенчмарк предлагает ИИ 135 интерактивных сред, которые не могли встречаться в каких-либо обучающих данных — новые проблемные пространства, требующие исследования и рассуждений с нуля, без каких-либо инструкций. Метрика оценки, относительная эффективность действий человека (RHAE), также штрафует за неэффективность: решите задачу, используя в десять раз больше действий, чем понадобилось бы человеку, и вы получите лишь 1% зачёта за эту среду.
Чтобы предотвратить манипуляции, 110 из 135 сред скрыты от публичного доступа. Только 25 открыты для тестирования. Ни одна модель даже близко не подошла к результату, который позволил бы претендовать на приз в $2 миллиона.
Почему результаты такие низкие
Разрыв в производительности не является неожиданностью для исследователей, изучающих генерализацию ИИ. Современные передовые модели демонстрируют исключительные возможности в задачах, похожих на распределение их обучающих данных. Они могут писать сложный код, синтезировать сложные документы и решать математические задачи на уровне доктора наук или выше — потому что они видели миллионы примеров таких задач.
ARC-AGI-3 полностью устраняет это преимущество. Среды разработаны так, чтобы не быть похожими ни на что из существующих наборов данных. Инструкций нет. Нет предварительных обучающих данных, которые соответствовали бы структуре каждой головоломки. Производительность требует такого гибкого, исследовательского рассуждения, которое люди развивают естественным образом и которого нет у современных архитектур ИИ.
Нулевой результат Grok особенно показателен. Grok-4.20 хорошо показывает себя в стандартных тестах, измеряющих запомненные знания и сопоставление шаблонов. На ARC-AGI-3 он набрал ноль баллов в каждой новой среде — что указывает на отсутствие способности к генерализации за пределами обучения, недостаточной даже для совершения продуктивных исследовательских действий.
Два определения, один неразрешённый спор
Разногласие между Хуангом и Шолле является структурным, а не фактическим. Они измеряют разные вещи.
| Дженсен Хуанг | Франсуа Шолле | |
|---|---|---|
| Определение AGI | ИИ, который выполняет сложные рабочие процессы и создаёт коммерческую ценность в масштабе | ИИ, который обобщает знания на новые ситуации без предварительного обучения, как это делает любой человек |
| Текущий статус ИИ | Уже достигнут | Не достигнут — лучший результат 0,37% |
| Формулировка бенчмарка | Важен практический результат | Способность к генерализации — единственный валидный тест |
| Финансовый интерес | Оценка Nvidia зависит от нарратива о зрелости ИИ | Независимый исследователь; приз пока никем не получен |
«Если система не может обобщать знания на новые ситуации без инструкций, это дорогое автозаполнение — а не общий интеллект». — Франсуа Шолле, фонд ARC Prize, март 2026 года
Yahoo Finance и Fortune оба отметили в своих материалах, что заявление Хуанга сделано генеральным директором компании, продающей оборудование, на котором работает вся разработка ИИ — существенный конфликт интересов, который должен влиять на оценку его утверждений.
Позиции других лидеров ИИ-индустрии
| Персона | Организация | Позиция по AGI (март 2026) |
|---|---|---|
| Дженсен Хуанг | Nvidia | Достигнут — ИИ может коммерчески выполнять сложные рабочие процессы |
| Франсуа Шолле | Фонд ARC Prize | Не достигнут — 0,37% на бенчмарке новых сред |
| Демис Хассабис | Google DeepMind | Приближается в узких научных областях |
| Дарио Амодеи | Anthropic | В пределах достижимости к 2026–2027 годам в конкретных областях знаний |
| Ян Лекун | AMI Labs / Meta | Далёк от достижения — не хватает моделей физического мира и здравого смысла |
Что это значит на практике
Для людей, использующих ИИ-инструменты сегодня, эта дискуссия носит несколько академический характер. Современные модели действительно мощны для задач, на которых они обучались: письмо, программирование, синтез исследований, анализ, рассуждения в рамках знакомых проблемных структур.
Чего они не могут надёжно делать — это столкнуться с по-настоящему новым видом проблемы, не имеющей аналога в обучающих данных, и разобраться, как подойти к ней с нуля. Этот разрыв — не сноска для маркетинга. Это разрыв в 99,63 процентных пункта между наилучшим результатом Gemini и базовым уровнем человека на бенчмарке, специально разработанном для его измерения.
Приз ARC в $2 миллиона так и не получен. Бенчмарк открыт. Разрыв остаётся.
Часто задаваемые вопросы
Заявил ли Дженсен Хуанг из Nvidia о достижении AGI? Да. 23 марта 2026 года Хуанг сказал в подкасте Lex Fridman: «Я думаю, что это уже сейчас. Я думаю, мы достигли AGI». Его определение требует ИИ, способного автономно выполнять сложные многоэтапные задачи и создавать коммерческую ценность — а не академическое определение, требующее генерализации на новые ситуации.
Что измерял ARC-AGI-3 и какими были результаты? ARC-AGI-3, выпущенный 26 марта 2026 года фондом ARC Prize, тестирует ИИ на 135 новых интерактивных средах без пересечения с обучающими данными. Метрика оценки (RHAE) также штрафует за неэффективность. Люди набрали 100%. Gemini 3.1 Pro набрал 0,37% (наивысший результат среди ИИ). GPT-5.4 набрал 0,26%, Claude Opus 4.6 набрал 0,25%, а Grok-4.20 набрал 0%.
Почему модели ИИ показывают такие низкие результаты на ARC-AGI-3? Бенчмарк устраняет все преимущества обучения. Модели не могут сопоставлять шаблоны с предыдущими примерами, потому что таковых не существует. ARC-AGI-3 требует истинной генерализации — рассуждений с нуля о новых средах — на что современные архитектуры ИИ надёжно не способны. Нулевой результат Grok-4.20 показывает, что запомненные знания, хотя и полезны в стандартных бенчмарках, не дают никакой выгоды при столкновении с по-настоящему невиданными типами задач.
Что такое приз ARC и выиграл ли его кто-нибудь? Фонд ARC Prize предлагает $2 миллиона за любую систему ИИ, соответствующую человеческой производительности на ARC-AGI-3. По состоянию на конец марта 2026 года ни одна модель даже близко не подошла к этому. Бенчмарк скрывает 110 из 135 сред от публичного доступа, чтобы предотвратить обучение на тестовых данных.
Источники
- Fortune — «Nvidia's Jensen Huang says 'We've achieved AGI.' But no one can agree on what that means»
- Decrypt — «Is AGI Here? Not Even Close, New AI Benchmark Suggests»
- Forbes — «Nvidia's Jensen Huang Says He Thinks 'We've Achieved AGI'»
- Winbuzzer — «ARC-AGI-3 Offers $2M for AI Matching Human Reasoning»
- ARC Prize Foundation — релиз бенчмарка ARC-AGI-3, 26 марта 2026 года

