
Как создают ИИ, моделирующий физическую реальность
Как DeepMind, World Labs и AMI Labs делают ставку на world models — ИИ, который предсказывает физические результаты, а не следующий токен в предложении.
Сводка
Языковые модели предсказывают слова. Модели мира предсказывают, что произойдёт дальше в реальности. Именно эта архитектурная разница объясняет, почему некоторые из самых заметных имён в исследованиях ИИ сошлись на моделях мира как на следующем необходимом уровне возможностей. В 2026 году три организации возглавляют эту разработку: Google DeepMind выпустила модель мира в реальном времени на основе видеодиффузии; World Labs Фей-Фей Ли коммерциализировала Marble — навигируемый симулятор 3D-окружений; а AMI Labs Яна Лекуна закрыла seed-раунд на $1,03 миллиарда — крупнейший в истории Европы — для создания ИИ на основе JEPA, который учится физическому пониманию с первых принципов.
Что на самом деле делает модель мира
Языковая модель обучена предсказывать следующий токен в последовательности. Учитывая фрагмент текста, она оценивает, какое слово, фраза или символ будет следующим — и таким образом учится рассуждать о языке, понятиях и закономерностях.
Модель мира делает нечто структурно иное. Учитывая текущее состояние физической среды, она предсказывает, что произойдёт дальше: как объекты будут вести себя под воздействием силы, как пространство выглядит с другой точки обзора, каковы последствия конкретного действия. Обучающие данные — это не текст, а видео, показания датчиков и симуляции.
Цель — ИИ, который может симулировать до того, как действовать. Вместо того чтобы описывать план словами и надеяться, что описание точное, ИИ с моделью мира может внутренне симулировать результат плана, выявить, что не сработает, и пересмотреть его до того, как что-либо будет выполнено в реальном мире.
Три организации создают эту возможность существенно разными способами.
Google DeepMind: видео в интерактивную симуляцию
В августе 2025 года DeepMind выпустила интерактивную модель мира в реальном времени, которая преобразует видео в играбельную симуляцию. Входные данные — любое видео: съёмка комнаты, уличной среды, игрового мира. Результат — интерактивная версия этого видео: пользователь может перемещаться по нему, совершать действия, а модель генерирует физически правдоподобный следующий кадр в реальном времени.
Подход DeepMind полностью избегает вручную заданных правил физики. Модель обучается физической динамике на основе тренировки на огромных наборах видеоданных — по сути, выводя, как работает мир, из наблюдения за ним. Симуляции соблюдают гравитацию, окклюзию, постоянство объектов и базовую структуру физического пространства без каких-либо явных правил, кодирующих эти свойства.
Текущие применения:
- Среды для обучения робототехники: генерация неограниченного числа новых сценариев из референсных съёмок вместо сбора новых физических данных
- Разработка игр: генерация интерактивных прототипных сред из референсных материалов
- Заземление ИИ-агентов: тестирование планов в симуляции перед реальным исполнением
Долгосрочное значение: модель мира DeepMind — это основа для автономных агентов, которые могут рассуждать о последствиях до того, как действовать, а не действовать и затем наблюдать результаты.
World Labs: Marble, навигируемый 3D-мир
Фей-Фей Ли — соруководитель Института человекоориентированного ИИ Стэнфорда и бывший глава Google Cloud AI — основала World Labs для коммерциализации крупномасштабного моделирования мира. Продуктовый запуск компании в 2026 году — Marble: генеративная модель, которая создаёт навигируемые 3D-окружения в реальном времени с нуля.
Там, где DeepMind преобразует существующее видео в интерактивную симуляцию, Marble генерирует совершенно новые 3D-миры по описанию или грубому эскизу. Эти окружения можно исследовать с любого угла с сохранением согласованной пространственной геометрии и физики — сцена, сгенерированная Marble, поддерживает структурную согласованность по мере перемещения по ней, чего предыдущие генеративные системы не могли достичь надёжно.
Где используется Marble:
| Применение | Что это обеспечивает |
|---|---|
| Обучение робототехники | Неограниченные разнообразные обучающие среды без сбора физических данных |
| Прототипирование игр и XR | Прототипирование раскладок миров и окружений без 3D-художников |
| Архитектура и дизайн | Симуляции прохода по зданиям на основе планов этажей или описаний |
| Научные исследования | Физические среды для экспериментов, слишком опасных или дорогих в реальности |
Коммерческая возможность, на которую целится World Labs, — стоимость 3D-контента: сейчас она измеряется миллионами долларов и месяцами производства. Генерация в стиле Marble сжимает это до часов.
AMI Labs: ставка на $1,03 миллиарда в JEPA
Advanced Machine Intelligence Labs, соучредителем которой является Ян Лекун (главный научный сотрудник по ИИ в Meta), закрыла seed-раунд на $1,03 миллиарда — крупнейший европейский seed-раунд за всю историю — от консорциума европейских технологических инвесторов.
AMI Labs не создаёт более крупную языковую модель или более совершенную систему видеодиффузии. Компания строит ИИ на основе архитектуры совместного предсказания вложений (JEPA) Лекуна, которая работает на принципиально иных принципах, чем текущие модели мира.
Вместо предсказания необработанных пикселей или текстовых токенов JEPA обучает ИИ предсказывать абстрактные представления — смысловую структуру сцены, а не её буквальный внешний вид. Аргумент Лекуна: человеческий здравый смысл строится не из запоминания наблюдений за миром. Он строится из изучения абстрактных моделей причины и следствия, физической динамики и поведения объектов на концептуальном уровне. JEPA пытается воспроизвести этот процесс обучения.
Практическое различие: системы на основе JEPA должны обобщаться на новые физические ситуации более эффективно, чем модели видеодиффузии, потому что они не пытаются реконструировать каждый пиксель — они моделируют концептуальную структуру, которая порождает эти пиксели.
Тезис AMI Labs, в формулировке Лекуна: масштабирование языковых моделей не может привести к созданию общего ИИ. Недостающий компонент — это модель мира, которая понимает физику с первых принципов, а не из статистических закономерностей в тексте или видео.
Сравнение трёх подходов
| Google DeepMind | World Labs (Marble) | AMI Labs (JEPA) | |
|---|---|---|---|
| Основной подход | Видеодиффузия — изучение физики через наблюдение за ней | Генеративный синтез 3D-окружений | Предсказание абстрактных представлений |
| Обучающие данные | Видеосъёмка | Мультимодальные данные об окружении | Не раскрыты; концептуальное обучение |
| Результат | Интерактивная симуляция из референсного видео | Новые 3D-миры по описанию | Абстрактная модель мира для рассуждений |
| Стадия | Выпущена (авг. 2025) | Коммерциализирована (2026) | Исследования / раннее создание |
| Предполагаемое использование | Обучение робототехники, заземление агентов | Робототехника, разработка игр, архитектура, XR | Долгосрочная основа для общего ИИ |
Почему это важно за пределами лаборатории
Модели мира — это инфраструктура для следующего поколения продуктов ИИ, а не краткосрочные потребительские приложения. Но продукты, которые будут созданы в 2026 и 2027 годах, будут всё больше зависеть от возможностей моделирования мира, которые формируются уже сейчас:
Робототехника в масштабе: каждой компании, создающей физический ИИ — автоматизацию складов, производство, доставку — необходимо обучать роботов на разнообразных сценариях. Модели мира генерируют неограниченное количество разнообразных обучающих сред без затрат на сбор физических данных. DeepMind и World Labs создают слой генерации обучающих сред, который будет использовать вся индустрия робототехники.
ИИ-агенты с физическим заземлением: современные ИИ-агенты, включая самые способные системы на основе языковых моделей, галлюцинируют по поводу физических ограничений, потому что рассуждают о физическом мире исключительно на основе текстовых описаний. ИИ с моделью мира может симулировать, будет ли план физически работать, прежде чем приступить к нему.
Создание 3D-контента: системы класса Marble сожмут сроки и затраты на производство 3D-контента на порядки — с прямыми последствиями для разработки игр, кинопроизводства, архитектуры и иммерсивных медиа.
Часто задаваемые вопросы
Что такое модель мира в ИИ? Модель мира — это система ИИ, которая строит внутреннюю симуляцию физической реальности — кодируя, как ведут себя объекты, как работают причина и следствие и что происходит дальше после определённого действия. В отличие от языковых моделей, которые предсказывают следующий текстовый токен, модели мира предсказывают следующее состояние физической среды. Они считаются фундаментальными для робототехники, автономных транспортных средств и физических ИИ-агентов.
Что создаёт Ян Лекун в AMI Labs? AMI Labs, соучредителем которой является Лекун и которая профинансирована seed-раундом на $1,03 миллиарда (крупнейшим в истории европейских стартапов), разрабатывает ИИ на основе JEPA — архитектуры совместного предсказания вложений. JEPA предсказывает абстрактные представления, а не необработанные пиксели или токены, стремясь дать ИИ тот вид физического здравого смысла, который люди развивают через опыт, а не через наблюдение. Лекун утверждает, что JEPA — это необходимая архитектура для ИИ, способного по-настоящему рассуждать о физическом мире.
Что такое продукт Marble от World Labs? Marble — это крупная модель мира от World Labs (основанной Фей-Фей Ли), которая генерирует навигируемые 3D-симуляции в реальном времени по описаниям или эскизам. В отличие от систем, преобразующих существующее видео в симуляцию, Marble создаёт новые 3D-окружения с согласованной физикой и пространственной геометрией. Применения включают обучающие среды для робототехники, прототипирование игр и AR/VR, а также архитектурную визуализацию.
Как работает модель мира Google DeepMind? Модель мира DeepMind, выпущенная в августе 2025 года, принимает видео на входе и преобразует его в интерактивную симуляцию. Пользователь может перемещаться и действовать внутри симулированного окружения, а модель генерирует физически правдоподобные следующие кадры в реальном времени. Вместо того чтобы вручную задавать правила физики, модель обучается физической динамике на основе тренировки на больших наборах видеоданных — выводя, как ведёт себя мир, из наблюдения за ним.
Источники
- Google DeepMind — выпуск интерактивной модели мира в реальном времени, август 2025
- World Labs — запуск продукта Marble и техническая документация, 2026
- AMI Labs — объявление о seed-раунде на $1,03 млрд и обзор архитектуры JEPA, 2026
- Ян Лекун — исследовательские статьи по JEPA и публичные выступления, Meta AI, 2025–2026

