Назад
Gemini Omni Flash: видеомодель Google, которую можно редактировать голосом
July 2, 2026
15 мин чтения
Поделиться статьёй

Gemini Omni Flash: видеомодель Google, которую можно редактировать голосом

Модель Google типа «любой формат в любой» генерирует видео 720p с синхронизированным звуком — и позволяет редактировать его в диалоге, реплика за репликой.

Gemini Omni Flash: видеомодель Google, которую вы редактируете, просто разговаривая с ней

Gemini Omni Flash — первая мультимодальная модель Google DeepMind типа «любой вход → любой выход» для генерации видео. Это не голосовой интерфейс, не обновление чат-бота и, конечно же, не то же самое, что архитектура «omni» от OpenAI. Прежде чем идти дальше, давайте разберёмся с этой путаницей, потому что она определяет всё, как нужно воспринимать эту модель.

Когда OpenAI выпустила GPT-4o, они назвали её «omni», чтобы обозначить голосовой и визуальный ввод в реальном времени в рамках одной модели. Использование Google слова «Omni» означает нечто структурно иное: оно описывает новое семейство моделей, спроектированное для приёма любой входной модальности (текст, изображения, аудио, видео) и генерации любой выходной модальности за один проход — начиная с видео, а генерация изображений и аудио на выходе появится позже, согласно дорожной карте. Omni от Google — это генеративная архитектура. «Omni» от OpenAI было историей про восприятие. Это не одно и то же понятие.

Это уточнение важно, потому что настоящая суперсила Gemini Omni Flash — не голосовое взаимодействие, а диалоговое, сохраняющее состояние редактирование видео в несколько ходов. Вы можете сгенерировать клип, попросить изменить освещение, попросить продлить сцену, поменять костюм персонажа и настроить угол камеры — всё в рамках одной непрерывной сессии, где модель помнит, что она уже создала. Эта возможность, вместе со встроенной синхронизированной генерацией аудио и AI-аватарами, делает модель по-настоящему новым явлением в сфере генерации видео.


Что на самом деле означает «Omni» в Google

Google DeepMind анонсировала семейство Omni на Google I/O 19 мая 2026 года, с общедоступным запуском для разработчиков/API 30 июня 2026 года. Архитектура Omni построена на принципе, что единая модель должна обрабатывать все модальности нативно — не через цепочку специализированных моделей с прикреплёнными адаптерами, а в едином унифицированном пространстве представлений.

На момент запуска сторона «любой выход» этого уравнения начинается конкретно с видео. Модель выдаёт MP4-клипы в разрешении 720p, 24 кадра в секунду, с соотношением сторон 16:9, 9:16 или 1:1, продолжительностью от 4 до 10 секунд — с синхронизированным аудио, сгенерированным за тот же проход. Генерация изображений и отдельного аудио заявлены в дорожной карте, но пока не работают.

«Flash» — это уровень скорости и стоимости, согласующийся с системой наименований Google в семействе Gemini. Планируется выпуск Gemini Omni Pro, который, предположительно, продвинется в сторону более высокого разрешения и большей длительности. На данный момент Omni Flash доступна через Gemini API (строка модели в публичном превью: gemini-omni-flash-preview), Google AI Studio, Flow, YouTube, приложение Gemini, а также — для тех, кто хочет запускать её вместе с более чем 150 другими медиа-моделями без обращения к Google Cloud IAM — через Happycapy.


Входные модальности: что работает сейчас, а что не работает

Официальная документация описывает богатую входную схему, и здесь стоит быть точным, поскольку некоторые входные данные принимаются API, но не функционируют на момент запуска:

Работает на момент запуска:

  • Текстовые подсказки (полная поддержка)
  • Изображения — до 7 референсных изображений для сохранения консистентности персонажа/продукта или переноса стиля
  • Аудио как голосовой референс для AI-аватаров (репликация лица/голоса)

Принимается схемой, но НЕ работает на момент запуска:

  • Видеореференсы в качестве входных данных
  • Обычный аудиовход (не связанный с Avatar-кейсами)

Это существенная оговорка. «Редактирование видео на основе видеореференса» звучит как основной сценарий использования, и схема технически принимает такой вход — но если вы отправите видеореференс, ожидая, что модель переоформит его в другом стиле или продлит его, вы получите непредсказуемый результат. Надёжный путь на сегодня: используйте референсные изображения для визуальной консистентности, текст — для режиссуры сцены, а многоходовой процесс редактирования — для итераций. Видеовход — известное ограничение, которое, предположительно, будет устранено по мере развития Omni.


Определяющая функция: диалоговое многоходовое редактирование

Любая другая модель генерации видео — Veo 3.1, Seedance 2.0, Sora 2 (до прекращения потребительской версии), Runway, Kling — работает по модели «подсказка на клип». Вы пишете подсказку — получаете клип. Не понравилось — пишете новую подсказку, получаете новый клип. Итерация — это серия разрозненных событий генерации.

Gemini Omni Flash ломает эту модель. Используя параметр previous_interaction_id в Gemini API, она сохраняет состояние контекста между ходами. Вы генерируете клип, модель хранит его в памяти, и последующие инструкции изменяют его — не с нуля, а как правки на основе существующего результата.

На практике рабочий процесс выглядит так:

  1. «Сгенерируй 6-секундный клип: женщина в кафе читает письмо, тёплый утренний свет, малая глубина резкости».
  2. «Замени кафе на террасу на крыше с видом на городской пейзаж».
  3. «Теперь немного отдали камеру и добавь фоновый уличный шум».
  4. «Жакет женщины должен быть тёмно-синим, а не серым».

Каждый ход сохраняет предыдущее и применяет изменения. Функционально это ощущается как работа с человеком-видеомонтажёром — только каждый круговой запрос стоит примерно $0,10–$1,00 в зависимости от длины клипа, и модель отвечает за секунды.

Честная оговорка: около 4–5-го хода начинает проявляться «дрифт». Модель надёжно сохраняет согласованность на протяжении примерно четырёх ходов редактирования; к пятому ходу консистентность персонажа, непрерывность освещения и пространственные отношения начинают нарушаться. Для сложных последовательностей практики выработали такой паттерн: сгенерировать высококачественную базу в Seedance 2.0 или Veo 3.1, а затем перенести её в сессию редактирования Omni Flash для доработки — рассматривая Omni Flash как инструмент точной финальной обработки, а не как основной генеративный движок. Мы вернёмся к этому.

Gemini Omni Flash conversational editing flow — multi-turn stateful session showing four edit turns on a single clip, with previous_interaction_id threading context across each instruction

Диаграмма: как работает многоходовое редактирование с сохранением состояния в Gemini Omni Flash. Каждый ход отправляет инструкцию; модель передаёт контекст через previous_interaction_id, чтобы применять целевые правки без повторной генерации с нуля.


Аудио: второй отличительный признак, который многие недооценивают

Каждое видео, сгенерированное Gemini Omni Flash, включает синхронизированное аудио, отрендеренное за тот же проход инференса. Это не шаг постобработки и не отдельная аудиомодель, «пришитая» к немому клипу — модель генерирует видео и звук вместе, используя моделирование звука на основе физики.

Что это означает на практике: если ваша подсказка описывает волны, разбивающиеся о берег, вы получаете звук волн. Сцена в кафе генерирует фоновую болтовню и шум кофемашины. Говорящий персонаж генерирует диалог с синхронизацией губ. Синхронизация точная — комфортно менее секунды — и для клипов короче шести-семи секунд качество держится. Дальше становится заметен дрифт синхронизации губ, что подтверждает оптимальный диапазон 4–10 секунд, для которого модель сейчас оптимизирована.

Для контент-создателей, которые до этого сшивали видео + стоковое аудио + постобработку в трёх отдельных инструментах, получение всего этого за один вызов генерации по-настоящему ценно. Не всегда идеально — но это сильная стартовая точка, устраняющая целый слой производственных издержек.


AI-аватары: скрытый козырь

Gemini Omni Flash включает отдельную возможность под названием AI Avatars: по референсному изображению лица и образцу голоса (для клонирования голоса) она генерирует фотореалистичное видео, где этот аватар говорит. Это единственный случай, где аудио как входной сигнал реально работает на момент запуска — конкретно как голосовой референс для аватара.

Для маркетинговых команд, продюсеров e-learning и клиентских коммуникаций в масштабе функция аватаров сразу применима на практике. Сгенерировали фирменное видео представителя бренда, локализовали его, поменяв клон голоса + текстовую подсказку, перезапустили за тридцать секунд. Adobe Firefly, Invideo и WPP входят в число первых корпоративных пользователей, которые прямо называют аватаров основным сценарием интеграции в рабочий процесс.

Есть важные ограничения: политика контента блокирует реальные имена и внешность лиц, не давших согласие, симуляции старения, сцены драк и всё, что можно обоснованно счесть дипфейком реального человека. Редактирование речи — изменение того, что человек якобы говорит, задним числом — полностью запрещено, как осознанный шаг против дипфейков. Каждый результат несёт неотключаемый водяной знак SynthID (незаметный для человеческого глаза, читаемый машинами), плюс C2PA Content Credentials. Это более полный стек подтверждения происхождения, чем у любой другой видеомодели, представленной на рынке на сегодня.


Бенчмарки: что заявляет Google и что подтверждено независимо

Внутренние оценки Google с участием людей-оценщиков заявляют, что Omni Flash занимает #1 место по:

  • Предпочтениям в редактировании видео и следовании инструкциям
  • Качеству text-to-video (MovieGenBench)
  • Консистентности reference-to-video
  • Image-to-video (делит #1 место, VBench I2V)

Это впечатляющие цифры, но честное прочтение таково, что все они — внутренние оценки Google. На момент написания статьи независимые сравнительные бенчмарки не опубликованы. Примечательно, что Omni Flash пока не отправлена в Artificial Analysis Video Arena, где Seedance 2.0 в настоящее время лидирует по реалистичности движений человека и физике. До тех пор, пока эта отправка не произойдёт и не появятся результаты сторонних тестов, бенчмарки следует воспринимать как ориентировочные, а не окончательные.

Консенсус практиков среди ранних тестировщиков совпадает с ожиданиями: сильная семантическая точность, надёжная синхронизация аудио, действительно новаторское диалоговое редактирование — но с заметными слабостями в физике движения («невесомое» ощущение, недостаточное моделирование веса), нарушением консистентности лица при поворотах головы, сбоями с нелатинским текстом (хирагана и китайские иероглифы с большим числом штрихов оказались особенно ненадёжны в практических тестах), а также упомянутым выше пределом в четыре хода редактирования.


Gemini Omni Flash против конкурентов

Вот честное сравнение с моделями, которые вы наиболее вероятно рассматриваете параллельно с Omni Flash:

Gemini Omni FlashVeo 3.1Seedance 2.0Sora 2
Максимальное разрешение720pДо 4KДо 1080pН/Д (снята с поддержки)
Многоходовое редактированиеДа (с сохранением состояния, ~4 хода)НетНетНет
Генерация аудиоДа (за тот же проход, с моделированием физики)ДаНетНет
AI-аватарыДаНетНетНет
Прим. стоимость/секунда~$0,10~$0,40–$0,75ПеременнаяН/Д (API снимается с поддержки в сентябре 2026)
Лучше всего дляРабочего процесса/редактирования, аватаров, аудиоКинематографического качества, длинных форматовРеалистичного движения человека, физикиН/Д
Слабые стороныПотолок 720p, физика движения, дрифт после 4 ходовНет редактирования с сохранением состояния, дорожеНет диалогового редактирования, нет аудиоПрекращена

Против Veo 3.1: Veo — правильный выбор, когда кинематографическое качество является основной целью и вы не планируете вести диалоговую итерацию. Кинематографистам и производителям высококлассной коммерческой продукции стоит начинать оттуда. Omni Flash выигрывает, когда нужна скорость итерации, встроенное аудио или функция аватаров — и когда 720p приемлемо для сценария использования (что для YouTube Shorts, социального контента и демо продуктов обычно так и есть).

Против Seedance 2.0: Seedance в настоящее время лидирует по независимым оценкам в рейтингах на реалистичность движений человека. Если вы генерируете видео с движущимися людьми — ходьба, танцы, спортивные движения — физическое моделирование Seedance пока имеет преимущество. Формирующийся рабочий процесс: сгенерируйте базовый клип в Seedance, затем доработайте его диалогово в Omni Flash. Вы получаете качество движения специализированной модели плюс гибкость редактирования многоходового интерфейса Omni.

Против Sora 2: Сейчас менее релевантна. Потребительское приложение Sora от OpenAI было прекращено в апреле 2026 года, а API запланирован к снятию с поддержки в сентябре 2026 года. Sora — не жизнеспособный долгосрочный выбор.

Это сравнение также помогает понять контекст ценообразования Omni Flash. При стоимости примерно $0,10 за секунду ($1,50 за миллион входных токенов, $17,50 за миллион выходных видеотокенов), 10-секундный клип стоит примерно $1,00. Это в 4–7 раз дешевле, чем Veo 3.1. Многоходовое редактирование подразумевает несколько проходов генерации, так что сессия редактирования из четырёх ходов на 10-секундном клипе может обойтись в $4,00 — всё ещё разумно для профессионального производства, но это стоит учитывать при оценке объёмов.


Где Omni Flash действительно вписывается в реальный производственный процесс

Ошибка, которую следует избегать — воспринимать Omni Flash как замену для всех видеомоделей, которые вы используете. На момент запуска это не самый высококачественный вариант, и она не была задумана таковой. Идея дизайна такова: редактирование видео должно ощущаться как разговор с коллегой, а не как оформление новой заявки каждый раз, когда вам нужно что-то изменить.

Рабочие процессы, где она безусловно выигрывает уже сегодня:

1. Социальный контент в больших объёмах. 720p вполне достаточно для TikTok, YouTube Shorts, Instagram Reels. Функция аватаров вместе с диалоговым редактированием означает, что вы можете производить локализованную серию коротких видео быстрее, чем на любом другом стеке. Генерация → доработка через диалог → публикация.

2. Демо-видео продукта. Референсные изображения продукта + текстовая режиссура + диалоговая доработка = убедительный рабочий процесс для команд e-commerce и SaaS. Отдельное аудиопроизводство не требуется.

3. Прототипирование и сторибординг. Низкая стоимость и быстрая итерация делают Omni Flash идеальной для визуализации концепций перед переходом к дорогостоящей генерации в высоком разрешении. Используйте её как слой предвизуализации.

4. Доработка на основе результатов специализированных моделей. Сгенерируйте высококачественную базу в Veo 3.1 или Seedance 2.0. Импортируйте её как референс (когда появится видеовход) или опишите то, что у вас есть, затем используйте диалоговый слой Omni Flash для подстройки деталей. Это паттерн, к которому сходятся первые корпоративные пользователи.

Рабочие процессы, где сначала стоит обратиться к специализированной модели:

  • Кинематографический контент 4K → Veo 3.1
  • Реалистичное движение человека / спорт → Seedance 2.0
  • Длинные форматы (>10 секунд) с консистентными персонажами → Veo 3.1 или ожидание Omni Pro

Запуск Gemini Omni Flash в Happycapy (без настройки Google Cloud)

Чтобы запустить Gemini Omni Flash напрямую через Gemini API, нужен проект в Google Cloud, выпуск API-ключа, понимание строки модели публичного превью и, как правило, некоторая доработка схемы API. Это разумное вложение для инженерной команды, строящей отдельный рабочий процесс — но это лишнее трение, если вы хотите быстро протестировать модель или запустить её вместе с другими генераторами видео для сравнения.

Happycapy размещает Gemini Omni Flash как одну из более чем 150 моделей — включая Veo 3.1, Seedance 2.0, модели генерации изображений, такие как Seedream 4.5, и другие — в браузерной облачной песочнице. Учётная запись Google Cloud не требуется. Отдельный API-ключ для каждого провайдера не нужен. Вы можете запустить генерацию Gemini Omni Flash, сравнить её с результатом Seedance 2.0 по одинаковой подсказке и построить многомодельный рабочий процесс, использующий каждую модель там, где она сильнее всего — всё в одном интерфейсе.

Для команд, изучающих агентные рабочие процессы на основе AI вокруг производства видео, возможность выстраивать цепочки вызовов моделей — сгенерировать в Seedance, доработать в Omni Flash, синтезировать отчёт или подпись в языковой модели — без сшивания отдельных API-интеграций является значительной экономией времени.

Начните бесплатно на happycapy.ai


Честный вердикт

Gemini Omni Flash — не самая визуально впечатляющая видеомодель, которую вы можете запустить сегодня. Если сравнивать сырое качество кадра при одинаковом разрешении, Seedance 2.0 выигрывает по физике движения, а Veo 3.1 — по кинематографической полировке. Это реальное ограничение, и потолок 720p, дрифт после четырёх ходов редактирования и сбои с нелатинским текстом — настоящие точки трения для некоторых рабочих процессов.

Но эти сравнения упускают то, что Omni Flash на самом деле пытается сделать. Модель делает ставку на то, что гладкость рабочего процесса важнее маргинальных приростов качества — и эта ставка чаще оправдывается в реальных производственных условиях, чем нет. Возможность сказать «сделай фон темнее», получить результат, сказать «теперь сделай цветокоррекцию теплее», и получить ещё один результат — в рамках непрерывной сессии, по цене $0,10/секунду — это принципиально иное отношение к генерации видео, чем всё, что доступно сейчас.

Семейство Omni явно представляет собой многолетнюю архитектурную ставку Google DeepMind. Omni Pro на подходе. Видеовход (сейчас принимается, но не функционирует) будет доработан. Разрешение будет расти. Диалоговая модель редактирования будет выдерживать больше ходов до наступления дрифта. То, что вы оцениваете сегодня — это первая модель в семействе, которая уже занимает своё место в многомодельном стеке, даже если пока не заменяет специализированные модели.

Практикам: используйте её параллельно, а не изолированно. Применяйте её там, где её преимущества в рабочем процессе реальны, используйте специализированные модели там, где качество имеет первостепенное значение. Стек — это Seedance 2.0 + Veo 3.1 для качества генерации, Omni Flash для диалоговой доработки и аватаров. Эта комбинация сильнее, чем любая отдельная модель на сегодня.

Для более глубокого взгляда на то, как мультимодальная архитектура Google сравнивается с моделями генерации изображений, такими как GPT Image 2, или для контекста о том, как выглядят интеграции MCP-серверов в конвейере видеопроизводства, эти материалы стоит почитать.

Доступ к Gemini Omni Flash вместе со всей библиотекой моделей — без настройки Google Cloud, без API-ключей для каждого провайдера:

Начните бесплатно на happycapy.ai


FAQ

Что такое Gemini Omni Flash?

Gemini Omni Flash — первая модель в новом семействе моделей «Omni» от Google DeepMind, спроектированная для приёма любой входной модальности (текст, изображения, аудио, видео) и генерации любой выходной модальности в рамках одной модели. На момент запуска она выдаёт видео с синхронизированным аудио. Её определяющая функция — диалоговое многоходовое редактирование: вы можете сгенерировать видеоклип, а затем доработать его в несколько ходов инструкций на естественном языке, при этом модель сохраняет состояние контекста между каждой правкой. Она стала доступна через Gemini API 30 июня 2026 года.

Чем Gemini Omni Flash отличается от «omni» в GPT-4o?

Названия сбивают с толку, но архитектуры принципиально различны. Когда OpenAI назвала GPT-4o «omni», они имели в виду, что модель может воспринимать несколько модальностей одновременно (голос + изображение) в качестве входных данных. «Omni» от Google относится к генеративной архитектуре: единая модель, которая и воспринимает, и генерирует в разных модальностях. Gemini Omni Flash не просто обрабатывает мультимодальные входные данные — она генерирует мультимодальные выходные данные (видео и аудио вместе). Семейство Omni от Google — это генеративная мультимодальная система; брендинг «omni» от OpenAI был про восприятие входных данных.

Gemini Omni Flash против Veo 3 — что лучше?

Они оптимизированы для разных задач. Veo 3.1 выдаёт результат в более высоком разрешении и более кинематографичный (до 4K против 720p у Omni Flash) и является лучшим выбором для полированного, высококачественного видеопроизводства. Gemini Omni Flash выигрывает по рабочему процессу: это единственная видеомодель с многоходовым редактированием с сохранением состояния, она включает генерацию AI-аватаров, выдаёт аудио за тот же проход инференса и стоит примерно в 4–7 раз меньше за секунду, чем Veo 3.1. Для социального контента, демо продуктов и итеративного прототипирования Omni Flash — более подходящий инструмент. Для кинематографического или эфирного качества правильный выбор — Veo 3.1.

Gemini Omni Flash бесплатна?

Не через API. Цена API составляет $1,50 за миллион входных токенов и $17,50 за миллион выходных видеотокенов — примерно $0,10 за секунду видео в 720p, или примерно $1,00 за 10-секундный клип. Бесплатного уровня API нет. Однако Gemini Omni Flash доступна бесплатно для подходящих пользователей на YouTube Shorts и YouTube Create (18+), а также через потребительские подписки Google AI Plus, Pro и Ultra. Корпоративный доступ доступен через Gemini Enterprise Agent Platform.

В каком разрешении Gemini Omni Flash генерирует видео?

На момент запуска — 720p, 24 кадра в секунду. Поддерживаемые соотношения сторон: 16:9, 9:16 и 1:1. Продолжительность клипа — 4–10 секунд. Более высокие разрешения (1080p и выше) заявлены в дорожной карте, вероятно, привязаны к грядущему уровню Gemini Omni Pro, но недоступны на момент запуска.

Какова цена Gemini Omni Flash?

Входные токены: $1,50 за миллион. Выходные видеотокены: $17,50 за миллион. На практике это выходит примерно на $0,10 за секунду сгенерированного видео в 720p, или примерно $1,00 за полный 10-секундный клип. Сессии многоходового редактирования включают несколько вызовов генерации, так что сессия доработки из четырёх ходов на 10-секундном клипе будет стоить примерно $4,00. Полная информация о ценах опубликована на ai.google.dev/gemini-api/docs/pricing.

В чём разница между Gemini Omni и Gemini Flash?

Gemini Flash — это линейка быстрых, экономически эффективных текстово-визуальных языковых моделей — уровень Flash в рамках стандартного семейства Gemini. Gemini Omni — отдельное, новое семейство моделей, построенное на другой архитектуре, предназначенной для мультимодальной генерации «любой вход → любой выход», начиная с видеовыхода. «Gemini Omni Flash» объединяет архитектуру Omni с уровнем скорости/стоимости Flash, позиционируя её как доступную точку входа в семейство Omni. Это архитектурно различные линейки моделей, а не одна модель разных размеров. Gemini Omni Pro (более высокое качество, вероятно более высокое разрешение) заявлен в дорожной карте отдельно от текстовых моделей Gemini Flash.


Источники


Gemini Omni Flash model architecture overview — showing the any-to-any input/output structure, with text, images, and audio reference flowing into a unified model and video+audio output emerging, alongside a side-by-side of supported aspect ratios and clip durations

Диаграмма: архитектура Gemini Omni Flash в общих чертах — унифицированная обработка входных данных по тексту, изображениям и аудиореференсу, с синхронизированным выходом видео+аудио в 720p, 24 кадра в секунду, в форматах 16:9 / 9:16 / 1:1, продолжительностью 4–10 секунд на клип.

Опубликовано July 2, 2026
Другие статьи