
Gemini Omni Flash: Mô hình Video của Google Cho Phép Bạn Chỉnh Sửa Bằng Lời Nói
Mô hình any-to-any của Google tạo video 720p với âm thanh đồng bộ — và cho phép bạn chỉnh sửa bằng cách trò chuyện qua nhiều lượt.
Gemini Omni Flash: Mô hình Video của Google mà Bạn Chỉnh sửa Bằng Cách Nói với Nó
Gemini Omni Flash là mô hình sinh video đa phương thức any-to-any đầu tiên của Google DeepMind — không phải là một giao diện giọng nói, không phải là bản nâng cấp chatbot, và tuyệt đối không giống với kiến trúc "omni" của OpenAI. Trước khi đi xa hơn, hãy giải quyết sự nhầm lẫn này, vì nó định hình toàn bộ cách bạn nên suy nghĩ về mô hình này.
Khi OpenAI phát hành GPT-4o, họ gọi nó là "omni" để chỉ khả năng nhập giọng nói + hình ảnh theo thời gian thực trong một mô hình duy nhất. Cách sử dụng "Omni" của Google mang một ý nghĩa khác về cấu trúc: nó mô tả một họ mô hình mới được thiết kế để nhận bất kỳ phương thức đầu vào (văn bản, hình ảnh, âm thanh, video) và tạo ra bất kỳ phương thức đầu ra trong một lần xử lý duy nhất — bắt đầu với video, với các đầu ra sinh hình ảnh và âm thanh sẽ được bổ sung sau trong lộ trình phát triển. Omni của Google là một kiến trúc sinh (generative). "Omni" của OpenAI là một câu chuyện về nhận thức (perception). Đây không phải là cùng một khái niệm.
Khung tư duy đó quan trọng vì siêu năng lực thực sự của Gemini Omni Flash không phải là tương tác bằng giọng nói — mà là khả năng chỉnh sửa video có trạng thái, mang tính hội thoại qua nhiều lượt tương tác. Bạn có thể tạo một đoạn clip, yêu cầu nó thay đổi ánh sáng, yêu cầu nó kéo dài cảnh, thay trang phục của một nhân vật, và điều chỉnh góc quay camera — trong một phiên làm việc liên tục nơi mô hình ghi nhớ những gì nó đã tạo ra. Khả năng đó, cộng với âm thanh đồng bộ tích hợp và khả năng tạo AI Avatar, khiến nó thực sự là điều gì đó mới mẻ trong bối cảnh sinh video hiện nay.
"Omni" Thực Sự Có Nghĩa Là Gì Tại Google
Google DeepMind đã công bố họ Omni tại Google I/O vào ngày 19 tháng 5 năm 2026, với phiên bản phát hành chính thức cho nhà phát triển/API vào ngày 30 tháng 6 năm 2026. Kiến trúc Omni được xây dựng dựa trên nguyên tắc rằng một mô hình duy nhất nên xử lý mọi phương thức một cách tự nhiên — không phải qua các mô hình chuyên biệt được ghép nối với các bộ điều hợp gắn thêm vào, mà trong một không gian biểu diễn thống nhất.
Khi ra mắt, khía cạnh "bất kỳ đầu ra nào" bắt đầu cụ thể với video. Mô hình tạo ra các clip MP4 ở độ phân giải 720p, 24fps, theo tỷ lệ khung hình 16:9, 9:16, hoặc 1:1, kéo dài từ 4 đến 10 giây — với âm thanh đồng bộ được tạo ra trong cùng một lần xử lý. Đầu ra hình ảnh và đầu ra âm thanh độc lập đang có trong lộ trình phát triển nhưng chưa được triển khai.
"Flash" là hạng mục về tốc độ và chi phí, nhất quán với cách đặt tên của Google trong toàn bộ họ Gemini. Một phiên bản Gemini Omni Pro đang được lên kế hoạch, dự kiến sẽ hướng đến độ phân giải cao hơn và thời lượng dài hơn. Hiện tại, Omni Flash là mô hình khả dụng qua Gemini API (chuỗi tên mô hình bản xem trước công khai: gemini-omni-flash-preview), Google AI Studio, Flow, YouTube, ứng dụng Gemini, và — đối với những người thực hành muốn chạy nó cùng với 150+ mô hình media khác mà không cần đụng đến Google Cloud IAM — Happycapy.
Các Phương Thức Đầu Vào: Điều Gì Hoạt Động Bây Giờ, Điều Gì Chưa
Tài liệu chính thức mô tả một lược đồ đầu vào phong phú, và điều đáng lưu ý ở đây là một số đầu vào được API chấp nhận nhưng chưa hoạt động khi ra mắt:
Hoạt động khi ra mắt:
- Câu lệnh văn bản (hỗ trợ đầy đủ)
- Hình ảnh — tối đa 7 hình ảnh tham chiếu để duy trì tính nhất quán của nhân vật/sản phẩm hoặc chuyển đổi phong cách
- Âm thanh như một tham chiếu giọng nói cho AI Avatars (nhân bản khuôn mặt/giọng nói)
Được lược đồ chấp nhận, CHƯA hoạt động khi ra mắt:
- Video tham chiếu làm đầu vào
- Đầu vào âm thanh thông thường (các trường hợp sử dụng không phải Avatar)
Đây là một lưu ý đáng cân nhắc. "Chỉnh sửa video từ video tham chiếu" nghe như một trường hợp sử dụng cốt lõi, và về mặt kỹ thuật lược đồ chấp nhận nó — nhưng nếu bạn gửi một video tham chiếu và kỳ vọng mô hình sẽ tái tạo phong cách hoặc kéo dài nó, bạn sẽ nhận được kết quả khó dự đoán. Cách tiếp cận đáng tin cậy hiện nay là: sử dụng hình ảnh tham chiếu để đảm bảo tính nhất quán về hình ảnh, dùng văn bản để định hướng cảnh quay, và sử dụng luồng chỉnh sửa nhiều lượt để lặp lại. Đầu vào video là một hạn chế đã được biết đến và có thể sẽ được khắc phục khi Omni phát triển hơn.
Tính Năng Nổi Bật Nhất: Chỉnh Sửa Đa Lượt Mang Tính Hội Thoại
Mọi mô hình sinh video khác — Veo 3.1, Seedance 2.0, Sora 2 (trước khi ngừng phục vụ người dùng cá nhân), Runway, Kling — đều hoạt động theo mô hình một câu lệnh cho một clip. Bạn viết một câu lệnh, bạn nhận được một clip. Bạn không thích nó, bạn viết một câu lệnh mới, bạn nhận được một clip mới. Việc lặp lại là một chuỗi các sự kiện tạo sinh rời rạc.
Gemini Omni Flash phá vỡ mô hình đó. Bằng cách sử dụng tham số previous_interaction_id trong Gemini API, nó duy trì ngữ cảnh có trạng thái qua nhiều lượt. Bạn tạo một clip, mô hình lưu giữ nó trong bộ nhớ, và các chỉ dẫn tiếp theo sẽ chỉnh sửa nó — không phải từ đầu, mà như những chỉnh sửa được áp lên kết quả hiện có.
Trong thực tế, một luồng công việc trông như sau:
- "Tạo một clip 6 giây về một người phụ nữ trong quán cà phê đang đọc một lá thư, ánh sáng buổi sáng ấm áp, độ sâu trường ảnh nông."
- "Đổi quán cà phê thành một sân thượng với đường chân trời thành phố."
- "Bây giờ zoom ra một chút và thêm tiếng ồn đường phố xung quanh."
- "Áo khoác của người phụ nữ nên là màu xanh navy đậm, không phải màu xám."
Mỗi lượt vẫn giữ lại những gì đã có trước và áp dụng phần thay đổi (delta). Về mặt chức năng, đây là cảm giác giống như làm việc với một người biên tập video thực sự — ngoại trừ việc mỗi lượt qua lại chỉ tốn khoảng $0,10-$1,00 tùy thuộc vào độ dài clip, và phản hồi trong vài giây.
Lưu ý trung thực: sự trôi dạt (drift) xuất hiện vào khoảng lượt thứ 4–5. Mô hình duy trì được tính nhất quán một cách đáng tin cậy qua khoảng bốn lượt chỉnh sửa; đến lượt thứ năm, tính nhất quán của nhân vật, sự liên tục về ánh sáng, và các quan hệ không gian bắt đầu bị phá vỡ. Đối với các chuỗi phức tạp, mô hình thực hành đã hình thành là: tạo một bản gốc có độ trung thực cao trong Seedance 2.0 hoặc Veo 3.1, sau đó đưa nó vào một phiên chỉnh sửa Omni Flash để tinh chỉnh — coi Omni Flash như một công cụ hoàn thiện chính xác hơn là công cụ tạo sinh chính. Chúng ta sẽ quay lại điều này.

Sơ đồ: Cách chỉnh sửa đa lượt có trạng thái hoạt động trong Gemini Omni Flash. Mỗi lượt đưa ra một chỉ dẫn; mô hình duy trì ngữ cảnh qua previous_interaction_id để áp dụng các chỉnh sửa có mục tiêu mà không cần tạo lại từ đầu.
Âm Thanh: Yếu Tố Khác Biệt Mà Hầu Hết Mọi Người Đang Bỏ Qua
Mọi video được tạo bởi Gemini Omni Flash đều bao gồm âm thanh đồng bộ, được kết xuất trong cùng một lần suy luận (inference pass). Đây không phải là một bước xử lý hậu kỳ hay một mô hình âm thanh riêng biệt được ghép vào một clip im lặng — mô hình tạo ra video và âm thanh cùng nhau, sử dụng mô phỏng âm thanh dựa trên vật lý.
Điều này có nghĩa là trong thực tế: nếu câu lệnh của bạn mô tả những đợt sóng vỗ vào bờ, bạn sẽ nhận được âm thanh của sóng. Một cảnh quán cà phê sẽ tạo ra tiếng nói chuyện xung quanh và tiếng máy pha cà phê. Một nhân vật đang nói sẽ tạo ra lời thoại đồng bộ với khẩu hình. Sự đồng bộ khá chặt chẽ — dưới một giây một cách thoải mái — và với các clip dưới sáu đến bảy giây, chất lượng vẫn được duy trì. Vượt qua ngưỡng đó, sự trôi dạt trong đồng bộ khẩu hình trở nên rõ rệt, điều này càng khẳng định khoảng thời gian lý tưởng 4–10 giây mà mô hình hiện đang được tối ưu hóa cho.
Đối với các nhà sáng tạo nội dung đã từng phải ghép video + âm thanh có sẵn + xử lý hậu kỳ trong ba công cụ riêng biệt, việc có được tất cả những điều đó trong một lệnh tạo sinh duy nhất thực sự có giá trị. Nó không phải lúc nào cũng hoàn hảo — nhưng đó là một điểm khởi đầu mạnh mẽ giúp loại bỏ toàn bộ một lớp chi phí sản xuất.
AI Avatars: Trường Hợp Sử Dụng Bị Đánh Giá Thấp
Gemini Omni Flash bao gồm một khả năng riêng biệt được gọi là AI Avatars: với một hình ảnh tham chiếu về khuôn mặt và một mẫu giọng nói (để nhân bản giọng nói), nó tạo ra một video ảnh thật của avatar đó đang nói. Đây là trường hợp sử dụng duy nhất mà âm thanh-làm-đầu-vào thực sự hoạt động khi ra mắt — cụ thể là làm tham chiếu giọng nói cho Avatar.
Đối với các nhóm marketing, các nhà sản xuất e-learning, và các bộ phận giao tiếp khách hàng ở quy mô lớn, tính năng Avatar có thể được sử dụng ngay lập tức. Tạo một video người phát ngôn theo thương hiệu, bản địa hóa nó bằng cách thay đổi bản nhân bản giọng nói + câu lệnh văn bản, chạy lại nó trong ba mươi giây. Adobe Firefly, Invideo, và WPP là những trong số những doanh nghiệp áp dụng sớm, cụ thể trích dẫn Avatars là một tích hợp luồng công việc chính.
Có những lớp bảo vệ quan trọng: chính sách nội dung ngăn chặn tên và ngoại hình thật của những cá nhân không đồng ý, các mô phỏng lão hóa, các cảnh đánh nhau, và bất cứ điều gì có thể hợp lý cấu thành một deepfake của một người thật. Chỉnh sửa lời nói — thay đổi những gì ai đó dường như nói một cách hồi tố — hoàn toàn bị hạn chế, như một lựa chọn có chủ đích để ngăn chặn deepfake. Mỗi đầu ra đều mang hình mờ SynthID không thể tắt (không thể cảm nhận được bằng mắt thường của con người, có thể đọc được bằng máy) cộng với Chứng chỉ Nội dung C2PA. Đây là một chuỗi xác thực nguồn gốc toàn diện hơn bất kỳ mô hình video nào khác hiện đang được cung cấp.
Các Chỉ Số Đánh Giá: Google Tuyên Bố Gì so với Điều Gì Được Xác Minh Độc Lập
Các đánh giá nội bộ bằng người đánh giá của Google tuyên bố Omni Flash xếp hạng #1 về:
- Sở thích chỉnh sửa video và tuân theo chỉ dẫn
- Chất lượng chuyển văn bản thành video (MovieGenBench)
- Tính nhất quán từ tham chiếu sang video
- Chuyển hình ảnh thành video (đồng hạng #1, VBench I2V)
Đây là những con số hấp dẫn, nhưng cách đọc trung thực là tất cả những con số này đều là các đánh giá nội bộ của Google. Chưa có chỉ số đối đầu độc lập nào được công bố tại thời điểm viết bài này. Đáng chú ý, Omni Flash chưa được gửi tới Artificial Analysis Video Arena, nơi Seedance 2.0 hiện đang dẫn đầu về chuyển động con người và vật lý thực tế. Cho đến khi việc gửi đó xảy ra và kết quả của bên thứ ba xuất hiện, các chỉ số đánh giá nên được coi là mang tính gợi ý hơn là dứt khoát.
Sự đồng thuận của những người thực hành từ những người kiểm tra sớm phù hợp với những gì bạn có thể mong đợi: độ chính xác ngữ nghĩa mạnh mẽ, đồng bộ âm thanh tốt, chỉnh sửa hội thoại thực sự mới lạ — nhưng với những yếu điểm rõ ràng trong vật lý chuyển động (cảm giác "lơ lửng", mô phỏng trọng lượng không đủ), tính nhất quán khuôn mặt bị phá vỡ khi quay đầu, các lỗi với văn bản không phải chữ Latin (hiragana và các ký tự Trung Quốc phức tạp đặc biệt không đáng tin cậy trong các đánh giá thực tế), và ngưỡng chỉnh sửa bốn lượt được đề cập ở trên.
Gemini Omni Flash so với Các Đối Thủ Cạnh Tranh
Đây là một so sánh trung thực giữa các mô hình mà bạn có khả năng sẽ đánh giá cùng với Omni Flash:
| Gemini Omni Flash | Veo 3.1 | Seedance 2.0 | Sora 2 | |
|---|---|---|---|---|
| Độ phân giải tối đa | 720p | Lên đến 4K | Lên đến 1080p | Không áp dụng (đã ngừng) |
| Chỉnh sửa đa lượt | Có (có trạng thái, ~4 lượt) | Không | Không | Không |
| Tạo âm thanh | Có (trong cùng một lần xử lý, dựa trên vật lý) | Có | Không | Không |
| AI Avatars | Có | Không | Không | Không |
| Chi phí xấp xỉ/giây | ~$0,10 | ~$0,40–$0,75 | Thay đổi | Không áp dụng (API ngừng vào tháng 9/2026) |
| Nổi bật nhất ở | Luồng công việc/chỉnh sửa, Avatars, âm thanh | Chất lượng điện ảnh, dài hạn | Chuyển động con người thực tế, vật lý | Không áp dụng |
| Điểm yếu | Ngưỡng 720p, vật lý chuyển động, trôi dạt sau 4 lượt | Không có chỉnh sửa có trạng thái, đắt hơn | Không có chỉnh sửa hội thoại, không có âm thanh | Đã ngừng cung cấp |
so với Veo 3.1: Veo là lựa chọn đúng đắn khi chất lượng điện ảnh là sản phẩm chính và bạn không có ý định lặp lại theo cách hội thoại. Các nhà làm phim và các đơn vị sản xuất thương mại cao cấp nên bắt đầu từ đó. Omni Flash chiến thắng khi bạn cần tốc độ lặp lại, âm thanh tích hợp, hoặc khả năng Avatar — và khi độ phân giải 720p là chấp nhận được cho trường hợp sử dụng (điều này, đối với YouTube Shorts, nội dung mạng xã hội, và các video demo sản phẩm, thường là như vậy).
so với Seedance 2.0: Seedance hiện đang dẫn đầu về điểm bảng xếp hạng độc lập cho tính thực tế của chuyển động con người. Nếu bạn đang tạo hình ảnh về những người đang di chuyển — đi bộ, nhảy múa, vận động thể thao — mô phỏng vật lý của Seedance vẫn có ưu thế. Luồng công việc mới nổi: tạo clip cơ sở của bạn trong Seedance, sau đó tinh chỉnh nó theo cách hội thoại trong Omni Flash. Bạn có được chất lượng chuyển động của một mô hình chuyên biệt cộng với tính linh hoạt trong chỉnh sửa của giao diện đa lượt của Omni.
so với Sora 2: Ít liên quan hơn hiện nay. Ứng dụng Sora dành cho người dùng cá nhân của OpenAI đã bị ngừng cung cấp vào tháng 4 năm 2026, và API dự kiến ngừng hoạt động vào tháng 9 năm 2026. Sora không còn là một lựa chọn khả thi trong dài hạn.
Sự so sánh này cũng đặt giá của Omni Flash vào bối cảnh cụ thể. Với khoảng $0,10 mỗi giây ($1,50/triệu token đầu vào, $17,50/triệu token đầu ra video), một clip 10 giây tốn khoảng $1,00. Rẻ hơn 4–7 lần so với Veo 3.1. Chỉnh sửa đa lượt đồng nghĩa với việc chạy nhiều lần tạo sinh, do đó một phiên chỉnh sửa bốn lượt trên một clip 10 giây có thể tốn $4,00 — vẫn hợp lý cho sản xuất chuyên nghiệp, nhưng cần được đưa vào khi ước tính quy mô lớn.
Vị Trí Thực Tế của Omni Flash trong Một Luồng Sản Xuất Thực Tế
Lỗi cần tránh là coi Omni Flash như một sự thay thế cho mọi mô hình video mà bạn sử dụng. Nó không phải là lựa chọn có độ trung thực cao nhất khi ra mắt, và nó không được thiết kế để trở thành như vậy. Luận điểm thiết kế là: việc chỉnh sửa video nên cảm giác như đang nói chuyện với một người cộng tác, không phải nộp một ticket mới mỗi lần bạn muốn một thay đổi.
Các luồng công việc mà nó chiến thắng rõ ràng, ngay hôm nay:
1. Nội dung mạng xã hội với số lượng lớn. 720p là hoàn toàn ổn cho TikTok, YouTube Shorts, Instagram Reels. Tính năng Avatar cộng với chỉnh sửa hội thoại có nghĩa là bạn có thể sản xuất một chuỗi video ngắn được bản địa hóa nhanh hơn bất kỳ giải pháp nào khác. Tạo → tinh chỉnh bằng cách nói → xuất bản.
2. Video demo sản phẩm. Hình ảnh tham chiếu của sản phẩm + hướng dẫn văn bản + tinh chỉnh hội thoại = một luồng công việc hấp dẫn cho các nhóm thương mại điện tử và SaaS. Không cần sản xuất âm thanh riêng biệt.
3. Tạo mẫu và làm storyboard. Chi phí thấp và lặp lại nhanh khiến Omni Flash trở nên lý tưởng để trực quan hóa các ý tưởng trước khi cam kết vào việc tạo sinh có độ phân giải cao đắt đỏ. Sử dụng nó như một lớp xem trước.
4. Tinh chỉnh trên các đầu ra của mô hình chuyên biệt. Tạo bản cơ sở chất lượng cao của bạn trong Veo 3.1 hoặc Seedance 2.0. Đưa nó vào như một tham chiếu (khi đầu vào video được triển khai) hoặc mô tả những gì bạn có, sau đó sử dụng lớp hội thoại của Omni Flash để chỉnh sửa chi tiết. Đây là mô hình mà những người áp dụng sớm trong doanh nghiệp đang hội tụ về.
Các luồng công việc mà bạn nên tìm đến một mô hình chuyên biệt trước:
- Nội dung điện ảnh 4K → Veo 3.1
- Chuyển động con người thực tế / thể thao → Seedance 2.0
- Nội dung dài (>10 giây) với các nhân vật nhất quán → Veo 3.1 hoặc chờ Omni Pro
Chạy Gemini Omni Flash trên Happycapy (Không Cần Thiết Lập Google Cloud)
Việc chạy Gemini Omni Flash trực tiếp qua Gemini API yêu cầu một dự án Google Cloud, cấp phát API key, hiểu về chuỗi tên mô hình bản xem trước công khai, và thường phải qua một số lần lặp lại trên lược đồ API. Đó là một khoản đầu tư hợp lý cho một nhóm kỹ thuật đang xây dựng một luồng công việc chuyên dụng — nhưng nó gây trở ngại nếu bạn muốn kiểm tra mô hình một cách nhanh chóng hoặc chạy nó cùng với các bộ sinh video khác để so sánh.
Happycapy lưu trữ Gemini Omni Flash là một trong hơn 150 mô hình — bao gồm Veo 3.1, Seedance 2.0, các mô hình sinh hình ảnh như Seedream 4.5, và các mô hình khác — trong một sandbox đám mây dựa trên trình duyệt. Không cần tài khoản Google Cloud. Không cần API key riêng cho từng nhà cung cấp. Bạn có thể chạy một lệnh tạo sinh Gemini Omni Flash, so sánh nó với đầu ra của Seedance 2.0 trên cùng một câu lệnh, và xây dựng một luồng công việc đa mô hình sử dụng từng mô hình ở nơi nó mạnh nhất — tất cả trong một giao diện duy nhất.
Đối với các nhóm đang tìm hiểu các luồng công việc AI tác nhân (agentic AI) xung quanh việc sản xuất video, khả năng chuỗi các lệnh gọi mô hình lại — tạo trong Seedance, tinh chỉnh trong Omni Flash, tổng hợp một báo cáo hoặc chú thích trong một mô hình ngôn ngữ — mà không cần ghép các tích hợp API riêng biệt lại với nhau là một sự tiết kiệm thời gian đáng kể.
Bắt đầu miễn phí tại happycapy.ai
Nhận Định Trung Thực
Gemini Omni Flash không phải là mô hình video sắc nét nhất mà bạn có thể chạy hiện nay. Nếu bạn so sánh chất lượng khung hình thô ở độ phân giải tương đương, Seedance 2.0 chiến thắng về vật lý chuyển động, và Veo 3.1 chiến thắng về độ hoàn thiện điện ảnh. Đó là một hạn chế thực sự, và ngưỡng 720p, sự trôi dạt trong chỉnh sửa sau bốn lượt, và các lỗi văn bản không phải chữ Latin là những điểm ma sát thực sự đối với một số luồng công việc.
Nhưng những so sánh đó bỏ lỡ điều mà Omni Flash thực sự đang cố gắng làm. Mô hình này đang đặt cược rằng sự trôi chảy trong luồng công việc quan trọng hơn những cải thiện độ trung thực nhỏ nhặt — và cách đặt cược đó đứng vững nhiều hơn là không trong các môi trường sản xuất thực tế. Khả năng nói "làm tối phần nền", nhận được kết quả, nói "bây giờ chuyển màu sắc ấm hơn", và nhận được một kết quả khác — trong một phiên liên tục, với $0,10/giây — là một quan hệ hoàn toàn khác với việc sinh video so với bất kỳ điều gì khác hiện có.
Họ Omni rõ ràng là một chiến lược kiến trúc nhiều năm tại Google DeepMind. Omni Pro đang đến. Đầu vào video (hiện đang được chấp nhận nhưng chưa hoạt động) sẽ được hoàn thiện. Độ phân giải sẽ được nâng cấp. Mô hình chỉnh sửa hội thoại sẽ có nhiều lượt hơn trước khi trôi dạt. Điều bạn đang đánh giá hôm nay là mô hình đầu tiên trong một họ — một mô hình đã tự khẳng định được vị trí của nó trong một chồng đa mô hình, dù nó vẫn chưa thay thế được các mô hình chuyên biệt.
Đối với những người thực hành: chạy nó song song, không phải riêng lẻ. Sử dụng nó ở nơi mà lợi thế về luồng công việc của nó là thực sự, sử dụng các mô hình chuyên biệt ở nơi độ trung thực là quan trọng nhất. Chồng công cụ là Seedance 2.0 + Veo 3.1 cho chất lượng tạo sinh, Omni Flash cho tinh chỉnh hội thoại và Avatars. Sự kết hợp đó mạnh mẽ hơn bất kỳ mô hình đơn lẻ nào hiện nay.
Để có cái nhìn sâu hơn về cách kiến trúc đa phương thức của Google so sánh với các mô hình sinh hình ảnh như GPT Image 2, hoặc để hiểu bối cảnh về các tích hợp máy chủ MCP trông như thế nào trong một quy trình sản xuất video, những tài nguyên đó đáng để đọc.
Truy cập Gemini Omni Flash cùng với toàn bộ thư viện mô hình — không cần thiết lập Google Cloud, không cần API key riêng cho từng nhà cung cấp:
Bắt đầu miễn phí tại happycapy.ai
Câu Hỏi Thường Gặp
Gemini Omni Flash là gì?
Gemini Omni Flash là mô hình đầu tiên trong họ mô hình "Omni" mới của Google DeepMind, được thiết kế để nhận bất kỳ phương thức đầu vào nào (văn bản, hình ảnh, âm thanh, video) và tạo ra bất kỳ phương thức đầu ra nào trong một mô hình duy nhất. Khi ra mắt, nó tạo ra video với âm thanh đồng bộ. Tính năng nổi bật của nó là chỉnh sửa đa lượt mang tính hội thoại: bạn có thể tạo một clip video và sau đó tinh chỉnh nó qua nhiều lượt chỉ dẫn bằng ngôn ngữ tự nhiên, với mô hình duy trì ngữ cảnh có trạng thái giữa mỗi lần chỉnh sửa. Nó đã khả dụng qua Gemini API vào ngày 30 tháng 6 năm 2026.
Gemini Omni Flash khác gì so với GPT-4o "omni"?
Cách đặt tên gây nhầm lẫn nhưng các kiến trúc lại hoàn toàn khác nhau. Khi OpenAI gọi GPT-4o là "omni," họ muốn nói nó có thể nhận thức nhiều phương thức đồng thời (giọng nói + hình ảnh) như đầu vào. "Omni" của Google chỉ một kiến trúc sinh: một mô hình duy nhất vừa nhận thức vừa tạo ra qua các phương thức. Gemini Omni Flash không chỉ xử lý đầu vào đa phương thức — nó tạo ra đầu ra đa phương thức (video và âm thanh cùng nhau). Họ Omni của Google là một hệ thống đa phương thức sinh; nhãn hiệu omni của OpenAI là về nhận thức đầu vào.
Gemini Omni Flash so với Veo 3 — cái nào tốt hơn?
Chúng được tối ưu hóa cho các mục đích khác nhau. Veo 3.1 tạo ra đầu ra có độ phân giải cao hơn, mang tính điện ảnh hơn (lên đến 4K so với 720p của Omni Flash) và là lựa chọn tốt hơn cho sản xuất video hoàn thiện, có độ trung thực cao. Gemini Omni Flash chiến thắng về luồng công việc: nó là mô hình video duy nhất có chỉnh sửa đa lượt có trạng thái, nó bao gồm tính năng tạo AI Avatar, nó tạo ra âm thanh trong cùng một lần suy luận, và nó có chi phí thấp hơn khoảng 4–7 lần mỗi giây so với Veo 3.1. Đối với nội dung mạng xã hội, demo sản phẩm, và tạo mẫu lặp lại, Omni Flash là công cụ tốt hơn. Đối với đầu ra chất lượng điện ảnh hoặc phát sóng, Veo 3.1 là lựa chọn đúng đắn.
Gemini Omni Flash có miễn phí không?
Không phải qua API. Giá API là $1,50/triệu token đầu vào và $17,50/triệu token đầu ra video — khoảng $0,10 mỗi giây video 720p, hoặc khoảng $1,00 cho một clip 10 giây. Không có hạn mức API miễn phí. Tuy nhiên, Gemini Omni Flash khả dụng miễn phí cho những người dùng đủ điều kiện trên YouTube Shorts và YouTube Create (18+), và qua các gói đăng ký người dùng Google AI Plus, Pro, và Ultra. Quyền truy cập doanh nghiệp khả dụng qua Gemini Enterprise Agent Platform.
Gemini Omni Flash tạo ra video với độ phân giải nào?
720p khi ra mắt, ở 24fps. Các tỷ lệ khung hình được hỗ trợ là 16:9, 9:16, và 1:1. Thời lượng clip là 4–10 giây. Các độ phân giải cao hơn (1080p và cao hơn) đang có trong lộ trình phát triển, có khả năng liên quan đến hạng mục Gemini Omni Pro sắp ra mắt, nhưng chưa khả dụng khi ra mắt.
Giá của Gemini Omni Flash là bao nhiêu?
Token đầu vào: $1,50 mỗi triệu. Token đầu ra video: $17,50 mỗi triệu. Về mặt thực tế, điều này tương đương với khoảng $0,10 mỗi giây video 720p được tạo ra, hoặc khoảng $1,00 cho một clip đầy đủ 10 giây. Các phiên chỉnh sửa đa lượt liên quan đến nhiều lệnh gọi tạo sinh, do đó một phiên tinh chỉnh bốn lượt trên một clip 10 giây sẽ tốn khoảng $4,00. Các chi tiết đầy đủ về giá được công bố tại ai.google.dev/gemini-api/docs/pricing.
Sự khác biệt giữa Gemini Omni và Gemini Flash là gì?
Gemini Flash là một dòng mô hình ngôn ngữ văn bản và hình ảnh nhanh, tiết kiệm chi phí — hạng mục Flash trong họ Gemini tiêu chuẩn. Gemini Omni là một họ mô hình riêng biệt, mới, được xây dựng trên một kiến trúc khác được thiết kế cho việc sinh đa phương thức any-to-any, bắt đầu với đầu ra video. "Gemini Omni Flash" kết hợp kiến trúc Omni với hạng mục tốc độ/chi phí Flash, đặt nó ở vị trí điểm khởi đầu dễ tiếp cận vào họ Omni. Đây là các dòng mô hình khác biệt về kiến trúc, không phải là cùng một mô hình ở các kích thước khác nhau. Một Gemini Omni Pro (độ trung thực cao hơn, có khả năng độ phân giải cao hơn) đang có trong lộ trình phát triển riêng biệt so với các mô hình văn bản Gemini Flash.
Nguồn
- Google Blog: Thông báo Gemini Omni
- Google AI Developers: Tài liệu API Gemini Omni
- Google DeepMind: Trang mô hình Gemini Omni
- Giá Gemini API
- Google Blog: Gemini Omni Flash / Nano / Banana 2 Lite

Sơ đồ: Tổng quan kiến trúc của Gemini Omni Flash — xử lý đầu vào thống nhất qua văn bản, hình ảnh, và tham chiếu âm thanh, với đầu ra video+âm thanh đồng bộ ở 720p, 24fps, theo các định dạng 16:9 / 9:16 / 1:1, 4–10 giây mỗi clip.

