
Gemini Omni Flash: نموذج الفيديو من Google الذي تُحرّره بالحديث معه
نموذج Google الشامل (any-to-any) الذي يُنشئ فيديو بدقة 720p مع صوت متزامن — ويتيح لك تحريره بالحديث عبر جولات متتالية.
Gemini Omni Flash: نموذج الفيديو من Google الذي تحرّره بالتحدث إليه
Gemini Omni Flash هو أول نموذج توليد فيديو متعدد الوسائط من نوع "أي إلى أي" من Google DeepMind — وهو ليس واجهة صوتية، ولا ترقية لروبوت محادثة، وبالتأكيد ليس نفس الشيء كبنية "omni" الخاصة بـ OpenAI. قبل أن نتقدم أكثر، لنوضّح هذا الالتباس، لأنه يشكّل كل ما يجب أن تفكر به حول هذا النموذج.
عندما أطلقت OpenAI نموذج GPT-4o، سمّته "omni" للإشارة إلى إدخال صوت + رؤية في الوقت الفعلي في نموذج واحد. استخدام Google لكلمة "Omni" يعني شيئاً مختلفاً بنيوياً: إنه يصف عائلة نماذج جديدة مصممة لقبول أي نوع من مدخلات الوسائط (نص، صور، صوت، فيديو) وتوليد أي نوع من مخرجات الوسائط في تمريرة واحدة إلى الأمام — بدءاً بالفيديو، مع مخرجات توليد الصور والصوت المقرر إضافتها لاحقاً في خارطة الطريق. Omni من Google هو بنية توليدية. أما "omni" من OpenAI فكانت قصة إدراك (perception). هذان ليسا المفهوم نفسه.
هذا التوضيح مهم لأن القدرة الحقيقية الخارقة لـ Gemini Omni Flash ليست التفاعل الصوتي — بل التحرير الحواري المتسلسل للفيديو عبر جولات متعددة. يمكنك توليد مقطع، وإخباره بتغيير الإضاءة، وطلب تمديد المشهد، وتبديل ملابس شخصية، وضبط زاوية الكاميرا — كل ذلك ضمن جلسة مستمرة يتذكر فيها النموذج ما بناه. هذه القدرة، بالإضافة إلى الصوت المتزامن المدمج وتوليد الصورة الرمزية بالذكاء الاصطناعي (AI Avatar)، تجعل منه شيئاً جديداً حقاً في مشهد توليد الفيديو.
ماذا تعني "Omni" فعلياً عند Google
أعلنت Google DeepMind عن عائلة Omni في مؤتمر Google I/O بتاريخ 19 مايو 2026، مع إطلاق التوفر العام للمطورين/واجهة برمجة التطبيقات (API) في 30 يونيو 2026. بنية Omni مبنية على مبدأ أن نموذجاً واحداً يجب أن يعالج جميع الوسائط بشكل أصلي — ليس عبر نماذج متخصصة متسلسلة مع محولات مضافة، بل في فضاء تمثيل موحّد واحد.
عند الإطلاق، جانب "أي مخرج" من هذه المعادلة يبدأ تحديداً بالفيديو. ينتج النموذج مقاطع MP4 بدقة 720p، بمعدل 24 لقطة في الثانية، بنسب أبعاد 16:9 أو 9:16 أو 1:1، بمدة تتراوح بين 4 و10 ثوان — مع صوت متزامن يتم توليده في نفس التمريرة. مخرجات الصور والصوت المستقل موجودة في خارطة الطريق ولكنها ليست فعّالة حالياً.
"Flash" هي فئة السرعة والتكلفة، بما يتوافق مع تسمية Google عبر عائلة Gemini. من المخطط إصدار Gemini Omni Pro، والذي من المفترض أن يدفع نحو دقة أعلى ومدة أطول. أما الآن، فإن Omni Flash متاح عبر Gemini API (سلسلة نموذج المعاينة العامة: gemini-omni-flash-preview)، وGoogle AI Studio، وFlow، وYouTube، وتطبيق Gemini، و — للممارسين الذين يريدون تشغيله جنباً إلى جنب مع أكثر من 150 نموذج وسائط آخر دون التعامل مع Google Cloud IAM — Happycapy.
وسائط الإدخال: ما يعمل الآن، وما لا يعمل
يصف التوثيق الرسمي مخطط إدخال غني، ومن المهم أن نكون دقيقين هنا لأن بعض المدخلات مقبولة عبر واجهة API لكنها ليست فعّالة عند الإطلاق:
تعمل عند الإطلاق:
- المطالبات النصية (دعم كامل)
- الصور — حتى 7 صور مرجعية لاتساق الشخصية/المنتج أو نقل الأسلوب
- الصوت كمرجع صوتي للصور الرمزية بالذكاء الاصطناعي (استنساخ الوجه/الصوت)
مقبولة عبر المخطط، لكنها لا تعمل عند الإطلاق:
- مراجع الفيديو كمدخل
- إدخال الصوت العام (حالات استخدام غير Avatar)
هذا تحفظ مهم. "تحرير الفيديو من مرجع فيديو إلى فيديو" يبدو كحالة استخدام أساسية، والمخطط يقبله تقنياً — ولكن إذا أرسلت مرجع فيديو متوقعاً من النموذج إعادة تصميمه أو تمديده، فستحصل على نتائج غير متوقعة. الطريقة الموثوقة اليوم هي: استخدام الصور المرجعية للاتساق البصري، واستخدام النص لتوجيه المشهد، واستخدام تدفق التحرير متعدد الجولات للتكرار. إدخال الفيديو هو قيد معروف من المفترض أن يُغلق مع نضوج Omni.
الميزة المحدِّدة: التحرير الحواري متعدد الجولات
كل نموذج توليد فيديو آخر — Veo 3.1، Seedance 2.0، Sora 2 (قبل توقفه الاستهلاكي)، Runway، Kling — يعمل على نموذج مطالبة لكل مقطع. تكتب مطالبة، تحصل على مقطع. لا يعجبك، تكتب مطالبة جديدة، تحصل على مقطع جديد. التكرار هو سلسلة من أحداث توليد منفصلة.
يكسر Gemini Omni Flash هذا النموذج. باستخدام معلمة previous_interaction_id في Gemini API، يحافظ على سياق مستمر عبر الجولات. تولّد مقطعاً، يحتفظ النموذج به في الذاكرة، والتعليمات اللاحقة تعدّله — ليس من الصفر، بل كتعديلات فوق النتيجة الموجودة.
عملياً، يبدو مسار العمل كما يلي:
- "أنشئ مقطعاً مدته 6 ثوان لامرأة في مقهى تقرأ رسالة، بضوء صباحي دافئ، وعمق ميدان ضحل."
- "غيّر المقهى إلى تراس على السطح مع خط أفق المدينة."
- "الآن قرّب البُعد قليلاً وأضف ضجيج شارع محيطي."
- "يجب أن تكون سترة المرأة كحلية غامقة، لا رمادية."
كل جولة تحافظ على ما سبق وتطبّق الفرق. هذا، من الناحية الوظيفية، يشعرك بالعمل مع محرّر فيديو بشري — إلا أن كل جولة تكلف تقريباً بين 0.10 و1.00 دولار حسب طول المقطع، ويستجيب في ثوانٍ.
التحفظ الصادق: يبدأ الانحراف بالظهور حول الجولة 4-5. يحافظ النموذج بشكل موثوق على التماسك خلال أربع جولات تحرير تقريباً؛ وبحلول الجولة الخامسة، يبدأ اتساق الشخصية واستمرارية الإضاءة والعلاقات المكانية بالتراجع. بالنسبة للتسلسلات المعقدة، النمط الذي ظهر بين الممارسين هو: توليد قاعدة عالية الدقة في Seedance 2.0 أو Veo 3.1، ثم إدخالها في جلسة تحرير Omni Flash للتنقية — معاملة Omni Flash كأداة صقل دقيقة بدلاً من محرك التوليد الأساسي. سنعود إلى هذا لاحقاً.

رسم توضيحي: كيف يعمل التحرير الحواري متعدد الجولات في Gemini Omni Flash. كل جولة تصدر تعليمة؛ يمرّر النموذج السياق عبر previous_interaction_id لتطبيق تعديلات محددة دون إعادة التوليد من الصفر.
الصوت: العامل التمييزي الآخر الذي يتجاهله معظم الناس
كل فيديو يتم توليده بواسطة Gemini Omni Flash يتضمن صوتاً متزامناً، يُعرض في نفس تمريرة الاستدلال. هذه ليست خطوة معالجة لاحقة أو نموذج صوتي منفصل يُلحق بمقطع صامت — بل يولّد النموذج الفيديو والصوت معاً، باستخدام محاكاة صوت مبنية على الفيزياء.
ما يعنيه هذا عملياً: إذا وصفت مطالبتك موجات تتحطم على الشاطئ، فستحصل على أصوات موجات. مشهد المقهى يولّد ضجيج ثرثرة محيطية وصوت آلة القهوة. شخصية تتحدث تولّد حواراً متزامن الشفاه. التزامن دقيق — أقل من ثانية بشكل مريح — وبالنسبة للمقاطع أقل من ستة إلى سبعة ثوان، تظل الجودة ثابتة. بعد ذلك، يصبح انحراف تزامن الشفاه ملحوظاً، وهذا يعزز نقطة التوازن المثلى بين 4-10 ثوان التي يُعدّ النموذج مُحسّناً لها حالياً.
بالنسبة لصنّاع المحتوى الذين كانوا يجمّعون الفيديو + الصوت المخزّن + المعالجة اللاحقة في ثلاث أدوات منفصلة، الحصول على كل ذلك في استدعاء توليد واحد أمر ذو قيمة حقيقية. ليس مثالياً دائماً — لكنه نقطة انطلاق قوية تزيل طبقة كاملة من عبء الإنتاج.
الصور الرمزية بالذكاء الاصطناعي: حالة الاستخدام الخفية
يتضمن Gemini Omni Flash قدرة متميزة تُدعى الصور الرمزية بالذكاء الاصطناعي (AI Avatars): بالاستناد إلى صورة مرجعية لوجه وعينة صوتية (لاستنساخ الصوت)، يولّد فيديو واقعياً لتلك الصورة الرمزية وهي تتحدث. هذه هي الحالة الاستخدامية الوحيدة التي يعمل فيها الصوت-كمدخل فعلياً عند الإطلاق — تحديداً كمرجع صوتي للصورة الرمزية.
بالنسبة لفرق التسويق ومنتجي التعليم الإلكتروني والاتصالات مع العملاء على نطاق واسع، ميزة الصورة الرمزية قابلة للتنفيذ فوراً. ولّد فيديو متحدث رسمي بالعلامة التجارية، وترجمه بتبديل استنساخ الصوت + المطالبة النصية، وأعد تشغيله في ثلاثين ثانية. Adobe Firefly وInvideo وWPP من بين المتبنين المبكرين على مستوى المؤسسات الذين يستشهدون بالصور الرمزية تحديداً كتكامل أساسي في سير العمل.
هناك ضوابط مهمة: تحظر سياسة المحتوى الأسماء الحقيقية وأشكال الأفراد غير الموافقين، ومحاكاة الشيخوخة، ومشاهد القتال، وأي شيء قد يشكّل بشكل معقول تزييفاً عميقاً (deepfake) لشخص حقيقي. تحرير الكلام — تعديل ما يبدو أن شخصاً قاله بشكل رجعي — محظور بالكامل، كخيار متعمد لمنع التزييف العميق. تحمل كل مخرجات علامة مائية غير قابلة للتعطيل من SynthID (غير مرئية للمشاهد البشري، قابلة للقراءة الآلية) بالإضافة إلى بيانات اعتماد محتوى C2PA. هذه مجموعة تتبع أصل أكثر شمولاً من أي نموذج فيديو آخر يُطرح حالياً.
المعايير القياسية: ما تدّعيه Google مقابل ما تم التحقق منه بشكل مستقل
تقييمات المقيّمين البشريين الداخلية لدى Google تدّعي أن Omni Flash يحتل المرتبة #1 في:
- تفضيل تحرير الفيديو واتباع التعليمات
- جودة النص إلى الفيديو (MovieGenBench)
- اتساق المرجع إلى الفيديو
- الصورة إلى الفيديو (متعادل في المرتبة #1، VBench I2V)
هذه أرقام مقنعة، لكن القراءة الصادقة هي أن جميعها تقييمات داخلية من Google. لم تُنشر أي معايير مقارنة مستقلة رأساً برأس حتى كتابة هذا المقال. من الملاحظ أن Omni Flash لم يُقدَّم بعد إلى Artificial Analysis Video Arena، حيث يتصدر Seedance 2.0 حالياً في الحركة البشرية الواقعية والفيزياء. حتى يحدث ذلك التقديم وتظهر نتائج طرف ثالث، يجب التعامل مع المعايير القياسية على أنها إرشادية لا نهائية.
يتماشى إجماع الممارسين من المختبِرين الأوائل مع ما تتوقعه: دقة دلالية قوية، تزامن صوتي جيد، تحرير حواري جديد بالفعل — لكن مع نقاط ضعف واضحة في فيزياء الحركة (شعور "طافٍ"، محاكاة وزن غير كافية)، وتراجع اتساق الوجه عند تحركات الرأس، وفشل في النصوص غير اللاتينية (كانت الهيراغانا والأحرف الصينية عالية التعقيد غير موثوقة بشكل خاص في المراجعات العملية)، وسقف الجولات الأربع للتحرير المذكور أعلاه.
Gemini Omni Flash مقابل المنافسة
هنا مقارنة صادقة عبر النماذج التي من المرجح أن تقيّمها جنباً إلى جنب مع Omni Flash:
| Gemini Omni Flash | Veo 3.1 | Seedance 2.0 | Sora 2 | |
|---|---|---|---|---|
| الدقة القصوى | 720p | حتى 4K | حتى 1080p | غير متاح (متوقف) |
| التحرير متعدد الجولات | نعم (مستمر، ~4 جولات) | لا | لا | لا |
| توليد الصوت | نعم (في التمريرة، مبني على الفيزياء) | نعم | لا | لا |
| الصور الرمزية بالذكاء الاصطناعي | نعم | لا | لا | لا |
| التكلفة التقريبية/ثانية | ~0.10 دولار | ~0.40-0.75 دولار | متغيرة | غير متاح (إيقاف API سبتمبر 2026) |
| الأفضل في | سير العمل/التحرير، الصور الرمزية، الصوت | الجودة السينمائية، طويل المدى | الحركة البشرية الواقعية، الفيزياء | غير متاح |
| نقاط الضعف | سقف 720p، فيزياء الحركة، انحراف الجولة الرابعة | لا يوجد تحرير مستمر، أعلى تكلفة | لا يوجد تحرير حواري، لا صوت | متوقف |
مقابل Veo 3.1: يعد Veo الخيار الصحيح عندما تكون الجودة السينمائية هي المخرَج الأساسي وأنت لا تخطط للتكرار الحواري. يجب أن يبدأ مصورو السينما والإنتاج التجاري الراقي من هناك. يفوز Omni Flash عندما تحتاج سرعة التكرار، أو الصوت المدمج، أو قدرة الصورة الرمزية — وعندما تكون 720p مقبولة لحالة الاستخدام (وهو الحال عادة بالنسبة لـ YouTube Shorts والمحتوى الاجتماعي وعروض المنتجات التجريبية).
مقابل Seedance 2.0: يتصدر Seedance حالياً درجات لوحة الصدارة المستقلة لواقعية الحركة البشرية. إذا كنت تولّد لقطات لأشخاص يتحركون — يمشون، يرقصون، حركة رياضية — لا تزال محاكاة الفيزياء في Seedance تتمتع بميزة. سير العمل الناشئ: ولّد مقطعك الأساسي في Seedance، ثم نقّه حوارياً في Omni Flash. تحصل على جودة الحركة من نموذج متخصص بالإضافة إلى مرونة التحرير من واجهة Omni متعددة الجولات.
مقابل Sora 2: أقل صلة الآن. تم إيقاف تطبيق Sora الاستهلاكي من OpenAI في أبريل 2026، ومن المقرر إيقاف واجهة API في سبتمبر 2026. Sora ليس خياراً قابلاً للاستمرار على المدى الطويل.
هذه المقارنة تضع أيضاً تسعير Omni Flash في سياقه. بتكلفة تقريبية 0.10 دولار في الثانية (1.50 دولار لكل مليون رمز إدخال، 17.50 دولار لكل مليون رمز إخراج فيديو)، تكلف مقطع مدته 10 ثوان حوالي 1.00 دولار. هذا أرخص بـ 4-7 مرات من Veo 3.1. التحرير متعدد الجولات يعني تشغيل عدة تمريرات توليد، بحيث يمكن أن تكلف جلسة تحرير من أربع جولات على مقطع مدته 10 ثوان حوالي 4.00 دولارات — لا تزال معقولة للإنتاج المهني، لكن يجدر أخذها في الحسبان عند تقديرات الحجم.
أين يناسب Omni Flash فعلياً في سير عمل إنتاجي حقيقي
الخطأ الذي يجب تجنبه هو معاملة Omni Flash كبديل لكل نموذج فيديو تستخدمه. إنه ليس الخيار الأعلى دقة عند الإطلاق، ولم يُصمم لذلك. فكرة التصميم هي: تحرير الفيديو يجب أن يشعرك بالتحدث إلى متعاون، لا بتقديم تذكرة جديدة كل مرة تريد فيها تغييراً.
سير العمل الذي يفوز فيه بشكل مباشر، اليوم:
1. المحتوى الاجتماعي بكميات كبيرة. 720p جيدة لـ TikTok وYouTube Shorts وInstagram Reels. ميزة الصورة الرمزية بالإضافة إلى التحرير الحواري تعني أنك يمكنك إنتاج سلسلة فيديو قصيرة مترجمة أسرع من أي مجموعة أدوات أخرى. ولّد ← نقّه بالتحدث ← أطلقه.
2. فيديو عرض منتج. صور مرجعية لمنتج + توجيه نصي + تنقية حوارية = سير عمل مقنع لفرق التجارة الإلكترونية وSaaS. لا حاجة لإنتاج صوتي منفصل.
3. النماذج الأولية ورسم القصة. التكلفة المنخفضة والتكرار السريع يجعلان Omni Flash مثالياً لتصور المفاهيم قبل الالتزام بتوليد عالي الدقة مكلف. استخدمه كطبقة تصور مسبق.
4. التنقية فوق مخرجات النماذج المتخصصة. ولّد قاعدتك عالية الجودة في Veo 3.1 أو Seedance 2.0. استوردها كمرجع (عند وصول إدخال الفيديو) أو صف ما لديك، ثم استخدم طبقة Omni Flash الحوارية لتعديل التفاصيل. هذا هو النمط الذي يتجمّع حوله المتبنون المبكرون على مستوى المؤسسات.
سير العمل الذي يجب أن تتوجه فيه إلى متخصص أولاً:
- المحتوى السينمائي بدقة 4K → Veo 3.1
- الحركة البشرية الواقعية / الرياضية → Seedance 2.0
- المحتوى الطويل (>10 ثوان) بشخصيات متسقة → Veo 3.1 أو الانتظار لـ Omni Pro
تشغيل Gemini Omni Flash على Happycapy (دون إعداد Google Cloud)
تشغيل Gemini Omni Flash عبر Gemini API مباشرة يتطلب مشروع Google Cloud، وتزويد مفتاح API، وفهم سلسلة نموذج المعاينة العامة، وعادةً بعض التكرار على مخطط API. هذا استثمار معقول لفريق هندسي يبني سير عمل مخصص — لكنه عائق إذا كنت تريد اختبار النموذج بسرعة أو تشغيله جنباً إلى جنب مع مولّدات فيديو أخرى للمقارنة.
تستضيف Happycapy Gemini Omni Flash كأحد أكثر من 150 نموذجاً — بما في ذلك Veo 3.1 وSeedance 2.0 ونماذج توليد الصور مثل Seedream 4.5 وغيرها — في صندوق حماية سحابي يعمل عبر المتصفح. لا حاجة لحساب Google Cloud. لا مفتاح API منفصل لكل مزوّد. يمكنك تشغيل توليد Gemini Omni Flash، ومقارنته بمخرج Seedance 2.0 على نفس المطالبة، وبناء سير عمل متعدد النماذج يستخدم كل نموذج حيث يكون أقوى — كل ذلك في واجهة واحدة.
بالنسبة للفرق التي تستكشف سير عمل الذكاء الاصطناعي الوكيلي حول إنتاج الفيديو، القدرة على تسلسل استدعاءات النماذج — التوليد في Seedance، والتنقية في Omni Flash، وتوليف تقرير أو تسمية توضيحية في نموذج لغوي — دون تجميع تكاملات API منفصلة معاً، هي توفير وقت ذو مغزى.
الحكم الصادق
Gemini Omni Flash ليس نموذج الفيديو الأكثر حدة مظهراً الذي يمكنك تشغيله اليوم. إذا كنت تقارن جودة الإطار الخام عند دقة معادلة، يفوز Seedance 2.0 في فيزياء الحركة، ويفوز Veo 3.1 في الصقل السينمائي. هذا قيد حقيقي، وسقف 720p وانحراف التحرير في الجولة الرابعة وفشل النصوص غير اللاتينية هي نقاط احتكاك حقيقية لبعض سير العمل.
لكن هذه المقارنات تفوّت ما يحاول Omni Flash فعله فعلياً. النموذج يراهن على أن سلاسة سير العمل أهم من مكاسب الدقة الهامشية — وهذا الرهان يصمد أكثر مما لا يصمد في بيئات الإنتاج الحقيقية. القدرة على قول "أعتم الخلفية"، والحصول على نتيجة، وقول "الآن حوّل تدرج اللون إلى أدفأ"، والحصول على نتيجة أخرى — في جلسة مستمرة، بتكلفة 0.10 دولار/ثانية — هي علاقة مختلفة جذرياً مع توليد الفيديو عن أي شيء آخر متاح حالياً.
عائلة Omni هي بوضوح رهان بنيوي متعدد السنوات لدى Google DeepMind. Omni Pro قادم. إدخال الفيديو (مقبول حالياً لكن غير فعّال) سيُغلق. الدقة ستتوسع. نموذج التحرير الحواري سيحصل على جولات أكثر قبل الانحراف. ما تقيّمه اليوم هو أول نموذج في عائلة — نموذج يكسب مكانته بالفعل في مجموعة متعددة النماذج، حتى لو لم يستبدل بعد المتخصصين.
للممارسين: شغّله بالتوازي، لا بالعزلة. استخدمه حيث تكون مزايا سير عمله حقيقية، واستخدم المتخصصين حيث تكون الدقة أساسية. المجموعة هي Seedance 2.0 + Veo 3.1 لجودة التوليد، وOmni Flash للتنقية الحوارية والصور الرمزية. هذا المزيج أقوى من أي نموذج واحد اليوم.
للنظر بعمق أكبر في كيفية مقارنة بنية Google متعددة الوسائط مع نماذج توليد الصور مثل GPT Image 2، أو للسياق حول ما تبدو عليه تكاملات خادم MCP في خط أنابيب إنتاج الفيديو، تلك المصادر تستحق القراءة.
الوصول إلى Gemini Omni Flash جنباً إلى جنب مع مكتبة النماذج الكاملة — دون إعداد Google Cloud، دون مفاتيح API لكل مزوّد:
الأسئلة الشائعة
ما هو Gemini Omni Flash؟
Gemini Omni Flash هو أول نموذج في عائلة "Omni" الجديدة من Google DeepMind، مصمم لقبول أي نوع من مدخلات الوسائط (نص، صور، صوت، فيديو) وتوليد أي نوع من مخرجات الوسائط في نموذج واحد. عند الإطلاق، يخرج فيديو مع صوت متزامن. ميزته المحدِّدة هي التحرير الحواري متعدد الجولات: يمكنك توليد مقطع فيديو ثم تنقيته عبر جولات تعليمات متعددة باللغة الطبيعية، مع احتفاظ النموذج بسياق مستمر بين كل تعديل. أصبح متاحاً عبر Gemini API في 30 يونيو 2026.
كيف يختلف Gemini Omni Flash عن "omni" في GPT-4o؟
التسمية مربكة لكن البنيتين مختلفتان جذرياً. عندما سمّت OpenAI GPT-4o بـ "omni"، كانت تعني أنه يمكنه إدراك وسائط متعددة في الوقت نفسه (صوت + رؤية) كمدخل. "Omni" من Google تشير إلى بنية توليدية: نموذج واحد يدرك ويولّد عبر الوسائط. لا يعالج Gemini Omni Flash فقط مدخلات متعددة الوسائط — بل يولّد مخرجات متعددة الوسائط (فيديو وصوت معاً). عائلة Omni من Google هي نظام توليدي متعدد الوسائط؛ أما وسم omni من OpenAI فكان يتعلق بالإدخال الإدراكي.
Gemini Omni Flash مقابل Veo 3 — أيهما أفضل؟
هما محسّنان لأشياء مختلفة. ينتج Veo 3.1 مخرجات ذات دقة أعلى وأكثر سينمائية (حتى 4K مقابل 720p لدى Omni Flash) وهو الخيار الأفضل لإنتاج فيديو مصقول وعالي الدقة. يفوز Gemini Omni Flash في سير العمل: إنه نموذج الفيديو الوحيد بتحرير مستمر متعدد الجولات، ويتضمن توليد الصورة الرمزية بالذكاء الاصطناعي، وينتج صوتاً في نفس تمريرة الاستدلال، ويكلف حوالي 4-7 مرات أقل في الثانية من Veo 3.1. بالنسبة للمحتوى الاجتماعي وعروض المنتجات التجريبية والنماذج الأولية التكرارية، Omni Flash هو الأداة الأفضل. للمخرجات السينمائية أو ذات جودة البث، Veo 3.1 هو الخيار الصحيح.
هل Gemini Omni Flash مجاني؟
ليس عبر API. تسعير API هو 1.50 دولار لكل مليون رمز إدخال و17.50 دولار لكل مليون رمز إخراج فيديو — حوالي 0.10 دولار لكل ثانية من فيديو 720p، أو حوالي 1.00 دولار لمقطع مدته 10 ثوان. لا توجد فئة API مجانية. مع ذلك، Gemini Omni Flash متاح دون تكلفة للمستخدمين المؤهلين على YouTube Shorts وYouTube Create (18+)، وعبر اشتراكات المستهلك Google AI Plus وPro وUltra. الوصول للمؤسسات متاح عبر منصة Gemini Enterprise Agent Platform.
ما الدقة التي يولّدها Gemini Omni Flash؟
720p عند الإطلاق، بمعدل 24 لقطة في الثانية. نسب الأبعاد المدعومة هي 16:9 و9:16 و1:1. مدة المقطع 4-10 ثوان. الدقات الأعلى (1080p وما فوق) موجودة في خارطة الطريق، وترتبط على الأرجح بفئة Gemini Omni Pro القادمة، لكنها غير متاحة عند الإطلاق.
ما هو تسعير Gemini Omni Flash؟
رموز الإدخال: 1.50 دولار لكل مليون. رموز إخراج الفيديو: 17.50 دولار لكل مليون. من الناحية العملية، هذا يصل إلى حوالي 0.10 دولار لكل ثانية من فيديو 720p مُولَّد، أو حوالي 1.00 دولار لمقطع كامل مدته 10 ثوان. جلسات التحرير متعدد الجولات تتضمن استدعاءات توليد متعددة، بحيث تكلف جلسة تنقية من أربع جولات على مقطع مدته 10 ثوان حوالي 4.00 دولارات. تفاصيل التسعير الكاملة منشورة على ai.google.dev/gemini-api/docs/pricing.
ما الفرق بين Gemini Omni وGemini Flash؟
Gemini Flash هو خط من نماذج اللغة السريعة والفعالة من حيث التكلفة للنص والرؤية — فئة Flash داخل عائلة Gemini المعيارية. Gemini Omni هي عائلة نماذج جديدة ومنفصلة مبنية على بنية مختلفة مصممة للتوليد متعدد الوسائط من أي إلى أي، بدءاً بمخرجات الفيديو. "Gemini Omni Flash" يجمع بنية Omni مع فئة السرعة/التكلفة Flash، ويضعه كنقطة دخول ميسّرة إلى عائلة Omni. هذان خطا نموذج متميزان بنيوياً، وليسا النموذج نفسه بحجمين مختلفين. Gemini Omni Pro (دقة أعلى، وربما دقة أعلى) موجود في خارطة الطريق بشكل منفصل عن نماذج Gemini Flash النصية.
المصادر
- مدونة Google: إعلان Gemini Omni
- Google AI Developers: توثيق Gemini Omni API
- Google DeepMind: صفحة نموذج Gemini Omni
- تسعير Gemini API
- مدونة Google: Gemini Omni Flash / Nano / Banana 2 Lite

رسم توضيحي: بنية Gemini Omni Flash في لمحة — معالجة إدخال موحدة عبر النص والصور والمرجع الصوتي، مع مخرجات فيديو+صوت متزامنة بدقة 720p، 24 لقطة في الثانية، بصيغ 16:9 / 9:16 / 1:1، بمدة 4-10 ثوان لكل مقطع.

