Kembali
بناء ذكاء اصطناعي يحاكي الواقع الفيزيائي
April 2, 2026
8 menit baca
Bagikan artikel ini

بناء ذكاء اصطناعي يحاكي الواقع الفيزيائي

كيف راهنت DeepMind وWorld Labs وAMI Labs على نماذج العالم — ذكاء اصطناعي يتنبأ بالنتائج الفيزيائية بدلاً من الكلمة التالية في الجملة.

ملخص

نماذج اللغة تتنبأ بالكلمات. نماذج العالم تتنبأ بما سيحدث بعد ذلك في الواقع. هذا الاختلاف البنيوي هو السبب في أن بعض أبرز الأسماء في مجال أبحاث الذكاء الاصطناعي قد توافقت على اعتبار نماذج العالم طبقة القدرات الأساسية التالية. في عام 2026، تتصدر ثلاث منظمات هذا البناء: أصدرت Google DeepMind نموذج عالم تفاعليًا في الزمن الحقيقي يعتمد على انتشار الفيديو (video diffusion)؛ وقامت شركة World Labs التابعة لفاي-فاي لي (Fei-Fei Li) بتسويق Marble، وهو محاكي بيئات ثلاثية الأبعاد قابلة للتنقل داخلها تجاريًا؛ وأغلقت AMI Labs التابعة ليان لوكون (Yann LeCun) جولة تمويل تأسيسي (seed) بقيمة 1.03 مليار دولار — الأكبر على الإطلاق في أوروبا — لبناء ذكاء اصطناعي يعتمد على JEPA يتعلم الفهم الفيزيائي من المبادئ الأولى.

ما الذي يفعله نموذج العالم فعليًا

يُدرَّب نموذج اللغة على التنبؤ بالرمز (token) التالي في تسلسل ما. فبالنظر إلى نص معين، يقدّر النموذج الكلمة أو العبارة أو الحرف الذي يأتي بعده — ومن خلال هذا، يتعلم الاستدلال على اللغة والمفاهيم والأنماط.

يقوم نموذج العالم بأمر مختلف بنيويًا. فبالنظر إلى الحالة الراهنة لبيئة فيزيائية، يتنبأ بما يحدث بعد ذلك: كيف تتصرف الأجسام تحت تأثير القوة، وكيف يبدو المكان من زاوية رؤية مختلفة، وما هي عواقب فعل معين. بيانات التدريب هنا ليست نصًا — بل هي فيديو وقراءات مستشعرات ومحاكاة.

الهدف هو ذكاء اصطناعي يمكنه المحاكاة قبل أن يتصرف. فبدلًا من وصف خطة بالكلمات والأمل في أن يكون الوصف دقيقًا، يمكن لذكاء اصطناعي مزوّد بنموذج عالم أن يحاكي داخليًا نتيجة خطة ما، ويحدد ما سيفشل، ويعدّل قبل تنفيذ أي شيء في العالم الحقيقي.

هناك ثلاث منظمات تبني هذه القدرة بطرق مختلفة بشكل ملموس.

Google DeepMind: تحويل الفيديو إلى محاكاة تفاعلية

في أغسطس 2025، أصدرت DeepMind نموذج عالم تفاعليًا في الزمن الحقيقي يحوّل الفيديو إلى محاكاة قابلة للتفاعل. المدخل هو أي فيديو — لقطات لغرفة، أو بيئة خارجية، أو عالم لعبة. المخرج هو نسخة تفاعلية من ذلك الفيديو: يمكن للمستخدم التحرك خلاله واتخاذ إجراءات، ويولّد النموذج الإطار (frame) التالي المعقول فيزيائيًا في الزمن الحقيقي.

يتجنب نهج DeepMind تمامًا وضع قواعد فيزيائية مصممة يدويًا. يتعلم النموذج الديناميكيات الفيزيائية من التدريب على مجموعات بيانات فيديو ضخمة — أي أنه يستنتج فعليًا كيفية عمل العالم من خلال مراقبته. تحترم المحاكاة الجاذبية والحجب (occlusion) وثبات الأجسام والبنية الأساسية للفضاء الفيزيائي دون أي قواعد صريحة تُرمِّز تلك الخصائص.

التطبيقات الحالية:

  • بيئات تدريب الروبوتات: توليد عدد غير محدود من السيناريوهات الجديدة من لقطات مرجعية بدلًا من جمع بيانات فيزيائية جديدة
  • تطوير الألعاب: توليد بيئات نموذجية تفاعلية من مواد مرجعية
  • تأسيس عملاء الذكاء الاصطناعي (AI agent grounding): اختبار الخطط في محاكاة قبل التنفيذ في العالم الحقيقي

الأثر بعيد المدى: نموذج عالم DeepMind هو أساس لعملاء ذكاء اصطناعي مستقلين يمكنهم الاستدلال على العواقب قبل التصرف — بدلًا من التصرف وملاحظة النتائج بعد ذلك.

World Labs: Marble، العالم الثلاثي الأبعاد القابل للتنقل

فاي-فاي لي — المديرة المشاركة لمعهد ستانفورد للذكاء الاصطناعي المتمركز حول الإنسان، والرئيسة السابقة للذكاء الاصطناعي في Google Cloud — أسست World Labs لتسويق نمذجة العالم على نطاق واسع تجاريًا. إطلاق المنتج الخاص بالشركة في عام 2026 هو Marble: نموذج توليدي ينشئ بيئات ثلاثية الأبعاد قابلة للتنقل في الزمن الحقيقي من الصفر.

في حين تحوّل DeepMind الفيديو الموجود مسبقًا إلى محاكاة تفاعلية، يولّد Marble عوالم ثلاثية الأبعاد جديدة كليًا من وصف أو رسم تخطيطي تقريبي. يمكن استكشاف هذه البيئات من أي زاوية مع الحفاظ على هندسة مكانية وفيزياء متسقة — فالمشهد الذي يولّده Marble يحافظ على تماسك بنيوي وأنت تتحرك خلاله، وهو أمر لم تتمكن الأنظمة التوليدية السابقة من تحقيقه بشكل موثوق.

أين يُستخدم Marble:

التطبيقما الذي يمكّنه
تدريب الروبوتاتبيئات تدريب متنوعة غير محدودة دون جمع بيانات فيزيائية
نماذج الألعاب والواقع الموسّع (XR)بناء نماذج أولية لتخطيطات وبيئات العالم دون فنانين ثلاثي الأبعاد
العمارة والتصميممحاكاة مبانٍ يمكن السير داخلها من مخططات الطوابق أو الأوصاف
البحث العلميبيئات فيزيائية للتجارب الخطيرة أو المكلفة جدًا لتنفيذها في الواقع

الفرصة التجارية التي تستهدفها World Labs هي تكلفة المحتوى الثلاثي الأبعاد: التي تُقاس حاليًا بملايين الدولارات وشهور من وقت الإنتاج. يُقلّص التوليد على غرار Marble هذا إلى ساعات.

AMI Labs: رهان 1.03 مليار دولار على JEPA

قامت Advanced Machine Intelligence Labs، التي شارك في تأسيسها يان لوكون (كبير علماء الذكاء الاصطناعي في Meta)، بإغلاق جولة تمويل تأسيسي بقيمة 1.03 مليار دولار — الأكبر في تاريخ الشركات الناشئة الأوروبية — من تحالف مستثمري تقنية أوروبيين.

لا تبني AMI Labs نموذج لغة أكبر أو نظام انتشار فيديو أفضل. بل تبني ذكاءً اصطناعيًا يعتمد على بنية التنبؤ بالتضمين المشترك (Joint Embedding Predictive Architecture - JEPA) الخاصة بلوكون، والتي تعمل على مبادئ مختلفة جذريًا عن نماذج العالم الحالية.

بدلًا من التنبؤ بالبكسلات الخام أو رموز النص، يُدرِّب JEPA الذكاء الاصطناعي على التنبؤ بـتمثيلات مجردة (abstract representations) — البنية الدلالية للمشهد بدلًا من مظهره الحرفي. حجة لوكون: الحس السليم البشري لا يُبنى من حفظ ملاحظات عن العالم. بل يُبنى من تعلّم نماذج مجردة للسبب والنتيجة، والديناميكيات الفيزيائية، وسلوك الأجسام على مستوى مفاهيمي. يحاول JEPA تكرار تلك العملية التعليمية.

الفرق العملي: يُفترض أن تعمم الأنظمة المعتمدة على JEPA على المواقف الفيزيائية الجديدة بفعالية أكبر من نماذج انتشار الفيديو، لأنها لا تحاول إعادة بناء كل بكسل — بل تنمذج البنية المفاهيمية التي تولّد تلك البكسلات.

فرضية AMI Labs، بحسب صياغة لوكون: توسيع نطاق نماذج اللغة لا يمكن أن يُنتج ذكاءً اصطناعيًا عامًا. المكوّن الناقص هو نموذج عالم يفهم الفيزياء من المبادئ الأولى، وليس من الأنماط الإحصائية في النص أو الفيديو.

مقارنة بين النهج الثلاثة

Google DeepMindWorld Labs (Marble)AMI Labs (JEPA)
النهج الأساسيانتشار الفيديو — تعلّم الفيزياء من خلال مراقبتهاتوليد بيئات ثلاثية الأبعاد توليديًاالتنبؤ بالتمثيلات المجردة
بيانات التدريبلقطات فيديوبيانات بيئية متعددة الوسائطغير معلنة؛ تدريب مفاهيمي
المخرجمحاكاة تفاعلية من فيديو مرجعيعوالم ثلاثية الأبعاد جديدة من وصفنموذج عالم مجرد للاستدلال
المرحلةصدر (أغسطس 2025)مسوَّق تجاريًا (2026)بحث / بناء أولي
الاستخدام المقصودتدريب الروبوتات، تأسيس العملاءالروبوتات، تطوير الألعاب، العمارة، XRأساس طويل المدى للذكاء الاصطناعي العام

لماذا يهم هذا خارج المختبر

نماذج العالم هي بنية تحتية للجيل القادم من منتجات الذكاء الاصطناعي، وليست تطبيقات استهلاكية قريبة المدى. لكن المنتجات التي يجري بناؤها في عامي 2026 و2027 ستعتمد بشكل متزايد على قدرات نمذجة العالم التي يجري تأسيسها الآن:

الروبوتات على نطاق واسع: كل شركة تبني ذكاءً اصطناعيًا فيزيائيًا — أتمتة المستودعات، التصنيع، التوصيل — تحتاج إلى تدريب الروبوتات على سيناريوهات متنوعة. تولّد نماذج العالم بيئات تدريب متنوعة غير محدودة دون تكلفة جمع البيانات الفيزيائية. تبني DeepMind وWorld Labs طبقة توليد بيئات التدريب التي ستستخدمها صناعة الروبوتات بأكملها.

عملاء ذكاء اصطناعي ذوو تأسيس فيزيائي: تعاني عملاء الذكاء الاصطناعي الحاليون، بما في ذلك أكثر الأنظمة القائمة على نماذج اللغة قدرةً، من الهلوسة بشأن القيود الفيزيائية لأنهم يستدلّون على العالم الفيزيائي من أوصاف نصية فقط. يمكن لذكاء اصطناعي مزوّد بنموذج عالم أن يحاكي ما إذا كانت خطة ما تعمل فيزيائيًا قبل الالتزام بها.

إنشاء المحتوى الثلاثي الأبعاد: ستُقلّص أنظمة من فئة Marble الجداول الزمنية وتكاليف إنتاج المحتوى الثلاثي الأبعاد بمقدار مراتب حجمية — مع تأثيرات مباشرة على تطوير الألعاب، وإنتاج الأفلام، والعمارة، والوسائط الغامرة.

الأسئلة المتكررة

ما هو نموذج العالم في الذكاء الاصطناعي؟ نموذج العالم هو نظام ذكاء اصطناعي يبني محاكاة داخلية للواقع الفيزيائي — يُرمِّز كيفية تصرف الأجسام، وكيفية عمل السبب والنتيجة، وما يحدث بعد فعل معين. وبخلاف نماذج اللغة التي تتنبأ برمز النص التالي، تتنبأ نماذج العالم بالحالة التالية لبيئة فيزيائية. وتُعتبر أساسية للروبوتات، والمركبات ذاتية القيادة، وعملاء الذكاء الاصطناعي الفيزيائي.

ما الذي يبنيه يان لوكون في AMI Labs؟ تقوم AMI Labs، التي شارك في تأسيسها لوكون وتم تمويلها بجولة تمويل تأسيسي بقيمة 1.03 مليار دولار (الأكبر في تاريخ الشركات الناشئة الأوروبية)، بتطوير ذكاء اصطناعي يعتمد على JEPA — بنية التنبؤ بالتضمين المشترك. يتنبأ JEPA بتمثيلات مجردة بدلًا من البكسلات الخام أو الرموز، بهدف إعطاء الذكاء الاصطناعي نوعًا من الحس الفيزيائي السليم الذي يطوّره البشر من خلال الخبرة بدلًا من الملاحظة. ويرى لوكون أن JEPA هو البنية الضرورية للذكاء الاصطناعي الذي يمكنه الاستدلال بشكل حقيقي على العالم الفيزيائي.

ما هو منتج Marble من World Labs؟ Marble هو نموذج عالم كبير من World Labs (التي أسستها فاي-فاي لي) يولّد محاكاة ثلاثية الأبعاد قابلة للتنقل في الزمن الحقيقي من أوصاف أو رسوم تخطيطية. وبخلاف الأنظمة التي تحوّل فيديو موجودًا مسبقًا إلى محاكاة، ينشئ Marble بيئات ثلاثية الأبعاد جديدة بفيزياء وهندسة مكانية متسقة. تشمل التطبيقات بيئات تدريب الروبوتات، ونماذج أولية للألعاب والواقع المعزز/الافتراضي، والتصوير المعماري.

كيف يعمل نموذج عالم Google DeepMind؟ يأخذ نموذج عالم DeepMind، الذي صدر في أغسطس 2025، مدخل فيديو ويحوّله إلى محاكاة تفاعلية. يمكن للمستخدم التنقل والتصرف داخل البيئة المحاكاة، ويولّد النموذج الإطارات التالية المعقولة فيزيائيًا في الزمن الحقيقي. وبدلًا من ترميز قواعد الفيزياء يدويًا، يتعلم النموذج الديناميكيات الفيزيائية من التدريب على مجموعات بيانات فيديو ضخمة — أي أنه يستنتج كيفية تصرف العالم من مراقبته.

المصادر

  • Google DeepMind — إصدار نموذج العالم التفاعلي في الزمن الحقيقي، أغسطس 2025
  • World Labs — إطلاق منتج Marble والوثائق التقنية، 2026
  • AMI Labs — الإعلان عن جولة التمويل التأسيسي بقيمة 1.03 مليار دولار ونظرة عامة على بنية JEPA، 2026
  • يان لوكون — أوراق بحثية عن JEPA وعروض تقديمية عامة، Meta AI، 2025–2026
Diterbitkan pada April 2, 2026
Artikel Lainnya
بناء ذكاء اصطناعي يحاكي الواقع الفيزيائي | مدونة Happycapy | Happycapy