Quay lại
معيار قياس جديد يمنح نماذج الذكاء الاصطناعي درجات قريبة من الصفر
March 31, 2026
7 phút đọc
Chia sẻ bài viết này

معيار قياس جديد يمنح نماذج الذكاء الاصطناعي درجات قريبة من الصفر

بعد ثلاثة أيام فقط من إعلان Jensen Huang عن تحقيق الذكاء الاصطناعي العام (AGI)، سجّل معيار ARC-AGI-3 أقل من واحد بالمئة لكل النماذج المتقدمة في مهام تفاعلية جديدة أتمّها البشر بنجاح كامل.

ملاحظة: يتناول هذا المقال نقاشًا خلافيًا يحتوي على عناصر تخمينية. تعكس الأحداث الموصوفة مواقف اتخذها أفراد محددون بالاسم؛ وتفسيرات حالة الذكاء العام الاصطناعي (AGI) لا تزال محل نزاع فعلي.

الملخص

في 23 مارس 2026، صرّح جنسن هوانغ، الرئيس التنفيذي لشركة Nvidia، لليكس فريدمان بأن الذكاء العام الاصطناعي قد تحقق. وفي 26 مارس — بعد ثلاثة أيام — أصدرت مؤسسة ARC Prize معيار ARC-AGI-3: 135 بيئة تفاعلية جديدة لم يسبق لأي نموذج ذكاء اصطناعي رؤيتها أثناء التدريب. حلّها البشر بكفاءة 100%. أفضل نموذج ذكاء اصطناعي تم اختباره سجّل 0.37%. أما Grok-4.20 فسجّل صفرًا تمامًا. النقاش لا يدور حول القدرة، بل حول معنى كلمة "عام".

النتائج

النظامنتيجة ARC-AGI-3 (RHAE)
البشر100%
Google Gemini 3.1 Pro0.37%
OpenAI GPT-5.40.26%
Anthropic Claude Opus 4.60.25%
xAI Grok-4.200.00%
جائزة ARC للنجاح2,000,000 دولار

ما قاله جنسن هوانغ

في 23 مارس، أطلق هوانغ أوضح تصريح علني في مسيرته المهنية حول هذا الموضوع:

"أعتقد أن الأمر قد حدث الآن. أعتقد أننا حققنا الذكاء العام الاصطناعي." — جنسن هوانغ، الرئيس التنفيذي لشركة Nvidia، بودكاست Lex Fridman، 23 مارس 2026

تعريف هوانغ للذكاء العام الاصطناعي هو تعريف عملي/وظيفي: ذكاء اصطناعي قادر على تنفيذ سير عمل متعدد الخطوات ومعقد، وكتابة أكواد بمستوى الإنتاج الفعلي، و — من حيث المبدأ — إدارة شركة تكنولوجيا حتى تبلغ قيمتها مليار دولار دون الحاجة إلى إشراف بشري على كل خطوة. وبهذا المعيار، يرى هوانغ أن Claude Code، وGPT-5.4 مع استخدام الأدوات، وتكوينات Grok متعددة الوكلاء، تستوفي هذا التعريف بالفعل.

انتشر التصريح في CNBC وForbes وFortune وYahoo Finance في غضون ساعات. وكان رد المجتمع البحثي متشككًا.

بعد ثلاثة أيام: ARC-AGI-3

نشر فرانسوا شوليه — مبتكر معيار ARC-AGI الأصلي والمؤسس المشارك لمؤسسة ARC Prize — معيار ARC-AGI-3 في 26 مارس. ولم يكن التوقيت بالنسبة لتصريح هوانغ محض صدفة.

صُمم ARC-AGI-3 لاختبار ما يتجاهله تعريف هوانغ تمامًا: التعميم الحقيقي (genuine generalization). يعرض المعيار على الذكاء الاصطناعي 135 بيئة تفاعلية لا يمكن أن تكون قد ظهرت في أي بيانات تدريب — مساحات مسائل جديدة تتطلب الاستكشاف والاستدلال من الصفر، دون أي تعليمات. ومقياس التقييم، وهو كفاءة الفعل البشري النسبية (RHAE)، يعاقب أيضًا على عدم الكفاءة: فحلّ اللغز باستخدام عشرة أضعاف عدد الأفعال التي يحتاجها الإنسان يمنحك فقط 1% من درجة تلك البيئة.

ولمنع التلاعب بالنتائج، تُحجب 110 من أصل 135 بيئة عن الوصول العام. ولا يُفتح للاختبار إلا 25 بيئة فقط. ولم يقترب أي نموذج من نتيجة تؤهله للفوز بجائزة الـ 2 مليون دولار.

لماذا النتائج منخفضة جدًا

هذه الفجوة في الأداء ليست مفاجئة للباحثين الذين يدرسون التعميم في الذكاء الاصطناعي. النماذج المتقدمة اليوم قادرة بشكل استثنائي على المهام التي تشابه توزيع بيانات تدريبها. فهي قادرة على كتابة أكواد معقدة، وتوليف وثائق معقدة، وحل مسائل رياضية بمستوى يوازي أو يتجاوز مستوى الدكتوراة — لأنها رأت ملايين الأمثلة على مهام مماثلة.

يزيل ARC-AGI-3 هذه الميزة تمامًا. فالبيئات مصممة لتكون مختلفة عن أي شيء موجود في أي مجموعة بيانات. لا توجد تعليمات. ولا توجد بيانات تدريب سابقة تتطابق مع بنية كل لغز. الأداء يتطلب نوعًا من الاستدلال المرن والاستكشافي الذي يطوره البشر بشكل طبيعي، والذي لا تتمتع به بنى الذكاء الاصطناعي الحالية.

نتيجة Grok الصفرية كاشفة بشكل خاص. يحقق Grok-4.20 أداءً جيدًا في الاختبارات القياسية التي تقيس المعرفة المحفوظة ومطابقة الأنماط. لكنه في ARC-AGI-3 سجّل صفرًا في كل بيئة جديدة — وهو ما يشير إلى عدم القدرة على التعميم خارج نطاق التدريب، بل حتى عدم القدرة على القيام بخطوات استكشافية مفيدة.

تعريفان، وجدال واحد لم يُحل

الخلاف بين هوانغ وشوليه بنيوي، وليس واقعيًا. فكلاهما يقيس شيئًا مختلفًا.

جنسن هوانغفرانسوا شوليه
تعريف الذكاء العام الاصطناعيذكاء اصطناعي ينفّذ سير عمل معقد وينشئ قيمة تجارية على نطاق واسعذكاء اصطناعي يعمّم على مواقف جديدة دون تدريب مسبق، كما يفعل أي إنسان
حالة الذكاء الاصطناعي الحاليةتحقق بالفعللم يتحقق — أفضل نتيجة 0.37%
إطار المعيارما يهم هو الناتج العمليقدرة التعميم هي الاختبار الصحيح الوحيد
المصلحة الماليةقيمة Nvidia السوقية تعتمد على سردية نضج الذكاء الاصطناعيباحث مستقل؛ ولم تُطالب الجائزة بعد من أي طرف

"إذا كان النظام غير قادر على التعميم على مواقف جديدة دون تعليمات، فهو مجرد إكمال تلقائي مكلف — وليس ذكاءً عامًا." — فرانسوا شوليه، مؤسسة ARC Prize، مارس 2026

أشارت Yahoo Finance وFortune كلاهما في تغطيتهما إلى أن تصريح هوانغ يصدر عن الرئيس التنفيذي للشركة التي تبيع العتاد الذي يشغّل تطوير الذكاء الاصطناعي بالكامل — تضارب مصالح مادي يجب أخذه في الحسبان عند تقييم تصريحاته.

أين يقف قادة الذكاء الاصطناعي الآخرون

الشخصالمؤسسةالموقف من الذكاء العام الاصطناعي (مارس 2026)
جنسن هوانغNvidiaتحقق — يمكن للذكاء الاصطناعي تشغيل سير عمل معقد تجاريًا
فرانسوا شوليهمؤسسة ARC Prizeلم يتحقق — 0.37% على معيار البيئات الجديدة
ديميس هاسابيسGoogle DeepMindيقترب في مجالات علمية ضيقة
داريو أمودايAnthropicفي المتناول بحلول 2026-2027 في مجالات معرفية محددة
يان لوكونAMI Labs / Metaبعيد جدًا عن التحقق — تنقصه نماذج العالم الفعلي والحس السليم

ما يعنيه هذا من الناحية العملية

بالنسبة للأشخاص الذين يستخدمون أدوات الذكاء الاصطناعي اليوم، فإن هذا النقاش أكاديمي إلى حد ما. فالنماذج الحالية قوية بحق في المهام التي دُرّبت عليها: الكتابة، والبرمجة، وتوليف الأبحاث، والتحليل، والاستدلال داخل بنى مسائل مألوفة.

ما لا تستطيع القيام به بشكل موثوق هو مواجهة نوع جديد فعليًا من المسائل — نوع لا يوجد له نظير في بيانات التدريب — ومعرفة كيفية التعامل معه من الصفر. هذه الفجوة ليست حاشية تسويقية. إنها فجوة تبلغ 99.63 نقطة نسبية بين أفضل أداء لـ Gemini والخط الأساسي البشري على معيار صُمم خصيصًا لقياسها.

جائزة ARC البالغة 2 مليون دولار لم تُطالب بعد. المعيار مفتوح. والفجوة لا تزال قائمة.

الأسئلة الشائعة

هل أعلن جنسن هوانغ من Nvidia أن الذكاء العام الاصطناعي قد تحقق؟ نعم. في 23 مارس 2026، قال هوانغ في بودكاست Lex Fridman: "أعتقد أن الأمر قد حدث الآن. أعتقد أننا حققنا الذكاء العام الاصطناعي." يتطلب تعريفه ذكاءً اصطناعيًا قادرًا على تنفيذ مهام معقدة متعددة الخطوات بشكل مستقل وخلق قيمة تجارية — وليس التعريف الأكاديمي الذي يتطلب التعميم على مواقف جديدة.

ماذا قاس ARC-AGI-3 وما كانت النتائج؟ يختبر ARC-AGI-3، الذي أصدرته مؤسسة ARC Prize في 26 مارس 2026، الذكاء الاصطناعي على 135 بيئة تفاعلية جديدة لا تتداخل مع بيانات التدريب. ومقياس التقييم (RHAE) يعاقب أيضًا على عدم الكفاءة. سجّل البشر 100%. وسجّل Gemini 3.1 Pro 0.37% (أعلى نتيجة لذكاء اصطناعي). وسجّل GPT-5.4 نسبة 0.26%، وClaude Opus 4.6 نسبة 0.25%، وGrok-4.20 نسبة 0%.

لماذا تسجّل نماذج الذكاء الاصطناعي نتائج ضعيفة جدًا على ARC-AGI-3؟ يزيل المعيار كل مزايا التدريب. لا تستطيع النماذج مطابقة الأنماط مع أمثلة سابقة لأنها غير موجودة. يتطلب ARC-AGI-3 تعميمًا حقيقيًا — استدلالًا من الصفر حول بيئات جديدة — وهو ما لا تستطيع بنى الذكاء الاصطناعي الحالية القيام به بشكل موثوق. وتُظهر نتيجة Grok-4.20 الصفرية أن المعرفة المحفوظة، وإن كانت مفيدة في المعايير القياسية، لا تقدّم أي فائدة عند مواجهة أنواع مسائل غير مرئية فعليًا.

ما هي جائزة ARC وهل فاز بها أحد؟ تقدّم مؤسسة ARC Prize مليوني دولار لأي نظام ذكاء اصطناعي يوازي أداء الإنسان على ARC-AGI-3. وحتى نهاية مارس 2026، لم يقترب أي نموذج من ذلك. ويحجب المعيار 110 من أصل 135 بيئة عن الوصول العام لمنع التدريب على بيانات الاختبار.

المصادر

  • Fortune — "Nvidia's Jensen Huang says 'We've achieved AGI.' But no one can agree on what that means"
  • Decrypt — "Is AGI Here? Not Even Close, New AI Benchmark Suggests"
  • Forbes — "Nvidia's Jensen Huang Says He Thinks 'We've Achieved AGI'"
  • Winbuzzer — "ARC-AGI-3 Offers $2M for AI Matching Human Reasoning"
  • ARC Prize Foundation — ARC-AGI-3 benchmark release, March 26, 2026
Đăng ngày March 31, 2026
Bài viết khác