กลับ
เกณฑ์มาตรฐานใหม่ให้คะแนนโมเดล AI ใกล้ศูนย์
March 31, 2026
7 นาทีในการอ่าน
แชร์บทความนี้

เกณฑ์มาตรฐานใหม่ให้คะแนนโมเดล AI ใกล้ศูนย์

สามวันหลังจาก Jensen Huang ประกาศว่าบรรลุ AGI แล้ว ARC-AGI-3 ให้คะแนนโมเดลระดับแนวหน้าทุกตัวต่ำกว่าหนึ่งเปอร์เซ็นต์ในภารกิจโต้ตอบรูปแบบใหม่ที่มนุษย์ทำได้อย่างสมบูรณ์แบบ

หมายเหตุ: บทความนี้พิจารณาข้อโต้แย้งที่มีความขัดแย้งพร้อมองค์ประกอบเชิงคาดการณ์ เหตุการณ์ที่อธิบายไว้สะท้อนถึงจุดยืนที่บุคคลที่ถูกกล่าวถึงยึดถือ การตีความสถานะ AGI ยังคงเป็นที่โต้เถียงกันอยู่

สรุป

เมื่อวันที่ 23 มีนาคม 2026 เจนเซ่น หวง (Jensen Huang) ซีอีโอของ Nvidia บอกกับ Lex Fridman ว่าปัญญาประดิษฐ์ทั่วไป (artificial general intelligence) ได้ถูกบรรลุแล้ว ในวันที่ 26 มีนาคม — สามวันต่อมา — มูลนิธิ ARC Prize ได้เปิดตัว ARC-AGI-3: สภาพแวดล้อมเชิงโต้ตอบใหม่ 135 รูปแบบที่โมเดล AI ไม่เคยเห็นมาก่อนในการฝึกฝน มนุษย์แก้ปัญหาเหล่านี้ได้ด้วยประสิทธิภาพ 100% ส่วนโมเดล AI ที่ดีที่สุดที่ทดสอบทำได้เพียง 0.37% Grok-4.20 ได้คะแนนเป็นศูนย์เป๊ะ การถกเถียงนี้ไม่ใช่เรื่องความสามารถ แต่เป็นเรื่องความหมายของคำว่า "ทั่วไป" (general)

คะแนน

ระบบคะแนน ARC-AGI-3 (RHAE)
มนุษย์100%
Google Gemini 3.1 Pro0.37%
OpenAI GPT-5.40.26%
Anthropic Claude Opus 4.60.25%
xAI Grok-4.200.00%
รางวัล ARC Prize สำหรับผู้ที่ผ่านเกณฑ์$2,000,000

สิ่งที่เจนเซ่น หวง กล่าว

เมื่อวันที่ 23 มีนาคม หวงได้กล่าวถ้อยแถลงที่ชัดเจนที่สุดในอาชีพของเขาเกี่ยวกับหัวข้อนี้ต่อสาธารณะ:

"ผมคิดว่าตอนนี้แหละ ผมคิดว่าเราบรรลุ AGI แล้ว" — เจนเซ่น หวง ซีอีโอของ Nvidia, พอดแคสต์ Lex Fridman, 23 มีนาคม 2026

คำนิยาม AGI ของหวงเป็นแบบเชิงปฏิบัติการ: AI ที่สามารถดำเนินขั้นตอนการทำงานที่ซับซ้อนหลายขั้นตอน เขียนโค้ดระดับการผลิตจริง และ — ในทางหลักการ — สามารถบริหารบริษัทเทคโนโลยีให้มีมูลค่า 1 พันล้านดอลลาร์ได้โดยไม่ต้องมีมนุษย์ควบคุมดูแลทุกขั้นตอน ตามมาตรฐานนี้ เขาให้เหตุผลว่า Claude Code, GPT-5.4 ที่ใช้เครื่องมือ และการตั้งค่าแบบมัลติเอเจนต์ของ Grok นั้นมีคุณสมบัติตรงตามเกณฑ์นี้อยู่แล้ว

ถ้อยแถลงนี้ปรากฏใน CNBC, Forbes, Fortune และ Yahoo Finance ภายในเวลาไม่กี่ชั่วโมง การตอบสนองจากชุมชนนักวิจัยเป็นไปในทางกังขา

สามวันต่อมา: ARC-AGI-3

ฟรองซัวส์ โชเลต์ (François Chollet) — ผู้สร้างเกณฑ์มาตรฐาน ARC-AGI ดั้งเดิมและผู้ร่วมก่อตั้งมูลนิธิ ARC Prize — ได้เผยแพร่ ARC-AGI-3 เมื่อวันที่ 26 มีนาคม ช่วงเวลาที่สัมพันธ์กับคำประกาศของหวงนั้นไม่ใช่เรื่องบังเอิญ

ARC-AGI-3 ถูกสร้างขึ้นเพื่อทดสอบสิ่งที่คำนิยามของหวงมองข้ามไปโดยเฉพาะ: การสรุปทั่วไปที่แท้จริง (genuine generalization) เกณฑ์มาตรฐานนี้นำเสนอสภาพแวดล้อมเชิงโต้ตอบ 135 รูปแบบให้กับ AI ซึ่งไม่มีทางปรากฏอยู่ในข้อมูลการฝึกฝนใดๆ — ปริภูมิปัญหาใหม่ที่ต้องใช้การสำรวจและการให้เหตุผลตั้งแต่ต้นโดยไม่มีคำแนะนำใดๆ ตัวชี้วัดคะแนน Relative Human Action Efficiency (RHAE) ยังลงโทษความไม่มีประสิทธิภาพด้วย: หากแก้ปริศนาโดยใช้การกระทำมากกว่าที่มนุษย์ต้องการถึงสิบเท่า จะได้รับเครดิตเพียง 1% สำหรับสภาพแวดล้อมนั้น

เพื่อป้องกันการเล่นระบบ 110 จาก 135 สภาพแวดล้อมถูกกันไว้ไม่ให้เข้าถึงได้แบบสาธารณะ มีเพียง 25 สภาพแวดล้อมที่เปิดให้ทดสอบได้ ไม่มีโมเดลใดทำคะแนนเข้าใกล้ระดับที่จะได้รับรางวัล 2 ล้านดอลลาร์เลย

เหตุใดคะแนนจึงต่ำมาก

ช่องว่างของประสิทธิภาพนี้ไม่ใช่เรื่องน่าประหลาดใจสำหรับนักวิจัยที่ศึกษาเรื่องการสรุปทั่วไปของ AI โมเดลชั้นแนวหน้าในปัจจุบันมีความสามารถอย่างน่าทึ่งในงานที่มีลักษณะคล้ายกับข้อมูลการฝึกฝนของมัน มันสามารถเขียนโค้ดที่ซับซ้อน สังเคราะห์เอกสารที่ซับซ้อน และแก้ปัญหาคณิตศาสตร์ในระดับปริญญาเอกหรือสูงกว่าได้ — เพราะมันได้เห็นตัวอย่างงานประเภทนี้มาแล้วนับล้านตัวอย่าง

ARC-AGI-3 กำจัดข้อได้เปรียบนั้นออกไปทั้งหมด สภาพแวดล้อมเหล่านี้ถูกออกแบบให้ไม่เหมือนกับสิ่งใดในชุดข้อมูลใดๆ ไม่มีคำแนะนำ ไม่มีข้อมูลการฝึกฝนก่อนหน้าที่จะเชื่อมโยงกับโครงสร้างของปริศนาแต่ละข้อ ประสิทธิภาพต้องอาศัยการให้เหตุผลแบบยืดหยุ่นและเชิงสำรวจที่มนุษย์พัฒนาขึ้นตามธรรมชาติ ซึ่งสถาปัตยกรรม AI ในปัจจุบันยังไม่มี

คะแนนศูนย์ของ Grok นั้นเผยให้เห็นความจริงอย่างชัดเจนเป็นพิเศษ Grok-4.20 ทำคะแนนได้ดีในการทดสอบมาตรฐานที่วัดความรู้ที่จดจำไว้และการจับคู่รูปแบบ แต่ใน ARC-AGI-3 มันได้คะแนนศูนย์ในทุกสภาพแวดล้อมใหม่ — บ่งชี้ว่าไม่มีความสามารถในการสรุปทั่วไปเกินกว่าการฝึกฝน แม้จะไม่มากพอที่จะทำการเคลื่อนไหวเชิงสำรวจที่เป็นประโยชน์เลยก็ตาม

นิยามสองแบบ ข้อโต้แย้งหนึ่งที่ยังไม่ได้รับการแก้ไข

ความขัดแย้งระหว่างหวงกับโชเลต์เป็นเรื่องโครงสร้าง ไม่ใช่ข้อเท็จจริง พวกเขากำลังวัดสิ่งที่แตกต่างกัน

เจนเซ่น หวงฟรองซัวส์ โชเลต์
นิยามของ AGIAI ที่ดำเนินขั้นตอนการทำงานที่ซับซ้อนและสร้างมูลค่าทางการค้าในระดับใหญ่AI ที่สรุปทั่วไปได้กับสถานการณ์ใหม่โดยไม่ต้องฝึกฝนล่วงหน้า เช่นเดียวกับมนุษย์ทุกคน
สถานะ AI ในปัจจุบันบรรลุแล้วยังไม่บรรลุ — คะแนนสูงสุดคือ 0.37%
กรอบแนวคิดเกณฑ์มาตรฐานผลลัพธ์เชิงปฏิบัติเป็นสิ่งสำคัญความสามารถในการสรุปทั่วไปเป็นการทดสอบที่ถูกต้องเพียงอย่างเดียว
ผลประโยชน์ทางการเงินมูลค่าของ Nvidia ขึ้นอยู่กับเรื่องเล่าความเจริญเต็มที่ของ AIนักวิจัยอิสระ; ยังไม่มีใครอ้างสิทธิ์รางวัล

"หากระบบไม่สามารถสรุปทั่วไปได้กับสถานการณ์ใหม่โดยไม่มีคำแนะนำ มันก็คือระบบเติมข้อความอัตโนมัติที่มีราคาแพง — ไม่ใช่ปัญญาประดิษฐ์ทั่วไป" — ฟรองซัวส์ โชเลต์, มูลนิธิ ARC Prize, มีนาคม 2026

ทั้ง Yahoo Finance และ Fortune ต่างระบุไว้ในรายงานข่าวว่าคำประกาศของหวงมาจากซีอีโอของบริษัทที่ขายฮาร์ดแวร์ซึ่งขับเคลื่อนการพัฒนา AI ทั้งหมด — ความขัดแย้งทางผลประโยชน์ที่สำคัญซึ่งควรนำมาพิจารณาในการชั่งน้ำหนักคำกล่าวของเขา

จุดยืนของผู้นำ AI คนอื่นๆ

บุคคลองค์กรจุดยืนเกี่ยวกับ AGI (มีนาคม 2026)
เจนเซ่น หวงNvidiaบรรลุแล้ว — AI สามารถดำเนินขั้นตอนการทำงานที่ซับซ้อนในเชิงพาณิชย์ได้
ฟรองซัวส์ โชเลต์มูลนิธิ ARC Prizeยังไม่บรรลุ — คะแนน 0.37% ในเกณฑ์มาตรฐานสภาพแวดล้อมใหม่
เดมิส ฮาซาบิส (Demis Hassabis)Google DeepMindกำลังใกล้เข้ามาในโดเมนวิทยาศาสตร์แบบเฉพาะทาง
ดาริโอ อาโมเดอี (Dario Amodei)Anthropicอยู่ในเอื้อมมือภายในปี 2026–2027 ในโดเมนความรู้เฉพาะทาง
ยานน์ เลอคุน (Yann LeCun)AMI Labs / Metaยังห่างไกลจากการบรรลุ — ยังขาดโมเดลของโลกทางกายภาพและสามัญสำนึก

สิ่งนี้มีความหมายอย่างไรในทางปฏิบัติ

สำหรับผู้คนที่ใช้เครื่องมือ AI ในปัจจุบัน การถกเถียงนี้ค่อนข้างเป็นเรื่องเชิงวิชาการ โมเดลปัจจุบันมีความทรงพลังอย่างแท้จริงสำหรับงานที่มันถูกฝึกฝนมา: การเขียน การเขียนโค้ด การสังเคราะห์งานวิจัย การวิเคราะห์ และการให้เหตุผลภายในโครงสร้างปัญหาที่คุ้นเคย

สิ่งที่มันไม่สามารถทำได้อย่างเชื่อถือได้คือการเผชิญกับปัญหาประเภทใหม่อย่างแท้จริง — ปัญหาที่ไม่มีข้อมูลการฝึกฝนที่คล้ายคลึงกัน — และคิดหาวิธีเข้าถึงมันตั้งแต่ต้น ช่องว่างนั้นไม่ใช่เพียงเชิงอรรถทางการตลาด มันคือช่องว่าง 99.63 จุดเปอร์เซ็นต์ระหว่างประสิทธิภาพที่ดีที่สุดของ Gemini กับพื้นฐานของมนุษย์ในเกณฑ์มาตรฐานที่ถูกออกแบบมาโดยเฉพาะเพื่อวัดสิ่งนี้

รางวัล ARC Prize มูลค่า 2 ล้านดอลลาร์ยังไม่มีผู้ใดได้รับ เกณฑ์มาตรฐานยังเปิดอยู่ ช่องว่างยังคงอยู่

คำถามที่พบบ่อย

เจนเซ่น หวง แห่ง Nvidia ประกาศว่า AGI บรรลุแล้วจริงหรือ? ใช่ เมื่อวันที่ 23 มีนาคม 2026 หวงกล่าวในพอดแคสต์ Lex Fridman ว่า: "ผมคิดว่าตอนนี้แหละ ผมคิดว่าเราบรรลุ AGI แล้ว" คำนิยามของเขาต้องการ AI ที่สามารถดำเนินงานที่ซับซ้อนหลายขั้นตอนได้โดยอิสระและสร้างมูลค่าทางการค้า — ไม่ใช่คำนิยามเชิงวิชาการที่ต้องการการสรุปทั่วไปกับสถานการณ์ใหม่

ARC-AGI-3 วัดอะไร และคะแนนเป็นอย่างไร? ARC-AGI-3 เผยแพร่เมื่อวันที่ 26 มีนาคม 2026 โดยมูลนิธิ ARC Prize ทดสอบ AI กับสภาพแวดล้อมเชิงโต้ตอบใหม่ 135 รูปแบบที่ไม่มีความทับซ้อนกับข้อมูลการฝึกฝน ตัวชี้วัดคะแนน (RHAE) ยังลงโทษความไม่มีประสิทธิภาพด้วย มนุษย์ทำคะแนนได้ 100% Gemini 3.1 Pro ทำคะแนนได้ 0.37% (คะแนน AI สูงสุด) GPT-5.4 ทำคะแนนได้ 0.26% Claude Opus 4.6 ทำคะแนนได้ 0.25% และ Grok-4.20 ทำคะแนนได้ 0%

เหตุใดโมเดล AI จึงทำคะแนนได้แย่มากใน ARC-AGI-3? เกณฑ์มาตรฐานนี้กำจัดข้อได้เปรียบจากการฝึกฝนทั้งหมด โมเดลไม่สามารถจับคู่รูปแบบกับตัวอย่างก่อนหน้าได้เพราะไม่มีตัวอย่างเช่นนั้นอยู่ ARC-AGI-3 ต้องการการสรุปทั่วไปที่แท้จริง — การให้เหตุผลตั้งแต่ต้นเกี่ยวกับสภาพแวดล้อมใหม่ — ซึ่งสถาปัตยกรรม AI ในปัจจุบันยังไม่สามารถทำได้อย่างเชื่อถือได้ คะแนนศูนย์ของ Grok-4.20 แสดงให้เห็นว่าความรู้ที่จดจำไว้ แม้จะมีประโยชน์ในเกณฑ์มาตรฐานทั่วไป แต่ไม่มีประโยชน์เลยเมื่อเผชิญกับปัญหาประเภทที่ไม่เคยเห็นมาก่อนอย่างแท้จริง

ARC Prize คืออะไร และมีใครได้รับรางวัลนี้หรือยัง? มูลนิธิ ARC Prize เสนอรางวัล 2 ล้านดอลลาร์สำหรับระบบ AI ใดๆ ที่สามารถทำประสิทธิภาพเทียบเท่ากับมนุษย์ใน ARC-AGI-3 ณ สิ้นเดือนมีนาคม 2026 ยังไม่มีโมเดลใดเข้าใกล้เลย เกณฑ์มาตรฐานนี้กันไม่ให้เข้าถึง 110 จาก 135 สภาพแวดล้อมแบบสาธารณะ เพื่อป้องกันการฝึกฝนบนข้อมูลทดสอบ

แหล่งอ้างอิง

  • Fortune — "Nvidia's Jensen Huang says 'We've achieved AGI.' But no one can agree on what that means"
  • Decrypt — "Is AGI Here? Not Even Close, New AI Benchmark Suggests"
  • Forbes — "Nvidia's Jensen Huang Says He Thinks 'We've Achieved AGI'"
  • Winbuzzer — "ARC-AGI-3 Offers $2M for AI Matching Human Reasoning"
  • ARC Prize Foundation — ARC-AGI-3 benchmark release, March 26, 2026
เผยแพร่เมื่อ March 31, 2026
บทความอื่นๆ
เกณฑ์มาตรฐานใหม่ให้คะแนนโมเดล AI ใกล้ศูนย์ | Happycapy blog | Happycapy