
เกณฑ์มาตรฐานใหม่ให้คะแนนโมเดล AI ใกล้ศูนย์
สามวันหลังจาก Jensen Huang ประกาศว่าบรรลุ AGI แล้ว ARC-AGI-3 ให้คะแนนโมเดลระดับแนวหน้าทุกตัวต่ำกว่าหนึ่งเปอร์เซ็นต์ในภารกิจโต้ตอบรูปแบบใหม่ที่มนุษย์ทำได้อย่างสมบูรณ์แบบ
หมายเหตุ: บทความนี้พิจารณาข้อโต้แย้งที่มีความขัดแย้งพร้อมองค์ประกอบเชิงคาดการณ์ เหตุการณ์ที่อธิบายไว้สะท้อนถึงจุดยืนที่บุคคลที่ถูกกล่าวถึงยึดถือ การตีความสถานะ AGI ยังคงเป็นที่โต้เถียงกันอยู่
สรุป
เมื่อวันที่ 23 มีนาคม 2026 เจนเซ่น หวง (Jensen Huang) ซีอีโอของ Nvidia บอกกับ Lex Fridman ว่าปัญญาประดิษฐ์ทั่วไป (artificial general intelligence) ได้ถูกบรรลุแล้ว ในวันที่ 26 มีนาคม — สามวันต่อมา — มูลนิธิ ARC Prize ได้เปิดตัว ARC-AGI-3: สภาพแวดล้อมเชิงโต้ตอบใหม่ 135 รูปแบบที่โมเดล AI ไม่เคยเห็นมาก่อนในการฝึกฝน มนุษย์แก้ปัญหาเหล่านี้ได้ด้วยประสิทธิภาพ 100% ส่วนโมเดล AI ที่ดีที่สุดที่ทดสอบทำได้เพียง 0.37% Grok-4.20 ได้คะแนนเป็นศูนย์เป๊ะ การถกเถียงนี้ไม่ใช่เรื่องความสามารถ แต่เป็นเรื่องความหมายของคำว่า "ทั่วไป" (general)
คะแนน
| ระบบ | คะแนน ARC-AGI-3 (RHAE) |
|---|---|
| มนุษย์ | 100% |
| Google Gemini 3.1 Pro | 0.37% |
| OpenAI GPT-5.4 | 0.26% |
| Anthropic Claude Opus 4.6 | 0.25% |
| xAI Grok-4.20 | 0.00% |
| รางวัล ARC Prize สำหรับผู้ที่ผ่านเกณฑ์ | $2,000,000 |
สิ่งที่เจนเซ่น หวง กล่าว
เมื่อวันที่ 23 มีนาคม หวงได้กล่าวถ้อยแถลงที่ชัดเจนที่สุดในอาชีพของเขาเกี่ยวกับหัวข้อนี้ต่อสาธารณะ:
"ผมคิดว่าตอนนี้แหละ ผมคิดว่าเราบรรลุ AGI แล้ว" — เจนเซ่น หวง ซีอีโอของ Nvidia, พอดแคสต์ Lex Fridman, 23 มีนาคม 2026
คำนิยาม AGI ของหวงเป็นแบบเชิงปฏิบัติการ: AI ที่สามารถดำเนินขั้นตอนการทำงานที่ซับซ้อนหลายขั้นตอน เขียนโค้ดระดับการผลิตจริง และ — ในทางหลักการ — สามารถบริหารบริษัทเทคโนโลยีให้มีมูลค่า 1 พันล้านดอลลาร์ได้โดยไม่ต้องมีมนุษย์ควบคุมดูแลทุกขั้นตอน ตามมาตรฐานนี้ เขาให้เหตุผลว่า Claude Code, GPT-5.4 ที่ใช้เครื่องมือ และการตั้งค่าแบบมัลติเอเจนต์ของ Grok นั้นมีคุณสมบัติตรงตามเกณฑ์นี้อยู่แล้ว
ถ้อยแถลงนี้ปรากฏใน CNBC, Forbes, Fortune และ Yahoo Finance ภายในเวลาไม่กี่ชั่วโมง การตอบสนองจากชุมชนนักวิจัยเป็นไปในทางกังขา
สามวันต่อมา: ARC-AGI-3
ฟรองซัวส์ โชเลต์ (François Chollet) — ผู้สร้างเกณฑ์มาตรฐาน ARC-AGI ดั้งเดิมและผู้ร่วมก่อตั้งมูลนิธิ ARC Prize — ได้เผยแพร่ ARC-AGI-3 เมื่อวันที่ 26 มีนาคม ช่วงเวลาที่สัมพันธ์กับคำประกาศของหวงนั้นไม่ใช่เรื่องบังเอิญ
ARC-AGI-3 ถูกสร้างขึ้นเพื่อทดสอบสิ่งที่คำนิยามของหวงมองข้ามไปโดยเฉพาะ: การสรุปทั่วไปที่แท้จริง (genuine generalization) เกณฑ์มาตรฐานนี้นำเสนอสภาพแวดล้อมเชิงโต้ตอบ 135 รูปแบบให้กับ AI ซึ่งไม่มีทางปรากฏอยู่ในข้อมูลการฝึกฝนใดๆ — ปริภูมิปัญหาใหม่ที่ต้องใช้การสำรวจและการให้เหตุผลตั้งแต่ต้นโดยไม่มีคำแนะนำใดๆ ตัวชี้วัดคะแนน Relative Human Action Efficiency (RHAE) ยังลงโทษความไม่มีประสิทธิภาพด้วย: หากแก้ปริศนาโดยใช้การกระทำมากกว่าที่มนุษย์ต้องการถึงสิบเท่า จะได้รับเครดิตเพียง 1% สำหรับสภาพแวดล้อมนั้น
เพื่อป้องกันการเล่นระบบ 110 จาก 135 สภาพแวดล้อมถูกกันไว้ไม่ให้เข้าถึงได้แบบสาธารณะ มีเพียง 25 สภาพแวดล้อมที่เปิดให้ทดสอบได้ ไม่มีโมเดลใดทำคะแนนเข้าใกล้ระดับที่จะได้รับรางวัล 2 ล้านดอลลาร์เลย
เหตุใดคะแนนจึงต่ำมาก
ช่องว่างของประสิทธิภาพนี้ไม่ใช่เรื่องน่าประหลาดใจสำหรับนักวิจัยที่ศึกษาเรื่องการสรุปทั่วไปของ AI โมเดลชั้นแนวหน้าในปัจจุบันมีความสามารถอย่างน่าทึ่งในงานที่มีลักษณะคล้ายกับข้อมูลการฝึกฝนของมัน มันสามารถเขียนโค้ดที่ซับซ้อน สังเคราะห์เอกสารที่ซับซ้อน และแก้ปัญหาคณิตศาสตร์ในระดับปริญญาเอกหรือสูงกว่าได้ — เพราะมันได้เห็นตัวอย่างงานประเภทนี้มาแล้วนับล้านตัวอย่าง
ARC-AGI-3 กำจัดข้อได้เปรียบนั้นออกไปทั้งหมด สภาพแวดล้อมเหล่านี้ถูกออกแบบให้ไม่เหมือนกับสิ่งใดในชุดข้อมูลใดๆ ไม่มีคำแนะนำ ไม่มีข้อมูลการฝึกฝนก่อนหน้าที่จะเชื่อมโยงกับโครงสร้างของปริศนาแต่ละข้อ ประสิทธิภาพต้องอาศัยการให้เหตุผลแบบยืดหยุ่นและเชิงสำรวจที่มนุษย์พัฒนาขึ้นตามธรรมชาติ ซึ่งสถาปัตยกรรม AI ในปัจจุบันยังไม่มี
คะแนนศูนย์ของ Grok นั้นเผยให้เห็นความจริงอย่างชัดเจนเป็นพิเศษ Grok-4.20 ทำคะแนนได้ดีในการทดสอบมาตรฐานที่วัดความรู้ที่จดจำไว้และการจับคู่รูปแบบ แต่ใน ARC-AGI-3 มันได้คะแนนศูนย์ในทุกสภาพแวดล้อมใหม่ — บ่งชี้ว่าไม่มีความสามารถในการสรุปทั่วไปเกินกว่าการฝึกฝน แม้จะไม่มากพอที่จะทำการเคลื่อนไหวเชิงสำรวจที่เป็นประโยชน์เลยก็ตาม
นิยามสองแบบ ข้อโต้แย้งหนึ่งที่ยังไม่ได้รับการแก้ไข
ความขัดแย้งระหว่างหวงกับโชเลต์เป็นเรื่องโครงสร้าง ไม่ใช่ข้อเท็จจริง พวกเขากำลังวัดสิ่งที่แตกต่างกัน
| เจนเซ่น หวง | ฟรองซัวส์ โชเลต์ | |
|---|---|---|
| นิยามของ AGI | AI ที่ดำเนินขั้นตอนการทำงานที่ซับซ้อนและสร้างมูลค่าทางการค้าในระดับใหญ่ | AI ที่สรุปทั่วไปได้กับสถานการณ์ใหม่โดยไม่ต้องฝึกฝนล่วงหน้า เช่นเดียวกับมนุษย์ทุกคน |
| สถานะ AI ในปัจจุบัน | บรรลุแล้ว | ยังไม่บรรลุ — คะแนนสูงสุดคือ 0.37% |
| กรอบแนวคิดเกณฑ์มาตรฐาน | ผลลัพธ์เชิงปฏิบัติเป็นสิ่งสำคัญ | ความสามารถในการสรุปทั่วไปเป็นการทดสอบที่ถูกต้องเพียงอย่างเดียว |
| ผลประโยชน์ทางการเงิน | มูลค่าของ Nvidia ขึ้นอยู่กับเรื่องเล่าความเจริญเต็มที่ของ AI | นักวิจัยอิสระ; ยังไม่มีใครอ้างสิทธิ์รางวัล |
"หากระบบไม่สามารถสรุปทั่วไปได้กับสถานการณ์ใหม่โดยไม่มีคำแนะนำ มันก็คือระบบเติมข้อความอัตโนมัติที่มีราคาแพง — ไม่ใช่ปัญญาประดิษฐ์ทั่วไป" — ฟรองซัวส์ โชเลต์, มูลนิธิ ARC Prize, มีนาคม 2026
ทั้ง Yahoo Finance และ Fortune ต่างระบุไว้ในรายงานข่าวว่าคำประกาศของหวงมาจากซีอีโอของบริษัทที่ขายฮาร์ดแวร์ซึ่งขับเคลื่อนการพัฒนา AI ทั้งหมด — ความขัดแย้งทางผลประโยชน์ที่สำคัญซึ่งควรนำมาพิจารณาในการชั่งน้ำหนักคำกล่าวของเขา
จุดยืนของผู้นำ AI คนอื่นๆ
| บุคคล | องค์กร | จุดยืนเกี่ยวกับ AGI (มีนาคม 2026) |
|---|---|---|
| เจนเซ่น หวง | Nvidia | บรรลุแล้ว — AI สามารถดำเนินขั้นตอนการทำงานที่ซับซ้อนในเชิงพาณิชย์ได้ |
| ฟรองซัวส์ โชเลต์ | มูลนิธิ ARC Prize | ยังไม่บรรลุ — คะแนน 0.37% ในเกณฑ์มาตรฐานสภาพแวดล้อมใหม่ |
| เดมิส ฮาซาบิส (Demis Hassabis) | Google DeepMind | กำลังใกล้เข้ามาในโดเมนวิทยาศาสตร์แบบเฉพาะทาง |
| ดาริโอ อาโมเดอี (Dario Amodei) | Anthropic | อยู่ในเอื้อมมือภายในปี 2026–2027 ในโดเมนความรู้เฉพาะทาง |
| ยานน์ เลอคุน (Yann LeCun) | AMI Labs / Meta | ยังห่างไกลจากการบรรลุ — ยังขาดโมเดลของโลกทางกายภาพและสามัญสำนึก |
สิ่งนี้มีความหมายอย่างไรในทางปฏิบัติ
สำหรับผู้คนที่ใช้เครื่องมือ AI ในปัจจุบัน การถกเถียงนี้ค่อนข้างเป็นเรื่องเชิงวิชาการ โมเดลปัจจุบันมีความทรงพลังอย่างแท้จริงสำหรับงานที่มันถูกฝึกฝนมา: การเขียน การเขียนโค้ด การสังเคราะห์งานวิจัย การวิเคราะห์ และการให้เหตุผลภายในโครงสร้างปัญหาที่คุ้นเคย
สิ่งที่มันไม่สามารถทำได้อย่างเชื่อถือได้คือการเผชิญกับปัญหาประเภทใหม่อย่างแท้จริง — ปัญหาที่ไม่มีข้อมูลการฝึกฝนที่คล้ายคลึงกัน — และคิดหาวิธีเข้าถึงมันตั้งแต่ต้น ช่องว่างนั้นไม่ใช่เพียงเชิงอรรถทางการตลาด มันคือช่องว่าง 99.63 จุดเปอร์เซ็นต์ระหว่างประสิทธิภาพที่ดีที่สุดของ Gemini กับพื้นฐานของมนุษย์ในเกณฑ์มาตรฐานที่ถูกออกแบบมาโดยเฉพาะเพื่อวัดสิ่งนี้
รางวัล ARC Prize มูลค่า 2 ล้านดอลลาร์ยังไม่มีผู้ใดได้รับ เกณฑ์มาตรฐานยังเปิดอยู่ ช่องว่างยังคงอยู่
คำถามที่พบบ่อย
เจนเซ่น หวง แห่ง Nvidia ประกาศว่า AGI บรรลุแล้วจริงหรือ? ใช่ เมื่อวันที่ 23 มีนาคม 2026 หวงกล่าวในพอดแคสต์ Lex Fridman ว่า: "ผมคิดว่าตอนนี้แหละ ผมคิดว่าเราบรรลุ AGI แล้ว" คำนิยามของเขาต้องการ AI ที่สามารถดำเนินงานที่ซับซ้อนหลายขั้นตอนได้โดยอิสระและสร้างมูลค่าทางการค้า — ไม่ใช่คำนิยามเชิงวิชาการที่ต้องการการสรุปทั่วไปกับสถานการณ์ใหม่
ARC-AGI-3 วัดอะไร และคะแนนเป็นอย่างไร? ARC-AGI-3 เผยแพร่เมื่อวันที่ 26 มีนาคม 2026 โดยมูลนิธิ ARC Prize ทดสอบ AI กับสภาพแวดล้อมเชิงโต้ตอบใหม่ 135 รูปแบบที่ไม่มีความทับซ้อนกับข้อมูลการฝึกฝน ตัวชี้วัดคะแนน (RHAE) ยังลงโทษความไม่มีประสิทธิภาพด้วย มนุษย์ทำคะแนนได้ 100% Gemini 3.1 Pro ทำคะแนนได้ 0.37% (คะแนน AI สูงสุด) GPT-5.4 ทำคะแนนได้ 0.26% Claude Opus 4.6 ทำคะแนนได้ 0.25% และ Grok-4.20 ทำคะแนนได้ 0%
เหตุใดโมเดล AI จึงทำคะแนนได้แย่มากใน ARC-AGI-3? เกณฑ์มาตรฐานนี้กำจัดข้อได้เปรียบจากการฝึกฝนทั้งหมด โมเดลไม่สามารถจับคู่รูปแบบกับตัวอย่างก่อนหน้าได้เพราะไม่มีตัวอย่างเช่นนั้นอยู่ ARC-AGI-3 ต้องการการสรุปทั่วไปที่แท้จริง — การให้เหตุผลตั้งแต่ต้นเกี่ยวกับสภาพแวดล้อมใหม่ — ซึ่งสถาปัตยกรรม AI ในปัจจุบันยังไม่สามารถทำได้อย่างเชื่อถือได้ คะแนนศูนย์ของ Grok-4.20 แสดงให้เห็นว่าความรู้ที่จดจำไว้ แม้จะมีประโยชน์ในเกณฑ์มาตรฐานทั่วไป แต่ไม่มีประโยชน์เลยเมื่อเผชิญกับปัญหาประเภทที่ไม่เคยเห็นมาก่อนอย่างแท้จริง
ARC Prize คืออะไร และมีใครได้รับรางวัลนี้หรือยัง? มูลนิธิ ARC Prize เสนอรางวัล 2 ล้านดอลลาร์สำหรับระบบ AI ใดๆ ที่สามารถทำประสิทธิภาพเทียบเท่ากับมนุษย์ใน ARC-AGI-3 ณ สิ้นเดือนมีนาคม 2026 ยังไม่มีโมเดลใดเข้าใกล้เลย เกณฑ์มาตรฐานนี้กันไม่ให้เข้าถึง 110 จาก 135 สภาพแวดล้อมแบบสาธารณะ เพื่อป้องกันการฝึกฝนบนข้อมูลทดสอบ
แหล่งอ้างอิง
- Fortune — "Nvidia's Jensen Huang says 'We've achieved AGI.' But no one can agree on what that means"
- Decrypt — "Is AGI Here? Not Even Close, New AI Benchmark Suggests"
- Forbes — "Nvidia's Jensen Huang Says He Thinks 'We've Achieved AGI'"
- Winbuzzer — "ARC-AGI-3 Offers $2M for AI Matching Human Reasoning"
- ARC Prize Foundation — ARC-AGI-3 benchmark release, March 26, 2026

