
Chuẩn Đo Mới Cho Điểm Các Mô Hình AI Gần Về Không
Ba ngày sau khi Jensen Huang tuyên bố AGI đã đạt được, ARC-AGI-3 khiến mọi mô hình AI hàng đầu chỉ đạt dưới một phần trăm trong các nhiệm vụ tương tác mới lạ mà con người giải hoàn hảo.
Lưu ý: Bài viết này xem xét một cuộc tranh luận gây tranh cãi với các yếu tố mang tính suy đoán. Các sự kiện được mô tả phản ánh quan điểm của những cá nhân được nêu tên; các cách diễn giải về trạng thái AGI vẫn đang được tranh luận sôi nổi.
Tóm tắt
Vào ngày 23 tháng 3 năm 2026, CEO của Nvidia Jensen Huang đã nói với Lex Fridman rằng trí tuệ nhân tạo tổng quát (AGI) đã được đạt được. Ba ngày sau, vào ngày 26 tháng 3, ARC Prize Foundation đã phát hành ARC-AGI-3: 135 môi trường tương tác hoàn toàn mới mà không có mô hình AI nào từng thấy trong quá trình huấn luyện. Con người giải quyết chúng với hiệu suất 100%. Mô hình AI tốt nhất được thử nghiệm chỉ đạt 0.37%. Grok-4.20 đạt đúng 0%. Cuộc tranh luận không phải về năng lực. Nó là về ý nghĩa của từ "tổng quát" (general).
Các điểm số
| Hệ thống | Điểm ARC-AGI-3 (RHAE) |
|---|---|
| Con người | 100% |
| Google Gemini 3.1 Pro | 0.37% |
| OpenAI GPT-5.4 | 0.26% |
| Anthropic Claude Opus 4.6 | 0.25% |
| xAI Grok-4.20 | 0.00% |
| Giải thưởng ARC Prize nếu đạt yêu cầu | $2,000,000 |
Jensen Huang đã nói gì
Vào ngày 23 tháng 3, Huang đã đưa ra tuyên bố công khai dứt khoát nhất trong sự nghiệp của mình về chủ đề này:
"Tôi nghĩ là bây giờ. Tôi nghĩ chúng ta đã đạt được AGI." — Jensen Huang, CEO của Nvidia, Lex Fridman Podcast, 23 tháng 3, 2026
Định nghĩa của Huang về AGI mang tính vận hành: một AI có khả năng thực thi các quy trình làm việc phức tạp nhiều bước, viết mã ở cấp độ sản xuất, và — về nguyên tắc — điều hành một công ty công nghệ đạt mức định giá 1 tỷ đô la mà không cần con người giám sát từng bước. Theo tiêu chuẩn đó, ông cho rằng, Claude Code, GPT-5.4 với khả năng sử dụng công cụ, và các cấu hình đa tác nhân của Grok đã đủ tiêu chuẩn.
Tuyên bố này đã xuất hiện trên CNBC, Forbes, Fortune, và Yahoo Finance chỉ trong vài giờ. Phản ứng từ cộng đồng nghiên cứu là hoài nghi.
Ba ngày sau: ARC-AGI-3
François Chollet — người tạo ra benchmark ARC-AGI ban đầu và đồng sáng lập ARC Prize Foundation — đã công bố ARC-AGI-3 vào ngày 26 tháng 3. Thời điểm này so với tuyên bố của Huang không phải là ngẫu nhiên.
ARC-AGI-3 được xây dựng để kiểm tra chính xác điều mà định nghĩa của Huang bỏ qua: khả năng tổng quát hóa thực sự. Benchmark này đưa AI vào 135 môi trường tương tác không thể xuất hiện trong bất kỳ dữ liệu huấn luyện nào — những không gian bài toán hoàn toàn mới yêu cầu khám phá và suy luận từ đầu, không có hướng dẫn. Chỉ số đánh giá, Relative Human Action Efficiency (RHAE), cũng phạt sự kém hiệu quả: giải quyết một câu đố với gấp mười lần số hành động mà con người cần, bạn chỉ nhận được 1% điểm cho môi trường đó.
Để ngăn chặn việc gian lận, 110 trong số 135 môi trường được giữ kín, không cho công khai truy cập. Chỉ có 25 môi trường được mở để thử nghiệm. Không có mô hình nào đạt được điểm số gần với mức có thể nhận giải thưởng 2 triệu đô la.
Vì sao các điểm số lại thấp như vậy
Khoảng cách về hiệu suất này không có gì đáng ngạc nhiên đối với các nhà nghiên cứu nghiên cứu về khả năng tổng quát hóa của AI. Các mô hình tiên tiến ngày nay có năng lực phi thường trong các nhiệm vụ giống với phân bố dữ liệu huấn luyện của chúng. Chúng có thể viết mã phức tạp, tổng hợp các tài liệu phức tạp, và giải các bài toán ở mức tiến sĩ hoặc cao hơn — vì chúng đã thấy hàng triệu ví dụ về các nhiệm vụ như vậy.
ARC-AGI-3 loại bỏ hoàn toàn lợi thế đó. Các môi trường được thiết kế để không giống với bất cứ thứ gì trong bất kỳ tập dữ liệu nào. Không có hướng dẫn. Không có dữ liệu huấn luyện trước nào ánh xạ tới cấu trúc của từng câu đố. Hiệu suất yêu cầu kiểu suy luận linh hoạt, mang tính khám phá mà con người phát triển một cách tự nhiên và mà các kiến trúc AI hiện tại không có.
Điểm số bằng không của Grok đặc biệt đáng chú ý. Grok-4.20 đạt hiệu suất tốt trên các bài kiểm tra chuẩn đo lường kiến thức ghi nhớ và khớp mẫu. Trên ARC-AGI-3, nó đạt điểm 0 trên mọi môi trường mới — cho thấy không có khả năng tổng quát hóa vượt ra ngoài huấn luyện, thậm chí không đủ để thực hiện các bước khám phá hữu ích.
Hai định nghĩa, một tranh luận chưa được giải quyết
Sự bất đồng giữa Huang và Chollet mang tính cấu trúc, không phải thực tế. Họ đang đo lường những thứ khác nhau.
| Jensen Huang | François Chollet | |
|---|---|---|
| Định nghĩa AGI | AI thực thi các quy trình làm việc phức tạp và tạo ra giá trị thương mại ở quy mô lớn | AI tổng quát hóa được với các tình huống mới mà không cần huấn luyện trước, giống như con người |
| Trạng thái AI hiện tại | Đã đạt được | Chưa đạt được — điểm cao nhất là 0.37% |
| Cách đóng khung benchmark | Kết quả thực tiễn mới quan trọng | Khả năng tổng quát hóa là bài kiểm tra hợp lệ duy nhất |
| Lợi ích tài chính | Định giá của Nvidia phụ thuộc vào câu chuyện về sự trưởng thành của AI | Nhà nghiên cứu độc lập; giải thưởng chưa ai nhận được |
"Nếu một hệ thống không thể tổng quát hóa với các tình huống mới mà không có hướng dẫn, đó là autocomplete đắt đỏ — không phải trí tuệ tổng quát." — François Chollet, ARC Prize Foundation, tháng 3, 2026
Cả Yahoo Finance và Fortune đều lưu ý trong bài đưa tin của mình rằng tuyên bố của Huang được đưa ra bởi CEO của công ty bán phần cứng cung cấp năng lượng cho toàn bộ sự phát triển AI — một xung đột lợi ích đáng kể ảnh hưởng đến cách các tuyên bố của ông nên được đánh giá.
Quan điểm của các nhà lãnh đạo AI khác
| Người | Tổ chức | Quan điểm về AGI (tháng 3, 2026) |
|---|---|---|
| Jensen Huang | Nvidia | Đã đạt được — AI có thể điều hành các quy trình làm việc phức tạp một cách thương mại |
| François Chollet | ARC Prize Foundation | Chưa đạt được — 0.37% trên benchmark môi trường mới |
| Demis Hassabis | Google DeepMind | Đang tiến gần trong các lĩnh vực khoa học hẹp |
| Dario Amodei | Anthropic | Có thể đạt được vào năm 2026–2027 trong các lĩnh vực kiến thức cụ thể |
| Yann LeCun | AMI Labs / Meta | Còn xa mới đạt được — thiếu các mô hình thế giới vật lý và ý thức chung |
Ý nghĩa thực tiễn của điều này
Đối với những người đang sử dụng các công cụ AI ngày nay, cuộc tranh luận này phần nào mang tính học thuật. Các mô hình hiện tại thực sự mạnh mẽ đối với các nhiệm vụ mà chúng được huấn luyện: viết, viết mã, tổng hợp nghiên cứu, phân tích, suy luận trong các cấu trúc bài toán quen thuộc.
Điều chúng không thể làm một cách đáng tin cậy là gặp phải một loại bài toán hoàn toàn mới — không có dữ liệu huấn luyện tương tự — và tìm ra cách tiếp cận nó từ đầu. Khoảng cách đó không phải là một chú thích marketing. Đó là khoảng cách 99.63 điểm phần trăm giữa hiệu suất tốt nhất của Gemini và mức chuẩn của con người trên một benchmark được thiết kế cụ thể để đo lường nó.
Giải thưởng 2 triệu đô la ARC Prize vẫn chưa có ai nhận được. Benchmark vẫn mở. Khoảng cách vẫn còn đó.
Câu hỏi thường gặp
CEO Nvidia Jensen Huang có tuyên bố AGI đã được đạt được không? Đúng vậy. Vào ngày 23 tháng 3 năm 2026, Huang đã nói trên podcast Lex Fridman: "Tôi nghĩ là bây giờ. Tôi nghĩ chúng ta đã đạt được AGI." Định nghĩa của ông yêu cầu một AI có thể tự động thực thi các nhiệm vụ phức tạp nhiều bước và tạo ra giá trị thương mại — không phải là định nghĩa học thuật yêu cầu khả năng tổng quát hóa với các tình huống mới.
ARC-AGI-3 đo lường điều gì và các điểm số là bao nhiêu? ARC-AGI-3, phát hành ngày 26 tháng 3 năm 2026 bởi ARC Prize Foundation, kiểm tra AI trên 135 môi trường tương tác mới không có sự chồng lấp với dữ liệu huấn luyện. Chỉ số đánh giá (RHAE) cũng phạt sự kém hiệu quả. Con người đạt điểm 100%. Gemini 3.1 Pro đạt 0.37% (điểm AI cao nhất). GPT-5.4 đạt 0.26%, Claude Opus 4.6 đạt 0.25%, và Grok-4.20 đạt 0%.
Vì sao các mô hình AI đạt điểm thấp trên ARC-AGI-3? Benchmark này loại bỏ hoàn toàn các lợi thế từ huấn luyện. Các mô hình không thể khớp mẫu với các ví dụ trước đó vì không có ví dụ nào tồn tại. ARC-AGI-3 yêu cầu khả năng tổng quát hóa thực sự — suy luận từ đầu về các môi trường mới — điều mà các kiến trúc AI hiện tại không thể làm được một cách đáng tin cậy. Điểm số bằng không của Grok-4.20 cho thấy kiến thức ghi nhớ, dù có ích trên các benchmark chuẩn, không mang lại lợi ích nào khi đối mặt với các loại bài toán hoàn toàn chưa từng thấy.
ARC Prize là gì và đã có ai giành được nó chưa? ARC Prize Foundation đang trao giải 2 triệu đô la cho bất kỳ hệ thống AI nào đạt hiệu suất tương đương con người trên ARC-AGI-3. Đến cuối tháng 3 năm 2026, không có mô hình nào đạt gần được mức đó. Benchmark này giữ kín 110 trong số 135 môi trường, không cho công khai truy cập để ngăn chặn việc huấn luyện trên dữ liệu kiểm tra.
Nguồn
- Fortune — "Nvidia's Jensen Huang says 'We've achieved AGI.' But no one can agree on what that means"
- Decrypt — "Is AGI Here? Not Even Close, New AI Benchmark Suggests"
- Forbes — "Nvidia's Jensen Huang Says He Thinks 'We've Achieved AGI'"
- Winbuzzer — "ARC-AGI-3 Offers $2M for AI Matching Human Reasoning"
- ARC Prize Foundation — ARC-AGI-3 benchmark release, March 26, 2026

