
Xây dựng AI mô phỏng thực tại vật lý
Cách DeepMind, World Labs và AMI Labs đặt cược vào world model — AI dự đoán kết quả vật lý thay vì token tiếp theo trong câu.
Tóm tắt
Các mô hình ngôn ngữ dự đoán từ ngữ. Các mô hình thế giới dự đoán điều gì sẽ xảy ra tiếp theo trong thực tế. Sự khác biệt về kiến trúc đó là lý do vì sao một số cái tên nổi bật nhất trong lĩnh vực nghiên cứu AI đã hội tụ về hướng mô hình thế giới như là lớp năng lực thiết yếu tiếp theo. Năm 2026, ba tổ chức đang dẫn đầu quá trình xây dựng này: Google DeepMind phát hành một mô hình thế giới tương tác thời gian thực dựa trên video diffusion; World Labs của Fei-Fei Li đã thương mại hóa Marble, một trình mô phỏng môi trường 3D có thể điều hướng; và AMI Labs của Yann LeCun đã huy động vòng gọi vốn hạt giống (seed) trị giá 1,03 tỷ USD — vòng gọi vốn hạt giống lớn nhất từ trước đến nay ở châu Âu — để xây dựng AI dựa trên JEPA có khả năng học hiểu vật lý từ những nguyên lý cơ bản nhất.
Một Mô Hình Thế Giới Thực Sự Làm Gì
Một mô hình ngôn ngữ được huấn luyện để dự đoán token tiếp theo trong một chuỗi. Với một đoạn văn bản cho trước, nó ước tính từ, cụm từ, hoặc ký tự nào sẽ xuất hiện tiếp theo — và qua đó, học cách suy luận về ngôn ngữ, khái niệm, và các khuôn mẫu.
Một mô hình thế giới làm một việc khác biệt về mặt cấu trúc. Với trạng thái hiện tại của một môi trường vật lý cho trước, nó dự đoán điều gì sẽ xảy ra tiếp theo: các vật thể hành xử như thế nào dưới tác động của lực, một không gian trông như thế nào từ một góc nhìn khác, hậu quả của một hành động cụ thể là gì. Dữ liệu huấn luyện không phải là văn bản — đó là video, dữ liệu cảm biến, và các mô phỏng.
Mục tiêu là tạo ra AI có thể mô phỏng trước khi hành động. Thay vì mô tả một kế hoạch bằng lời và hy vọng mô tả đó chính xác, một AI có mô hình thế giới có thể mô phỏng nội bộ kết quả của một kế hoạch, xác định điều gì sẽ thất bại, và điều chỉnh lại trước khi bất cứ điều gì được thực thi trong thế giới thực.
Ba tổ chức đang xây dựng năng lực này theo những cách khác biệt đáng kể.
Google DeepMind: Chuyển Video Thành Mô Phỏng Tương Tác
Vào tháng 8 năm 2025, DeepMind đã phát hành một mô hình thế giới tương tác thời gian thực có thể chuyển video thành mô phỏng có thể chơi được. Đầu vào là bất kỳ video nào — cảnh quay của một căn phòng, một môi trường ngoài trời, một thế giới trò chơi. Đầu ra là một phiên bản tương tác của video đó: người dùng có thể di chuyển xuyên qua nó, thực hiện các hành động, và mô hình sẽ tạo ra khung hình tiếp theo hợp lý về mặt vật lý trong thời gian thực.
Phương pháp của DeepMind hoàn toàn tránh việc lập trình thủ công các quy tắc vật lý. Mô hình học các động lực học vật lý từ việc huấn luyện trên các tập dữ liệu video khổng lồ — về cơ bản là suy luận cách thế giới vận hành từ việc quan sát nó. Các mô phỏng tuân theo trọng lực, sự che khuất, tính bền vững của vật thể (object permanence), và cấu trúc cơ bản của không gian vật lý mà không cần bất kỳ quy tắc rõ ràng nào mã hóa những đặc tính đó.
Các ứng dụng hiện tại:
- Môi trường huấn luyện robot: tạo ra vô số kịch bản mới từ cảnh quay tham chiếu thay vì phải thu thập dữ liệu vật lý mới
- Phát triển game: tạo ra các môi trường prototype tương tác từ tài liệu tham chiếu
- Định hình hành vi cho AI agent (AI agent grounding): kiểm tra các kế hoạch trong mô phỏng trước khi thực thi trong thế giới thực
Ý nghĩa dài hạn: Mô hình thế giới của DeepMind là nền tảng cho các AI agent tự chủ có thể suy luận về hậu quả trước khi hành động — thay vì hành động rồi mới quan sát kết quả.
World Labs: Marble, Thế Giới 3D Có Thể Điều Hướng
Fei-Fei Li — đồng giám đốc Viện AI Lấy Con Người Làm Trung Tâm (Human-Centered AI Institute) của Stanford và cựu trưởng bộ phận AI của Google Cloud — đã thành lập World Labs để thương mại hóa việc mô hình hóa thế giới ở quy mô lớn. Sản phẩm ra mắt năm 2026 của công ty là Marble: một mô hình sinh (generative model) tạo ra các môi trường 3D có thể điều hướng, thời gian thực, hoàn toàn từ đầu.
Trong khi DeepMind chuyển đổi video có sẵn thành mô phỏng tương tác, Marble tạo ra các thế giới 3D hoàn toàn mới từ một mô tả hoặc bản vẽ phác thảo. Những môi trường này có thể được khám phá từ mọi góc độ với hình học không gian và vật lý nhất quán — một cảnh được Marble tạo ra vẫn duy trì tính mạch lạc về cấu trúc khi bạn di chuyển xuyên qua nó, điều mà các hệ thống sinh trước đây không thể đạt được một cách ổn định.
Nơi Marble được sử dụng:
| Ứng dụng | Điều nó cho phép |
|---|---|
| Huấn luyện robot | Vô số môi trường huấn luyện đa dạng mà không cần thu thập dữ liệu vật lý |
| Prototype game và XR | Tạo prototype cho bố cục và môi trường thế giới mà không cần các nhà thiết kế 3D |
| Kiến trúc và thiết kế | Mô phỏng công trình có thể đi lại được từ bản vẽ mặt bằng hoặc mô tả |
| Nghiên cứu khoa học | Các môi trường vật lý cho những thí nghiệm quá nguy hiểm hoặc quá tốn kém để thực hiện trong thực tế |
Cơ hội thương mại mà World Labs đang hướng tới là chi phí tạo nội dung 3D: hiện tại được đo bằng hàng triệu đô la và nhiều tháng thời gian sản xuất. Việc tạo nội dung theo kiểu Marble có thể rút ngắn điều này xuống chỉ còn vài giờ.
AMI Labs: Cú Cược 1,03 Tỷ USD Vào JEPA
Advanced Machine Intelligence Labs, đồng sáng lập bởi Yann LeCun (Nhà khoa học trưởng về AI của Meta), đã huy động thành công vòng gọi vốn hạt giống trị giá 1,03 tỷ USD — vòng gọi vốn hạt giống lớn nhất trong lịch sử châu Âu — từ một liên minh các nhà đầu tư công nghệ châu Âu.
AMI Labs không xây dựng một mô hình ngôn ngữ lớn hơn hoặc một hệ thống video diffusion tốt hơn. Họ đang xây dựng AI dựa trên Kiến Trúc Dự Đoán Nhúng Kết Hợp (Joint Embedding Predictive Architecture - JEPA) của LeCun, hoạt động dựa trên các nguyên lý hoàn toàn khác so với các mô hình thế giới hiện tại.
Thay vì dự đoán các pixel thô hoặc token văn bản, JEPA huấn luyện AI để dự đoán các biểu diễn trừu tượng — cấu trúc ý nghĩa của một khung cảnh hơn là hình dạng bên ngoài theo nghĩa đen của nó. Lập luận của LeCun là: lẽ thường (common sense) của con người không được xây dựng từ việc ghi nhớ các quan sát về thế giới. Nó được xây dựng từ việc học các mô hình trừu tượng về nguyên nhân và kết quả, động lực học vật lý, và hành vi của vật thể ở mức khái niệm. JEPA cố gắng tái tạo quá trình học đó.
Sự khác biệt thực tế: các hệ thống dựa trên JEPA được kỳ vọng sẽ tổng quát hóa tốt hơn với các tình huống vật lý mới lạ so với các mô hình video diffusion, bởi vì chúng không cố tái tạo lại từng pixel — chúng mô hình hóa cấu trúc khái niệm tạo ra những pixel đó.
Luận điểm của AMI Labs, theo cách diễn giải của LeCun: việc mở rộng quy mô các mô hình ngôn ngữ không thể tạo ra AI tổng quát. Thành phần còn thiếu là một mô hình thế giới hiểu vật lý từ những nguyên lý cơ bản, không phải từ các khuôn mẫu thống kê trong văn bản hoặc video.
So Sánh Ba Phương Pháp
| Google DeepMind | World Labs (Marble) | AMI Labs (JEPA) | |
|---|---|---|---|
| Phương pháp cốt lõi | Video diffusion — học vật lý từ việc quan sát nó | Tổng hợp môi trường 3D bằng mô hình sinh | Dự đoán biểu diễn trừu tượng |
| Dữ liệu huấn luyện | Cảnh quay video | Dữ liệu môi trường đa phương thức | Chưa được công bố; huấn luyện dựa trên khái niệm |
| Đầu ra | Mô phỏng tương tác từ video tham chiếu | Thế giới 3D mới từ mô tả | Mô hình thế giới trừu tượng cho suy luận |
| Giai đoạn | Đã phát hành (Tháng 8, 2025) | Đã thương mại hóa (2026) | Nghiên cứu / xây dựng giai đoạn đầu |
| Mục đích sử dụng | Huấn luyện robot, định hình hành vi agent | Robot, phát triển game, kiến trúc, XR | Nền tảng AI tổng quát dài hạn |
Vì Sao Điều Này Quan Trọng Ngoài Phòng Thí Nghiệm
Các mô hình thế giới là hạ tầng cho thế hệ sản phẩm AI tiếp theo, không phải là các ứng dụng tiêu dùng trong ngắn hạn. Nhưng các sản phẩm được xây dựng vào năm 2026 và 2027 sẽ ngày càng phụ thuộc vào các năng lực mô hình hóa thế giới đang được thiết lập ngay bây giờ:
Robot ở quy mô lớn: Mọi công ty xây dựng AI vật lý — tự động hóa nhà kho, sản xuất, giao hàng — đều cần huấn luyện robot trên nhiều kịch bản đa dạng. Các mô hình thế giới tạo ra vô số môi trường huấn luyện đa dạng mà không tốn chi phí thu thập dữ liệu vật lý. DeepMind và World Labs đang xây dựng lớp tạo môi trường huấn luyện mà toàn bộ ngành công nghiệp robot sẽ sử dụng.
AI agent có khả năng định hình theo thực tế vật lý: Các AI agent hiện tại, bao gồm cả những hệ thống dựa trên mô hình ngôn ngữ mạnh nhất, thường "ảo giác" (hallucinate) về các giới hạn vật lý vì chúng chỉ suy luận về thế giới vật lý dựa trên các mô tả bằng văn bản. Một AI có mô hình thế giới có thể mô phỏng xem liệu một kế hoạch có hoạt động về mặt vật lý hay không trước khi thực hiện nó.
Tạo nội dung 3D: Các hệ thống thuộc lớp Marble sẽ rút ngắn đáng kể thời gian và chi phí sản xuất nội dung 3D — với những tác động trực tiếp đến phát triển game, sản xuất phim, kiến trúc, và truyền thông đa phương tiện đắm chìm (immersive media).
Các Câu Hỏi Thường Gặp
Mô hình thế giới trong AI là gì? Một mô hình thế giới là một hệ thống AI xây dựng một mô phỏng nội bộ về thực tế vật lý — mã hóa cách các vật thể hành xử, cách nguyên nhân và kết quả vận hành, và điều gì xảy ra tiếp theo sau một hành động nhất định. Khác với các mô hình ngôn ngữ dự đoán token văn bản tiếp theo, các mô hình thế giới dự đoán trạng thái tiếp theo của một môi trường vật lý. Chúng được coi là nền tảng cho robot, xe tự hành, và các AI agent vật lý.
Yann LeCun đang xây dựng gì tại AMI Labs? AMI Labs, đồng sáng lập bởi LeCun và được cấp vốn với vòng gọi vốn hạt giống 1,03 tỷ USD (lớn nhất trong lịch sử startup châu Âu), đang phát triển AI dựa trên JEPA — Kiến Trúc Dự Đoán Nhúng Kết Hợp. JEPA dự đoán các biểu diễn trừu tượng thay vì các pixel hoặc token thô, nhằm mang lại cho AI loại lẽ thường về vật lý mà con người phát triển qua kinh nghiệm thay vì qua quan sát. LeCun cho rằng JEPA là kiến trúc cần thiết cho AI có thể thực sự suy luận về thế giới vật lý.
Sản phẩm Marble của World Labs là gì? Marble là một mô hình thế giới quy mô lớn từ World Labs (thành lập bởi Fei-Fei Li) tạo ra các mô phỏng 3D có thể điều hướng, thời gian thực từ các mô tả hoặc bản vẽ phác thảo. Khác với các hệ thống chuyển đổi video có sẵn thành mô phỏng, Marble tạo ra các môi trường 3D hoàn toàn mới với vật lý và hình học không gian nhất quán. Các ứng dụng bao gồm môi trường huấn luyện robot, prototype game và AR/VR, và trực quan hóa kiến trúc.
Mô hình thế giới của Google DeepMind hoạt động như thế nào? Mô hình thế giới của DeepMind, phát hành vào tháng 8 năm 2025, nhận đầu vào là video và chuyển đổi nó thành một mô phỏng tương tác. Người dùng có thể điều hướng và hành động trong môi trường được mô phỏng, và mô hình sẽ tạo ra các khung hình tiếp theo hợp lý về mặt vật lý trong thời gian thực. Thay vì lập trình thủ công các quy tắc vật lý, mô hình học các động lực học vật lý từ việc huấn luyện trên các tập dữ liệu video lớn — suy luận ra cách thế giới hành xử từ việc quan sát nó.
Nguồn
- Google DeepMind — Phát hành mô hình thế giới tương tác thời gian thực, tháng 8, 2025
- World Labs — Ra mắt sản phẩm Marble và tài liệu kỹ thuật, 2026
- AMI Labs — Thông báo vòng gọi vốn hạt giống 1,03 tỷ USD và tổng quan kiến trúc JEPA, 2026
- Yann LeCun — Các bài nghiên cứu JEPA và các buổi trình bày công khai, Meta AI, 2025–2026

