กลับ
การสร้าง AI ที่จำลองโลกแห่งความจริงทางกายภาพ
April 2, 2026
8 นาทีในการอ่าน
แชร์บทความนี้

การสร้าง AI ที่จำลองโลกแห่งความจริงทางกายภาพ

DeepMind, World Labs และ AMI Labs กำลังทุ่มเดิมพันกับ world models — AI ที่คาดการณ์ผลลัพธ์ทางกายภาพ แทนที่จะคาดเดาคำถัดไปในประโยค

สรุป

โมเดลภาษาทำนายคำ ส่วนโมเดลโลก (World Model) ทำนายสิ่งที่จะเกิดขึ้นต่อไปในความเป็นจริง ความแตกต่างทางโครงสร้างนี้เป็นเหตุผลว่าทำไมชื่อที่โดดเด่นที่สุดหลายชื่อในสายงานวิจัย AI จึงมาบรรจบกันที่ world models ในฐานะเลเยอร์ความสามารถที่จำเป็นลำดับต่อไป ในปี 2026 มีสามองค์กรที่เป็นผู้นำในการสร้างสิ่งนี้ ได้แก่ Google DeepMind ที่เปิดตัวโมเดลโลกแบบอินเทอร์แอกทีฟเรียลไทม์ที่อิงจาก video diffusion, World Labs ของ Fei-Fei Li ที่นำ Marble ซึ่งเป็นตัวจำลองสภาพแวดล้อม 3D ที่สามารถเดินสำรวจได้ออกสู่เชิงพาณิชย์ และ AMI Labs ของ Yann LeCun ที่ปิดรอบระดมทุน seed round มูลค่า 1.03 พันล้านดอลลาร์ — ซึ่งเป็นรอบที่ใหญ่ที่สุดในยุโรปเท่าที่มีมา — เพื่อสร้าง AI ที่อิงจาก JEPA ซึ่งเรียนรู้ความเข้าใจทางกายภาพจากหลักการพื้นฐาน

World Model ทำอะไรได้บ้าง

โมเดลภาษาถูกฝึกให้ทำนายโทเคนคำถัดไปในลำดับข้อความ เมื่อได้รับข้อความหนึ่งช่วง มันจะประเมินว่าคำ วลี หรือตัวอักษรใดจะมาถัดไป — และผ่านกระบวนการนี้ มันเรียนรู้ที่จะให้เหตุผลเกี่ยวกับภาษา แนวคิด และรูปแบบต่างๆ

ในขณะที่ world model ทำสิ่งที่แตกต่างในเชิงโครงสร้าง เมื่อได้รับสถานะปัจจุบันของสภาพแวดล้อมทางกายภาพ มันจะทำนายว่าจะเกิดอะไรขึ้นต่อไป เช่น วัตถุมีพฤติกรรมอย่างไรภายใต้แรง พื้นที่หนึ่งมีลักษณะอย่างไรเมื่อมองจากมุมที่แตกต่างออกไป และผลลัพธ์ของการกระทำอย่างใดอย่างหนึ่งเป็นอย่างไร ข้อมูลการฝึกไม่ใช่ข้อความ แต่เป็นวิดีโอ ค่าที่อ่านได้จากเซนเซอร์ และการจำลอง (simulations)

เป้าหมายคือ AI ที่สามารถจำลองสถานการณ์ก่อนที่จะลงมือทำ แทนที่จะอธิบายแผนด้วยคำพูดและหวังว่าคำอธิบายนั้นจะถูกต้อง AI ที่มี world model สามารถจำลองผลลัพธ์ของแผนภายในตัวมันเอง ระบุสิ่งที่จะล้มเหลว และปรับปรุงแผนก่อนที่จะดำเนินการใดๆ ในโลกความเป็นจริง

องค์กรทั้งสามกำลังสร้างความสามารถนี้ในรูปแบบที่แตกต่างกันอย่างมีความหมาย

Google DeepMind: จากวิดีโอสู่การจำลองแบบอินเทอร์แอกทีฟ

ในเดือนสิงหาคม 2025 DeepMind ได้เปิดตัวโมเดลโลกแบบอินเทอร์แอกทีฟเรียลไทม์ที่แปลงวิดีโอให้เป็นการจำลองที่เล่นได้ อินพุตคือวิดีโอใดๆ ก็ได้ — ฟุตเทจของห้อง สภาพแวดล้อมภายนอก หรือโลกในเกม เอาต์พุตคือเวอร์ชันอินเทอร์แอกทีฟของวิดีโอนั้น ผู้ใช้สามารถเคลื่อนที่ผ่านมันได้ ทำการกระทำต่างๆ ได้ และโมเดลจะสร้างเฟรมถัดไปที่สอดคล้องกับหลักฟิสิกส์ในเรียลไทม์

แนวทางของ DeepMind หลีกเลี่ยงการเขียนกฎฟิสิกส์ด้วยมือโดยสิ้นเชิง โมเดลเรียนรู้พลศาสตร์ทางกายภาพจากการฝึกด้วยชุดข้อมูลวิดีโอขนาดใหญ่ — ซึ่งเปรียบเสมือนการอนุมานว่าโลกทำงานอย่างไรจากการเฝ้าดูมัน การจำลองนี้เคารพต่อแรงโน้มถ่วง การบังกัน (occlusion) ความคงอยู่ของวัตถุ (object permanence) และโครงสร้างพื้นฐานของพื้นที่ทางกายภาพ โดยไม่มีกฎที่เขียนไว้อย่างชัดแจ้งใดๆ กำหนดคุณสมบัติเหล่านั้น

การใช้งานในปัจจุบัน:

  • สภาพแวดล้อมการฝึกฝนหุ่นยนต์: สร้างสถานการณ์ใหม่ๆ ได้ไม่จำกัดจากฟุตเทจอ้างอิง แทนการเก็บข้อมูลทางกายภาพใหม่
  • การพัฒนาเกม: สร้างสภาพแวดล้อมต้นแบบแบบอินเทอร์แอกทีฟจากเนื้อหาอ้างอิง
  • การให้ AI agent มีความเข้าใจในโลกจริง (grounding): ทดสอบแผนในการจำลองก่อนดำเนินการในโลกจริง

ความหมายในระยะยาว: world model ของ DeepMind เป็นพื้นฐานสำหรับ AI agent แบบอัตโนมัติที่สามารถให้เหตุผลเกี่ยวกับผลที่จะเกิดขึ้นก่อนที่จะลงมือทำ — แทนที่จะลงมือทำแล้วสังเกตผลลัพธ์ทีหลัง

World Labs: Marble โลก 3D ที่เดินสำรวจได้

Fei-Fei Li — ผู้อำนวยการร่วมของ Human-Centered AI Institute แห่ง Stanford และอดีตหัวหน้าฝ่าย AI ของ Google Cloud — ก่อตั้ง World Labs เพื่อนำการสร้าง world model ขนาดใหญ่ออกสู่เชิงพาณิชย์ ผลิตภัณฑ์ที่เปิดตัวในปี 2026 ของบริษัทคือ Marble ซึ่งเป็นโมเดลเชิงกำเนิด (generative model) ที่สร้างสภาพแวดล้อม 3D แบบเรียลไทม์ที่เดินสำรวจได้จากศูนย์

ในขณะที่ DeepMind แปลงวิดีโอที่มีอยู่แล้วให้เป็นการจำลองแบบอินเทอร์แอกทีฟ Marble สร้างโลก 3D ใหม่ทั้งหมดขึ้นจากคำอธิบายหรือภาพสเก็ตช์คร่าวๆ สภาพแวดล้อมเหล่านี้สามารถสำรวจได้จากทุกมุมมองด้วยเรขาคณิตของพื้นที่และฟิสิกส์ที่สอดคล้องกัน — ฉากที่สร้างโดย Marble รักษาความสอดคล้องเชิงโครงสร้างไว้ได้ในขณะที่คุณเคลื่อนที่ผ่านมัน ซึ่งเป็นสิ่งที่ระบบเชิงกำเนิดรุ่นก่อนไม่สามารถทำได้อย่างน่าเชื่อถือ

พื้นที่ที่ Marble ถูกนำไปใช้:

การใช้งานสิ่งที่ทำได้
การฝึกฝนหุ่นยนต์สภาพแวดล้อมการฝึกที่หลากหลายไม่จำกัดโดยไม่ต้องเก็บข้อมูลทางกายภาพ
การสร้างต้นแบบเกมและ XRสร้างต้นแบบเลย์เอาต์และสภาพแวดล้อมของโลกโดยไม่ต้องใช้ศิลปิน 3D
สถาปัตยกรรมและการออกแบบการจำลองอาคารที่เดินสำรวจได้จากแบบแปลนหรือคำอธิบาย
การวิจัยทางวิทยาศาสตร์สภาพแวดล้อมทางกายภาพสำหรับการทดลองที่อันตรายหรือมีค่าใช้จ่ายสูงเกินไปที่จะทำในความเป็นจริง

โอกาสทางธุรกิจที่ World Labs กำลังมุ่งเป้าคือค่าใช้จ่ายของเนื้อหา 3D ซึ่งปัจจุบันวัดเป็นเงินหลายล้านดอลลาร์และเวลาผลิตหลายเดือน การสร้างในรูปแบบของ Marble ย่นระยะเวลานี้ให้เหลือเพียงไม่กี่ชั่วโมง

AMI Labs: การเดิมพัน 1.03 พันล้านดอลลาร์กับ JEPA

Advanced Machine Intelligence Labs ซึ่งร่วมก่อตั้งโดย Yann LeCun (Chief AI Scientist ของ Meta) ปิดรอบระดมทุน seed round มูลค่า 1.03 พันล้านดอลลาร์ — ซึ่งเป็นรอบ seed round ที่ใหญ่ที่สุดในยุโรปเท่าที่มีมา — จากกลุ่มนักลงทุนด้านเทคโนโลยียุโรป

AMI Labs ไม่ได้สร้างโมเดลภาษาที่ใหญ่ขึ้นหรือระบบ video diffusion ที่ดีขึ้น แต่กำลังสร้าง AI ที่อิงจาก Joint Embedding Predictive Architecture (JEPA) ของ LeCun ซึ่งทำงานบนหลักการที่แตกต่างจาก world model ในปัจจุบันโดยพื้นฐาน

แทนที่จะทำนายพิกเซลดิบหรือโทเคนข้อความ JEPA ฝึก AI ให้ทำนาย การแสดงผลเชิงนามธรรม (abstract representations) — โครงสร้างที่มีความหมายของฉากมากกว่ารูปลักษณ์ที่ปรากฏจริง ข้อโต้แย้งของ LeCun คือ สามัญสำนึกของมนุษย์ไม่ได้ถูกสร้างขึ้นจากการจดจำการสังเกตโลก แต่ถูกสร้างขึ้นจากการเรียนรู้โมเดลเชิงนามธรรมของเหตุและผล พลศาสตร์ทางกายภาพ และพฤติกรรมของวัตถุในระดับแนวคิด JEPA พยายามจำลองกระบวนการเรียนรู้นั้น

ความแตกต่างในทางปฏิบัติคือ ระบบที่อิงจาก JEPA ควรจะสามารถสรุปนัยทั่วไป (generalize) ไปสู่สถานการณ์ทางกายภาพใหม่ๆ ได้อย่างมีประสิทธิภาพมากกว่าโมเดล video diffusion เพราะมันไม่ได้พยายามสร้างพิกเซลทุกพิกเซลขึ้นมาใหม่ — แต่กำลังจำลองโครงสร้างเชิงแนวคิดที่ก่อให้เกิดพิกเซลเหล่านั้น

วิทยานิพนธ์ของ AMI Labs ในมุมมองของ LeCun คือ การขยายขนาดโมเดลภาษาไม่สามารถสร้าง AI ทั่วไป (general AI) ได้ ส่วนที่ขาดหายไปคือ world model ที่เข้าใจฟิสิกส์จากหลักการพื้นฐาน ไม่ใช่จากรูปแบบทางสถิติในข้อความหรือวิดีโอ

เปรียบเทียบสามแนวทาง

Google DeepMindWorld Labs (Marble)AMI Labs (JEPA)
แนวทางหลักVideo diffusion — เรียนรู้ฟิสิกส์จากการเฝ้าดูการสังเคราะห์สภาพแวดล้อม 3D เชิงกำเนิดการทำนายการแสดงผลเชิงนามธรรม
ข้อมูลการฝึกฟุตเทจวิดีโอข้อมูลสภาพแวดล้อมแบบหลายรูปแบบ (multi-modal)ไม่ได้เปิดเผย; การฝึกเชิงแนวคิด
เอาต์พุตการจำลองแบบอินเทอร์แอกทีฟจากวิดีโออ้างอิงโลก 3D ใหม่จากคำอธิบายworld model เชิงนามธรรมสำหรับการให้เหตุผล
ระยะเปิดตัวแล้ว (ส.ค. 2025)นำออกสู่เชิงพาณิชย์แล้ว (2026)การวิจัย / การสร้างในระยะเริ่มต้น
การใช้งานที่ตั้งใจไว้การฝึกฝนหุ่นยนต์ การให้ agent มีความเข้าใจโลกจริงหุ่นยนต์ การพัฒนาเกม สถาปัตยกรรม XRพื้นฐานของ AI ทั่วไปในระยะยาว

เหตุใดสิ่งนี้จึงสำคัญนอกห้องแล็บ

World models คือโครงสร้างพื้นฐานสำหรับผลิตภัณฑ์ AI รุ่นต่อไป ไม่ใช่แอปพลิเคชันสำหรับผู้บริโภคในระยะใกล้ แต่ผลิตภัณฑ์ที่กำลังถูกสร้างในปี 2026 และ 2027 จะพึ่งพาความสามารถของ world modeling ที่กำลังถูกวางรากฐานอยู่ในขณะนี้มากขึ้นเรื่อยๆ:

หุ่นยนต์ในระดับขนาดใหญ่: ทุกบริษัทที่สร้าง physical AI — ระบบอัตโนมัติในคลังสินค้า การผลิต การจัดส่ง — ต้องฝึกฝนหุ่นยนต์ด้วยสถานการณ์ที่หลากหลาย World models สร้างสภาพแวดล้อมการฝึกที่หลากหลายไม่จำกัดโดยไม่มีต้นทุนของการเก็บข้อมูลทางกายภาพ DeepMind และ World Labs กำลังสร้างเลเยอร์การสร้างสภาพแวดล้อมการฝึกที่อุตสาหกรรมหุ่นยนต์ทั้งหมดจะนำไปใช้

AI agent ที่มีความเข้าใจในโลกจริง: AI agent ในปัจจุบัน รวมถึงระบบที่มีความสามารถสูงสุดที่อิงจากโมเดลภาษา มักเกิดอาการหลอน (hallucinate) เกี่ยวกับข้อจำกัดทางกายภาพ เพราะพวกมันให้เหตุผลเกี่ยวกับโลกทางกายภาพจากคำอธิบายข้อความเพียงอย่างเดียว AI ที่มี world model สามารถจำลองว่าแผนหนึ่งจะใช้งานได้จริงในทางกายภาพหรือไม่ก่อนที่จะดำเนินการตามแผนนั้น

การสร้างเนื้อหา 3D: ระบบระดับ Marble จะย่นระยะเวลาและต้นทุนการผลิตเนื้อหา 3D ลงหลายเท่าตัว — ซึ่งส่งผลโดยตรงต่อการพัฒนาเกม การผลิตภาพยนตร์ สถาปัตยกรรม และสื่อแบบดื่มดื่ม (immersive media)

คำถามที่พบบ่อย

World model ใน AI คืออะไร? World model คือระบบ AI ที่สร้างการจำลองภายในของความเป็นจริงทางกายภาพ — เข้ารหัสว่าวัตถุมีพฤติกรรมอย่างไร เหตุและผลทำงานอย่างไร และจะเกิดอะไรขึ้นต่อไปหลังจากการกระทำหนึ่งๆ ต่างจากโมเดลภาษาที่ทำนายโทเคนข้อความถัดไป world models ทำนายสถานะถัดไปของสภาพแวดล้อมทางกายภาพ พวกมันถูกมองว่าเป็นพื้นฐานสำคัญสำหรับหุ่นยนต์ ยานยนต์ไร้คนขับ และ physical AI agent

Yann LeCun กำลังสร้างอะไรที่ AMI Labs? AMI Labs ซึ่งร่วมก่อตั้งโดย LeCun และได้รับทุนจากรอบ seed round มูลค่า 1.03 พันล้านดอลลาร์ (ใหญ่ที่สุดในประวัติศาสตร์สตาร์ทอัพยุโรป) กำลังพัฒนา AI ที่อิงจาก JEPA — Joint Embedding Predictive Architecture JEPA ทำนายการแสดงผลเชิงนามธรรมมากกว่าพิกเซลดิบหรือโทเคน โดยมีเป้าหมายที่จะให้ AI มีสามัญสำนึกทางกายภาพในลักษณะที่มนุษย์พัฒนาผ่านประสบการณ์มากกว่าการสังเกต LeCun ยืนยันว่า JEPA คือโครงสร้างที่จำเป็นสำหรับ AI ที่สามารถให้เหตุผลเกี่ยวกับโลกทางกายภาพได้อย่างแท้จริง

ผลิตภัณฑ์ Marble ของ World Labs คืออะไร? Marble คือ large world model จาก World Labs (ก่อตั้งโดย Fei-Fei Li) ที่สร้างการจำลอง 3D แบบเรียลไทม์ที่เดินสำรวจได้จากคำอธิบายหรือภาพสเก็ตช์ ต่างจากระบบที่แปลงวิดีโอที่มีอยู่แล้วให้เป็นการจำลอง Marble สร้างสภาพแวดล้อม 3D ใหม่ๆ ด้วยฟิสิกส์และเรขาคณิตของพื้นที่ที่สอดคล้องกัน การใช้งานได้แก่ สภาพแวดล้อมการฝึกฝนหุ่นยนต์ การสร้างต้นแบบเกมและ AR/VR และการแสดงภาพทางสถาปัตยกรรม

World model ของ Google DeepMind ทำงานอย่างไร? World model ของ DeepMind ที่เปิดตัวในเดือนสิงหาคม 2025 รับอินพุตวิดีโอและแปลงให้เป็นการจำลองแบบอินเทอร์แอกทีฟ ผู้ใช้สามารถนำทางและทำการกระทำภายในสภาพแวดล้อมที่จำลองขึ้นได้ และโมเดลจะสร้างเฟรมถัดไปที่สอดคล้องกับหลักฟิสิกส์ในเรียลไทม์ แทนที่จะเขียนกฎฟิสิกส์ด้วยมือ โมเดลเรียนรู้พลศาสตร์ทางกายภาพจากการฝึกด้วยชุดข้อมูลวิดีโอขนาดใหญ่ — อนุมานว่าโลกมีพฤติกรรมอย่างไรจากการสังเกตมัน

แหล่งอ้างอิง

  • Google DeepMind — การเปิดตัว world model แบบอินเทอร์แอกทีฟเรียลไทม์ สิงหาคม 2025
  • World Labs — การเปิดตัวผลิตภัณฑ์ Marble และเอกสารทางเทคนิค 2026
  • AMI Labs — ประกาศรอบระดมทุน seed round มูลค่า 1.03 พันล้านดอลลาร์ และภาพรวมโครงสร้าง JEPA 2026
  • Yann LeCun — งานวิจัย JEPA และการนำเสนอสาธารณะ Meta AI, 2025–2026
เผยแพร่เมื่อ April 2, 2026
บทความอื่นๆ