บล็อก

Google DeepMind Genie 3 คืออะไร? พรมแดนใหม่ของเวิลด์โมเดล

Google DeepMind Genie 3 คืออะไร? พรมแดนใหม่ของเวิลด์โมเดล

Google DeepMind ประกาศ Genie 3 เวิลด์โมเดลอเนกประสงค์ที่ถือเป็นก้าวกระโดดครั้งสำคัญของสภาพแวดล้อมเชิงโต้ตอบที่ AI สร้าง ระบบนี้สร้างโลกแบบไดนามิกที่คุณสำรวจได้แบบเรียลไทม์ที่ 24 เฟรมต่อวินาที โดยคงความสม่ำเสมอที่ความละเอียด 720p เป็นเวลาหลายนาที

นี่ไม่ใช่การสร้างวิดีโอแบบดั้งเดิม Genie 3 สร้างสภาพแวดล้อมที่คุณสำรวจและโต้ตอบได้ในขณะที่กำลังถูกสร้างขึ้น


เวิลด์โมเดลคืออะไร?

ก่อนทำความเข้าใจ Genie 3 ควรนิยามก่อนว่า “เวิลด์โมเดล” หมายถึงอะไรจริง ๆ

เวิลด์โมเดลคือระบบ AI ที่ใช้ความเข้าใจเกี่ยวกับโลกเพื่อจำลองแง่มุมต่าง ๆ ของโลก ระบบเหล่านี้ช่วยให้เอเจนต์ AI คาดการณ์ได้ว่าสภาพแวดล้อมจะวิวัฒน์อย่างไร และการกระทำของพวกมันจะส่งผลอย่างไร

คิดว่าเป็นความแตกต่างระหว่าง:

  • การสร้างวิดีโอ: สร้างคลิปที่เรนเดอร์ไว้ล่วงหน้าให้คุณรับชม
  • การจำลองโลก: สร้างสภาพแวดล้อมต่อเนื่องที่คุณสำรวจและมีอิทธิพลได้

Google DeepMind บุกเบิกงานวิจัยนี้มานานกว่าทศวรรษ ตั้งแต่การฝึกเอเจนต์ให้เชี่ยวชาญเกมวางแผนแบบเรียลไทม์ (AlphaStar) ไปจนถึงการพัฒนาสภาพแวดล้อมจำลองสำหรับหุ่นยนต์


วิวัฒนาการ: จาก Genie 1 สู่ Genie 3

Genie 3 ต่อยอดจากสองรุ่นก่อนหน้า:

Genie 1 (2024): เวิลด์โมเดลรากฐานรุ่นแรกที่สร้างสภาพแวดล้อมใหม่ให้เอเจนต์ AI จากภาพได้

Genie 2 (2024): เวิลด์โมเดลรากฐานขนาดใหญ่ที่ขยายความสามารถ แต่ยังขาดการโต้ตอบแบบเรียลไทม์

Genie 3 (2026): เวิลด์โมเดลรุ่นแรกในซีรีส์ที่อนุญาตให้โต้ตอบแบบเรียลไทม์ พร้อมความสม่ำเสมอและความสมจริงที่ดีขึ้นเมื่อเทียบกับ Genie 2

Google DeepMind อธิบายเวิลด์โมเดลว่าเป็น “ก้าวสำคัญบนเส้นทางสู่ AGI” เพราะทำให้สามารถฝึกเอเจนต์ AI ในสภาพแวดล้อมจำลองที่สมบูรณ์และไม่จำกัดได้


ความสามารถหลักของ Genie 3

การจำลองคุณสมบัติทางกายภาพของโลก

Genie 3 จำลองปรากฏการณ์ธรรมชาติ เช่น พลวัตของน้ำ เอฟเฟกต์แสง และปฏิสัมพันธ์ด้านสิ่งแวดล้อมที่ซับซ้อนได้

ตัวอย่างพรอมต์ที่สาธิต:

  • สำรวจภูมิประเทศภูเขาไฟด้วยหุ่นยนต์มีล้อ พร้อมหลบแอ่งลาวา
  • ขี่เจ็ตสกีระหว่างเทศกาลแห่งแสง
  • เดินเลียบชายฝั่งฟลอริดาตอนพายุเฮอริเคน โดยคลื่นซัดข้ามถนน
  • ติดตามแมงกะพรุนผ่านช่องระบายความร้อนใต้ทะเลลึก
  • ขับเฮลิคอปเตอร์เหนือหน้าผาชายฝั่ง

การจำลองโลกธรรมชาติ

ระบบสร้างระบบนิเวศที่มีชีวิตชีวา พร้อมพฤติกรรมสัตว์ที่สมจริงและพืชพรรณที่ซับซ้อน

ตัวอย่างพรอมต์:

  • วิ่งผ่านภูมิทัศน์ธารน้ำแข็งพร้อมพบสัตว์ป่า
  • ว่ายน้ำผ่านฝูงแมงกะพรุนเรืองแสงในมหาสมุทรลึก
  • สำรวจสวนเซนญี่ปุ่นที่มีลายทรายที่คราดไว้
  • เคลื่อนผ่านสภาพแวดล้อมใบไม้หนาทึบที่เปียกฝน

แอนิเมชันและนิยาย

Genie 3 ดึงจินตนาการออกมา สร้างสถานการณ์แฟนตาซีและตัวละครแอนิเมชันที่แสดงออกได้ในหลายสไตล์ภาพ

ตัวอย่างพรอมต์:

  • สิ่งมีชีวิตขนฟูวิ่งข้ามสะพานสายรุ้ง (สไตล์แอนิเมชัน 3D)
  • เป็นกิ้งก่าในสไตล์โอริกามิ
  • บินเป็นหิ่งห้อยผ่านบ้านต้นไม้ต้องมนตร์
  • ภูมิทัศน์ไอริชที่กำลังเปลี่ยนแปลงด้านแรงโน้มถ่วงอย่างดรามา

การสำรวจสถานที่และฉากประวัติศาสตร์

ระบบก้าวข้ามขอบเขตทางภูมิศาสตร์และเวลาได้

ตัวอย่างพรอมต์:

  • ภูมิประเทศภูเขาในเทือกเขาแอลป์
  • เวนิสโดยเรือ Vaporetto พร้อมเงาสะท้อนคลองที่สมจริง
  • พระราชวัง Knossos ในครีตโบราณในสภาพที่เคยรุ่งเรือง
  • ปั่นจักรยานบนถนน Killar-Kishtwar ที่อันตรายในอินเดีย

ความก้าวหน้าทางเทคนิค

การโต้ตอบแบบเรียลไทม์

การทำให้ได้ประสิทธิภาพเรียลไทม์ที่ 24 fps ต้องใช้นวัตกรรมทางเทคนิคอย่างมาก ระหว่างการสร้างเฟรมแบบออโตเรเกรสซีฟ โมเดลต้องคำนึงถึงเส้นทางทั้งหมดที่สร้างไว้ก่อนหน้า

ตัวอย่างเช่น หากผู้ใช้กลับไปยังสถานที่หลังจากสำรวจไปหนึ่งนาที โมเดลจะอ้างอิงข้อมูลที่เกี่ยวข้องจากจุดก่อนหน้านั้น ทั้งหมดนี้ขณะคำนวณหลายครั้งต่อวินาทีเพื่อตอบสนองต่ออินพุตใหม่ของผู้ใช้เมื่อมาถึง

ความสม่ำเสมอของสภาพแวดล้อมตลอดช่วงเวลายาว

สภาพแวดล้อมที่ AI สร้างต้องคงความสอดคล้องทางกายภาพจึงจะดื่มด่ำได้ ในทางเทคนิค การสร้างแบบเรียลไทม์ยากกว่าวิดีโอที่เรนเดอร์ไว้ล่วงหน้า เพราะความคลาดเคลื่อนสะสมตามเวลา

สภาพแวดล้อมของ Genie 3 ยังคง “สอดคล้องเป็นส่วนใหญ่เป็นเวลาหลายนาที โดยความจำทางภาพย้อนกลับไปได้ไกลถึงหนึ่งนาทีก่อน” Google DeepMind ระบุว่านี่คือ ความสามารถที่เกิดขึ้นเอง ต่างจาก NeRF หรือ Gaussian Splatting เพราะ Genie 3 ไม่ต้องการตัวแทน 3D ที่ระบุอย่างชัดเจน

เหตุการณ์ในโลกที่สั่งด้วยพรอมต์ได้

นอกเหนือจากการควบคุมการเดินทาง Genie 3 อนุญาตให้แทรกแซงด้วยข้อความเพื่อปรับโลกที่สร้างขึ้น:

  • เปลี่ยนสภาพอากาศ
  • นำวัตถุและตัวละครใหม่เข้ามา
  • ปรับสภาพแวดล้อมระหว่างประสบการณ์

สิ่งนี้ขยายขอบเขตของสถานการณ์ “จะเกิดอะไรขึ้นถ้า” ซึ่งสำคัญต่อการฝึกเอเจนต์ AI ให้รับมือกับสถานการณ์ที่ไม่คาดคิด


ขับเคลื่อนการวิจัยเอเจนต์ที่มีร่างกาย

การใช้งานสำคัญคือการฝึกเอเจนต์ AI ในสภาพแวดล้อมที่สร้างขึ้น Google DeepMind ทดสอบ Genie 3 กับ เอเจนต์ SIMA (เอเจนต์ทั่วไปสำหรับสภาพแวดล้อมเสมือน 3D)

กระบวนการ:

  1. สร้างโลกด้วยฉากที่กำหนด
  2. สั่งให้เอเจนต์ไล่ตามเป้าหมายที่แตกต่างกัน
  3. เอเจนต์ส่งการกระทำการเดินทางไปยัง Genie 3
  4. Genie 3 จำลองอนาคตตามการกระทำเหล่านั้น (โดยไม่รู้เป้าหมายของเอเจนต์)

เพราะ Genie 3 คงความสม่ำเสมอ เอเจนต์จึงดำเนินลำดับการกระทำที่ยาวขึ้นและบรรลุเป้าหมายที่ซับซ้อนกว่าได้ Google DeepMind คาดว่าเทคโนโลยีนี้จะมีบทบาทสำคัญขณะที่พวกเขามุ่งสู่ AGI


ข้อจำกัดปัจจุบัน

ทีมยอมรับข้อจำกัดหลายประการ:

ข้อจำกัด คำอธิบาย
พื้นที่การกระทำที่จำกัด แม้เหตุการณ์ที่สั่งด้วยพรอมต์จะอนุญาตให้แทรกแซงสภาพแวดล้อมได้กว้าง การกระทำโดยตรงของเอเจนต์ยังถูกจำกัด
ปฏิสัมพันธ์หลายเอเจนต์ ปฏิสัมพันธ์ที่ซับซ้อนระหว่างเอเจนต์อิสระหลายตัวยังท้าทาย
ความแม่นยำทางภูมิศาสตร์ ไม่สามารถจำลองสถานที่ในโลกจริงได้อย่างสมบูรณ์แบบ
การเรนเดอร์ข้อความ ข้อความที่ชัดเจนและอ่านได้ปรากฏเฉพาะเมื่อระบุไว้ในพรอมต์อินพุต
ระยะเวลา รองรับการโต้ตอบต่อเนื่องหลายนาที ไม่ใช่หลายชั่วโมงที่ยาวนาน

ความพร้อมให้ใช้งาน

ขณะนี้ Genie 3 เป็นงานวิจัยรุ่นพรีวิวที่เปิดให้ใช้งานแบบจำกัด

Google DeepMind กำลังเปิดให้กลุ่มนักวิชาการและครีเอเตอร์จำนวนไม่มากเข้าถึงก่อน แนวทางนี้ช่วยให้พวกเขาสามารถ:

  • เก็บฟีดแบ็กที่สำคัญ
  • พัฒนามุมมองข้ามศาสตร์ต่อพรมแดนใหม่นี้
  • สร้างความเข้าใจเกี่ยวกับความเสี่ยงและมาตรการบรรเทาที่เหมาะสม

ขณะนี้ยังไม่มีรายชื่อรอหรือจุดเข้าถึงสำหรับสาธารณะ จุดเน้นอยู่ที่การพัฒนาอย่างรับผิดชอบก่อนเปิดให้ใช้งานกว้างขึ้น


อะไรต่อไป?

Google DeepMind มองว่า Genie 3 เป็นช่วงเวลาสำคัญที่เวิลด์โมเดลเริ่มส่งผลทั้งต่องานวิจัย AI และสื่อเชิงสร้างสรรค์ พวกเขากำลังสำรวจ:

  • การศึกษาและการฝึกอบรม: ช่วยให้นักเรียนเรียนรู้ และผู้เชี่ยวชาญสั่งสมประสบการณ์
  • การฝึกเอเจนต์: มอบพื้นที่ขนาดใหญ่สำหรับฝึกหุ่นยนต์และระบบอัตโนมัติ
  • การประเมินเอเจนต์: สำรวจประสิทธิภาพและจุดอ่อนของเอเจนต์
  • การเปิดให้ผู้ทดสอบเพิ่มเติม: ทำให้ Genie 3 พร้อมใช้งานสำหรับผู้ใช้มากขึ้นในอนาคต

ภาพรวมที่ใหญ่กว่า

Genie 3 สะท้อนการเปลี่ยนวิธีคิดเกี่ยวกับคอนเทนต์ที่ AI สร้างขึ้น เรากำลังเคลื่อนจาก:

  • คลิปนิ่ง → สภาพแวดล้อมแบบโต้ตอบได้
  • พรอมต์ตายตัว → การควบคุมแบบเรียลไทม์
  • การดูวิดีโอ → การเดินสำรวจโลก

ในตอนนี้ Genie 3 ยังคงเป็นเครื่องมือวิจัย แต่ชี้ไปสู่อนาคตที่ AI ไม่ได้สร้างเพียงคอนเทนต์ให้บริโภค แต่สร้างโลกให้สำรวจ


กำลังมองหาทางเลือกอยู่หรือ?

การเข้าถึง Genie 3 ที่จำกัดทำให้ผู้ใช้ส่วนใหญ่ยังลองใช้ไม่ได้ในวันนี้ หากคุณอยากสัมผัสการสร้างโลกแบบเรียลไทม์ตอนนี้ PixVerse R1 เป็นทางเลือกที่เข้าถึงได้สาธารณะ:

  • สร้างแบบเรียลไทม์ได้สูงสุด 1080p
  • สตรีมได้ไม่สิ้นสุด
  • สร้างเสียงที่ซิงก์กัน
  • กำลังขยายการเข้าถึงสาธารณะ

อ่านเพิ่มเติมใน การเปรียบเทียบ Genie 3 กับ PixVerse R1 หรือลองใช้ได้ที่ realtime.pixverse.ai.