บล็อก

PixVerse R1: สถาปัตยกรรมและวิสัยทัศน์เบื้องหลังเวิลด์โมเดลเรียลไทม์รุ่นถัดไป

อัปเดตล่าสุดเมื่อ
PixVerse R1: สถาปัตยกรรมและวิสัยทัศน์เบื้องหลังเวิลด์โมเดลเรียลไทม์รุ่นถัดไป

PixVerse R1 เป็นเวิลด์โมเดลเรียลไทม์ตัวแรกที่ติดตั้งใช้งานในโปรดักชัน — ระบบที่สร้างวิดีโอต่อเนื่องและโต้ตอบได้ มากกว่าการผลิตคลิปแยกชิ้น บทความนี้พิจารณาสถาปัตยกรรมทางเทคนิคที่ทำให้ R1 เป็นไปได้ ปรัชญาการออกแบบเบื้องหลังการพัฒนา และวิธีที่โมเดลเติบโตเต็มที่ตั้งแต่การเปิดตัวครั้งแรก

ปัญหาที่ R1 แก้

การสร้างวิดีโอ AI มาตรฐานเดินตามรูปแบบคำขอ-การตอบสนอง: ส่งพรอมต์ รอการประมวลผล รับคลิปคงที่ เวิร์กโฟลว์นี้ผลิตผลงานเดี่ยวที่น่าประทับใจ แต่มีข้อจำกัดพื้นฐาน: คอนเทนต์ที่สร้างขึ้นนั้นเฉื่อย คุณดูมัน คุณไม่ได้อาศัยอยู่ในนั้น

R1 ถูกออกแบบตั้งแต่ต้นเพื่อขจัดข้อจำกัดนี้ แทนที่จะสร้างไฟล์วิดีโอที่มีขอบเขตจำกัด R1 สร้าง สตรีมภาพที่คงอยู่และโต้ตอบได้ — โลกที่มีอยู่และวิวัฒน์เพื่อตอบสนองต่ออินพุตของผู้ใช้แบบเรียลไทม์

นี่ไม่ใช่การปรับปรุงแบบค่อยเป็นค่อยไปของการสร้างคลิป แต่เป็นปัญหาเชิงคำนวณคนละแบบที่มีข้อกำหนดทางสถาปัตยกรรมต่างกัน และต้องใช้วิธีตัดสินคุณภาพที่ต่างออกไป ความตรงตามพรอมต์และความเนี้ยบของแต่ละคลิปยังสำคัญสำหรับวิดีโอแบบครั้งเดียว แต่เวิลด์โมเดลถูกตัดสินจากความหน่วง หน่วยความจำ และความสามารถในการคงความสอดคล้องกันตลอดเซสชันที่ยาวนาน

สถาปัตยกรรมสามองค์ประกอบ

สถาปัตยกรรมของ R1 ประกอบด้วยระบบที่เชื่อมโยงกันสามระบบ โดยแต่ละระบบตอบโจทย์ความท้าทายเฉพาะในการสร้างโลกแบบเรียลไทม์:

1. Omni Foundation Model

ฐานของ R1 คือ โมเดลมัลติโมดัลแบบ omni-native ที่ประมวลผลข้อมูลภาพ เสียง และการโต้ตอบภายในสถาปัตยกรรมเดียวกัน ต่างจากแนวทางแบบไปป์ไลน์ที่ส่งแต่ละโมดัลผ่านโมเดลแยกกันแล้วค่อยรวมเอาต์พุตในภายหลัง Omni Foundation จัดการการใช้เหตุผลข้ามโมดัลภายในตัวเอง โดยถือว่าข้อความ ภาพ วิดีโอ และเสียงเป็นกระแสโทเค็นต่อเนื่องสายเดียว ไม่ใช่งานสี่ชิ้นที่ถูกเย็บติดกัน

การประมวลผลแบบรวมนี้จำเป็นต่อประสิทธิภาพแบบเรียลไทม์ ไปป์ไลน์หลายโมเดลเพิ่มความหน่วงทุกจุดส่งต่องาน และแต่ละจุดส่งต่อยังเป็นที่ที่ข้อผิดพลาดแทรกเข้ามาได้เมื่อข้อมูลถูกแปลระหว่างระบบ เมื่อความต้องการคือเวลาตอบสนองต่ำกว่าหนึ่งวินาที มิลลิวินาทีเหล่านั้นสะสมเป็นการหน่วงที่รับรู้ได้ และการสูญเสียจากการแปลสะสมเป็นอาร์ติแฟกต์ที่มองเห็น การฝึก Omni Foundation แบบ end-to-end บนข้อมูลความละเอียดเนทีฟ แทนอินพุตที่ถูกครอปหรือปรับขนาด กำจัดทั้งสองปัญหาที่ต้นทาง: ไม่มีความหน่วงระหว่างโมเดลให้ต้องกำจัด และไม่มีรอยต่อที่สมมติฐานของโมเดลหนึ่งขัดกับอีกโมเดล

2. กลไกออโตรีเกรสซีฟที่เสริมด้วยหน่วยความจำ

การสร้างโลกแบบเรียลไทม์ต้องการให้ระบบจำสิ่งที่สร้างไปแล้ว หากผู้ใช้หันมองไปทางซ้าย สำรวจห้อง แล้วหันกลับมาทางขวาอีกครั้ง เนื้อหาที่สร้างไว้ก่อนหน้าต้องยังอยู่ตรงนั้น — สอดคล้องกับสิ่งที่เรนเดอร์ไปเมื่อครู่ ไม่ใช่ถูกสร้างใหม่เงียบ ๆ ให้กลายเป็นสิ่งที่ต่างออกไปเล็กน้อย

กลไกแอตเทนชันที่เสริมด้วยหน่วยความจำ ของ R1 คงสถานะของสภาพแวดล้อมตลอดไทม์ไลน์การสร้าง สิ่งนี้ถูกทำให้เป็นกระบวนการออโตรีเกรสซีฟ: แต่ละเฟรมใหม่ถูกกำหนดเงื่อนไขไม่เพียงจากอินพุตปัจจุบัน แต่จากหน่วยความจำสะสมของเนื้อหาทั้งหมดที่สร้างไว้ก่อนหน้า แทนที่จะถูกสุ่มเป็นเหตุการณ์อิสระแบบคลิปเดี่ยว

ผลลัพธ์คือ ความสอดคล้องในระยะยาว — โลกที่สร้างขึ้นยังคงสอดคล้องในตัวเองตลอดเซสชันที่ยาวนาน แม้ผู้ใช้จะสำรวจ โต้ตอบ และกลับไปยังพื้นที่ที่สร้างไว้ก่อนหน้า นี่เป็นปัญหาวิจัยที่เปิดอยู่และยากที่สุดในสาขานี้ด้วย: งานอิสระเกี่ยวกับเวิลด์โมเดลวิดีโอเชิงโต้ตอบชี้ว่าข้อผิดพลาดในการทำนายที่สะสมและหน่วยความจำที่ไม่เพียงพอคืออุปสรรคหลักของการสร้างเชิงโต้ตอบที่รันยาวนาน และการออกแบบหน่วยความจำของ R1 ถูกสร้างขึ้นโดยตรงรอบโหมดความล้มเหลวนั้น

3. เอนจินตอบสนองฉับพลัน

องค์ประกอบที่ท้าทายทางเทคนิคมากที่สุด โมเดลดิฟฟิวชันมาตรฐานต้องใช้ขั้นตอนการสุ่มหลายสิบขั้นเพื่อสร้างเฟรมเดียว — ช้าเกินไปสำหรับการโต้ตอบแบบเรียลไทม์ เอนจินตอบสนองฉับพลันของ R1 ลดสิ่งนี้เหลือเพียงไม่กี่ขั้นตอนการสุ่มต่อเฟรมผ่านเทคนิคที่ประสานกันสามอย่าง:

  • การพับวิถีเชิงเวลา บีบอัดกระบวนการดิฟฟิวชันโดยอาศัยความซ้ำซ้อนเชิงเวลา: เฟรมที่ต่อเนื่องกันในสตรีมวิดีโอต่อเนื่องมีเนื้อหาภาพร่วมกันจำนวนมาก แทนที่จะสร้างแต่ละเฟรมตั้งแต่ต้น เอนจินใช้ไพรเออร์เชิงโครงสร้าง — โดยผลคือการแมปไปสู่การแจกแจงเอาต์พุตที่สะอาด — เพื่อให้สถานะของเฟรมก่อนหน้าทำงานส่วนใหญ่ จึงลดจำนวนขั้นตอนการสุ่มใหม่ที่ต้องใช้อย่างมาก
  • การปรับแก้ไกด์ดานซ์ พับผลของ classifier-free guidance เข้าไปในโมเดลการสร้างโดยตรง เพื่อให้ระบบไม่ต้องรันรอบไกด์ดานซ์แยกทับทุกขั้นตอนการสุ่ม
  • แอตเทนชันแบบสแปร์สที่ปรับตัวได้ ตัดการพึ่งพาระยะไกลที่ซ้ำซ้อนออกจากการคำนวณแอตเทนชัน ทำให้กราฟการคำนวณเบาลงเมื่อเซสชันดำเนินต่อไป แทนที่จะปล่อยให้หนักขึ้นทุกเฟรมบริบทที่เพิ่มเข้ามา

แนวทางนี้แลกความแปลกใหม่ทางภาพต่อเฟรมจำนวนเล็กน้อยกับอัตราเร่งมหาศาลของความเร็วในการสร้าง — เป็นจุดแลกเปลี่ยนที่เหมาะพอดีกับการโต้ตอบแบบเรียลไทม์ ซึ่งความลื่นไหลเชิงเวลาสำคัญกว่าความแตกต่างของเฟรมใดเฟรมหนึ่งจากเฟรมก่อนหน้า

จุดแลกเปลี่ยนในการออกแบบ

สถาปัตยกรรมของ R1 มีจุดแลกเปลี่ยนที่ตั้งใจ ซึ่งสะท้อนลำดับความสำคัญแบบเรียลไทม์:

การสะสมข้อผิดพลาด — การสร้างแบบออโตรีเกรสซีฟสะสมข้อผิดพลาดเล็กน้อยเมื่อเวลาผ่านไป แต่ละเฟรมสร้างบนเฟรมก่อนหน้า และความไม่สมบูรณ์สามารถทบต้นได้ R1 บรรเทาสิ่งนี้ผ่านกลไกการแก้ไขเป็นระยะในระบบหน่วยความจำ แต่เซสชันที่ยาวนานยังอาจแสดงการคลาดเคลื่อนทีละน้อยในความคงอยู่ของวัตถุหรือโครงสร้างฉาก เมื่อเทียบกับการสร้างแบบไม่ออโตรีเกรสซีฟ

เพดานความละเอียด — ข้อจำกัดแบบเรียลไทม์กำหนดขีดจำกัดความละเอียดในทางปฏิบัติ ความละเอียดที่สูงขึ้นต้องใช้การคำนวณต่อเฟรมมากขึ้น ซึ่งไปชนงบการสร้างแบบเรียลไทม์โดยตรง สถาปัตยกรรมวิจัยดั้งเดิมของ R1 ตั้งเป้าเรียลไทม์ 1080p เป็นเพดานของจุดแลกเปลี่ยนนี้ ความละเอียดที่ใช้ได้จริงผ่านพื้นผิวหนึ่ง ๆ ยังขึ้นกับเส้นทางการเข้าถึง เพราะประสบการณ์บนเว็บ เซสชันโลกที่ใช้ร่วมกัน และเอนด์พอยต์ API ของพาร์ตเนอร์ สามารถเปิดขีดจำกัดที่ต่างกันได้ ผู้ที่วางแผนการผสานในโปรดักชันควรยืนยันตัวเลขปัจจุบันกับผลิตภัณฑ์ที่ใช้งานจริง แทนที่จะถือว่าตัวเลขเดียวคงที่บนทุกพื้นผิว

ความหลากหลายเทียบกับความสอดคล้อง — การพับวิถีเชิงเวลาที่ทำให้ได้ความเร็ว ยังหมายความว่าเฟรมที่ต่อเนื่องกันมีความสัมพันธ์ทางภาพกันมากกว่าการสร้างแบบมาตรฐาน นี่เป็นพฤติกรรมที่ตั้งใจสำหรับโลกที่คงอยู่ (คุณต้องการความสอดคล้อง) แต่หมายความว่า R1 สร้างความหลากหลายทางภาพต่อหน่วยการสร้างน้อยกว่าโมเดลแบบคลิป

จุดแลกเปลี่ยนเหล่านี้เป็นทางเลือกทางวิศวกรรม ไม่ใช่ข้อจำกัด R1 ปรับให้เหมาะกับฟังก์ชันวัตถุประสงค์ที่ต่างจากโมเดลสร้างคลิป และการออกแบบสะท้อนลำดับความสำคัญนั้นอย่างตรงไปตรงมา

R1 อยู่ตรงไหนเมื่อเทียบกับ V6 และ C1

ตอนนี้ PixVerse ครอบคลุมงานสร้างสรรค์สองแบบที่ต่างกัน และควรระบุให้ชัดว่าโมเดลใดตอบคำถามใด หากสิ่งที่ต้องส่งมอบคือไฟล์ — คลิปโซเชียล วิดีโอผลิตภัณฑ์ ช็อตภาพยนตร์ หรือการส่งออกภาพเป็นวิดีโอ — PixVerse V6 และ PixVerse C1 ถูกสร้างมาสำหรับเวิร์กโฟลว์นั้น พร้อมการควบคุมระดับพรอมต์และระดับช็อตที่มุ่งสู่ผลลัพธ์ที่เสร็จและดาวน์โหลดได้ หากสิ่งที่ต้องส่งมอบคือประสบการณ์ที่ยังตอบสนองต่อไปหลังจากเริ่มสร้าง — เกม เลเยอร์ไลฟ์สตรีม ฉาก XR พื้นที่ผู้ใช้หลายคนที่ใช้ร่วมกัน — นั่นคืออาณาเขตของ R1 และการฝืนโมเดลแบบคลิปเข้าไปในบทบาทนั้นพลาดสาระของเวิลด์โมเดล

วิธีง่าย ๆ ในการยึดความแตกต่างนี้: เลือก V6 หรือ C1 เมื่อคุณต้องการสิ่งที่จะส่งออก ประเมิน R1 เมื่อคุณต้องการสิ่งที่จะรันต่อไป

การประยุกต์ใช้

สถาปัตยกรรมของ R1 เปิดหมวดการใช้งานที่โมเดลแบบคลิปให้บริการไม่ได้โดยพื้นฐาน:

  • ความบันเทิงเชิงโต้ตอบ — เกมที่เป็น AI โดยกำเนิด ภาพยนตร์เชิงโต้ตอบ และเรื่องเล่าที่สร้างแบบเรียลไทม์ขณะผู้เล่นตัดสินใจ
  • การฝึกและการจำลอง — สภาพแวดล้อมตามสถานการณ์ที่สมจริงซึ่งสร้างตามความต้องการ รวมถึงการจำลองด้านอุตสาหกรรม เกษตรกรรม และนิเวศวิทยา
  • เนื้อหาสดและโลกที่ใช้ร่วมกัน — ประสบการณ์สตรีมที่ปรับตามอินพุตของผู้ชม และสภาพแวดล้อมผู้ใช้หลายคนที่ผู้เข้าร่วมโต้ตอบภายในพื้นที่ที่สร้างขึ้นเดียวกัน
  • การสำรวจเชิงสร้างสรรค์และการศึกษา — การสร้างโลกแบบปลายเปิดสำหรับศิลปินและนักออกแบบ รวมถึงสภาพแวดล้อมการเรียนรู้และการฝึกที่ปรับตัวได้

การประเมิน R1 อย่างตรงไปตรงมา

เนื่องจากเวิลด์โมเดลยังเป็นหมวดที่กำลังเกิดขึ้น จึงควรระบุข้อควรระวังในทางปฏิบัติควบคู่กับความสามารถ: เซสชันยาวอาจยังคลาดเคลื่อน ความเที่ยงตรงทางฟิสิกส์ถูกแลกกับความเร็วโดยการออกแบบ และความละเอียดกับฟีเจอร์ที่ใช้ได้แตกต่างกันตามเส้นทางการเข้าถึง (ประสบการณ์บนเว็บเทียบกับ API ของพาร์ตเนอร์) การเปรียบเทียบเบนช์มาร์กกับเวิลด์โมเดลอื่นมีความหมายก็ต่อเมื่อคำนึงถึงความยาวเซสชัน ประเภทการโต้ตอบ และความละเอียด — ไม่ใช่แค่ตัวเลขพาดหัวตัวเดียว

มองไปข้างหน้า

R1 เป็นก้าวแรกในทิศทางวิจัยที่ PixVerse เชื่อว่าจะนิยามยุคถัดไปของเนื้อหาที่สร้างด้วย AI นับตั้งแต่เปิดตัวครั้งแรก โมเดลได้ย้ายจากสถาปัตยกรรมวิจัยไปสู่ประสบการณ์เว็บที่ใช้งานจริง เส้นทางพาร์ตเนอร์และ API และฟีเจอร์โลกที่ใช้ร่วมกันที่ขยายออก — เป็นหลักฐานว่าทิศทางนี้กำลังถูกสร้างต่อ ไม่ได้ถูกทิ้งไว้เป็นเดโมครั้งเดียว เมื่อประสิทธิภาพเชิงคำนวณดีขึ้นและนวัตกรรมทางสถาปัตยกรรมดำเนินต่อไป คุณภาพ ความละเอียด และความซับซ้อนของโลกที่สร้างแบบเรียลไทม์จะเพิ่มขึ้น — และอาจเข้าใกล้ความเที่ยงตรงของเนื้อหาที่เรนเดอร์ล่วงหน้า ขณะยังคงการโต้ตอบแบบเรียลไทม์

การเปลี่ยนผ่านจาก “AI สร้างเนื้อหาให้คุณรับชม” สู่ “AI สร้างโลกให้คุณอาศัยอยู่” กำลังเกิดขึ้น R1 คือจุดที่มันเริ่มต้น

แหล่งข้อมูลที่เกี่ยวข้อง

→ สัมผัส R1 บน PixVerse