บล็อก

PixVerse-R1: เวิลด์โมเดลเรียลไทม์รุ่นถัดไป

PixVerse-R1: เวิลด์โมเดลเรียลไทม์รุ่นถัดไป

PixVerse-R1: เวิลด์โมเดลเรียลไทม์รุ่นถัดไป

บทคัดย่อ

เรานำเสนอ PixVerse-R1 เวิลด์โมเดลเรียลไทม์รุ่นถัดไปที่สถาปัตยกรรมตั้งอยู่บนโมเดลพื้นฐานมัลติโมดัลแบบเนทีฟ ระบบนี้ทำให้สร้างวิดีโอแบบเรียลไทม์ได้ โดยเนื้อหาภาพตอบสนองต่ออินพุตของผู้ใช้ทันทีและลื่นไหล ด้วยการก้าวข้ามความหน่วงภายในและความจำกัดด้านความยาวคงที่ของเวิร์กโฟลว์วิดีโอแบบดั้งเดิม PixVerse-R1 เปลี่ยนการสร้างวิดีโอให้เป็นสตรีมภาพที่ไม่สิ้นสุด ต่อเนื่อง และโต้ตอบได้ นี่คือวิวัฒนาการสำคัญในการสร้าง ประสบการณ์ และการแบ่งปันสื่อภาพและเสียง ซึ่งเป็นจุดเปลี่ยนกระบวนทัศน์สู่สื่ออัจฉริยะเชิงโต้ตอบที่ปรับตัวได้ทันทีตามเจตนาของผู้ใช้

พร้อมสัมผัส R1 แล้วหรือยัง? ดู ประกาศเปิดตัว PixVerse R1 ของเราสำหรับข้อมูลเชิงปฏิบัติ และ วิธีรับรหัสเชิญ เพื่อเข้าถึง R1

1. บทนำ

ภูมิทัศน์สื่อดิจิทัลกำลังเปลี่ยนอย่างพื้นฐานจากเนื้อหาคงที่ที่เรนเดอร์ล่วงหน้า สู่ประสบการณ์เชิงโต้ตอบที่เปลี่ยนแปลงได้ ไปป์ไลน์การผลิตแบบดั้งเดิมถูกจำกัดมาโดยตลอดด้วยความหน่วงสูงและคลิปความยาวคงที่ ทำให้เกิดขั้วตรงข้ามระหว่างการสร้างเนื้อหากับการบริโภคแบบเรียลไทม์

เพื่อตอบข้อจำกัดเหล่านี้ เราแนะนำสถาปัตยกรรมเวิลด์โมเดลแบบใหม่ที่รวมโมเดลพื้นฐานมัลติโมดัลแบบเนทีฟ กลไกออโตรีเกรสซีฟด้านความสอดคล้อง และเอนจินตอบสนองฉับพลันเข้าด้วยกัน แนวทางแบบรวมนี้ทำให้ประมวลผลแพตช์เชิงปริภูมิ-เวลาควบคู่กับข้อมูลข้อความและเสียงได้ ซึ่งรื้อไซโลการประมวลผลสื่อแบบดั้งเดิมอย่างมีประสิทธิผล ด้วยการนำระบบที่สตรีมได้ไม่สิ้นสุดผ่านกลไกออโตรีเกรสซีฟและเอนจินตอบสนองฉับพลันมาใช้งาน โลกที่สร้างขึ้นยังคงสอดคล้องทางกายภาพในระยะยาวโดยมีโอเวอร์เฮดเชิงคำนวณต่ำ

ความสามารถหลัก: ด้วยสถาปัตยกรรมนี้ ระบบของเราบรรลุความก้าวหน้าด้านประสิทธิภาพ โดยสร้างวิดีโอความละเอียดสูงได้ถึง 1080P แบบเรียลไทม์ ความสามารถนี้ยกระดับความเที่ยงตรงทางภาพ และเปิดทางสู่เกมที่เป็น AI โดยกำเนิดและภาพยนตร์เชิงโต้ตอบ ซึ่งสภาพแวดล้อมและเรื่องเล่าวิวัฒน์อย่างไดนามิกตามการโต้ตอบของผู้ใช้ ในภาพกว้าง สิ่งนี้ทำให้ระบบเชิงสร้างทำหน้าที่เป็นโลกเชิงโต้ตอบที่คงอยู่ แทนที่จะเป็นสิ่งประดิษฐ์สื่อที่มีขอบเขตจำกัด ซึ่งชี้วิถีสู่การจำลองภาพและเสียงที่ต่อเนื่อง มีสถานะ และโต้ตอบได้

2. สถาปัตยกรรมทางเทคนิค

2.1 Omni: โมเดลพื้นฐานมัลติโมดัลแบบเนทีฟ

เพื่อให้ได้ความสามารถทั่วไป เราได้ก้าวข้ามไปป์ไลน์การสร้างแบบดั้งเดิมด้วยการออกแบบ Native Multimodal Foundation Model แบบเอนด์ทูเอนด์อย่างสมบูรณ์

  • การแทนค่าแบบรวม: โมเดล Omni รวมโมดัลที่หลากหลาย (ข้อความ ภาพ วิดีโอ เสียง) ให้เป็นกระแสโทเค็นต่อเนื่อง ทำให้รับอินพุตมัลติโมดัลแบบใดก็ได้ภายในเฟรมเวิร์กเดียว
  • การฝึกแบบเอนด์ทูเอนด์: สถาปัตยกรรมทั้งหมดถูกฝึกข้ามงานที่ต่างชนิดโดยไม่มีอินเทอร์เฟซขั้นกลาง ซึ่งป้องกันการแพร่ของข้อผิดพลาดและรับรองความสามารถในการขยายที่แข็งแรง
  • ความละเอียดดั้งเดิม: เราใช้การฝึกที่ความละเอียดดั้งเดิมภายในเฟรมเวิร์กนี้เพื่อหลีกเลี่ยงอาร์ติแฟกต์ที่มักเกิดจากการครอปหรือปรับขนาด

ยิ่งไปกว่านั้น โมเดลได้ซึมซับกฎฟิสิกส์และพลวัตภายในของโลกจริง โดยเรียนรู้จากคลังข้อมูลวิดีโอโลกจริงขนาดมหาศาล ความเข้าใจพื้นฐานนี้ทำให้ระบบสังเคราะห์ “โลกคู่ขนาน” ที่สอดคล้องและตอบสนองได้แบบเรียลไทม์

โมเดล Omni ขยายขนาดได้อย่างมีประสิทธิผล ไม่ได้ทำหน้าที่เพียงเป็นเอนจินเชิงสร้าง แต่เป็นก้าวบุกเบิกสู่การสร้างตัวจำลองวัตถุประสงค์ทั่วไปของโลกกายภาพ ด้วยการถือว่างานจำลองเป็นกระบวนทัศน์การสร้างแบบเอนด์ทูเอนด์ชิ้นเดียว เราเอื้อต่อการสำรวจโลกที่สร้างด้วย AI แบบเรียลไทม์และระยะยาว สถาปัตยกรรม Omni

รูปที่ 1 สถาปัตยกรรมเอนด์ทูเอนด์ของ Omni Native Multimodal Foundation Model ของเรา การออกแบบแบบรวมทำให้โมเดล Omni รับอินพุตมัลติโมดัลแบบใดก็ได้ และสร้างเสียงกับวิดีโอในเวลาเดียวกัน

2.2 หน่วยความจำ: การสตรีมไม่สิ้นสุดที่สอดคล้องผ่านกลไกออโตรีเกรสซีฟ

ต่างจากวิธีดิฟฟิวชันมาตรฐานที่ถูกจำกัดอยู่กับคลิปที่มีขอบเขต PixVerse-R1 ผสานการโมเดลแบบออโตรีเกรสซีฟเพื่อให้สตรีมภาพได้ไม่สิ้นสุดและต่อเนื่อง และรวมกลไกแอตเทนชันที่เสริมด้วยหน่วยความจำเพื่อให้โลกที่สร้างขึ้นยังคงสอดคล้องทางกายภาพในระยะยาว

  • การสตรีมไม่สิ้นสุด: ด้วยการกำหนดการสังเคราะห์วิดีโอเป็นกระบวนการออโตรีเกรสซีฟ โมเดลทำนายเฟรมถัดไปตามลำดับเพื่อให้ได้การสตรีมภาพที่ต่อเนื่องและไม่มีขอบเขต
  • ความสอดคล้องเชิงเวลา: กลไกแอตเทนชันที่เสริมด้วยหน่วยความจำกำหนดเงื่อนไขการสร้างเฟรมปัจจุบันจากตัวแทนแฝงของบริบทก่อนหน้า เพื่อให้โลกยังคงสอดคล้องทางกายภาพในระยะยาว

กลไกหน่วยความจำ

รูปที่ 2 การโมเดลออโตรีเกรสซีฟที่ผสานกับโมเดลพื้นฐาน Omni

2.3 เรียลไทม์ 1080P: เอนจินตอบสนองฉับพลัน

แม้การดีนอยส์แบบวนซ้ำมักรับรองคุณภาพสูง แต่ความหนาแน่นเชิงคำนวณมักขัดขวางประสิทธิภาพแบบเรียลไทม์ เพื่อแก้ปัญหานี้และให้สร้างแบบเรียลไทม์ที่ความละเอียดสูง (สูงสุด 1080P) เราออกแบบไปป์ไลน์ใหม่เป็นเอนจินตอบสนองฉับพลัน

IRE ปรับกระบวนการสุ่มให้เหมาะสมผ่านความก้าวหน้าต่อไปนี้:

  • การพับวิถีเชิงเวลา: ด้วยการใช้ Direct Transport Mapping เป็นไพรเออร์เชิงโครงสร้าง เครือข่ายทำนายการแจกแจงข้อมูลที่สะอาดโดยตรง ซึ่งลดขั้นตอนการสุ่มจากหลายสิบขั้นเหลือเพียง 1–4 สร้างเส้นทางที่กระชับและจำเป็นต่อความหน่วงต่ำยิ่ง
  • การปรับแก้ไกด์ดานซ์: เราเลี่ยงโอเวอร์เฮดการสุ่มของ Classifier-Free Guidance โดยผสานเกรเดียนต์แบบมีเงื่อนไขเข้าสู่โมเดลนักเรียน
  • แอตเทนชันแบบสแปร์สที่ปรับตัวได้: สิ่งนี้ลดความซ้ำซ้อนของการพึ่งพาระยะไกล ให้กราฟการคำนวณที่กระชับขึ้น ซึ่งเอื้อต่อการสร้างเรียลไทม์ 1080P ต่อไป

เอนจินตอบสนองฉับพลัน

รูปที่ 3 เอนจินตอบสนองฉับพลันประกอบด้วยสามโมดูล: การพับวิถีเชิงเวลา การปรับแก้ไกด์ดานซ์ และการเรียนรู้แอตเทนชันแบบสแปร์สที่ปรับตัวได้

3. การประยุกต์ใช้และผลกระทบทางสังคม

PixVerse-R1 แนะนำสื่อเชิงสร้างรูปแบบใหม่: ระบบภาพและเสียงแบบเรียลไทม์ ต่อเนื่อง และมีสถานะ ต่างจากวิดีโอที่เรนเดอร์ล่วงหน้า สื่อนี้ทำงานเป็นกระบวนการที่คงอยู่ซึ่งตอบสนองต่อเจตนาของผู้ใช้ทันที โดยการสร้างและการโต้ตอบถูกผูกกันอย่างแน่น สื่อใหม่นี้เปิดระบบเชิงโต้ตอบในวงกว้าง ซึ่งรวมถึงแต่ไม่จำกัดเพียง:

  • สื่อเชิงโต้ตอบ

    • เกมที่เป็น AI โดยกำเนิดและประสบการณ์ภาพยนตร์เชิงโต้ตอบ
    • VR/XR แบบเรียลไทม์และการจำลองที่สมจริง
  • ระบบเชิงสร้างสรรค์และการศึกษา

    • ศิลปะสื่อที่ปรับตัวได้และงานติดตั้งเชิงโต้ตอบ
    • สภาพแวดล้อมการเรียนรู้และการฝึกแบบเรียลไทม์
  • การจำลองและการวางแผน

    • การวิจัยเชิงทดลองและการสำรวจสถานการณ์
    • การจำลองด้านอุตสาหกรรม เกษตรกรรม และนิเวศวิทยา

นอกเหนือจากการใช้งานเฉพาะ PixVerse-R1 ทำหน้าที่เป็นตัวจำลองโลกภาพและเสียงที่ต่อเนื่อง ลดระยะห่างระหว่างเจตนาของมนุษย์กับการตอบสนองของระบบ และเปิดรูปแบบใหม่ของการร่วมสร้างระหว่างมนุษย์กับ AI ภายในสภาพแวดล้อมดิจิทัลที่คงอยู่

4. บทสรุป

PixVerse-R1 แนะนำเฟรมเวิร์กเชิงสร้างแบบเรียลไทม์ที่ก้าวข้ามข้อจำกัดภายในของเวิร์กโฟลว์วิดีโอแบบดั้งเดิม ผ่านนวัตกรรมทางสถาปัตยกรรมด้านการประมวลผลมัลติโมดัลและการตอบสนองฉับพลัน ด้วยการทำให้สร้างได้อย่างสอดคล้องและเรียลไทม์ โมเดลนี้เป็นวิวัฒนาการสำคัญในการสร้างและประสบการณ์สื่อภาพและเสียง การมุ่งสู่ความหน่วงแบบเรียลไทม์ทำให้เปลี่ยนจากการบริโภคเนื้อหาคงที่ไปสู่การโต้ตอบกับสภาพแวดล้อมแบบไดนามิก และให้ฐานเชิงคำนวณที่ขยายได้สำหรับแอปพลิเคชันตั้งแต่เกมที่เป็น AI โดยกำเนิดไปจนถึงการจำลองอุตสาหกรรมที่ซับซ้อน ด้วยการเชื่อมช่องว่างระหว่างเจตนาของผู้ใช้กับฟีดแบ็กภาพที่ฉับพลัน ระบบนี้สร้างพรมแดนใหม่สำหรับการโมเดลโลกเชิงโต้ตอบและสภาพแวดล้อมที่มนุษย์กับ AI ร่วมมือกัน

5. ข้อจำกัด

แม้ PixVerse-R1 มีข้อได้เปรียบด้านการโมเดลอย่างมีนัยสำคัญ แต่ยังมีข้อจำกัดหลักสองประการเกี่ยวกับความแม่นยำเชิงเวลาและความเที่ยงตรงทางกายภาพ:

  • การสะสมข้อผิดพลาดเชิงเวลา: ในลำดับที่ยาว ข้อผิดพลาดในการทำนายเล็กน้อยอาจสะสม และอาจบั่นทอนความสมบูรณ์เชิงโครงสร้างของการจำลอง
  • จุดแลกเปลี่ยนระหว่างฟิสิกส์กับการคำนวณ: เพื่อให้สร้างแบบเรียลไทม์ได้สำเร็จ มีการยอมเสียบางอย่างเกี่ยวกับความซับซ้อนของการสร้าง ดังนั้นอาจมีการสูญเสียระดับหนึ่งในการเรนเดอร์กฎฟิสิกส์บางข้ออย่างแม่นยำ เมื่อเทียบกับโมเดลที่ไม่ใช่เรียลไทม์