Cập nhật sản phẩm

PixVerse ra mắt R2, đưa mô hình thế giới thời gian thực tiến tới những thế giới bền vững, có thể chơi

PixVerse ra mắt R2, đưa mô hình thế giới thời gian thực tiến tới những thế giới bền vững, có thể chơi

Tạo video bằng AI thường là quy trình một lần. Mô hình nhận một prompt, tạo một clip cố định, rồi dừng. Muốn thay đổi, người dùng phải bắt đầu lại với prompt mới và clip mới. Mỗi kết quả đều khép kín và rời rạc.

Một mô hình thế giới thời gian thực hoạt động khác. Thay vì trả về một clip, nó tạo ra một thế giới tiếp tục chạy khi người dùng đang ở trong đó. Thế giới có thể điều hướng theo thời gian thực. Đầu vào mới đến trong lúc mô hình vẫn đang tạo và thay đổi những gì xảy ra tiếp theo. Thế giới không đặt lại giữa các hành động, và nó giữ trạng thái xuyên suốt, càng nhất quán khi phiên chạy càng lâu.

PixVerse giới thiệu mô hình thế giới thời gian thực đầu tiên trên thế giới, R1, vào tháng 1 năm 2026. R1 chứng minh mô thức này khả thi: video có thể trở thành một luồng nghe nhìn liên tục, tương tác, thay vì một đầu ra cố định.

Hôm nay, chúng tôi ra mắt R2, bản nâng cấp của mô hình thế giới thời gian thực. Nó giữ sự mạch lạc qua những phiên dài hơn nhiều, nhớ những gì xảy ra trong một phiên và mang điều đó về phía trước, đồng thời đưa văn bản, tài liệu tham chiếu, âm thanh và điều khiển hành động vào cùng một thế giới đang chạy.

Một thế giới nhớ và đáp lại

Thay đổi cốt lõi ở R2 là những gì đầu vào có thể làm. Trong video AI thông thường, và ở các phiên bản tạo thời gian thực trước đó, đầu vào chỉ tác động khoảnh khắc hiện tại, rồi khoảnh khắc đó trôi qua. Hành động tiếp theo bắt đầu từ đầu. Thế giới không mang gì về phía trước.

Trong R2, đầu vào tồn tại. Một prompt, một hành động hoặc một tín hiệu âm thanh không chỉ thay đổi khung hình hiện tại. Nó cập nhật trạng thái đang chạy của thế giới và định hình những gì theo sau: nhân vật sẽ hành xử ra sao sau này, tình huống được giải quyết thế nào, và môi trường phát triển ra sao khi phiên tiếp tục. Một hành động trước đó vẫn còn đúng ở phần sau của cùng phiên.

Khám phá một thế giới sống. Người chơi bước vào một thế giới được tạo và di chuyển trong đó theo thời gian thực, điều khiển nhân vật bằng phím WASD và xoay camera bằng phím mũi tên. Prompt thay đổi thế giới khi người chơi đi tiếp, thêm yếu tố và biến đổi môi trường. Nhân vật tương tác với xung quanh theo một logic vật lý, và mỗi đầu vào xây trên đầu vào trước thay vì bắt đầu từ con số không.

Định hình câu chuyện. Thế giới có thể phát triển một cốt truyện uốn theo những gì người chơi làm. Trong Zero Mark, một game phim tương tác xây trên R2 bởi nhà sáng tạo Xiaolongbao, một sinh vật chặn đường và xin một món quà. Tặng nó một con rồng hoặc một chiếc lá dẫn tới những phản hồi thực sự khác nhau. Câu chuyện rẽ nhánh từ đầu vào thay vì đi theo một lối đã viết sẵn, và mô hình tạo từng kết quả trực tiếp.

Trong Zero Mark, cùng một lần gặp đi theo hai hướng: tặng sinh vật một con rồng và tặng nó một chiếc lá tạo ra những phản hồi khác nhau, được tạo trực tiếp.

Trong Zero Mark, cùng một lần gặp đi theo hai hướng: tặng sinh vật một con rồng và tặng nó một chiếc lá tạo ra những phản hồi khác nhau, được tạo trực tiếp.

Nhân vật đáp lại đúng ngữ cảnh. Nhân vật trong thế giới có thể hiểu người chơi và phản hồi nhịp với câu chuyện. Trong một câu chuyện tương tác do nhà sáng tạo Jade Wu xây trên R2, người chơi nói chuyện với nhân vật tên Eve, người giữ danh tính và ký ức xuyên suốt hội thoại, khơi ra manh mối và đẩy cốt truyện. Lời đáp, biểu cảm và chuyển động của cô theo cả cuộc trò chuyện cho đến lúc đó lẫn chỗ câu chuyện đã tới. Cô giữ một danh tính nhất quán qua nhiều lượt trao đổi thay vì đặt lại, đọc ít giống một nhân vật không phải người chơi theo kịch bản và giống hơn một người biết bạn và theo dõi những gì đang diễn ra.

Bài toán mở quy mô và câu trả lời của R2

Khác với việc tạo một clip video cố định, nơi mô hình nhận một prompt duy nhất và một khoảng thời gian cố định để lấp đầy, một thế giới tiếp tục chạy không có ranh giới như vậy. Nó phải làm nhiều việc cùng lúc, liên tục, mà không đứt gãy:

  • Giữ mạch lạc theo thời gian. Nhân vật, địa điểm và quy tắc của thế giới phải giữ nguyên. Mỗi giây chạy thêm là một cơ hội nữa để lệch.
  • Nhận đầu vào giữa lúc đang tạo. Mô hình không thể tạm dừng để suy nghĩ. Điều khiển mới đến khi thế giới đang chuyển động và phải được hòa vào mà không dừng lại.
  • Nhớ và phục hồi. Mô hình phải mang tiếp những gì đã xảy ra, và khi các lỗi nhỏ tích tụ trong một phiên dài, sửa chúng thay vì làm chúng chồng chất.
  • Làm tất cả những điều này trực tiếp. Ngân sách độ trễ phải đủ chặt để cảm giác tương tác.

Bên dưới những yêu cầu này là một căng thẳng sâu hơn. Cách thông thường để mô hình đủ nhanh cho thời gian thực là làm nó đơn giản hơn, còn cách thông thường để nó mạnh hơn là làm nó nặng hơn và chậm hơn. Tốc độ và năng lực kéo ngược nhau. Cách chuẩn mà lĩnh vực này xây các hệ thống ấy còn làm vấn đề nặng thêm: một chuỗi dài các giai đoạn huấn luyện tách biệt, mỗi giai đoạn bàn giao cho giai đoạn kế, chất lượng và độ ổn định bào mòn ở mỗi lần bàn giao.

Câu trả lời của R2 là ngừng ép phải chọn giữa tốc độ và năng lực, và tách công việc thành hai giai đoạn xây trên cùng một nền. Omni Causal AR là động cơ năng lực, hoạt động như một xương sống được huấn luyện liên tục. Nó phát triển một mô hình nhân quả duy nhất tiếp tục học trên nhiều dữ liệu hơn, nhiều loại đầu vào hơn, nhiều tác vụ hơn và những khoảng thời gian dài hơn, cộng dồn năng lực ở một chỗ thay vì suy giảm qua các lần bàn giao.

Lớp tăng tốc thời gian thực sau đó lấy chính mô hình đó và nén nó để chạy trực tiếp, thay vì huấn luyện một mô hình nhanh riêng từ đầu, nên mức tăng năng lực không còn phải đánh đổi bằng tốc độ.

Cách R2 thay pipeline huấn luyện nhiều bước thông thường, nơi chất lượng bào mòn ở mỗi lần bàn giao, bằng một mô hình được huấn luyện liên tục rồi nén để dùng theo thời gian thực.

Cách R2 thay pipeline huấn luyện nhiều bước thông thường, nơi chất lượng bào mòn ở mỗi lần bàn giao, bằng một mô hình được huấn luyện liên tục rồi nén để dùng theo thời gian thực.

Xung quanh hai giai đoạn này là một tập lựa chọn kỹ thuật có chủ đích, để mỗi mức tăng năng lực được chuyển tiếp sang sản phẩm thời gian thực. Báo cáo kỹ thuật PixVerse R2 đầy đủ bao gồm kiến trúc và chi tiết đánh giá.

“Các mô hình ngôn ngữ lớn đã cho thấy mở quy mô là một con đường đáng tin cậy tới năng lực,” Changhu Wang, đồng sáng lập và CEO của PixVerse, nói. “R2 là trường hợp của chúng tôi cho thấy các mô hình thế giới thời gian thực có thể đi một con đường tương tự: với kiến trúc đúng, một mô hình có thể tiếp tục mạnh hơn mà không từ bỏ tương tác thời gian thực. Theo thời gian, đó là cách một công cụ sáng tạo trở thành một môi trường mà người ta có thể bước vào và định hình.”

Từ mô hình thế giới đến game có thể chơi

R2 đã bước từ trình diễn nghiên cứu sang thứ mà sản phẩm thực có thể xây trên đó. Ra mắt lần đầu vào tháng 7 năm 2026, PixVerse Game Engine hiện chạy trên R2.

Chow Li, Head of PixVerse Games, trình bày game engine thời gian thực của PixVerse tại Tech in Asia Conference, tháng 9 năm 2026.

Chow Li, Head of PixVerse Games, trình bày game engine thời gian thực của PixVerse tại Tech in Asia Conference, tháng 9 năm 2026.

Khi trình bày tại Tech in Asia Conference vào tháng 9, Head of Games của PixVerse, Chow Li, đặt điều này như một chuyển dịch về những gì một game có thể là. Những mảnh vốn làm một game thành game—nhân vật, thế giới, và những lựa chọn của người chơi—không còn là tài sản cố định dựng sẵn. Người chơi giờ có thể nói điều họ muốn và thấy nó xảy ra, và trải nghiệm thành hình qua lúc chơi thay vì được viết trước. Tạo thế giới và chơi thế giới trở thành cùng một hành động.

Jaden Xie, đồng sáng lập và President của PixVerse, phát biểu trên một panel tại Google AI App Day ở Singapore, tháng 9 năm 2026.

Jaden Xie, đồng sáng lập và President của PixVerse, phát biểu trên một panel tại Google AI App Day ở Singapore, tháng 9 năm 2026.

Khi phát biểu trên một panel tại Google AI App Day ở Singapore, đồng sáng lập và President Jaden Xie chỉ ra những tiến bộ của mô hình video như một động lực mạnh cho làn sóng game AI-native tiếp theo. “Điều thú vị là những gì các nhà sáng tạo đã xây trên mô hình thế giới của chúng tôi kể từ khi chúng tôi mở beta vào tháng 7,” Jaden nói. “Chúng tôi tin các mô hình video của mình sẽ trao quyền cho nhiều nhà sáng tạo hơn trong việc đưa ý tưởng thành hiện thực.”

Tình trạng sẵn có

Một bộ sưu tập những thế giới này hiện đã mở để khám phá tại world.pixverse.video.

Giới thiệu về PixVerse

PixVerse là nền tảng tạo video AI toàn cầu, được hơn 150 triệu người dùng tại hơn 177 quốc gia tin dùng. Với bộ mô hình độc quyền phát triển hoàn toàn nội bộ, PixVerse giúp bất kỳ ai tạo video chất lượng điện ảnh từ một prompt, ảnh hoặc clip. Vào tháng 1 năm 2026, PixVerse ra mắt R1, mô hình thế giới thời gian thực đầu tiên trên thế giới, biến video thành một luồng vô hạn, liên tục và tương tác. R2 xây trên nền tảng đó, mở quy mô mô hình thế giới thời gian thực để chạy những phiên dài hơn, mạch lạc hơn. Với các đội phân bố khắp châu Á và Hoa Kỳ, PixVerse được thành lập năm 2023 với cam kết biến video thành ngôn ngữ phổ quát của biểu đạt con người. Tháng 3 năm 2026, PixVerse khép vòng Series C, đạt trạng thái kỳ lân. Để biết thêm, hãy truy cập pixverse.ai.

Tài nguyên liên quan

Nguồn chính thức: PixVerse.