部落格

PixVerse R1:新一代即時世界模型的技術架構與設計理念

最後更新於
PixVerse R1:新一代即時世界模型的技術架構與設計理念

PixVerse R1 是首個投入生產部署的即時世界模型——一套能夠生成持續、可互動影片的系統,而非產出孤立片段。本文將深入探討 R1 得以實現的技術架構、其背後的設計理念,以及該模型自首次釋出以來的迭代演進。

R1 解決的問題

標準 AI 影片生成遵循請求-響應模式:提交提示詞,等待處理,接收靜態片段。這一工作流程能產出令人印象深刻的單個輸出,但存在一個根本性限制:生成的內容是惰性的。你只能觀看,無法身臨其境。

R1 從底層設計之初就旨在消除這一限制。R1 不生成有限時長的影片檔案,而是生成持續的、互動式的視覺流——一個真實存在、並能即時響應使用者輸入而不斷演化的世界。

這不是對片段生成的漸進式改進,而是一個具有不同架構需求的全新計算問題,也需要一套不同的質量評判標準。對於一次性影片而言,提示詞還原度和單條片段的精緻度依然重要;而世界模型的評判標準則是延遲、記憶能力,以及在長時段會話中能否保持連貫一致。

三元件架構

R1 的架構由三個相互關聯的系統組成,每個系統各自應對即時世界生成中的特定挑戰:

1. Omni 基礎模型

R1 的基礎是一個原生全模態多模態模型,能在統一架構內處理視覺、音訊和互動資料。與將不同模態路由到獨立模型再合併輸出的流水線方法不同,Omni 基礎模型在內部完成跨模態推理,將文本、影像、影片和音訊視為一個連續的 token 流,而不是拼接在一起的四項獨立任務。

這種統一處理對即時效能至關重要。多模型流水線在每個交接點都會引入延遲,而每一次交接也是誤差滋生的地方,因為資訊需要在不同系統之間轉譯。當要求達到亞秒級響應時間時,這些毫秒級的延遲會疊加成明顯的卡頓,轉譯損失也會累積成可見的瑕疵。以端到端方式訓練 Omni 基礎模型,並使用原始解析度資料而非裁剪或縮放後的輸入,從源頭上消除了這兩個問題:既沒有需要消除的跨模型延遲,也不存在一個模型的假設與另一個模型相沖突的接縫。

2. 記憶增強自迴歸機制

即時世界生成要求系統記住已生成的內容。如果使用者向左看、探索一個房間、再向右看,之前生成的內容必須仍然存在——與數秒前渲染的畫面保持一致,而不是被悄悄重新生成成略有不同的樣子。

R1 的記憶增強注意力機制在整個生成時間線上維護環境狀態。這通過自迴歸過程實現:每一新幀的生成不僅以當前輸入為條件,還以此前所有生成內容的累積記憶為條件,而不是像單條片段那樣被當作獨立事件取樣生成。

其結果是長時域連貫性——即使使用者不斷探索、互動並重訪已生成的區域,生成的世界在長時段會話中始終保持自我一致。這也是該領域最難攻克的開放性研究問題:關於互動式影片世界模型的獨立研究已經指出,誤差的累積預測和記憶能力不足是長時段互動式生成面臨的核心障礙,而 R1 的記憶設計正是針對這一失效模式而構建的,而非繞開它。

3. 即時響應引擎

這是技術要求最高的元件。標準擴散模型需要數十個取樣步驟才能生成單幀——對即時互動而言遠遠太慢。R1 的即時響應引擎通過三項協同技術,將每幀所需的取樣步驟壓縮至寥寥數步:

  • 時間軌跡摺疊通過利用時間冗餘來壓縮擴散過程:連續影片流中的相鄰幀共享大量視覺內容。該引擎不從頭生成每一幀,而是使用一種結構先驗——本質上是一種趨向乾淨輸出分佈的對映——讓前一幀的狀態承擔大部分工作,從而大幅減少所需的新取樣步驟數量。
  • 引導校正將無分類器引導的效果直接摺疊進生成模型本身,使系統無需在每個取樣步驟之上再執行一次獨立的引導計算。
  • 自適應稀疏注意力削減了注意力計算中冗餘的長程依賴關係,使計算圖在會話持續進行時保持輕量,而不是隨著上下文幀數的增加而愈發沉重。

這種方法以少量的每幀視覺新穎性換取生成速度的大幅提升——對於時間流暢性比單幀與前一幀的差異程度更重要的即時互動場景而言,這正是恰到好處的權衡。

設計取捨

R1 的架構涉及深思熟慮的權衡,這些權衡反映了其即時優先順序:

誤差累積——自迴歸生成會隨時間累積微小誤差。每一幀都建立在前一幀的基礎上,瑕疵可能逐漸疊加。R1 通過記憶系統中的週期性校正機制來緩解這一問題,但與非自迴歸生成相比,較長的會話仍可能在物體持續性或場景結構上出現漸進漂移。

解析度上限——即時約束帶來實際的解析度限制。更高解析度需要每幀更多計算量,這直接擠壓即時生成的預算空間。R1 最初的研究架構將即時 1080p 設定為這一權衡的上限;不過通過特定入口實際可用的解析度仍取決於訪問路徑,因為網頁端體驗、共享世界會話和合作夥伴 API 介面各自可能開放不同的限制。任何計劃進行生產環境整合的團隊都應該以線上產品的即時資料為準,而不是將某一個數字視為在所有入口通用的固定值。

多樣性 vs. 一致性——實現速度的時間軌跡摺疊也意味著連續幀之間的視覺相關性高於標準生成。對於持續性世界而言,這正是預期行為(你希望獲得一致性),但這也意味著 R1 在單位生成量上產生的視覺多樣性少於基於片段的模型。

這些取捨是工程選擇,而非侷限性。R1 針對與片段生成模型不同的目標函式進行最佳化,其設計準確地反映了這一優先順序。

R1 與 V6、C1 的定位差異

PixVerse 目前覆蓋兩類不同的創作需求,有必要明確哪個模型對應哪種需求。如果最終交付物是一個檔案——一條社交短片、一支產品影片、一個電影感鏡頭、一段圖片轉影片匯出——那麼 PixVerse V6 和 PixVerse C1 就是為這類工作流打造的,提供面向提示詞級和鏡頭級的精細控制,目標是產出一個完成的、可下載的結果。如果最終交付物是一種在生成開始後仍會持續響應的體驗——一款遊戲、一層直播互動、一個 XR 場景、一個多人共享空間——那就是 R1 的領域,把基於片段的模型強行套用到這種角色上,恰恰誤解了世界模型存在的意義。

一個簡單的判斷方式是:需要匯出成品時選擇 V6 或 C1;需要讓它持續執行時選擇 R1。

應用場景

R1 的架構使一類基於片段的模型從根本上無法服務的應用成為可能:

  • 互動娛樂——原生 AI 遊戲、互動電影,以及隨玩家選擇即時生成的敘事內容
  • 訓練與模擬——按需生成的沉浸式場景化環境,涵蓋工業、農業和生態模擬等領域
  • 直播內容與共享世界——能夠適應觀眾輸入的流媒體體驗,以及多使用者在同一生成空間內互動的環境
  • 創意與教育探索——面向藝術家和設計師的開放式世界生成,以及自適應學習與培訓環境

客觀評估 R1

由於世界模型仍是一個新興品類,有必要在列舉其能力的同時點明實際的注意事項:長時段會話仍可能出現漂移,物理保真度是為了速度而在設計上做出的取捨,可用的解析度和功能也會因訪問路徑(網頁端體驗與合作伙伴 API)而異。與其他世界模型的基準對比,只有在同時考慮會話時長、互動型別和解析度的情況下才有意義——而不能只看單一的頭條數字。

展望未來

R1 代表了 PixVerse 所認為將定義 AI 生成內容下一個時代的研究方向邁出的第一步。自首次釋出以來,該模型已經從一套研究架構發展為一個上線的網頁體驗、一條合作伙伴與 API 通路,以及不斷擴充的共享世界功能——這證明這一方向正在被持續構建,而非停留在一次性演示。隨著計算效率的提升和架構創新的持續推進,即時生成世界的質量、解析度和複雜性將不斷提高——有望在保持即時互動性的同時,接近預渲染內容的保真度。

從“AI 為你生成內容供你觀看”到“AI 為你生成世界供你身臨其境”的轉變正在進行中。R1 正是這一切的起點。

相關資源

→ 在 PixVerse 體驗 R1