المدونات

PixVerse R1: البنية والرؤية وراء نموذج العالم في الوقت الفعلي من الجيل التالي

آخر تحديث في
PixVerse R1: البنية والرؤية وراء نموذج العالم في الوقت الفعلي من الجيل التالي

PixVerse R1 هو أول نموذج عالم في الوقت الفعلي يُنشر للإنتاج — نظام يولّد فيديو مستمرًا وتفاعليًا بدلًا من إنتاج مقاطع معزولة. يتناول هذا المقال البنية التقنية التي تجعل R1 ممكنًا، وفلسفة التصميم وراء تطويره، وكيف نضج النموذج منذ إصداره الأول.

المشكلة التي يحلها R1

يتبع توليد فيديو الذكاء الاصطناعي القياسي نمط الطلب والاستجابة: أرسل موجّهًا، وانتظر المعالجة، واستلم مقطعًا ثابتًا. ينتج مسار العمل هذا مخرجات فردية مؤثرة، لكنه يفرض قيدًا أساسيًا: المحتوى المولَّد خامل. تشاهده؛ ولا تسكنه.

صُمّم R1 من الأساس لإزالة هذا القيد. بدلًا من توليد ملف فيديو محدود، يولّد R1 بثًا بصريًا مستمرًا وتفاعليًا — عالمًا يوجد ويتطور استجابةً لمدخل المستخدم، في الوقت الفعلي.

هذا ليس تحسينًا تدريجيًا لتوليد المقاطع. إنها مسألة حوسبية مختلفة بمتطلبات معمارية مختلفة، وتستدعي طريقة مختلفة للحكم على الجودة. تظل دقة الالتزام بالموجه وصقل كل مقطع مهمين للفيديوهات المنفردة، لكن نموذج العالم يُقيَّم وفق زمن الاستجابة والذاكرة ومدى تماسكه عبر جلسة طويلة.

معمارية من ثلاثة مكوّنات

تتألف معمارية R1 من ثلاثة أنظمة مترابطة، يعالج كل منها تحديًا محددًا في توليد العالم في الوقت الفعلي:

1. نموذج الأساس الشامل

أساس R1 هو نموذج متعدد الوسائط أصلي شامل يعالج البيانات البصرية والصوتية وبيانات التفاعل ضمن معمارية موحّدة. وعلى خلاف نهج خطوط المعالجة التي توجّه الوسائط المختلفة عبر نماذج منفصلة ثم تدمج مخرجاتها لاحقًا، يتولى نموذج الأساس الشامل الاستدلال عبر الوسائط داخليًا، ويتعامل مع النص والصورة والفيديو والصوت بوصفها تيارًا متصلًا واحدًا من الرموز بدل أربع مهام منفصلة تُخاط معًا.

هذه المعالجة الموحّدة ضرورية للأداء في الوقت الفعلي. تُدخل خطوط المعالجة متعددة النماذج زمن استجابة عند كل نقطة تسليم، وكل تسليم هو أيضًا موضع يمكن أن تتسلل إليه الأخطاء أثناء ترجمة المعلومات بين الأنظمة. وعندما يكون المطلوب أزمنة استجابة دون الثانية، تتراكم تلك الأجزاء من الألف من الثانية لتصبح تأخيرًا محسوسًا، وتتراكب خسائر الترجمة لتصبح عيوبًا مرئية. تدريب نموذج الأساس الشامل من طرف إلى طرف، على بيانات بالدقة الأصلية بدل مدخلات مقصوصة أو مُعاد تحجيمها، يزيل المشكلتين من مصدرهما: لا يوجد زمن استجابة بين النماذج لإزالته، ولا يوجد خط تماس تتعارض عنده افتراضات نموذج مع افتراضات نموذج آخر.

2. آلية الانحدار الذاتي المعزَّزة بالذاكرة

يتطلب توليد العالم في الوقت الفعلي أن يتذكر النظام ما سبق أن ولّده. إذا نظر المستخدم إلى اليسار واستكشف غرفة ثم نظر إلى اليمين مجددًا، فيجب أن يظل المحتوى المولَّد سابقًا موجودًا — متسقًا مع ما عُرض قبل لحظات، لا أن يُعاد توليده بهدوء إلى شيء مختلف قليلًا.

تحافظ آلية الانتباه المعزَّزة بالذاكرة في R1 على حالة البيئة عبر الخط الزمني للتوليد. ويُنفَّذ ذلك كعملية انحدار ذاتي: يُشترط كل إطار جديد ليس على المدخل الحالي فحسب، بل على الذاكرة المتراكمة لكل المحتوى المولَّد سابقًا، بدل أخذ عينة منه كحدث مستقل بالطريقة التي يُعامل بها مقطع واحد.

النتيجة هي تماسك طويل الأفق — يظل العالم المولَّد متسقًا مع ذاته عبر الجلسات الممتدة، حتى مع استكشاف المستخدمين وتفاعلهم والعودة إلى مناطق وُلّدت سابقًا. وهذه أيضًا أصعب مسألة بحثية مفتوحة في هذا المجال: أشارت أعمال مستقلة حول نماذج عوالم الفيديو التفاعلية إلى أن أخطاء التنبؤ المتراكبة وعدم كفاية الذاكرة هما العائقان المركزيان أمام التوليد التفاعلي طويل التشغيل، وصُمّمت ذاكرة R1 مباشرة حول نمط الفشل هذا لا حوله.

3. محرك الاستجابة الفورية

المكوّن الأكثر تطلبًا من الناحية التقنية. تتطلب نماذج الانتشار القياسية عشرات خطوات أخذ العينات لإنتاج إطار واحد — وهو أبطأ بكثير من أن يصلح للتفاعل في الوقت الفعلي. يختزل محرك الاستجابة الفورية في R1 ذلك إلى حفنة من خطوات أخذ العينات لكل إطار عبر ثلاث تقنيات منسّقة:

  • طي المسار الزمني يضغط عملية الانتشار باستغلال التكرار الزمني: تتشارك الإطارات المتتالية في تيار فيديو متصل قدرًا كبيرًا من المحتوى البصري. وبدل توليد كل إطار من الصفر، يستخدم المحرك مسبقًا بنيويًا — هو في الواقع تعيين نحو توزيع المخرجات النظيفة — بحيث تؤدي حالة الإطار السابق معظم العمل، ما يخفض بشكل كبير عدد خطوات أخذ العينات الجديدة المطلوبة.
  • تصحيح التوجيه يطوي أثر التوجيه الخالي من المصنّف مباشرة داخل نموذج التوليد نفسه، فلا يضطر النظام إلى تنفيذ تمريرة توجيه منفصلة فوق كل خطوة أخذ عينات.
  • الانتباه المتناثر التكيفي يستبعد الاعتمادات طويلة المدى الزائدة في حساب الانتباه، فيُبقي الرسم البياني الحوسبي أخف مع استمرار الجلسة بدل أن يزداد ثقلًا مع كل إطار إضافي من السياق.

يقايض هذا النهج قدرًا صغيرًا من الجدة البصرية لكل إطار بمكسب هائل في سرعة التوليد — وهي المقايضة الصحيحة تمامًا للتفاعل في الوقت الفعلي، حيث تهم نعومة الزمن أكثر من مدى اختلاف أي إطار واحد عن الإطار الذي يسبقه.

مقايضات التصميم

تنطوي معمارية R1 على مقايضات متعمدة تعكس أولوياته في الوقت الفعلي:

تراكم الأخطاء — يراكم التوليد بالانحدار الذاتي أخطاء صغيرة بمرور الوقت. يُبنى كل إطار على الإطار السابق، ويمكن أن تتراكب العيوب. يخفف R1 ذلك عبر آليات تصحيح دورية في نظام الذاكرة، لكن الجلسات الممتدة قد تُظهر مع ذلك انحرافًا تدريجيًا في ثبات الأجسام أو بنية المشهد مقارنة بالتوليد غير القائم على الانحدار الذاتي.

سقف الدقة — تفرض قيود الوقت الفعلي حدودًا عملية على الدقة. تتطلب الدقة الأعلى مزيدًا من الحوسبة لكل إطار، وهو ما يصطدم مباشرة بميزانية التوليد في الوقت الفعلي. استهدفت معمارية البحث الأصلية لـ R1 دقة 1080p في الوقت الفعلي كسقف لهذه المقايضة؛ وما تزال الدقة المتاحة فعلًا عبر سطح معيّن تعتمد على مسار الوصول، إذ يمكن أن تكشف تجربة الويب وجلسة العالم المشترك ونقطة نهاية واجهة شريك عن حدود مختلفة لكل منها. وعلى من يخطط لتكامل إنتاجي أن يؤكد الأرقام الحالية مقابل المنتج الحي بدل معاملة رقم واحد كقيمة ثابتة عبر كل سطح.

التنوع مقابل الاتساق — يعني طي المسار الزمني الذي يتيح السرعة أيضًا أن الإطارات المتتالية أكثر ارتباطًا بصريًا مما هي عليه في التوليد القياسي. وهذا هو السلوك المقصود لعالم مستمر (فأنت تريد الاتساق)، لكنه يعني أن R1 ينتج تنوعًا بصريًا أقل لكل وحدة توليد مقارنة بنموذج قائم على المقاطع.

هذه المقايضات خيارات هندسية، وليست قيودًا. يحسّن R1 لدالة هدف مختلفة عن نماذج توليد المقاطع، ويعكس تصميمه تلك الأولوية بدقة.

أين يقع R1 إلى جانب V6 وC1

يمتد PixVerse الآن عبر مهمتين إبداعيتين مختلفتين، ومن المفيد أن نكون صريحين بشأن أي نموذج يجيب عن أي سؤال. إذا كان المخرج ملفًا — مقطعًا اجتماعيًا أو فيديو منتج أو لقطة سينمائية أو تصديرًا من صورة إلى فيديو — فإن PixVerse V6 وPixVerse C1 مبنيان لسير العمل هذا، مع تحكم على مستوى الموجه واللقطة موجّه نحو نتيجة مكتملة قابلة للتنزيل. وإذا كان المخرج تجربة تواصل الاستجابة بعد بدء التوليد — لعبة أو طبقة بث مباشر أو مشهد واقع ممتد أو مساحة مشتركة متعددة المستخدمين — فذلك مجال R1، وإقحام نموذج قائم على المقاطع في هذا الدور يفوّت الغاية من نموذج العالم.

طريقة بسيطة للإمساك بالتمييز: اختر V6 أو C1 عندما تحتاج إلى شيء لتصديره؛ وقيّم R1 عندما تحتاج إلى شيء يواصل العمل.

التطبيقات

تمكّن معمارية R1 فئة من التطبيقات لا تستطيع النماذج القائمة على المقاطع خدمتها من الأساس:

  • الترفيه التفاعلي — ألعاب أصيلة للذكاء الاصطناعي، وسينما تفاعلية، وسرديات تُولَّد في الوقت الفعلي مع اتخاذ اللاعبين لخياراتهم
  • التدريب والمحاكاة — بيئات غامرة قائمة على السيناريوهات تُولَّد عند الطلب، بما في ذلك المحاكاة الصناعية والزراعية والبيئية
  • المحتوى المباشر والعوالم المشتركة — تجارب بث تتكيف مع مدخلات الجمهور، وبيئات متعددة المستخدمين يتفاعل فيها المشاركون داخل الفضاء المولَّد نفسه
  • الاستكشاف الإبداعي والتعليمي — توليد عوالم مفتوح للفنانين والمصممين، إضافة إلى بيئات تعلم وتدريب تكيفية

تقييم R1 بصدق

ولأن نماذج العالم ما تزال فئة ناشئة، فمن المفيد تسمية التحفظات العملية إلى جانب القدرات: يمكن أن تنحرف الجلسات الطويلة مع ذلك، وتُقايض دقة الفيزياء بالسرعة عن قصد، وتختلف الدقة والميزات المتاحة حسب مسار الوصول (تجربة الويب مقابل واجهة الشريك). ولا تكون مقارنات المعايير مع نماذج العالم الأخرى ذات معنى إلا عندما تراعي طول الجلسة ونوع التفاعل والدقة — لا رقمًا عنوانيًا واحدًا فحسب.

التطلع إلى الأمام

يمثّل R1 الخطوة الأولى في اتجاه بحثي تعتقد PixVerse أنه سيحدد الحقبة التالية للمحتوى المولَّد بالذكاء الاصطناعي. ومنذ إطلاقه الأول، انتقل النموذج بالفعل من معمارية بحثية إلى تجربة ويب حية، ومسار للشركاء وواجهة برمجة التطبيقات، وميزات موسّعة للعوالم المشتركة — وهو دليل على أن الاتجاه يُبنى فعليًا بدل أن يُترك كعرض لمرة واحدة. ومع تحسن الكفاءة الحوسبية واستمرار الابتكارات المعمارية، سترتفع جودة العوالم المولَّدة في الوقت الفعلي ودقتها وتعقيدها — وقد تقترب من دقة المحتوى المُعد مسبقًا مع الحفاظ على التفاعل في الوقت الفعلي.

الانتقال من «يولّد الذكاء الاصطناعي محتوى لتشاهده» إلى «يولّد الذكاء الاصطناعي عوالم لتسكنها» جارٍ. وR1 هو حيث يبدأ.

موارد ذات صلة

→ جرّب R1 على PixVerse