ব্লগ

PixVerse R2: রিয়েল-টাইম Omni ওয়ার্ল্ড মডেল স্কেলিং

সর্বশেষ আপডেট
PixVerse R2: রিয়েল-টাইম Omni ওয়ার্ল্ড মডেল স্কেলিং

PixVerse R1 প্রথম রিয়েল-টাইম ভিডিও ওয়ার্ল্ড মডেল পরিচয় করিয়ে পাঠিয়েছে, ভিডিও জেনারেশনকে একটি ফিক্সড ক্লিপের ওয়ান-শট ডেলিভারি থেকে একটি অবিরত চলমান ওয়ার্ল্ডে পরিণত করেছে। মডেল ব্যবহারকারীর ইনপুট নিতে থাকতে পারে, রিয়েল টাইমে ওয়ার্ল্ড স্টেট আপডেট করতে পারে, এবং ইন্টারঅ্যাকশনের সঙ্গে সামঞ্জস্যপূর্ণ সিঙ্ক্রোনাইজড অডিও ও ভিডিও স্ট্রিম করতে পারে। R1 দেখিয়েছে এই প্রযুক্তিগত প্যারাডাইম কাজ করতে পারে।

PixVerse R2 পরের প্রশ্নের উত্তর দেয়: একটি রিয়েল-টাইম ভিডিও ওয়ার্ল্ড মডেল কীভাবে স্কেল করতে থাকে। R2 দুটি লক্ষ্যে মনোযোগ দেয়। প্রথমত, এটি এমন একটি গতিশীল ওয়ার্ল্ড গড়ে যা দীর্ঘ হরাইজনে একীভূত স্টেট ধরে রাখতে পারে, পূর্ণ স্পেশিওটেম্পোরাল প্রায়রকে এমন ওয়ার্ল্ড বিবর্তনে রূপান্তর করে যা শুধু সময়ের সামনের দিকে এগোয়। দ্বিতীয়ত, এটি টেক্সট, রেফারেন্স, অডিও ও অ্যাকশন থেকে ভৌত কার্যকারণ ও ইন্টারঅ্যাকশন সিগন্যাল একটি একক মডেলে অবিরত আত্মস্থ করে, যাতে ওয়ার্ল্ড একই সময়ে জেনারেট করতে, নিয়ন্ত্রণ গ্রহণ করতে ও স্টেট আপডেট করতে পারে, সিঙ্ক্রোনাইজড অডিও ও ভিডিও স্ট্রিম করতে করতে।

সেই লক্ষ্যগুলোকে ঘিরে R2 মডেল, ডেটা, টাস্ক, কন্ট্রোল সিগন্যাল ও টাইম স্কেলের বৃদ্ধিকে জেনারেশন গুণমান, লং-রেঞ্জ কনসিসটেন্সি ও মাল্টিমোডাল নিয়ন্ত্রণের লাভে পরিণত করে।


সামগ্রিক ফ্রেমওয়ার্ক

R2 সিস্টেমকে দুটি মূল স্তরে ভাঁজ করে: Omni Causal AR ও Real-Time Acceleration। Omni Causal AR উচ্চমানের, মাল্টিমোডাল, লং-হরাইজন ওয়ার্ল্ড জেনারেশন প্রসারিত করতে থাকে। Real-Time Acceleration কঠোর ইন্টারঅ্যাকশন-লেটেন্সি বাজেটের অধীনে সেই সক্ষমতা যতটা সম্ভব লসলেসভাবে উত্তরাধিকার করে। পথ স্পষ্ট: ওয়ার্ল্ড মডেলের সক্ষমতার সিলিং বাড়ান, তারপর সেই সক্ষমতাকে রিয়েল-টাইম, ইন্টারঅ্যাকটিভ অপারেটিং রেঞ্জে ত্বরান্বিত করুন।

পুরোনো লং-ভিডিও ও রিয়েল-টাইম পাইপলাইন সাধারণত অনেক ট্রেনিং স্টেজ শৃঙ্খলিত করত: একটি বাইডিরেকশনাল মডেলকে AR মডেলে রূপান্তর, একটি টাস্ক-নির্দিষ্ট বাইডিরেকশনাল মডেল থেকে ডিস্টিলেশন টিচার তৈরি, DMD ডিস্টিলেশন চালানো, তারপর ট্রেন-ইনফারেন্স গ্যাপ বন্ধ করতে সেলফ-রোলআউট DMD যোগ। প্রতিটি স্টেজে সক্ষমতা পুনরায় স্থানান্তর, অবজেক্টিভ পুনঃসারিবদ্ধকরণ এবং ডেটা ডিস্ট্রিবিউশন পুনরায় ফিট করতে হতো। সেই স্থানান্তরের সময় ছবির গুণমান, মোশন, কন্ডিশন ফলোয়িং ও লং-হরাইজন স্থিতিশীলতা ক্ষয় হতে পারত। মডেল, ডেটা ও টাস্ক স্কেল বাড়লে মাল্টি-স্টেজ পাইপলাইন অপ্টিমাইজেশন টার্গেট ভাগ করে দিত এবং ট্রেনিং খরচ ও সিস্টেম জটিলতা দুটোই বাড়াত।

Legacy multi-stage pipeline versus PixVerse R2 scaling world modeling

চিত্র ১. লেগাসি মাল্টি-স্টেজ পাইপলাইন বনাম PixVerse R2 স্কেলিং ওয়ার্ল্ড মডেলিং। R2 সক্ষমতা সম্প্রসারণ ও রিয়েল-টাইম ডিস্টিলেশনকে Omni Causal AR ও একটি রিয়েল-টাইম অ্যাক্সেলারেশন স্তরে একত্রিত করে, একটি ফ্রেমওয়ার্কে মাল্টি-টাস্ক, মাল্টি-সিগন্যাল ও লং-ভিডিও মডেলিং একীভূত করে।

PixVerse R2 রিয়েল-টাইম ওয়ার্ল্ড মডেলের জন্য একটি একীভূত ট্রেনিং প্যারাডাইম প্রস্তাব করে। অনেক মডেল ও টাস্ক স্টেজ জুড়ে বারবার সক্ষমতা স্থানান্তর না করে এটি জটিল পাইপলাইনকে দুটি প্রক্রিয়ায় নামিয়ে আনে যা স্কেল করতে পারে: একটি Omni Causal AR-কে অবিরত প্রিট্রেন করা যা একীভূত ওয়ার্ল্ড স্টেট ধরে রাখে, তারপর সেটিকে সরাসরি একটি ত্বরান্বিত মডেলে ডিস্টিল করা যা স্পেশিয়াল কনসিসটেন্সি ও লং-হরাইজন মডেলিং উত্তরাধিকার করে রিয়েল টাইমে জেনারেট করতে পারে।

কম স্টেজ সীমানা স্বাধীন টিচার, টাস্ক অ্যালাইনমেন্ট ও বারবার মডেল ট্রান্সফার থেকে আসা সক্ষমতা ক্ষতি কমায়। নতুন ডেটা, টাস্ক, কন্ট্রোল সিগন্যাল ও মডেল স্কেল আরও সরাসরি রিয়েল-টাইম ওয়ার্ল্ড-মডেলিং সক্ষমতায় রূপান্তরিত হতে পারে।

স্টেজ ১: Omni Causal AR-এর continual pretraining। R2 আর বাইডিরেকশনাল জেনারেশন প্রায়র ও লং-ভিডিও AR-কে দুটি বিচ্ছিন্ন স্টেজ হিসেবে দেখে না। এটি বাইডিরেকশনাল-মডেল সক্ষমতার ওপর একটি একীভূত Omni Causal AR অবিরত প্রশিক্ষণ দেয়। ডাইনামিক চাঙ্ক ভিন্ন ডেটা ফর্মকে একটি ভাগ করা টেম্পোরাল রিপ্রেজেন্টেশন দেয়: মডেল বাইডিরেকশনাল প্রিট্রেনিং থেকে উচ্চমানের শর্ট ভিডিও ও মাল্টিমোডাল ডেটা গ্রহণ করতে পারে, এবং অবিচ্ছিন্ন লং ভিডিও ও মাল্টি-টার্ন ইন্টারঅ্যাকশন ট্র্যাজেক্টরিতে প্রসারিত হতে পারে। ছবির গুণমান, অডিওভিজ্যুয়াল প্রকাশ, লং-হরাইজন জেনারেশন ও মাল্টি-সিগন্যাল নিয়ন্ত্রণ বারবার রূপান্তরের মধ্য দিয়ে পুনরায় স্থানান্তরিত না হয়ে একটি মডেলের ভিতরেই স্কেল করতে পারে।

স্টেজ ২: স্কেল করা Omni Causal AR থেকে একটি রিয়েল-টাইম অ্যাক্সেলারেশন স্তর ডিস্টিল করা। Continual pretraining Omni Causal AR-কে একই সঙ্গে উচ্চমানের জেনারেশন, স্থিতিশীল লং-হরাইজন স্টেট ট্রান্সফার এবং বাস্তব কজাল রোলআউট দেয়। R2 তারপর স্টুডেন্ট ODE ইনিশিয়ালাইজেশন ও ডিস্টিলেশন টিচার উভয়ের জন্য একই Omni Causal AR ব্যবহার করে, যাতে টিচার, স্টুডেন্ট ও বাস্তব AR ইনফারেন্স একটি সামঞ্জস্যপূর্ণ কজাল মডেলিং বেস ভাগ করে। রিয়েল-টাইম ডিস্টিলেশন হয়ে ওঠে “বিদ্যমান একটি ওয়ার্ল্ড মডেলের ফিউ-স্টেপ অ্যাক্সেলারেশন”, “একটি লং-হরাইজন ওয়ার্ল্ড পুনরায় শেখা” নয়।


Omni Causal AR

R2 সেই মাল্টিমোডাল ইনপুট, অটোরিগ্রেসিভ জেনারেশন ও রিয়েল-টাইম ইন্টারঅ্যাকশন পথ চালিয়ে যায় যা R1 ইতিমধ্যে যাচাই করেছে, তারপর সেই সক্ষমতাকে একটি একীভূত Omni Causal AR ট্রেনিং রুটে কেন্দ্রীভূত করে। Omni Causal AR পূর্ণ স্পেশিওটেম্পোরাল জেনারেশন প্রায়রকে এমন ওয়ার্ল্ড-স্টেট ট্রান্সফারে রূপান্তর করে যা শুধু সময়ের সামনের দিকে এগোয়। কজালাইজেশন ও continual pretraining-এর মাধ্যমে মডেল ছবি, মোশন, অডিও ও মাল্টিমোডাল সেমান্টিক সক্ষমতা ধরে রাখে, একই সঙ্গে শুধু ইতিহাস থেকে পরবর্তী সিঙ্ক্রোনাইজড অডিওভিজ্যুয়াল চাঙ্ক ভবিষ্যদ্বাণী করতে শেখে।

ট্রেনিং অবজেক্ট স্বাধীন শর্ট ভিডিও থেকে অবিচ্ছিন্ন লং ভিডিও ও মাল্টি-টার্ন ইন্টারঅ্যাকশন ট্র্যাজেক্টরিতে প্রসারিত হলে মডেল ধীরে ধীরে ঐতিহাসিক ওয়ার্ল্ড স্টেট, বর্তমান ইন্টারঅ্যাকশন ইনপুট ও ভবিষ্যৎ ওয়ার্ল্ড বিবর্তনের মধ্যে দীর্ঘমেয়াদি কার্যকারণ গড়ে তোলে।

মডেলটি একসঙ্গে একটি টেক্সট প্রম্পট, মাল্টিমোডাল রেফারেন্স, অ্যাকশন সিগন্যাল (যেমন WASD বা ধারাবাহিক নিয়ন্ত্রণ) এবং অডিও গ্রহণ করে, এবং সিঙ্ক্রোনাইজড ভিডিও ও অডিও আউটপুট দেয়। একটি রানের সময় বিভিন্ন কন্ট্রোল সিগন্যাল মডেলে প্রবেশ করতে পারে এবং পরবর্তী ওয়ার্ল্ড স্টেট বদলে দিতে পারে। R2 শুধু একবারের শর্তে সাড়া দিচ্ছে না; এটি একই সময়ে জেনারেট করতে, কন্ট্রোল গ্রহণ করতে এবং ওয়ার্ল্ড আপডেট করতে পারে।

একই ওয়ার্ল্ডের ভিতরে দীর্ঘ রানে কজাল জেনারেশন ধরে রাখতে R2 চারটি সমস্যা সমাধান করে: ট্রেন-ইনফারেন্স ডিস্ট্রিবিউশন গ্যাপ, নয়েজি হিস্ট্রির প্রতি রোবাস্টনেস, দীর্ঘমেয়াদি ও সাম্প্রতিক মেমোরির সমন্বয়, এবং এরর স্টেট সংশোধন। Hybrid Teacher / Diffusion Forcing মডেলকে পরিষ্কার ও নয়েজি—দুই ধরনের হিস্ট্রির সঙ্গেই খাপ খাইয়ে নিতে দেয়। Multi-Timescale Memory একসঙ্গে ওয়ার্ল্ড অ্যাঙ্কর, সাম্প্রতিক ডায়নামিকস এবং অবজেক্ট স্টেট সংরক্ষণ করে। একটি Error Bank ব্যর্থ স্টেটগুলোকে আবার ট্রেনিংয়ে ফিরিয়ে আনে। একত্রে এগুলো দীর্ঘমেয়াদি ওয়ার্ল্ড স্টেটের জন্য একটি ট্রেনিং লুপ তৈরি করে এবং সময়ের সঙ্গে ছবি, চরিত্র, মোশন, অডিও-ভিজ্যুয়াল সম্পর্ক ও কন্ট্রোল রেসপন্সে ড্রিফট কমায়।

PixVerse R2 Omni Causal AR-এর মাল্টিমোডাল কন্ট্রোল ও সিঙ্ক্রোনাইজড অডিওভিজ্যুয়াল আউটপুট

চিত্র ২। PixVerse R2 Omni Causal AR। মডেলটি একটি রানের সময় বিভিন্ন কন্ট্রোল সিগন্যাল গ্রহণ করতে পারে। প্রতিটি ইন্টারঅ্যাকশন মুহূর্তে সক্রিয় সিগন্যাল মিলিত গ্র্যানুলারিটির একটি ডায়নামিক অডিওভিজ্যুয়াল চাঙ্কের সঙ্গে সারিবদ্ধ হয় এবং পরবর্তী ভিডিও ও অডিও সেগমেন্ট চালায়।

ডায়নামিক চাঙ্ক জেনারেশন

বিভিন্ন কন্ট্রোল সিগন্যাল বিভিন্ন টাইমস্কেলে থাকে। প্রম্পট ও রেফারেন্স সাধারণত পূর্ণ সেমান্টিক্স বা দীর্ঘ ঘটনা বর্ণনা করে। অ্যাকশন (WASD)-এর জন্য সূক্ষ্ম, তাৎক্ষণিক স্টেট ফিডব্যাক দরকার। অডিও একসঙ্গে সেমান্টিক্স, ছন্দ ও টেম্পোরাল সিঙ্ক বহন করে। প্রতিটি ইনপুটকে যদি একটি নির্দিষ্ট দৈর্ঘ্যের সময়-ইউনিটে জোর করে ঢোকানো হয়, মডেলকে প্রায়ই রেসপন্সের গতি ও প্রকাশের সম্পূর্ণতার মধ্যে আপস করতে হয়।

Dynamic Chunk হলো R2 যেভাবে এই ইন্টারঅ্যাকশন টাইমস্কেলগুলোকে এক করে। R2 বর্তমান কন্ট্রোল সিগন্যালের সেমান্টিক সীমানা ও সময়কাল অনুযায়ী অডিওভিজ্যুয়াল সিকোয়েন্সকে অ্যাডাপটিভভাবে ভাগ করে, এবং একটি সর্বোচ্চ চাঙ্ক সাইজ কম্পিউট ও ট্রেনিং স্থিতিশীলতা সীমাবদ্ধ রাখে। ছোট চাঙ্ক অ্যাকশন ও স্থানীয় নির্দেশের জন্য রেসপন্স প্রিসিশন বাড়ায়। দীর্ঘ চাঙ্ক ঘটনা, মোশন ও অডিওভিজ্যুয়াল সেমান্টিক্সের পূর্ণ কাঠামো ধরে রাখে। বিভিন্ন টাস্ক ও কন্ট্রোল সিগন্যাল মডেল স্ট্রাকচার না বদলে একটি কজাল জেনারেশন ইন্টারফেস শেয়ার করতে পারে।

Hybrid Teacher Forcing / Diffusion Forcing

দীর্ঘ-হরাইজন AR-এর মূল টান হলো, ট্রেনিং হিস্ট্রি সাধারণত পরিষ্কার থাকে, অথচ আসল রানটাইম হিস্ট্রিতে মডেলের নিজের নয়েজ ও স্থানীয় ত্রুটি থাকে। শুধু পরিষ্কার হিস্ট্রিতে ট্রেনিং করলে এক-ধাপের কোয়ালিটি সিলিং বাড়তে পারে, কিন্তু মডেল ছোট বিচ্যুতিতে অতিরিক্ত সংবেদনশীল হয়ে যায়। শুধু বিঘ্নিত হিস্ট্রিতে ট্রেনিং করলে ছবির গুণমান, মোশন ও কন্ট্রোল রেসপন্স ক্ষতিগ্রস্ত হতে পারে।

R2 একটি ট্রেনিং প্রক্রিয়ায় পরিষ্কার হিস্ট্রি ও নয়েজি হিস্ট্রি মেশায়। পরিষ্কার হিস্ট্রি ওয়ার্ল্ড ইভোলিউশনের কোয়ালিটি সিলিং স্থিতিশীল করে। নয়েজি হিস্ট্রি মডেলকে আগেভাগেই সেই অসম্পূর্ণ স্টেটের সঙ্গে খাপ খাইয়ে নেয়, যা এটি ডিপ্লয়মেন্টে দেখবে। এই পরিপূরক ট্রেনিং ট্রেন-ইনফারেন্স গ্যাপ কমায়, ফলে হিস্ট্রিতে ইতিমধ্যে ছোট ত্রুটি থাকলেও মডেল উচ্চমানের পরবর্তী ওয়ার্ল্ড সেগমেন্ট জেনারেট করতে এবং এগিয়ে যেতে পারে।

Causal Attention Mask ও Relative Temporal RoPE একসঙ্গে নির্ধারণ করে বর্তমান স্টেট কোন হিস্ট্রি পড়তে পারে এবং সেই হিস্ট্রি বর্তমান উইন্ডোতে কোথায় বসে। Attention Mask কঠোর কজাল ভিজিবিলিটি প্রয়োগ করে। Temporal RoPE একটি গ্লোবাল ব্লক ID-এর সঙ্গে সীমাহীনভাবে বাড়ে না; এটি বর্তমান অ্যাটেনশন উইন্ডোর ভিতরে আপেক্ষিক স্লট অনুযায়ী পুনরায় ইনডেক্স হয়। রোলিং উইন্ডো সামনে এগোলে আসল সময় এগোতে থাকে, কিন্তু সিঙ্ক মেমোরি, সাম্প্রতিক হিস্ট্রি ও বর্তমান চাঙ্ক একটি স্থিতিশীল, সীমাবদ্ধ আপেক্ষিক পজিশন রেঞ্জে ম্যাপ করা থাকে।

Hybrid teacher forcing ও diffusion forcing-এর কজাল অ্যাটেনশন মাস্ক এবং রিলেটিভ টেম্পোরাল RoPE

চিত্র ৩। Hybrid Teacher / Diffusion Forcing-এর জন্য একীভূত কজাল অ্যাটেনশন মাস্ক ও রিলেটিভ টেম্পোরাল RoPE। উপরের অংশ দুটি হিস্ট্রি নির্মাণের কজাল ভিজিবিলিটি দেখায়। নিচের অংশ প্রতিনিধিত্বমূলক কোয়েরিকে Q/K ব্লক, আপেক্ষিক স্লট ও RoPE ID-তে ম্যাপ করে, দেখায় যে আসল ব্লক ID এগোতে থাকে, অথচ উইন্ডোর ভিতরের সময় স্থানাঙ্ক সীমাবদ্ধ থাকে।

মাল্টি-টাইমস্কেল মেমোরি

দীর্ঘমেয়াদি ওয়ার্ল্ড মডেলিং সব হিস্ট্রি মনে রাখলেই হয় না। সীমাহীন হিস্ট্রি কম্পিউট ও মেমোরি খরচ দ্রুত বাড়ায়; অতিরিক্ত ক্রপ করলে চরিত্রের পরিচয়, সিন সেটআপ ও মূল ঘটনা হারিয়ে যায়। R2 Sink Memory, Rolling History ও একটি Object KV Cache থেকে একটি মাল্টি-স্কেল মেমোরি সিস্টেম তৈরি করে।

  • Sink Memory চরিত্র, সিন, স্টাইল ও ওয়ার্ল্ড রুলের মতো দীর্ঘমেয়াদি অ্যাঙ্কর সংরক্ষণ করে।
  • Rolling History সাম্প্রতিক অ্যাকশন, পোজ, ক্যামেরা ও পরিবেশ পরিবর্তনের ওপর ফোকাস করে, যাতে স্থানীয় স্টেট স্বাভাবিকভাবে যুক্ত থাকে।
  • Object KV Cache ইতিমধ্যে গণনা করা অবজেক্ট-লেভেল হিস্ট্রি রিপ্রেজেন্টেশন পুনরায় ব্যবহার ও কম্প্রেস করে, এবং সীমিত বাজেটের ভিতরে সেই স্টেটগুলো রাখে যা পরবর্তী বিবর্তনকে সত্যিই প্রভাবিত করে।

তিনটি একসঙ্গে দীর্ঘমেয়াদি পরিচয় স্থিতিশীলতা, স্বল্প-পরিসরের মোশন ধারাবাহিকতা ও নিয়ন্ত্রণযোগ্য রানটাইম খরচ দেয়, এবং চরিত্র ড্রিফট, সিন জাম্প, ক্রস-চাঙ্ক ফ্লিকার ও ভাঙা অ্যাকশন কমায়।

Error Bank

একটি AR ওয়ার্ল্ড মডেলে গুরুতর ড্রিফট প্রায়ই একটি ছোট প্রাথমিক ত্রুটি থেকে শুরু হয়, যা হিস্ট্রিতে লেখা হয় এবং পরে উত্তরাধিকারসূত্রে চলে। R2 একটি Error Bank তৈরি করে, যা প্রতিনিধিত্বমূলক এরর হিস্ট্রিকে পুনর্ব্যবহারযোগ্য নমুনা হিসেবে রাখে এবং ট্রেনিংয়ের সময় নির্ধারিত হারে সেগুলোকে সাধারণ হিস্ট্রিতে রিপ্লে করে। মডেল আর শুধু আদর্শ স্টেট থেকে কীভাবে এগোতে হয় তা শেখে না; ইতিমধ্যে ড্রিফট হওয়া হিস্ট্রি চিনতে, গ্রহণ করতে ও মেরামত করতেও শেখে।

ধাপে ধাপে মূল্যায়নে দীর্ঘমেয়াদি ব্রাইটনেস-ড্রিফট মেট্রিক 0.201 থেকে 0.129-এ নেমেছে, প্রায় 35.8% হ্রাস। ২৯টি দীর্ঘ-সিকোয়েন্স নমুনার মধ্যে ২০টিতে উন্নতি হয়েছে, এবং স্থির থাকার কথা ছিল এমন ৫টি নমুনার সবকটিতেই ভুল মোশন কমেছে।


রিয়েল-টাইম অ্যাক্সিলারেশন

R2-এর রিয়েল-টাইম অ্যাক্সিলারেশন কয়েক-ধাপের মডেলের ভিতরে একটি দীর্ঘ-হরাইজন ওয়ার্ল্ড নতুন করে শেখে না। এটি এমন একটি ওয়ার্ল্ড মডেলকে ত্বরান্বিত করে, যা ইতিমধ্যে দীর্ঘ সময় স্থিতিশীলভাবে চলতে পারে। অ্যাক্সিলারেশন লেয়ার ক্রমাগত প্রিট্রেইন করা Omni Causal AR থেকে শুরু হয় এবং এটিকে স্টুডেন্ট ODE ইনিশিয়ালাইজেশন ও ডিস্টিলেশন টিচার—দুই কাজেই ব্যবহার করে, ফলে টিচার, স্টুডেন্ট ও আসল AR ইনফারেন্স একটি সামঞ্জস্যপূর্ণ কজাল ট্রাজেক্টরি ডিস্ট্রিবিউশন শেয়ার করে।

এই একীভূত কজাল সূচনাবিন্দু Self-Forcing ও Rolling Forcing ধরনের টিউনিংয়ের ওপর নির্ভরতা কমায়। রিয়েল-টাইম অ্যাক্সিলারেশন সেই সমস্যাগুলোর ওপর মনোযোগ দিতে পারে যা কয়েক-ধাপের গতি আসলে তৈরি করে: অ্যাডভারসারিয়াল রেগুলারাইজেশনসহ DDMD ডিস্টিলেশনের সময় কন্ডিশন অ্যালাইনমেন্ট, জেনারেশন ডিস্ট্রিবিউশন ও রিয়ালিজম সামলায়; ব্লক-স্পার্স অ্যাটেনশন দীর্ঘ-কনটেক্সট কম্পিউট সংকুচিত করে; এবং একটি পিরামিড পথ উচ্চ-রেজোলিউশন জেনারেশনের খরচ কমায়।

অ্যাডভারসারিয়াল রেগুলারাইজেশনসহ DDMD

অতি-অল্প-ধাপের জেনারেশনে কন্ডিশন অ্যালাইনমেন্ট, ডিস্ট্রিবিউশন ম্যাচিং ও রিয়ালিজম একই অপটিমাইজেশন সমস্যা নয়। R2 DDMD-এর ওপর ভিত্তি করে এবং DMD2 থেকে অ্যাডভারসারিয়াল রেগুলারাইজেশন যোগ করে। তিনটি ট্রেনিং সিগন্যাল এক স্টুডেন্টে মিলিত হয়: কন্ডিশন অ্যালাইনমেন্ট কন্ট্রোল শক্ত করে, ডিস্ট্রিবিউশন ম্যাচিং টিচার ডিস্ট্রিবিউশন ধরে রাখে, এবং অ্যাডভারসারিয়াল রেগুলারাইজেশন বাস্তব ডেটাকে অ্যাঙ্কর করে, ফলে অল্প স্যাম্পলিং ধাপেও নির্ভুল ইন্টারঅ্যাকশন রেসপন্স ও বিশ্বাসযোগ্য ওয়ার্ল্ড দুটোই থাকতে পারে।

ব্লক-স্পার্স অ্যাটেনশন

R2 স্পেটিওটেম্পোরাল টোকেন সিকোয়েন্সে ব্লক-স্পার্স অ্যাটেনশন ব্যবহার করে। মডেল Q, K ও V-কে কম্পিউট ব্লকে ভাগ করে, দ্রুত অনুমান করে প্রতিটি কোয়েরি ব্লকের কোন কি/ভ্যালু ব্লক সবচেয়ে বেশি দরকার, শুধু সর্বোচ্চ স্কোরের সংযোগ রাখে, এবং সেই নির্বাচিত ব্লকে এক্স্যাক্ট সফটম্যাক্স অ্যাটেনশন চালায়। ব্লক-লেভেল রাউটিং এলোমেলো প্রুনিং নয়; এটি বর্তমান মাল্টিমোডাল কন্ট্রোল, সাম্প্রতিক মোশন ও মূল ওয়ার্ল্ড স্টেটের মধ্যে শক্ত নির্ভরতার ওপর কম্পিউট কেন্দ্রীভূত করে।

ট্রেনিংয়ের সময় মডেলকে স্পার্স কানেকশন স্ট্রাকচারের সঙ্গে খাপ খাইয়ে R2 অ্যাটেনশন স্পার্সিটি ৯০%-এর ওপরে তোলে, এবং বর্তমান মূল্যায়নে ছবির গুণমান, অ্যাকশন ধারাবাহিকতা, কন্ডিশন ফলোয়িং ও দীর্ঘ-হরাইজন স্থিতিশীলতায় স্পষ্ট পতন ছাড়াই তা রাখে।

পিরামিড আল্ট্রা-ফিউ-স্টেপ ডিস্টিলেশন

উচ্চ-রেজোলিউশন স্পেসে শুরু থেকে সব ওয়ার্ল্ড মডেলিং করলে সেই গ্লোবাল স্ট্রাকচারের জন্য কম্পিউট নষ্ট হয়, যা নিম্ন রেজোলিউশনই ইতিমধ্যে নির্ধারণ করতে পারে। R2 জেনারেশনকে এক বা দুটি লো-রেজোলিউশন স্টেজ এবং একটি হাই-রেজোলিউশন স্টেজ হিসেবে সাজায়। লো-রেজোলিউশন স্টেজ সিন লেআউট, সাবজেক্ট মোশন ও ক্যামেরা স্ট্রাকচার নির্ধারণ করে। হাই-রেজোলিউশন স্টেজ টেক্সচার, এজ ও স্থানীয় ডিটেইল ফিরিয়ে আনে। মোটা-থেকে-সূক্ষ্ম এই পথ বারবার হাই-রেজোলিউশন কম্পিউট কাটে, অথচ শক্তিশালী স্ট্রাকচারাল স্থিতিশীলতা ও ডিটেইল ধরে রাখে।


উপসংহার ও সীমা

PixVerse R1 প্রথম রিয়েল-টাইম ভিডিও ওয়ার্ল্ড মডেল প্রস্তাব করে শিপ করেছিল, দেখিয়েছিল যে ভিডিও অফলাইন নির্দিষ্ট কনটেন্ট থেকে এমন একটি ডায়নামিক ওয়ার্ল্ডে যেতে পারে যা রিয়েল টাইমে ইন্টারঅ্যাক্ট করতে পারে এবং চলতে থাকতে পারে। PixVerse R2 তারপর সমাধান করে কীভাবে সেই প্যারাডাইম স্কেল করতে থাকে: একটি একীভূত Omni Causal AR বাড়তে থাকা ডেটা, টাস্ক, মোডালিটি ও টাইমস্কেল বহন করে, এবং Real-Time Acceleration পূর্ণ ওয়ার্ল্ড-মডেলিং সক্ষমতাকে রিয়েল-টাইম ফিউ-স্টেপ ইনফারেন্সে নিয়ে আসে।

R2 কোনো একক-বিন্দু সক্ষমতার আপগ্রেড নয়। এটি পরবর্তী প্রজন্মের রিয়েল-টাইম ওয়ার্ল্ড মডেলের জন্য একটি একীভূত ট্রেনিং পথ। R1 রিয়েল-টাইম ভিডিও ওয়ার্ল্ড মডেলকে বাস্তব করেছিল। R2 সেগুলোকে একটি একীভূত, স্কেলযোগ্য, ক্রমাগত উন্নতিশীল পর্যায়ে নিয়ে যায়।

কঠোর রিয়েল-টাইম কম্পিউট ও ইন্টারঅ্যাকশন-লেটেন্সি বাজেটের অধীনে বর্তমান একক-জেনারেশন কোয়ালিটির এখনও শীর্ষ অফলাইন ভিডিও মডেলের তুলনায় উন্নতির জায়গা আছে, বিশেষ করে জটিল সিন ডিটেইল, মোশনের স্বাভাবিকতা, ভৌত সামঞ্জস্য এবং দীর্ঘ রানে স্থিতিশীলতায়। এই ফাঁকগুলো প্রায়ই ফ্রেমওয়ার্কের সিলিংয়ের চেয়ে R2-এর বর্তমান স্কেলিং পর্যায়কেই প্রতিফলিত করে।


আর্লি অ্যাক্সেস

২০২৬ সালের ২৩ আগস্ট পর্যন্ত এই রিপোর্ট PixVerse R2-কে ক্লোজড টেস্টিং হিসেবে বর্ণনা করেছিল। ২০২৬ সালের ২২ সেপ্টেম্বর PixVerse ঘোষণা করে যে এই ওয়ার্ল্ডগুলোর একটি সংগ্রহ world.pixverse.video-তে এক্সপ্লোর করার জন্য খোলা। R2 লঞ্চ ঘোষণা দেখুন।

সেই ঘোষণা অবাধ API অ্যাক্সেস খোলে না। PixVerse ওয়ার্ল্ড মডেল R2 অভিজ্ঞতা ফর্ম আর্লি এক্সপেরিয়েন্স ও API অ্যাক্সেসের অনুরোধের পথ হিসেবেই থাকে।


সম্পর্কিত রিসোর্স

২০২৬ সালের ২২ সেপ্টেম্বরের ঘোষণার ওয়ার্ল্ডগুলো world.pixverse.video-তে এক্সপ্লোর করার জন্য খোলা। API অ্যাক্সেস এখনও উপরের ফর্মের মাধ্যমে অনুরোধ করা হয়। আপনি আজই PixVerse V6 ও R1 দিয়ে তৈরি করতে পারেন।