AI ভিডিও প্রম্পটের 7টি ভুল, যা নিঃশব্দে আপনার ক্লিপ নষ্ট করে
বেশির ভাগ হতাশাজনক AI ভিডিও ক্লিপের কারণ দুর্বল মডেল নয়। এর কারণ ছবি তৈরির প্রম্পট থেকে ধার করা কিছু অভ্যাস, যা চলমান দৃশ্যের জন্য কখনোই কার্যকর ছিল না। একটি স্থির ফ্রেম অনেক বিশেষণ সামলাতে পারে। পাঁচ সেকেন্ডের ভিডিও পারে না, কারণ মডেলকে একই সঙ্গে সময়ের বিন্যাস, ক্যামেরার চলাচল, বিষয়বস্তুর ধারাবাহিকতা এবং প্রায়ই অডিওও সামলাতে হয়।
এই নির্দেশিকায় এমন সাতটি প্রম্পট লেখার অভ্যাস বিশ্লেষণ করা হয়েছে, যা নিঃশব্দে AI দিয়ে তৈরি ভিডিওকে ক্ষতিগ্রস্ত করে। সঙ্গে রয়েছে সংশোধনের আগে ও পরের প্রম্পট এবং PixVerse-এ চালানো প্রকৃত ভিডিও তৈরির পরীক্ষা। PixVerse-এ উপলব্ধ Seedance 2.0, HappyHorse 1.0, PixVerse V6, PixVerse C1, Kling O3 এবং Kling 3.0-সহ বিভিন্ন মডেলে এই সংশোধনগুলো তুলনা করতে পারেন। মূল সমস্যাগুলো কোনো একটি মডেলের বিশেষ সমস্যা নয়—বেশির ভাগ AI ভিডিও জেনারেটরেই এগুলো দেখা যায়, কারণ ব্যর্থতার জায়গাগুলো একই: অতিরিক্ত ভারী প্রম্পট, অস্পষ্ট আবহের শব্দ, পরস্পরবিরোধী ক্যামেরা নির্দেশনা, নকল নেতিবাচক প্রম্পট, কাঁপুনি তৈরি করে এমন গতির ভাষা, রেফারেন্স ছবির অতিরিক্ত বর্ণনা এবং মান বোঝানোর সাধারণ বিশেষণ।
এখানে শুধু সংক্ষিপ্ত করার জন্য প্রম্পট ছোট করার কথা বলা হচ্ছে না। উদ্দেশ্য হলো প্রম্পটের প্রতিটি শব্দকে কাজে লাগানো। ভালোভাবে তৈরি প্রম্পটে গুরুত্বপূর্ণ তথ্য আগে থাকে, গতির একটি নির্দিষ্ট পথ বেছে নেওয়া হয়, দৃশ্যগতভাবে যা অপরিবর্তিত থাকা দরকার তা সুরক্ষিত রাখা হয়, এবং রুচিনির্ভর অস্পষ্ট শব্দের বদলে এমন ভাষা ব্যবহার করা হয়, যা মডেল সত্যিই দৃশ্যায়ন করতে পারে।
আমরা এই পরীক্ষাগুলো কীভাবে সাজিয়েছি
নিচের প্রতিটি উদাহরণ PixVerse-এ একই ধরনের সেটআপে তৈরি করা হয়েছে: প্রতিটি ক্লিপে একই প্রাথমিক জেনারেশন সেটিংস এবং অডিও চালু রাখা হয়েছে। আমরা কোনো নির্দিষ্ট মডেলের কৌশল দেখাতে চাইনি—উদ্দেশ্য ছিল বাকি পরিবেশ অপরিবর্তিত রেখে প্রম্পট নিজে কী প্রভাব ফেলছে তা আলাদা করে দেখা। ছয়টি ক্লিপ ল্যান্ডস্কেপ বিন্যাসে 1280x720 রেজোলিউশনে তৈরি হয়েছে; রেফারেন্স ছবির উদাহরণটি পোর্ট্রেট বিন্যাসে 720x1280 রেজোলিউশনে তৈরি হয়েছে, কারণ সেটি পণ্যের একটি উল্লম্ব শটের ওপর নির্ভরশীল। প্রতিটি আউটপুটে শব্দ রয়েছে।
একটি কার্যকর প্রম্পটের ছয়টি প্রয়োজনীয় ফলের ভিত্তিতে আমরা প্রতিটি আউটপুট বিচার করেছি: নির্দেশনা অনুসরণ, গতির স্পষ্টতা, বিষয়বস্তুর ধারাবাহিকতা, ক্যামেরার স্থিতিশীলতা, অডিওর ব্যবহারযোগ্যতা এবং ক্লিপটি বাস্তবে কোনো ব্লগ পোস্ট, বিজ্ঞাপনের খসড়া, প্রস্তাবনার স্লাইড বা টিউটোরিয়ালে ব্যবহার করা সম্ভব কি না।
এই ব্যবহারিক নীতিগুলো ইচ্ছাকৃতভাবেই বিভিন্ন মডেলের জন্য প্রযোজ্য। বর্তমান বেশির ভাগ ভিডিও জেনারেটরের দুর্বলতার জায়গাগুলো একই: সময়ের সঙ্গে দৃশ্যের বিচ্যুতি, অস্পষ্ট গতির সংকেত, অস্থিতিশীল ক্যামেরার পথ এবং নিঃশব্দে পরস্পরের সঙ্গে প্রতিদ্বন্দ্বিতা করা নির্দেশনা।
এখানে উল্লেখ করা নির্দিষ্ট মডেলগুলো সম্পর্কে আরও জানতে আমাদের Seedance 2.0 পর্যালোচনা, HappyHorse 1.0 বনাম Seedance 2.0 তুলনা এবং Kling 3.0 বিশ্লেষণ দেখুন। আপনার প্রোডাকশন প্রক্রিয়ায় প্রম্পট পরীক্ষা যুক্ত করতে চাইলে, আমাদের AI ভিডিও তৈরির নির্দেশিকা-তে টেক্সট থেকে ভিডিও এবং ছবি থেকে ভিডিও তৈরির কাজ স্বয়ংক্রিয় করার আলোচনা রয়েছে।
ভুল 1: প্রম্পটের দৈর্ঘ্যকে নিয়ন্ত্রণের মাপকাঠি ভাবা
আরও বর্ণনা যোগ করলে মনে হয় মডেল কাজ করার জন্য আরও তথ্য পাবে। বাস্তবে অতিরিক্ত ভারী প্রম্পট সাধারণত সবচেয়ে গুরুত্বপূর্ণ নির্দেশনাটিকেই চাপা দেয়। প্রথম লাইনটি সবচেয়ে বেশি গুরুত্ব পায়; তার পরে স্তূপ করা সবকিছু মূল ধারণাটিকে জোরদার করার বদলে মডেলের মনোযোগের জন্য প্রতিযোগিতা করে।
এটি যেমন দেখায়:
একটি মার্জিত স্টুডিওতে বিলাসবহুল সুগন্ধির বোতল, সুন্দর আলো, চলচ্চিত্রসুলভ প্রতিফলন, উচ্চমানের বিজ্ঞাপনী চেহারা, দামি উপকরণ, কোমল কণা, মসৃণ গতি, পরিশীলিত আবহ, উচ্চমান, সূক্ষ্ম টেক্সচার, নাটকীয় ক্যামেরা চলাচল, আবেগপূর্ণ গল্প বলা, বিলাসবহুল ব্র্যান্ডের ভাব, বাস্তবসম্মত কাচ, সোনালি তরল, ঝলমলে আলোর বিন্দু, ধীর গতি, মার্জিত ছায়া, নিখুঁত কম্পোজিশন, কোনো বিকৃতি নয়, কোনো ঝিকিমিকি নয়, কোনো ত্রুটিপূর্ণ শারীরিক গঠন নয়, কোনো এলোমেলো পটভূমি নয়, কোনো অতিরিক্ত বস্তু নয়, পেশাদার ভিডিও, ভাইরাল বিজ্ঞাপনের ধরন।
পড়লে বিস্তারিত মনে হয়, কিন্তু প্রায় প্রতিটি বাক্যাংশ হয় অস্পষ্ট, নয়তো আগের কোনো ধারণার পুনরাবৃত্তি। মডেলকে গতি, আলো, আবহ, প্রতিফলন, কণার প্রভাব এবং মান বোঝানোর একগুচ্ছ শব্দের মধ্যে বেছে নিতে হয়—আর এই ভিড়ে আসল বিষয়বস্তু হারিয়ে যায়।
কেন এটি ব্যর্থ হয়: ভিডিও মডেল ধারাবাহিকভাবে টেক্সট পড়ে, আর মূল কাজের সবচেয়ে স্পষ্ট সংকেতটি সাধারণত পুরো ক্লিপজুড়ে সবচেয়ে ভালোভাবে টিকে থাকে। ক্লিপ দীর্ঘ হলে এটি আরও গুরুত্বপূর্ণ হয়ে ওঠে, কারণ সময়জুড়ে ধারাবাহিকতা বজায় রাখাই মডেলের জন্য কঠিন কাজ। ভিডিও মডেল এখনো নির্ভুল পদার্থবিদ্যা ও কার্যকারণ সম্পর্ক সামলাতে সমস্যায় পড়ে বলে OpenAI যে পর্যবেক্ষণ জানিয়েছে, তার সঙ্গেও এটি মিলে যায়—মূল ধারণার পরে দুর্বল নির্দেশনা স্তূপ করলে বাড়তি নিয়ন্ত্রণ আসে না, শুধু বিভ্রান্তি বাড়ে।
সমাধান: 50-80 শব্দের একটি সুসংহত কাঠামো রাখুন—প্রথম বাক্যে বিষয়বস্তু, কাজ ও স্থান; দ্বিতীয় বাক্যে ক্যামেরা ও শৈলী; তৃতীয় বাক্যে সীমাবদ্ধতা।
কালো মার্বেলের ওপর একটি স্বচ্ছ কাচের সুগন্ধির বোতল দাঁড়িয়ে আছে, আর উষ্ণ প্রান্ত-আলো সোনালি তরলের মধ্য দিয়ে যাচ্ছে। বোতলটি প্রদর্শনের জন্য অল্প ঘুরে পাশের একটি সরু অংশ দেখায়, তারপর আবার কেন্দ্রে স্থির হয়। লেবেলের উচ্চতা থেকে ঢাকনার দিকে ধীরে ম্যাক্রো পুশ-ইন, বিলাসবহুল স্টুডিও আলো, বোতলের পেছনে কোমল সোনালি ধুলোর কণা ভাসছে। শেষে একটি স্থিতিশীল, কেন্দ্রীভূত ফ্রেম; কোনো টেক্সট ওভারলে নয়, কোনো অতিরিক্ত বস্তু নয়। অডিও: কাচের মৃদু নড়াচড়ার শব্দ, স্টুডিওর কোমল পরিবেশগত শব্দ।
পরীক্ষা: PixVerse, 5 সেকেন্ড, 720p, 16:9, কাচের নড়াচড়া ও স্টুডিওর পরিবেশগত শব্দের জন্য অডিও চালু। আমরা দেখতে চেয়েছিলাম, একটি সংক্ষিপ্ত প্রম্পট মূল কাজকে আড়াল না করে পণ্যের পরিচয়, সংযত গতি, আলো এবং ক্যামেরার নিয়ন্ত্রণ বজায় রাখতে পারে কি না।
ফলাফলে পুরো পুশ-ইনজুড়ে বোতলটি কেন্দ্রে থাকে, কাচের ভেতর দিয়ে সোনালি তরল স্পষ্ট দেখা যায়, আর উষ্ণ পেছনের আলো কোনো একক বিশেষণের ওপর নির্ভর না করেই বিলাসবহুল আবহ তৈরি করে। ছোট প্রম্পট মানেই অস্পষ্ট প্রম্পট নয়—একটি বিষয়বস্তু, একটি সংযত কাজ, একটি ক্যামেরা চলাচল এবং কয়েকটি বাস্তব সীমাবদ্ধতাসহ সংক্ষিপ্ত নির্দেশনা ছড়ানো পছন্দের দীর্ঘ তালিকার চেয়ে ধারাবাহিকভাবে ভালো ফল দেয়।
ভুল 2: মান বাড়ানোর সুইচ হিসেবে “চলচ্চিত্রসুলভ” শব্দের ওপর নির্ভর করা
প্রায় প্রতিটি AI ভিডিও প্রম্পটেই “চলচ্চিত্রসুলভ” শব্দটি দেখা যায়, অথচ এটি ব্যবহারযোগ্য শব্দগুলোর মধ্যে অন্যতম কম কার্যকর। এটি ভৌতিক আলো, রোমান্টিক সোনালি বিকেলের আলো, রুক্ষ প্রামাণ্যচিত্রের বাস্তবতা, কল্পবিজ্ঞানের কুয়াশা বা আরও বহু চলচ্চিত্রের চেহারা বোঝাতে পারে, যেগুলোর মধ্যে কোনো মিল নেই।
এটি যেমন দেখায়:
একজন অবসরপ্রাপ্ত গোয়েন্দা রাতে বৃষ্টিভেজা গলি দিয়ে হাঁটছেন। চলচ্চিত্রসুলভ, পেশাদার, নাটকীয়, সিনেমার মানের।
এতে মডেল একটি আবহ পায়, নির্দিষ্ট দৃশ্যরূপ পায় না। আউটপুট অন্ধকার ও রুক্ষ থেকে উজ্জ্বল ও চকচকে—যেকোনো রকম হতে পারে, আর কোনটি হবে তা অনুমান করার উপায় থাকে না।
কেন এটি ব্যর্থ হয়: “চলচ্চিত্রসুলভ”-এর মতো বিস্তৃত শব্দ প্রশিক্ষণ ডেটার বিশাল, পরস্পর সম্পর্কহীন অংশের সঙ্গে যুক্ত। আপনি প্রকৃত দৃশ্যভাষা—আলোর বিন্যাস, লেন্সের বৈশিষ্ট্য, কম্পোজিশন, ক্যামেরার চলাচল, রঙের সমাহার বা নির্দিষ্ট পরিচালকের শৈলীর কোনো সংকেত—উল্লেখ না করলে মডেলের পক্ষে বোঝা সম্ভব নয়, আপনি “চলচ্চিত্রসুলভ”-এর কোন ধরন কল্পনা করছেন। Runway-এর Gen-3 Alpha গবেষণাও একই দিক নির্দেশ করে: অত্যন্ত বর্ণনামূলক এবং সময়ের ঘটনায় সমৃদ্ধ ক্যাপশন অস্পষ্ট শৈলীর নামের চেয়ে ধারাবাহিকভাবে ভালো ফল দেয়।
সমাধান: “চলচ্চিত্রসুলভ”-এর বদলে নির্দিষ্ট কিছু দিন—আলোর বিন্যাস, লেন্সের আচরণ, কম্পোজিশনের নিয়ম বা রঙের সমাহার।
লম্বা গাঢ় কোট পরা একজন অবসরপ্রাপ্ত গোয়েন্দা রাতে বৃষ্টিভেজা গলি দিয়ে হাঁটছেন। ওয়াইড শট থেকে মিডিয়াম ক্লোজ-আপে ধীর পুশ-ইন, ভেজা পাথর-বিছানো রাস্তায় লাল ও নীল নিয়ন আলোর প্রতিফলন, গলির গভীরতার দিকে একবিন্দু পরিপ্রেক্ষিত, দৃশ্যের নিয়ন সাইন থেকে অ্যানামরফিক লেন্স ফ্লেয়ার, তাঁর মুখের সামনে দিয়ে সিগারেটের ধোঁয়া যাচ্ছে। অডিও: রাস্তায় বৃষ্টি, দূরের যানবাহনের শব্দ, নিয়নের মৃদু গুঞ্জন।
পরীক্ষা: PixVerse, 5 সেকেন্ড, 720p, 16:9, বৃষ্টি ও শহরের পরিবেশগত শব্দের জন্য অডিও চালু। আমরা দেখতে চেয়েছিলাম, শুধু “চলচ্চিত্রসুলভ” শব্দের চেয়ে চলচ্চিত্রের নির্দিষ্ট উপাদান উল্লেখ করলে আরও স্থিতিশীল আবহ তৈরি হয় কি না।
এটি কাজ করেছে, কারণ প্রম্পটে মডেল সত্যিই ফুটিয়ে তুলতে পারে এমন জিনিসের নাম দেওয়া হয়েছে: ভেজা পাথর-বিছানো রাস্তা, নিয়ন প্রতিফলন, গলির গভীরতার দিকে একবিন্দু পরিপ্রেক্ষিত, ধীর পুশ-ইন, নোয়ার শৈলীর আলো। গোয়েন্দা দৃশ্যের মূল কেন্দ্রবিন্দু থাকেন, আর গলির গভীরতা ও রঙিন সাইন আবহ তৈরি করে। ক্লিপটি চলচ্চিত্রের মতো মনে হয়, কারণ প্রম্পটে শটের চেহারা বর্ণনা করা হয়েছে—কোনো জনপ্রিয় শব্দ ধার করার কারণে নয়।
ভুল 3: একটি শটে একাধিক ক্যামেরা চলাচল স্তূপ করা
AI ভিডিও মডেল ক্যামেরার নির্দেশনা মোটামুটি ভালোভাবেই অনুসরণ করতে পারে, তবে তখনই, যখন একটি প্রধান চলাচল থাকে। একসঙ্গে কয়েকটি ক্যামেরার সংকেত দিলে সাধারণত কাঁপুনি, বিচ্যুতি বা ক্লিপের মাঝখানে অনাকাঙ্ক্ষিত দৃশ্যান্তর দেখা যায়।
এটি যেমন দেখায়:
একটি ক্ষুদ্র চৌম্বকীয় ট্রেন কাচের টেরারিয়াম শহরের মধ্য দিয়ে যায়। ক্যামেরা এগিয়ে আসে, বাঁ দিকে প্যান করে, ট্রেনের চারপাশে ঘোরে, শ্যাওলার টাওয়ারের মধ্য দিয়ে ওপরের দিকে টিল্ট করে এবং হাতে ধরা ক্যামেরার কাঁপুনি যোগ করে।
এটি বাস্তব চলচ্চিত্রের ক্যামেরা চলাচলের মতো শোনায়, কিন্তু জেনারেশনের জন্য এটি অগ্রাধিকারের জন্য প্রতিযোগিতা করা পাঁচটি আলাদা স্থানিক ভেক্টর। মডেলকে হয় সেগুলো ক্রমানুসারে সাজাতে হয়, নয়তো মিশিয়ে দিতে হয়, আর দুই ক্ষেত্রেই সাধারণত দৃশ্যমান অস্থিতিশীলতা তৈরি হয়।
কেন এটি ব্যর্থ হয়: পুশ-ইন, প্যান, চারপাশে ঘোরা, টিল্ট এবং হাতে ধরা ক্যামেরার কাঁপুনি—প্রতিটি ক্যামেরার চলাচলের আলাদা দিক বোঝায়। এগুলো স্তূপ করলে মডেলকে অনুমান করতে হয় কোনটি প্রাধান্য পাবে এবং কখন পরেরটিতে যেতে হবে—সাধারণত এই বদলের সময়ই দুলুনি দেখা যায়। Direct-a-Video ও MotionCtrl-এর মতো ক্যামেরা নিয়ন্ত্রণব্যবস্থার গবেষণায় ঠিক এই কারণেই ক্যামেরার চলাচলকে বস্তুর গতি থেকে ইচ্ছাকৃতভাবে আলাদা করা হয়: একটি প্রম্পটকে একসঙ্গে পাঁচটি ক্যামেরা ভেক্টর বহন করতে বলা উচিত নয়।
সমাধান: ক্যামেরার একটি প্রধান চলাচল বেছে নিন, তারপর তার সঙ্গে সর্বোচ্চ একটি চলাচলের অনুভূতিসংক্রান্ত সংকেত যোগ করুন।
ল্যাবের টেবিলে রাখা কাচের টেরারিয়াম শহরের মধ্য দিয়ে একটি ক্ষুদ্র চৌম্বকীয় ট্রেন মসৃণভাবে এগিয়ে যায়, শ্যাওলার টাওয়ার ও জলীয় বাষ্প জমে বিন্দু তৈরি হওয়া কাচের দেয়াল পেরিয়ে। ক্যামেরা: ট্রেনের সমান্তরালে একটি মসৃণ পাশমুখী ট্র্যাকিং চলাচল, শুধু সামান্য হাতে ধরা ক্যামেরার অনুভূতি। পটভূমি পাশ দিয়ে সরে যাওয়ার সময় ট্রেন কেন্দ্রে থাকে। অডিও: মৃদু বৈদ্যুতিক গুঞ্জন, ছোট রেলের কম্পন, কাচে পানির ফোঁটা, ঘরের চাপা পরিবেশগত শব্দ।
পরীক্ষা: PixVerse, 5 সেকেন্ড, 720p, 16:9, অডিও চালু। এই দৃশ্যে ক্যামেরার বিশৃঙ্খলা তৈরি করার মতো অনেক আকর্ষণীয় উপাদান রয়েছে—কাচের প্রতিফলন, ছোট ভবন, জমে থাকা জলীয় বাষ্প, চলন্ত ট্রেন, ম্যাক্রো মাপ—তাই এটি একটি ভালো চাপের পরীক্ষা: পটভূমি গতির উদ্দীপনা তৈরি করার সময় একটিমাত্র পাশমুখী ট্র্যাকিং চলাচল ছোট বিষয়বস্তুকে স্পষ্ট রাখতে পারে কি না।
ফলাফলটি পুরো সেটের সবচেয়ে পরিষ্কার ফলগুলোর একটি। ট্রেনটি ফ্রেমের নিচে স্পষ্ট থাকে, আর শ্যাওলায় ঢাকা টেরারিয়াম তার পেছনে প্যারাল্যাক্স ও গভীরতা তৈরি করে। পুশ, প্যান, চারপাশে ঘোরা ও টিল্ট স্তূপ করার বদলে প্রম্পট একটি পাশমুখী চলাচলে স্থির থাকায় ক্যামেরা কখনো নিজের সঙ্গে সংঘাতে জড়ায় না।
ভুল 4: অস্তিত্বহীন নেতিবাচক প্রম্পট লেখা
অনেক নির্মাতা Stable Diffusion-এর অভ্যাস ভিডিও প্রম্পটে নিয়ে আসেন এবং “নেতিবাচক: কাঁপুনি, বাঁকা অঙ্গ, ঝিকিমিকি, বিকৃতি”-এর মতো লাইন লেখেন। বেশির ভাগ AI ভিডিও জেনারেটরে প্রকৃত নেতিবাচক প্রম্পটের ক্ষেত্র নেই—এই টেক্সটও কেবল প্রম্পটেরই আরও অংশ।
এটি যেমন দেখায়:
একজন ঘড়ি মেরামতকারী ডেস্ক ল্যাম্পের নিচে ভাসমান ঘড়ির যন্ত্রাংশের একটি ঘনক মেরামত করছেন। নেতিবাচক: কাঁপুনি, ত্রুটিপূর্ণ হাত, বাঁকা আঙুল, ঝিকিমিকি, বিকৃতি, ভাঙা গিয়ার, অস্থিতিশীল আলো।
এটি উল্টো পরিস্থিতি আরও খারাপ করতে পারে। মডেল তখনো “কাঁপুনি”, “বাঁকা আঙুল” এবং “বিকৃতি” শব্দগুলোকে টেক্সট হিসেবেই পড়ে, আর সেসব ধারণা বাদ দেওয়ার বদলে আপনি যে সংশ্লিষ্ট বৈশিষ্ট্যগুলো এড়াতে চেয়েছিলেন, ঠিক সেগুলোই এনে দিতে পারে।
কেন এটি ব্যর্থ হয়: ইন্টারফেসে আলাদা নেতিবাচক প্রম্পটের ইনপুট না থাকলে, আপনার লেখা সবকিছুই ইতিবাচক নির্দেশনা হিসেবে বিবেচিত হয়। “নেতিবাচক:”-কে কঠোর বর্জনের নির্দেশ হিসেবে বোঝার কোনো অন্তর্নির্মিত ধারণা মডেলের নেই—স্থিতিশীলতা চাইলে স্থিতিশীল ফলাফলটি সরাসরি বর্ণনা করতে হবে।
সমাধান: প্রতিটি নেতিবাচক নির্দেশনাকে কাঙ্ক্ষিত অবস্থা জানায় এমন ইতিবাচক সীমাবদ্ধতায় রূপান্তর করুন।
একজন ঘড়ি মেরামতকারী উষ্ণ ডেস্ক ল্যাম্পের নিচে ক্ষুদ্র ভাসমান ঘড়ির যন্ত্রাংশের একটি ঘনকের ভেতরে পিতলের চিমটা দিয়ে একটি স্বচ্ছ গিয়ার বসাচ্ছেন। ক্যামেরা হাত থেকে ঘনকের দিকে ধীরে এগিয়ে আসে। হাত স্বাভাবিকভাবে নড়ে, গিয়ারের প্রান্ত তীক্ষ্ণ থাকে, ঘনক কেন্দ্রে থাকে এবং উষ্ণ ল্যাম্পের আলো ঝিকিমিকি ছাড়া একই রকম থাকে। অডিও: পিতলের চিমটার ক্লিক, ক্ষুদ্র গিয়ারের টিক, নীরব কর্মশালার পরিবেশগত শব্দ।
পরীক্ষা: PixVerse, 5 সেকেন্ড, 720p, 16:9, ছোট যান্ত্রিক শব্দ ও কর্মশালার পরিবেশগত শব্দের জন্য অডিও চালু। হাত, ক্ষুদ্র গিয়ার ও স্বচ্ছ প্রান্ত—সবই দৃশ্যগত ত্রুটির ঝুঁকিপূর্ণ উপাদান, তাই স্পষ্টভাবে বলা সীমাবদ্ধতা নেতিবাচক তালিকার তুলনায় দৃশ্যমান ভুল সত্যিই কমায় কি না, তা যাচাই করার জন্য এটি উপযোগী।
ল্যাম্পের নিচে চিমটা, স্বচ্ছ ঘনক ও গিয়ারের খুঁটিনাটি দৃশ্যগতভাবে আলাদা থাকে। হাতটি ক্যামেরার যথেষ্ট কাছে থাকায় মডেলের ওপর চাপ পড়ে, কিন্তু কাঙ্ক্ষিত আচরণ সরাসরি বলা—স্বাভাবিক হাত, তীক্ষ্ণ প্রান্ত, স্থির আলো—এমন নেতিবাচক তালিকার চেয়ে পরিষ্কার ফল দেয়, যেখানে এড়াতে চাওয়া শব্দগুলোই আবার বলা হয়।
ভুল 5: গতির নির্দেশনা হিসেবে “দ্রুত” ব্যবহার করা
গতি চাইলে “দ্রুত”-কে স্বাভাবিক শব্দ মনে হয়, কিন্তু এটি ভিডিও জেনারেশনকে অস্থিতিশীলতার দিকে ঠেলে দেয়—বিশেষত প্রম্পটে আগে থেকেই জটিল কাজ, ক্যামেরার চলাচল বা একাধিক চলমান উপাদান থাকলে।
এটি যেমন দেখায়:
একজন লংবোর্ড আরোহী পাহাড়ি রাস্তা দিয়ে দ্রুত নামছেন, দ্রুত ক্যামেরা, তাড়াতাড়ি বাঁক, দ্রুত গতিজনিত ঝাপসা, গতিশীল বেগ, তীব্র অ্যাকশন, ক্ষিপ্র চলাচল।
এখন বিষয়বস্তু, ক্যামেরা, প্রভাব ও দৃশ্যের সময়বিন্যাস—সবকিছুকে একসঙ্গে গতি বাড়াতে বলা হচ্ছে, আর সেই চাপে মডেলকে শারীরিক গঠন, বস্তুর আকৃতি, ক্যামেরার পথ ও পটভূমির ধারাবাহিকতা একসঙ্গে ধরে রাখতে হয়।
কেন এটি ব্যর্থ হয়: গতি শুধু শৈলী বোঝানো শব্দ নয়—এটি সময়সংক্রান্ত দাবি। “দ্রুত” বলার বদলে গতি দৃশ্যমান করে এমন ভৌত প্রমাণ বর্ণনা করুন: সংকুচিত ভঙ্গি, ছিটকে পড়ার ধরন, পটভূমিতে প্রসারিত রেখা, নিয়ন্ত্রিত ক্যামেরা ফ্রেমিং।
সমাধান: “দ্রুত”-এর বদলে গতির নির্দিষ্ট ভৌত বৈশিষ্ট্য দিন।
ঢাল বেয়ে নামা একজন লংবোর্ড আরোহী বৃষ্টিতে পিচ্ছিল পাহাড়ি রাস্তার বাঁকে শরীর হেলিয়ে দেন, হাঁটু ভাঁজ করা, পেছনের হাতটি অ্যাসফল্টের কয়েক ইঞ্চি ওপরে ভাসছে। প্রতিটি চাকা বাইরে দিকে পাতলা পানির ছিটা ছুড়ে দেয়, আর রাস্তার পাশের প্রতিফলকগুলো পটভূমিতে কোমল দীর্ঘ রেখায় প্রসারিত হয়। ক্যামেরা একটি স্থির ট্র্যাকিং শটে বোর্ডের পাশে নিচু অবস্থান ধরে রাখে। হেলমেট ও জ্যাকেট অপরিবর্তিত থাকে। অডিও: চাকার গুঞ্জন, ভেজা রাস্তার শোঁ শোঁ শব্দ, বাতাসের চাপ, বোর্ডের একটি বাঁক নেওয়ার শব্দ।
পরীক্ষা: PixVerse, 5 সেকেন্ড, 720p, 16:9, অডিও চালু। এখানে প্রশ্ন হলো, মডেলকে একসঙ্গে পাঁচটি জিনিসের গতি বাড়াতে না বলে ভৌত গতির ভাষা দিয়ে দ্রুততার অনুভূতি প্রকাশ করা যায় কি না।
ফলাফলটি “দ্রুত” শব্দের বদলে ভৌত প্রমাণ দিয়ে গতির অনুভূতি তৈরি করে: নিচু ক্যামেরা কোণ, ভেজা রাস্তার প্রতিফলন, শরীর গুটিয়ে চালানোর ভঙ্গি এবং পানির ছিটা একসঙ্গে নামার গতিকে দ্রুত মনে করায়, অথচ আরোহী ও বোর্ড দুটোই সম্পূর্ণ স্পষ্ট থাকে।
ভুল 6: ইতিমধ্যে আপলোড করা রেফারেন্স ছবির আবার বর্ণনা দেওয়া
ছবি থেকে ভিডিও তৈরির ক্ষেত্রে আপলোড করা ছবিতে ইতিমধ্যে দৃশ্যমান সবকিছু আবার বলা দ্বন্দ্ব তৈরি করে। ছবিতে যদি স্পটলাইটের নিচে সুগঠিত কালো হ্যান্ডব্যাগ দেখা যায়, আর প্রম্পটে সামান্য ভিন্ন ভাষায় সেই ব্যাগের আবার বর্ণনা দেন, তাহলে একই বিষয়বস্তুর জন্য মডেল এখন দুটি নির্দেশনা পায়—পিক্সেল ও টেক্সট—আর তাদের মধ্যে যেকোনো অমিল বিচ্যুতির সুযোগ তৈরি করে।
এটি যেমন দেখায় (ছবি থেকে ভিডিও তৈরির প্রম্পট):
বাঁকানো হাতল, রুপালি ক্ল্যাস্প, সুগঠিত দেহ, সেলাই করা প্যানেল ও অন্ধকার স্টুডিও পটভূমিসহ একটি কালো চামড়ার হ্যান্ডব্যাগ নাটকীয় স্পটলাইটের নিচে রাখা আছে।
এসব যদি রেফারেন্স ছবিতে আগে থেকেই থাকে, তাহলে প্রম্পট মডেলকে সেই বিবরণ নতুনভাবে ব্যাখ্যা করতে উৎসাহ দেয়, যা তার শুধু সংরক্ষণ করা উচিত—ফলে অবয়ব, উপাদান, আলংকারিক উপাদান, এমনকি পটভূমিও বদলে যেতে পারে।
কেন এটি ব্যর্থ হয়: রেফারেন্স ছবি নিজেই ইতিমধ্যে একটি শক্তিশালী নির্দেশনা। দৃশ্যমান বিষয়বস্তু আবার বর্ণনা করলে নির্দেশনার দ্বিতীয় একটি মাধ্যম খুলে যায়, যা ছবিতে আসলে যা রয়েছে তার সঙ্গে পিক্সেল ধরে নাও মিলতে পারে। এক্ষেত্রে প্রম্পটের কাজ হলো ছবি যা দেখাতে পারে না তা নির্দেশ করা: গতি ও ক্যামেরার আচরণ।
সমাধান: ছবি থেকে ভিডিও তৈরির ক্ষেত্রে প্রম্পটকে তিনটি কাজে সীমাবদ্ধ রাখুন—গতির নির্দেশনা, ক্যামেরার নির্দেশনা এবং ধারাবাহিকতার একটি নিয়ম।
রেফারেন্সের বস্তুটি সম্পূর্ণ অক্ষত রাখুন। বর্তমান ফ্রেমিং থেকে ক্যামেরার কোমল পুশ-ইন যোগ করুন, আর দৃশ্যমান পৃষ্ঠজুড়ে একটি সরু উজ্জ্বল আলোর রেখা ধীরে সরতে থাকুক। রেফারেন্স ছবির হুবহু অবয়ব, উপাদান, আলংকারিক খুঁটিনাটি, পটভূমি, আলোর দিক ও কম্পোজিশন বজায় রাখুন। অডিও: প্রদর্শনকক্ষের কোমল পরিবেশগত শব্দ, কাচের ক্ষীণ অনুরণন, কাপড়ের মৃদু খসখস।
পরীক্ষা: PixVerse, 5 সেকেন্ড, 720p, 9:16 উল্লম্ব, ছবি থেকে ভিডিও তৈরি; উপাদানের সূক্ষ্ম শব্দ ও ঘরের পরিবেশগত শব্দের জন্য অডিও চালু। এটি কাজ করে শুধু এই কারণে যে রেফারেন্স ছবি ইতিমধ্যে বস্তুটি নির্ধারণ করে দিয়েছে—প্রম্পট ইচ্ছাকৃতভাবে রং, আকৃতি বা উপাদান আবার বর্ণনা করে না এবং মডেলকে অদৃশ্য যান্ত্রিক ব্যবস্থা উদ্ভাবন করতে বলে না।
হ্যান্ডব্যাগ তার অবয়ব, ক্ল্যাস্পের অবস্থান, হাতলের আকৃতি ও চামড়ার টেক্সচার ধরে রাখে, অন্ধকার স্টুডিও পটভূমিও অক্ষত থাকে, আর ক্যামেরা ও আলোর উজ্জ্বল রেখা সমস্ত গতি জোগায়। রেফারেন্সনির্ভর পণ্যের ভিডিওতে উচ্চাকাঙ্ক্ষার চেয়ে প্রম্পটের সংযম বেশি গুরুত্বপূর্ণ হয়ে ওঠে।
ভুল 7: মান বোঝানোর সাধারণ শব্দ দিয়ে প্রম্পট ভরিয়ে ফেলা
“অসাধারণ”, “সুন্দর”, “উচ্চমানের”, “মহাকাব্যিক” এবং “পেশাদার”-এর মতো শব্দ AI ভিডিও প্রম্পটে নিয়মিত দেখা যায়, কিন্তু এগুলো প্রায় কোনো নির্দিষ্ট দিকনির্দেশ দেয় না। এগুলো বহুল ব্যবহৃত পরিচয়সূচক শব্দ, যা এত বিচিত্র আউটপুটের সঙ্গে যুক্ত যে নির্ভরযোগ্য নিয়ন্ত্রণ দিতে পারে না।
এটি যেমন দেখায়:
উচ্চমানের দৃশ্য, চমকপ্রদ গতি, পেশাদার আলো এবং নিখুঁত কম্পোজিশনসহ একটি অসাধারণ, সুন্দর, মহাকাব্যিক উৎসবের দৃশ্য।
এতে মডেলকে বলা হয় আউটপুট ভালো হওয়া উচিত, কিন্তু এই নির্দিষ্ট দৃশ্যে “ভালো” আসলে দেখতে কেমন, তা বলা হয় না।
কেন এটি ব্যর্থ হয়: শুধু “মহাকাব্যিক” বলতে বিস্তৃত ভূদৃশ্য, যুদ্ধ, উজ্জ্বল আকাশ, বিশাল মাপ, নাটকীয় সংগীত, ধীর গতি বা কল্পকাহিনির বর্ম বোঝাতে পারে। বিশেষণটির বদলে দৃশ্যমান ও নির্দিষ্ট কিছু না দিলে আপনি কোনটি বোঝাতে চেয়েছেন, তা মডেলের পক্ষে অনুমান করার উপায় নেই।
সমাধান: প্রতিটি সাধারণ বিশেষণের বদলে নামসহ দৃশ্যমান সংকেত দিন—কম্পোজিশন, আলোর বিন্যাস, লেন্সের বৈশিষ্ট্য, রঙের সমাহার, উপাদানের আচরণ।
পানির পাতলা আয়নাসদৃশ স্তরে ঢাকা সাদা লবণসমতলে রাতের ঘুড়ি উৎসব চলছে। গভীর সমুদ্রের প্রাণীর আকৃতির তিনটি অর্ধস্বচ্ছ ঘুড়ি মাথার ওপরে ভাসছে, কাপড়ের নিচে নীল-সবুজ জৈব-আলোকোজ্জ্বল পাঁজর স্পন্দিত হচ্ছে। গোড়ালির উচ্চতার প্রতিফলন থেকে সবচেয়ে কাছের ঘুড়ির লেজ পর্যন্ত নিচু কোণে ধীর পুশ-ইন, ওয়াইড লেন্সের অনুভূতি, সায়ান-ম্যাজেন্টা রঙের বৈপরীত্য, দিগন্ত বরাবর লণ্ঠন। অডিও: কাপড়ের ফড়ফড়, টানটান সুতার কম্পন, অগভীর পানিতে পায়ের শব্দ, দূরের ভিড়ের গুঞ্জন।
পরীক্ষা: PixVerse, 5 সেকেন্ড, 720p, 16:9, কাপড়, পায়ের শব্দ ও ভিড়ের পরিবেশগত শব্দের জন্য অডিও চালু। লক্ষ্য ছিল নির্দিষ্ট দৃশ্যগত সংকেত মান বোঝানোর সাধারণ শব্দের চেয়ে শৈলীর ধারাবাহিকতা ভালোভাবে বজায় রাখে কি না দেখা।
আউটপুট মূল ধারণাটি বজায় রাখে—লবণসমতলের প্রতিফলনের ওপরে উজ্জ্বল পাঁজরসহ অর্ধস্বচ্ছ, প্রাণীর আকৃতির ঘুড়ি। ক্যামেরার কোণ অনুরোধ করা গোড়ালির উচ্চতার ফ্রেমিংয়ের চেয়ে সামান্য ওপরে হয়েছে, তাই নির্দেশনা অনুসরণ নিখুঁত ছিল না, কিন্তু শুধু “সুন্দর মহাকাব্যিক উৎসব” দিয়ে যা তৈরি হতো তার চেয়ে দৃশ্যের পরিচয় অনেক বেশি শক্তিশালী। নির্দিষ্ট বিশেষ্য, আলোর সংকেত ও রঙের সম্পর্ক রুচিনির্ভর বিশেষণের চেয়ে ধারাবাহিকভাবে ভালো ফল দেয়।
দুটি পূর্ণাঙ্গ প্রম্পটের বিশ্লেষণ
আগে: “ভবিষ্যতের একটি শহর নিয়ে আকর্ষণীয় চলচ্চিত্রসুলভ AI ভিডিও তৈরি করুন। এটিকে সুন্দর, বাস্তবসম্মত, নাটকীয়, উচ্চমানের ও ভাইরাল করুন।” — এতে ভুল 2 ও ভুল 7 একসঙ্গে রয়েছে, অথচ দৃশ্যকে ধরে রাখার জন্য কোনো বিষয়বস্তু, কাজ, ক্যামেরার পথ বা শেষ ফ্রেম নেই।
পরে: “ভবিষ্যতের একটি শহর উন্মোচনের 6-সেকেন্ডের দৃশ্য। ক্যামেরা বৃষ্টিভেজা রাস্তার ওপর দিয়ে নিচুতে মসৃণভাবে এগিয়ে যায়, রাস্তার পৃষ্ঠে নীল হলোগ্রাফিক সাইনের প্রতিফলন দেখা যায়। একটি ডেলিভারি ড্রোন লেন্সের খুব কাছ দিয়ে যায় এবং কাচের টাওয়ারের দিকে ওঠে। সামনে দিকে মসৃণ ট্র্যাকিং, শীতল নীল রঙের সমাহার, টাওয়ারের প্রবেশপথে উষ্ণ আলো, মৃদু বৃষ্টি, দূরের যানবাহনের শব্দ, ড্রোনের একবার পাশ দিয়ে যাওয়া।”
আগে: “একজন লংবোর্ড আরোহী পাহাড়ি রাস্তা দিয়ে দ্রুত নামেন, যানবাহন এড়ান, পড়ে থাকা গাছের ওপর দিয়ে লাফ দেন, স্ফুলিঙ্গের মধ্য দিয়ে পিছলে যান, ড্রোন শটে কাট হয়, চাকার ক্লোজ-আপে কাট হয়, হেলমেটের প্রতিফলনে কাট হয়, তারপর লোগো ও আতশবাজি দিয়ে শেষ হয়, সবকিছু 5 সেকেন্ডে, দ্রুত ক্যামেরা, নিখুঁত শব্দ।” — এটি একটি অতিরিক্ত ভারী, টানা বাক্যে ভুল 1, 3, 4 ও 5 একসঙ্গে যুক্ত করে।
পরে: ওপরে ভুল 5-এ দেওয়া একই লংবোর্ড আরোহীর সংশোধিত প্রম্পট—একটি কাজ, একটি ক্যামেরা চলাচল, ইতিবাচক সীমাবদ্ধতা, নির্দিষ্ট অডিও সংকেত।
পুনর্ব্যবহারযোগ্য প্রম্পট টেমপ্লেট
শুরু করার সাধারণ ভিত্তি হিসেবে এই কাঠামো ব্যবহার করুন:
[Subject] + [one action] + [location]. [One camera movement] + [specific style, lens, lighting, or composition]. [Positive constraints: what must stay stable, what should be absent, whether audio is needed].
উদাহরণ: “গাঢ় কাঠের টেবিলে একটি সিরামিক কফির কাপ রাখা আছে, আর ধীর পাক খেয়ে বাষ্প উঠছে। ধীর ম্যাক্রো পুশ-ইন, পাশ থেকে উষ্ণ টাংস্টেন আলো, অগভীর ডেপথ অব ফিল্ড, পটভূমিতে শান্ত সকালের ক্যাফে। কাপের আকৃতি অপরিবর্তিত থাকে, কোনো টেক্সট ওভারলে নয়, অডিওতে ঘরের কোমল পরিবেশগত শব্দ ও চামচের ক্ষীণ টুংটাং রয়েছে।”
মূল শিক্ষা
ভালো AI ভিডিও প্রম্পট বেশি দীর্ঘ নয়—বেশি সুসংহত। বিষয়বস্তু, কাজ ও স্থান শুরুতেই দিন। “চলচ্চিত্রসুলভ” এবং মান বোঝানোর সাধারণ শব্দের বদলে দৃশ্যমান, নির্দিষ্ট সংকেত ব্যবহার করুন। ক্যামেরার একটি চলাচলে স্থির থাকুন। নকল নেতিবাচক প্রম্পট বাদ দিয়ে ইতিবাচক সীমাবদ্ধতা দিন। “দ্রুত”-এর বদলে ভৌত গতির বিবরণ দিন। ছবি থেকে ভিডিও তৈরির সময় রেফারেন্স ছবিকে আবার বর্ণনা না করে নিজের কাজ করতে দিন।
এই সংশোধনগুলো বর্তমান বেশির ভাগ AI ভিডিও জেনারেটরে কার্যকর, কারণ এগুলো একই অন্তর্নিহিত দুর্বলতাকে লক্ষ্য করে: সময়ের সঙ্গে বিচ্যুতি, অস্পষ্ট শৈলী নির্বাচন, ক্যামেরার কাঁপুনি, বিষয়বস্তুর অসংগতি এবং অতিরিক্ত ভারী গতির নির্দেশনা। PixVerse এগুলো বাস্তবে প্রয়োগ করা সহজ করে, কারণ টুল বদলানো বা কাজের প্রক্রিয়া নতুন করে সাজানো ছাড়াই একই প্রম্পট Seedance 2.0, HappyHorse 1.0, PixVerse V6, PixVerse C1, Kling O3 এবং Kling 3.0-তে পরীক্ষা করতে পারেন।
FAQ
একটি AI ভিডিও প্রম্পট সত্যিই ভালো হয় কীভাবে? একটি ভালো প্রম্পট মডেলকে স্পষ্ট শট দেয়: বিষয়বস্তু, কাজ, স্থান, একটি ক্যামেরা চলাচল, দৃশ্যমান শৈলীর সংকেত এবং কয়েকটি ইতিবাচক সীমাবদ্ধতা। “কালো মার্বেলের ওপর কাচের সুগন্ধির বোতল, প্রদর্শনের জন্য ধীর ঘূর্ণন, উষ্ণ প্রান্ত-আলো, স্থির প্রতিফলন” প্রতিবারই “চলচ্চিত্রসুলভ বিলাসবহুল পণ্যের ভিডিও”-র চেয়ে ভালো ফল দেয়।
একটি AI ভিডিও প্রম্পট কতটা দীর্ঘ হওয়া উচিত? বেশির ভাগ টেক্সট থেকে ভিডিও তৈরির প্রম্পটের জন্য 50-80 শব্দ একটি ভালো প্রাথমিক সীমা। বিষয়বস্তু, কাজ ও স্থান দিয়ে শুরু করুন, তারপর ক্যামেরার চলাচল, আলো, গতির বিবরণ ও অডিও যোগ করুন। অস্পষ্ট প্রথম বাক্যকে পরে আরও শব্দ যোগ করে খুব কমই উদ্ধার করা যায়।
প্রম্পটের শব্দ হিসেবে “চলচ্চিত্রসুলভ” কেন ভালো কাজ করে না? এটি এত বিস্তৃত যে নির্দিষ্ট কিছু নির্দেশ করতে পারে না। এর বদলে দৃশ্যমান চলচ্চিত্রের ভাষা দিন—“35mm হাতে ধরা ক্যামেরার অনুভূতি”, “নিয়ন প্রতিফলনসহ বৃষ্টিভেজা গলি”, “ধীর ডলি-ইন”, “পেছন থেকে তীব্র আলো”, “পটভূমিতে দৃশ্যের মধ্যে থাকা উষ্ণ বাতি”।
AI ভিডিও জেনারেটর কি প্রকৃত নেতিবাচক প্রম্পট সমর্থন করে? কিছু টুলে আলাদা নেতিবাচক প্রম্পটের ক্ষেত্র থাকে, কিন্তু সাধারণ প্রম্পট বক্স সাধারণত সবকিছুকে নির্দেশনা হিসেবে পড়ে। এর বদলে ইতিবাচক সীমাবদ্ধতা লিখুন—“হাত স্বাভাবিক থাকে”, “ক্যামেরা স্থির থাকে”, “পটভূমি খালি থাকে”, “পণ্যের অবয়ব অক্ষত থাকে”।
বিষয়বস্তু না বদলে ছবি থেকে ভিডিও তৈরির প্রম্পট কীভাবে দেব? আপলোড করা ছবিতে ইতিমধ্যে যা আছে, তা আবার বর্ণনা করবেন না। ছবি যা দেখাতে পারে না, তার জন্য প্রম্পট ব্যবহার করুন—গতি, ক্যামেরার আচরণ, আলোর পরিবর্তন, অডিও এবং ধারাবাহিকতার একটি নিয়ম (“রেফারেন্সের বস্তুটি অক্ষত রাখুন, কোমল পুশ-ইন যোগ করুন, অবয়ব ও উপাদান বজায় রাখুন”)।