AI দিয়ে ছবি থেকে কথা বলা অবতার কীভাবে তৈরি করবেন
কথা বলা অবতার একটি স্থির পোর্ট্রেট বা চরিত্রের ছবিকে কথা বলে এমন ভিডিওতে পরিণত করে। মৌলিক কর্মধারা সহজ: পরিষ্কার ছবি দিয়ে শুরু করুন, স্ক্রিপ্ট বা অডিও ট্র্যাক দিন, ঠোঁটের নড়াচড়ার সমন্বয় তৈরি করুন, ফলাফল দেখুন এবং আপনার দর্শকের ব্যবহৃত ফরম্যাটে এক্সপোর্ট করুন।
PixVerse ছবি ও ভিডিওর জন্য Avatar Lip Sync কর্মধারা দেয়। এতে সরবরাহ করা অডিও, টাইপ করা সংলাপ বা কণ্ঠ ক্লোন করার ইনপুট ব্যবহার করা যায়, ফলে নির্মাতারা ক্যামেরার সামনে নতুন করে রেকর্ড না করেই অনুমোদিত চরিত্রের ছবিকে কথা বলা ভিডিওতে পরিণত করতে পারেন। এই নির্দেশিকায় ফলাফলকে দেখতে ও শুনতে আরও স্বাভাবিক করার জন্য প্রয়োজনীয় নির্মাণসংক্রান্ত সিদ্ধান্তগুলো আলোচনা করা হয়েছে।
কথা বলা অবতার কী?
কথা বলা অবতার হলো এমন ব্যক্তি, চরিত্র বা ডিজিটাল অবয়ব, যার মুখের নড়াচড়া কথার সঙ্গে সমন্বিত। এটি বাস্তব পোর্ট্রেট, আঁকা চরিত্র বা আপনার ব্যবহারের অনুমতি আছে এমন তৈরি করা চরিত্রের ওপর ভিত্তি করে বানানো যেতে পারে।
কথা বলা অবতার ছোট ব্যাখ্যামূলক ভিডিও, শিক্ষা, পণ্যের পরিচিতি, সামাজিক পোস্ট, গ্রাহক সহায়তার ভিডিও ও নির্মাতাদের পরীক্ষামূলক কাজে উপযোগী। বক্তব্য সংক্ষিপ্ত হলে এবং ছবি, কণ্ঠ ও দৃশ্যশৈলী একই উপস্থাপনার অংশ বলে মনে হলে এগুলো সবচেয়ে ভালো কাজ করে।
শুরু করার আগে নিশ্চিত করুন যে ব্যক্তির চেহারা ও কণ্ঠ ব্যবহারের অধিকার আপনার আছে। বাস্তব ব্যক্তির স্পষ্ট সম্মতি নিন, বিভ্রান্তিকরভাবে কারও পরিচয় অনুকরণ এড়িয়ে চলুন এবং বাস্তবসম্মত AI-তৈরি মিডিয়া প্রকাশ করেন এমন প্রতিটি প্ল্যাটফর্মের তথ্য প্রকাশের নিয়ম মেনে চলুন।
কথা বলা অবতার তৈরি করতে যা দরকার
আপনার তিনটি ইনপুট দরকার:
- মূল ছবি বা অবতার: মুখ ও দৃশ্যশৈলী নির্ধারণ করে এমন পোর্ট্রেট বা চরিত্রের ছবি।
- কণ্ঠের উৎস: লেখা থেকে কণ্ঠ তৈরির জন্য টাইপ করা স্ক্রিপ্ট, রেকর্ড করা অডিও ফাইল অথবা আপনার ব্যবহারের অনুমতি আছে এমন বিশেষ কণ্ঠ।
- আউটপুট পরিকল্পনা: তৈরি হওয়া ভিডিওর প্ল্যাটফর্ম, দৈর্ঘ্য-প্রস্থের অনুপাত, সময়কাল ও উদ্দেশ্য।
চাইলে পটভূমি বা শৈলীর সমন্বয় অবতারকে চ্যানেলের সঙ্গে মানিয়ে নিতে সাহায্য করতে পারে। বক্তব্যই মূল হলে পরিবেশ সহজ রাখুন; মুখ থেকে মনোযোগ না সরিয়ে প্রেক্ষাপট জোরদার করলে ব্র্যান্ডের উপাদানযুক্ত বা চিত্রভিত্তিক পরিবেশ ব্যবহার করুন।
মূল ছবি প্রস্তুত করুন
ঠোঁটের নড়াচড়ার সমন্বয়ের মানে মূল ছবির বড় প্রভাব আছে। সমান আলো, দৃশ্যমান মুখ এবং যতটা সম্ভব কম বাধাসহ পরিষ্কার, সামনে থেকে তোলা পোর্ট্রেট ব্যবহার করুন। সানগ্লাস, মুখের ওপর হাত, তীব্র ছায়া বা অনেকটা পাশ থেকে তোলা কোণ মুখের নড়াচড়া শনাক্ত করা কঠিন করে তোলে।
সবচেয়ে ভালোভাবে শুরু করতে:
- এমন ছবি ব্যবহার করুন, যেখানে দুই চোখ ও পুরো মুখ দৃশ্যমান।
- স্বাভাবিক, নিরপেক্ষ অভিব্যক্তিসহ কেন্দ্রে থাকা মুখ বেছে নিন।
- কম রেজোলিউশনের সামাজিক মাধ্যমের থাম্বনেইল ও অতিরিক্ত সংকুচিত স্ক্রিনশট এড়িয়ে চলুন।
- সম্ভব হলে ব্যস্ত পটভূমি থেকে ব্যক্তিকে স্পষ্টভাবে আলাদা রাখুন।
- শুধু নিজের তৈরি বা অ্যানিমেট করার অনুমতি আছে এমন ছবি ব্যবহার করুন।
আঁকা বা তৈরি করা চরিত্রও কাজে আসতে পারে। সে ক্ষেত্রে মুখের বৈশিষ্ট্য অত্যন্ত বিমূর্ত না হয়ে চোখ, ঠোঁট ও মুখের সীমানা স্পষ্ট আছে কি না নিশ্চিত করুন।
PixVerse-এ কথা বলা অবতার কীভাবে তৈরি করবেন
1. Avatar Lip Sync খুলুন এবং আপনার ছবি বা ভিডিও যোগ করুন
PixVerse-এ Avatar Lip Sync খুলুন, তারপর অনুমোদিত পোর্ট্রেট, চরিত্রের ছবি বা মূল ভিডিও আপলোড করুন। এই কর্মধারা JPG, PNG ও WebP-সহ প্রচলিত ছবির ফরম্যাট এবং ভিডিওভিত্তিক ঠোঁটের নড়াচড়ার সমন্বয়ের জন্য সমর্থিত ভিডিও ফরম্যাট গ্রহণ করে।
শুধু একটি ছবি দিয়ে শুরু করলে নড়াচড়াসমৃদ্ধ ফলাফল তৈরি করতে ছবি থেকে ভিডিও বা অবতার তৈরির কর্মধারা ব্যবহার করুন। আপনার কাছে ইতিমধ্যে উপস্থাপকের ভিডিও থাকলে ঠোঁটের নড়াচড়ার সমন্বয় তার মুখের নড়াচড়াকে নতুন কণ্ঠের ট্র্যাক বা স্ক্রিপ্টের সঙ্গে মিলিয়ে দিতে পারে।
2. কণ্ঠস্বরের ইনপুট বেছে নিন
প্রকল্পের সঙ্গে মানানসই কণ্ঠস্বর তৈরির পদ্ধতি বেছে নিন:
- টাইপ করা স্ক্রিপ্ট: চূড়ান্ত সংলাপ লিখুন এবং উপলব্ধ টেক্সট-টু-স্পিচ কণ্ঠস্বর বেছে নিন। খসড়া বা ছোট ব্যাখ্যামূলক ভিডিওর জন্য এটিই সবচেয়ে দ্রুত পদ্ধতি।
- আপলোড করা অডিও: স্বাভাবিক গতি, স্বরের ভঙ্গি বা উচ্চারণ গুরুত্বপূর্ণ হলে পরিষ্কার রেকর্ডিং ব্যবহার করুন।
- কাস্টম কণ্ঠস্বর: মূল বক্তার কণ্ঠস্বর ব্যবহারের স্পষ্ট অনুমতি থাকলেই কাস্টম কণ্ঠস্বর তৈরি বা নির্বাচন করুন।
স্ক্রিপ্ট লিখুন মুখে বলার জন্য, নিবন্ধের জন্য নয়। ছোট বাক্য, প্রচলিত শব্দ এবং স্বাভাবিক বিরতি বোঝায় এমন যতিচিহ্ন ব্যবহার করুন। ভারী অনুচ্ছেদ একটি ভালো অ্যাভাটারকেও তাড়াহুড়ো করে কথা বলছে বলে মনে করাতে পারে।
3. স্টাইল, ফরম্যাট ও সময়কাল নির্ধারণ করুন
ভিডিওটি যেখানে দেখা হবে, সেই অনুযায়ী আউটপুট বেছে নিন। উল্লম্ব 9:16 কম্পোজিশন TikTok, Instagram Reels এবং YouTube Shorts-এর জন্য উপযোগী। 16:9 কম্পোজিশন সাধারণ YouTube আপলোড, উপস্থাপনা এবং এমবেড করা প্লেয়ারের জন্য মানানসই। ফিডে দেখানোর জন্য বর্গাকার 1:1 কম্পোজিশন কাজে আসতে পারে।
তৈরি করার আগে কথা বলার ক্লিপটি পরিকল্পনা করুন। প্রতি ক্লিপে একটি নির্দিষ্ট ভাবনা সাধারণত দীর্ঘ একক বক্তব্যের চেয়ে বেশি বিশ্বাসযোগ্য হয়। অভিব্যক্তি, সময়ের সমন্বয় বা ফ্রেমিং ঠিক করতে হলে ছোট অংশগুলো পর্যালোচনা ও আবার তৈরি করাও সহজ।
4. লিপ সিঙ্ক তৈরি ও পর্যালোচনা করুন
একটি প্রিভিউ তৈরি করুন, তারপর অডিও চালু রেখে পুরোটা দেখুন। প্রথমে স্বাভাবিক গতিতে মুখের নড়াচড়া পর্যালোচনা করুন, কারণ প্রতিটি ফ্রেম আলাদা করে নিখুঁত দেখালেও চলমান অবস্থায় ফলাফল অস্বাভাবিক লাগতে পারে।
এক্সপোর্ট করার আগে এই বিষয়গুলো যাচাই করুন:
- ঠোঁটের নড়াচড়া কি প্রতিটি উচ্চারিত বাক্যাংশের শুরু ও শেষের সঙ্গে মেলে?
- দৃষ্টির দিক, মাথার নড়াচড়া ও অভিব্যক্তি কি স্ক্রিপ্টের স্বরের সঙ্গে মানানসই?
- কণ্ঠস্বর কি স্পষ্ট এবং মনোযোগ নষ্ট করে এমন পটভূমির শব্দমুক্ত?
- চূড়ান্ত ক্রপ ও ক্যাপশন বসানোর পরও কি মুখ দেখা যায়?
কিছু ঠিক লাগছে না মনে হলে একবারে একটি ইনপুট ঠিক করুন। আরও ভিজুয়াল ইফেক্ট যোগ করার চেয়ে পরিষ্কার মূল ছবি, সহজ বাক্য, ধীর গতিতে বলা বা পরিষ্কার অডিও ফাইল বেশি কার্যকর হতে পারে।
5. এক্সপোর্ট করুন এবং চূড়ান্ত সম্পাদনা প্রস্তুত করুন
সেরা সংস্করণটি এক্সপোর্ট করুন, তারপর আপনার এডিটরে প্রয়োজনীয় ক্যাপশন, শিরোনাম কার্ড, সহায়ক দৃশ্য বা পটভূমির সংগীত যোগ করুন। ক্যাপশন যেন মুখ ও গুরুত্বপূর্ণ মুখের অভিব্যক্তি ঢেকে না দেয়। চূড়ান্ত ভিডিওতে বাস্তবসম্মত কৃত্রিম ব্যক্তি বা ক্লোন করা কণ্ঠস্বর থাকলে উপযুক্ত প্রেক্ষাপট যোগ করুন এবং প্রকাশের আগে সংশ্লিষ্ট প্ল্যাটফর্মের লেবেল ব্যবহার করুন।
টেক্সট-টু-স্পিচ, আপলোড করা অডিও ও কণ্ঠস্বর ক্লোনিং
কণ্ঠস্বর তৈরির প্রতিটি পদ্ধতিতে নির্মাণের সুবিধা ও সীমাবদ্ধতা আলাদা।
টেক্সট-টু-স্পিচ
স্ক্রিপ্ট ঘন ঘন বদলালে বা একাধিক ভাষা কিংবা গতির সংস্করণ প্রয়োজন হলে টেক্সট-টু-স্পিচ ব্যবহারিক। স্ক্রিপ্টে স্বাভাবিক যতিচিহ্ন ও ছোট বাক্যাংশ থাকলে এটি নিয়ন্ত্রণ করা সবচেয়ে সহজ। তৈরি করার আগে লাইনগুলো জোরে পড়ুন; আপনার নিজের কণ্ঠে অস্বস্তিকর শোনালে কৃত্রিম কণ্ঠেও সম্ভবত অস্বস্তিকর শোনাবে।
আপলোড করা অডিও
আপলোড করা ভয়েসওভার বক্তার স্বাভাবিক ছন্দ ও অভিব্যক্তি বজায় রাখে। নিরিবিলি জায়গায় রেকর্ড করুন, মাইক্রোফোন থেকে একই দূরত্ব বজায় রাখুন এবং আপলোডের আগে অপ্রয়োজনীয় পটভূমির শব্দ সরিয়ে ফেলুন। পরিষ্কার অডিও ফাইল লিপ-সিঙ্ক ব্যবস্থাকে অনুসরণ করার জন্য আরও স্পষ্ট সংকেত দেয়।
কণ্ঠস্বর ক্লোনিং
কাস্টম কণ্ঠস্বরের কর্মপ্রবাহ ধারাবাহিকভাবে উপস্থিত কোনো মুখপাত্র বা চরিত্রের কণ্ঠ পুরো সিরিজজুড়ে একই রাখতে সাহায্য করতে পারে। এগুলোর ক্ষেত্রে সর্বোচ্চ সতর্কতা প্রয়োজন: শুধু নিজের মালিকানাধীন বা ব্যবহারের লিখিত অনুমতি থাকা কণ্ঠের নমুনা ব্যবহার করুন, কণ্ঠস্বর কৃত্রিম হলে তা স্পষ্টভাবে জানান এবং কখনো প্রতারণামূলকভাবে কারও অনুকরণ তৈরি করবেন না।
PixVerse-এর স্পিচ (লিপ সিঙ্ক) ডকুমেন্টেশন বিল্ট-ইন ও কাস্টম কণ্ঠস্বরের সমর্থন এবং স্ক্রিপ্ট ও অডিওভিত্তিক লিপ-সিঙ্ক কর্মপ্রবাহ বর্ণনা করে। নির্মাণের কাজ শুরু করার আগে অ্যাপের ভেতরের ও প্ল্যাটফর্মের বর্তমান ডকুমেন্টেশন দেখুন, কারণ উপলব্ধ সেটিংস ও সীমা বদলাতে পারে।
কথা বলা অ্যাভাটারকে আরও স্বাভাবিক দেখাবেন কীভাবে
অতিরিক্ত ইফেক্টের বদলে সামঞ্জস্যপূর্ণ ইনপুট থেকে স্বাভাবিক ফলাফল আসে। অ্যাভাটার যে ভূমিকা পালন করছে, তার সঙ্গে ভিজুয়াল স্টাইল, স্ক্রিপ্ট ও কণ্ঠস্বর মিলিয়ে নিন।
- শিক্ষামূলক ব্যাখ্যামূলক ভিডিও: শান্ত কণ্ঠস্বর, পরিচ্ছন্ন পটভূমি, পরিমিত গতি এবং সরাসরি দৃষ্টি ব্যবহার করুন।
- পণ্য বা বিপণনের ভিডিও: সংক্ষেপে সুবিধাগুলো তুলে ধরুন, ব্র্যান্ডের সঙ্গে মানানসই পরিবেশ এবং পরিপাটি কিন্তু সহজে পড়া যায় এমন ক্যাপশন স্টাইল ব্যবহার করুন।
- সামাজিক মাধ্যমের ছোট ভিডিও: প্রথম কয়েক সেকেন্ডেই মূল কথাটি বলুন, উল্লম্ব কম্পোজিশন ব্যবহার করুন এবং স্ক্রিপ্টকে একটি মূল প্রাপ্তির ওপর কেন্দ্রীভূত রাখুন।
- চরিত্রভিত্তিক কনটেন্ট: সাধারণ কর্পোরেট ভঙ্গি চাপিয়ে না দিয়ে চিত্র বা চরিত্রের ব্যক্তিত্ব অনুযায়ী কণ্ঠস্বর ও শব্দচয়ন নির্ধারণ করুন।
অতিরিক্ত দীর্ঘ বাক্য, আবেগের দ্রুত পরিবর্তন এবং কণ্ঠস্বরের সঙ্গে মানানসই নয় এমন মূল ছবি এড়িয়ে চলুন। আনুষ্ঠানিক প্রতিকৃতির সঙ্গে তাড়াহুড়ো করে অনানুষ্ঠানিকভাবে বলা কথা অসংগত লাগতে পারে, এমনকি মুখের নড়াচড়া প্রযুক্তিগতভাবে সঠিক হলেও।
কথা বলা অ্যাভাটার তৈরিতে সাধারণ ভুল
খারাপ মানের মূল ছবি দিয়ে শুরু করা
ঝাপসা, অপর্যাপ্ত আলোতে তোলা বা কৌণিক ছবিতে মডেল কাজ করার জন্য মুখের কম বিস্তারিত তথ্য পায়। অন্য সব সেটিংস বদলানোর আগে মূল ছবিটি পরিবর্তন করুন।
অতিরিক্ত ভারী স্ক্রিপ্ট লেখা
সংক্ষিপ্ত, মুখে বলা ভাবনার জন্য কথা বলা অ্যাভাটার ভালো কাজ করে। দীর্ঘ উপস্থাপনাকে একাধিক ক্লিপে ভাগ করুন এবং সহায়ক বিস্তারিত তথ্য যোগ করতে অন্য দৃশ্যের কাটঅ্যাওয়ে বা ক্যাপশন ব্যবহার করুন।
সম্মতি ও প্রকাশের বিষয় উপেক্ষা করা
অনুমতি ছাড়া কোনো বাস্তব ব্যক্তির ছবি অ্যানিমেট করবেন না বা তাঁর কণ্ঠস্বর ক্লোন করবেন না। লক্ষ্য প্ল্যাটফর্মের বর্তমান নিয়ম পর্যালোচনা করুন এবং দর্শকেরা যুক্তিসংগতভাবে সেটিকে অসম্পাদিত বাস্তব রেকর্ডিং মনে করতে পারেন এমন ক্ষেত্রে কৃত্রিম বা পরিবর্তিত মিডিয়ার বিষয়টি প্রকাশ করুন।
সব প্ল্যাটফর্মের জন্য একই ক্রপ এক্সপোর্ট করা
চূড়ান্ত গন্তব্যের জন্য মূল কম্পোজিশন তৈরি করুন। উল্লম্ব ছোট ভিডিওতে মানানসই প্রতিকৃতির মুখ অনুভূমিক ক্রপে বাদ পড়তে পারে, আর YouTube-এ ঠিকঠাক থাকা ক্যাপশন অন্য প্ল্যাটফর্মে ইন্টারফেসের নিয়ন্ত্রণগুলোর নিচে পড়তে পারে।
এরপর কী করবেন
কথা বলা অ্যাভাটার একটি সম্পূর্ণ ভিডিও কর্মপ্রবাহের একটি অংশ। কথা বলার মুহূর্তে এটি ব্যবহার করুন, তারপর সহায়ক দৃশ্য, পণ্যের শট, স্ক্রিন রেকর্ডিং বা তৈরি করা বি-রোলের সঙ্গে মিলিয়ে নিন, যা দর্শকদের বার্তাটি বুঝতে সাহায্য করে।
নতুন ভিজুয়াল দৃশ্যের জন্য PixVerse টেক্সট-টু-ভিডিও দিয়ে শুরু করুন। কোনো চরিত্র বা পণ্যের ছবিতে নড়াচড়া যোগ করতে ইমেজ-টু-ভিডিও ব্যবহার করুন। তারপর সেরা উপকরণগুলো একসঙ্গে সম্পাদনা করে বার্তাটি স্পষ্ট, সম্মানজনক এবং যে প্ল্যাটফর্মে প্রকাশিত হবে তার উপযোগী করে তুলুন।
এখনও প্ল্যাটফর্ম বেছে নিচ্ছেন? উপস্থাপককেন্দ্রিক টুলের জন্য AI অ্যাভাটার ভিডিও জেনারেটরের তুলনা দেখুন।