教程

如何用 AI 将照片制作成会说话的数字人

如何用 AI 将照片制作成会说话的数字人

会说话的数字人能将静态肖像或角色图像变成开口说话的视频。基本流程很简单:从清晰图像开始,提供脚本或音频,生成口型同步,检查结果,然后按受众使用的平台格式导出。

PixVerse 提供 Avatar Lip Sync 工作流,适用于图像和视频。它可使用提供的音频、输入的台词或声音克隆素材,让创作者在无需重新进行镜头前表演的情况下,将已获批准的角色图像制作成说话视频。本指南将介绍让成片看起来自然、听起来可信的重要制作决策。

什么是会说话的数字人?

会说话的数字人是嘴部动作与语音同步的人物、角色或数字形象。它可以基于真实肖像、插画角色,或您获准使用的生成角色。

会说话的数字人适合短讲解、教育内容、产品介绍、社交帖子、客服视频和创作者实验。当口播信息简洁,图像、声音和视觉风格都像同一场呈现的一部分时,效果最好。

开始前,请确认您有权使用该人物的肖像和声音。对于真实人物应获得明确同意,避免误导性冒充,并遵守发布逼真 AI 生成媒体的每个平台披露规则。

制作会说话的数字人需要什么

您需要三项输入:

  1. 源图像或数字人: 用来确定面部和视觉风格的肖像或角色图像。
  2. 声音来源: 用于文字转语音的输入脚本、录制的音频文件,或您获授权使用的自定义声音。
  3. 输出方案: 最终视频的平台、画幅比例、时长和用途。

可选的背景或风格处理可以帮助数字人融入发布渠道。口播是重点时请保持场景简洁;当品牌化或插画背景能强化语境且不抢占面部注意力时再使用。

准备源图像

源图像会显著影响口型同步质量。请使用清晰、正面、光线均匀、嘴部可见且遮挡尽量少的肖像。墨镜、手遮住脸、强烈阴影或大角度侧脸都会让嘴部追踪更困难。

要获得更好的起点:

  • 使用双眼和完整嘴部都清晰可见的图像。
  • 选择居中的面部和自然、中性的表情。
  • 避免低分辨率社交媒体缩略图和严重压缩的截图。
  • 在可能的情况下,让主体与繁杂背景清楚分离。
  • 只使用您创作或获准制作动画的图像。

插画或生成角色同样可用。此时应确保面部有清晰的眼睛、嘴唇和五官边界,而不是过于抽象的特征。

如何在 PixVerse 中制作会说话的数字人

1. 打开 Avatar Lip Sync 并添加图像或视频

打开 PixVerse 的 Avatar Lip Sync,然后上传已获批准的肖像、角色图像或源视频。该工作流支持 JPG、PNG 和 WebP 等常见图像格式,也支持用于视频口型同步的兼容视频格式。

如果您只有一张照片,可使用图生视频或数字人工作流制作以动态为主的结果。若已有出镜者视频,口型同步可以使其嘴部动作对齐新的声音轨或脚本。

2. 选择声音输入

选择符合项目的声音方式:

  • 输入脚本: 输入最终台词并选择可用的文字转语音声音。这是制作草稿或短讲解最快的方式。
  • 上传音频: 当自然的节奏、语气或发音很重要时,使用干净的录音。
  • 自定义声音: 仅在您明确获准使用原说话者声音时创建或选择自定义声音。

请为口语而非文章写脚本。使用短句、日常用词和标出自然停顿的标点。密集的一段文字会让原本不错的数字人显得仓促。

3. 设置风格、格式和时长

根据视频的观看场景选择输出。竖屏 9:16 适合 TikTok、Instagram Reels 和 YouTube Shorts。16:9 适合常规 YouTube 视频、演示文稿和嵌入式播放器。正方形 1:1 可用于信息流版位。

在生成前规划好口播片段。每段聚焦一个观点通常比长篇独白更令人信服。短片段也更便于检查,并在表情、节奏或构图需要调整时重新生成。

4. 生成并检查口型同步

生成预览后,打开声音完整观看。先以正常速度检查嘴部动作,因为逐帧看来完美的结果在运动中仍可能不自然。

导出前检查以下内容:

  • 嘴部动作是否与每句口语的开始和结束吻合?
  • 视线、头部运动和表情是否支持脚本的语气?
  • 声音是否清晰,没有分散注意力的背景噪声?
  • 最终裁切和字幕放置后,面部是否仍清楚可见?

如果有不对劲的地方,一次只调整一项输入。更清晰的源图像、更简单的句子、更慢的朗读或更干净的音频文件,往往比增加视觉效果更有效。

5. 导出并准备最终剪辑

导出最佳版本后,在编辑器中加入字幕、标题卡、辅助视觉素材或背景音乐。字幕应避开嘴部和重要面部表情。如果最终视频包含逼真的合成人物或克隆声音,请在发布前补充适当说明,并使用相关平台标签。

文字转语音、上传音频与声音克隆

每种声音方式都有不同的制作取舍。

文字转语音

当脚本经常改动,或需要多个语言及语速版本时,文字转语音非常实用。脚本有自然标点和短分句时最容易控制。生成前大声读出台词;如果它用您的声音读起来别扭,合成声音大概也会别扭。

上传音频

上传的旁白可保留说话者自然的节奏与表达。请在安静空间录制,保持麦克风距离一致,并在上传前去除不必要的背景噪声。干净的音频文件可为口型同步系统提供更清晰的跟随信号。

声音克隆

自定义声音工作流可以让固定的发言人或角色在系列内容中保持一致的声音。它需要格外谨慎:只使用您拥有或已获得书面许可的声音样本,清楚说明声音为合成,并且绝不制作欺骗性冒充内容。

PixVerse 的 Speech (Lip Sync) 文档 介绍了内置及自定义声音,以及基于脚本和音频的口型同步工作流。开始批量制作前,请查看最新应用内和平台文档,因为可用设置和限制可能会变化。

如何让会说话的数字人更自然

自然的结果来自一致的输入,而不是夸张的效果。请让视觉风格、脚本和声音与数字人扮演的角色相匹配。

  • 教育讲解: 使用平静的声音、干净的背景、适中的语速和直接的视线。
  • 产品或营销视频: 使用简洁的卖点、符合品牌的场景和精致但易读的字幕风格。
  • 社交短视频: 在前几秒说出关键句,使用竖屏构图,让脚本聚焦一个核心收益。
  • 角色内容: 让插画或角色设定引导声音和措辞,而不是强行采用泛化的企业表达。

避免过长的句子、情绪的快速变化,以及与声音不匹配的源图像。正式肖像搭配匆忙、随意的朗读,即使口型技术上准确,也会显得不协调。

常见的会说话数字人错误

从糟糕的源图像开始

模糊、光线不足或角度倾斜的图像会给模型提供更少的面部细节。请先更换源图像,而不是修改所有其他设置。

脚本写得太密集

会说话的数字人适合简短、口语化的观点。将长演示拆成一系列片段,并用视觉转场或字幕补充细节。

忽视同意与披露

未经许可,不要让真实人物的照片动起来或克隆其声音。请查看目标平台当前规则,并在观众可能合理地将其误认为未经编辑的真实录音时,披露合成或修改媒体。

为所有平台导出同一种裁切

请按最终发布场景创建源构图。适合竖屏短视频的肖像在横向裁切中可能丢失面部,而在 YouTube 有效的字幕在其他平台可能被界面控件遮挡。

下一步

会说话的数字人只是完整视频工作流的一部分。可将它用于口播时刻,再结合辅助场景、产品镜头、屏幕录制或生成的 b-roll,帮助观众理解信息。

如需全新的视觉场景,请从 PixVerse 文生视频 开始。对于需要动态效果的角色或产品图像,可使用 图生视频。最后在剪辑中将最好的素材结合起来,让信息清楚、尊重受众,并适合计划发布的平台。

相关资源