튜토리얼

AI로 사진에서 말하는 아바타를 만드는 방법

AI로 사진에서 말하는 아바타를 만드는 방법

말하는 아바타는 정지된 인물 사진이나 캐릭터 이미지를 말하는 동영상으로 바꿉니다. 기본 과정은 간단합니다. 선명한 이미지로 시작하고, 스크립트나 오디오 트랙을 제공하고, 립싱크를 생성한 뒤 결과를 검토하여 시청자가 사용하는 형식으로 내보내면 됩니다.

PixVerse는 이미지와 영상을 위한 Avatar Lip Sync 워크플로를 제공합니다. 제공한 오디오, 입력한 문장 또는 음성 복제 입력을 사용할 수 있으므로, 크리에이터는 승인된 캐릭터 이미지를 새로 카메라 앞에서 촬영하지 않고도 말하는 영상으로 만들 수 있습니다. 이 가이드에서는 결과가 더 자연스럽게 보이고 들리도록 하는 제작상의 선택을 다룹니다.

말하는 아바타란 무엇인가요?

말하는 아바타는 입 움직임이 음성과 동기화된 사람, 캐릭터 또는 디지털 인물입니다. 사용할 권한이 있는 실제 인물 사진, 일러스트 캐릭터 또는 생성된 캐릭터를 기반으로 만들 수 있습니다.

말하는 아바타는 짧은 설명 영상, 교육, 제품 소개, 소셜 게시물, 고객 지원 영상, 크리에이터 실험에 유용합니다. 말할 내용이 간결하고 이미지, 음성, 시각적 스타일이 모두 하나의 프레젠테이션처럼 느껴질 때 가장 효과적입니다.

시작하기 전에 해당 인물의 초상과 음성을 사용할 권한이 있는지 확인하세요. 실제 인물에게는 명확한 동의를 받고, 오해를 부르는 사칭을 피하며, 사실적인 AI 생성 미디어를 게시하는 각 플랫폼의 고지 규정을 따르세요.

말하는 아바타를 만드는 데 필요한 것

세 가지 입력이 필요합니다.

  1. 원본 이미지 또는 아바타: 얼굴과 시각적 스타일을 정하는 인물 사진 또는 캐릭터 이미지입니다.
  2. 음성 소스: 텍스트 음성 변환용으로 입력한 스크립트, 녹음된 오디오 파일 또는 사용할 권한이 있는 맞춤 음성입니다.
  3. 출력 계획: 완성된 영상의 게시 플랫폼, 화면 비율, 길이 및 목적입니다.

선택적으로 배경이나 스타일 처리를 더하면 아바타가 채널에 잘 어울립니다. 말할 내용이 중심일 때는 배경을 단순하게 유지하고, 얼굴과 경쟁하지 않으면서 맥락을 강화할 때는 브랜드 배경이나 일러스트 배경을 사용하세요.

원본 이미지 준비하기

원본 이미지는 립싱크 품질에 큰 영향을 줍니다. 조명이 고르고 입이 잘 보이며 가림이 적은 선명한 정면 인물 사진을 사용하세요. 선글라스, 얼굴을 가린 손, 강한 그림자 또는 심한 측면 각도는 입 추적을 더 어렵게 만듭니다.

더 좋은 출발점을 위해 다음을 따르세요.

  • 두 눈과 입 전체가 보이는 이미지를 사용하세요.
  • 자연스럽고 중립적인 표정의 중앙 배치 얼굴을 선택하세요.
  • 해상도가 낮은 소셜 미디어 썸네일과 심하게 압축된 스크린샷은 피하세요.
  • 가능하다면 피사체가 복잡한 배경과 명확히 분리되도록 하세요.
  • 직접 만들었거나 애니메이션화할 권한이 있는 이미지만 사용하세요.

일러스트나 생성 캐릭터도 사용할 수 있습니다. 이 경우에는 지나치게 추상적인 특징보다는 눈, 입술, 얼굴 윤곽이 명확하게 드러나는지 확인하세요.

PixVerse에서 말하는 아바타를 만드는 방법

1. Avatar Lip Sync를 열고 이미지 또는 영상을 추가하세요

PixVerse의 Avatar Lip Sync를 열고 승인된 인물 사진, 캐릭터 이미지 또는 원본 영상을 업로드하세요. 이 워크플로는 JPG, PNG, WebP를 포함한 일반 이미지 형식과 영상 기반 립싱크를 위한 지원 영상 형식을 제공합니다.

사진만으로 시작한다면 이미지 투 비디오 또는 아바타 워크플로를 사용해 움직임이 있는 결과를 만드세요. 발표자 영상이 이미 있다면 립싱크를 통해 새 음성 트랙이나 스크립트에 맞춰 입 움직임을 정렬할 수 있습니다.

2. 음성 입력 선택하기

프로젝트에 맞는 음성 방식을 선택하세요.

  • 입력한 스크립트: 최종 문장을 입력하고 사용할 수 있는 텍스트 음성 변환 음성을 선택하세요. 초안이나 짧은 설명 영상에 가장 빠른 방법입니다.
  • 업로드한 오디오: 자연스러운 속도, 톤 또는 발음이 중요할 때 깨끗한 녹음을 사용하세요.
  • 맞춤 음성: 원래 화자의 음성을 사용할 명시적 허가가 있을 때만 맞춤 음성을 만들거나 선택하세요.

스크립트는 글이 아니라 말하기를 위해 작성하세요. 짧은 문장, 일상적인 단어, 자연스러운 멈춤을 나타내는 문장부호를 사용하세요. 빽빽한 문단은 다른 부분이 훌륭한 아바타도 성급하게 느껴지게 할 수 있습니다.

3. 스타일, 형식 및 길이 설정하기

영상이 시청될 장소를 기준으로 출력을 정하세요. 세로 9:16 구성은 TikTok, Instagram Reels, YouTube Shorts에 유용합니다. 16:9 구성은 일반 YouTube 업로드, 프레젠테이션, 임베드 플레이어에 적합합니다. 정사각형 1:1 구성은 피드 게시물에 잘 맞을 수 있습니다.

생성하기 전에 말하는 클립을 계획하세요. 하나의 클립에는 하나의 핵심 생각을 담는 편이 긴 독백보다 대체로 더 설득력 있습니다. 짧은 구간은 표정, 타이밍 또는 프레이밍을 조정해야 할 때 검토하고 다시 생성하기도 쉽습니다.

4. 립싱크 생성 및 검토하기

미리보기를 생성한 뒤 오디오를 켜고 끝까지 시청하세요. 프레임별로 완벽해 보이는 결과도 움직이는 영상에서는 부자연스럽게 느껴질 수 있으므로, 먼저 일반 속도에서 입 움직임을 검토하세요.

내보내기 전에 다음 사항을 확인하세요.

  • 입 움직임이 각 말하는 구절의 시작과 끝에 맞나요?
  • 시선, 머리 움직임, 표정이 스크립트의 톤을 뒷받침하나요?
  • 음성이 선명하고 주의를 흐트러뜨리는 배경 소음이 없나요?
  • 최종 크롭과 자막 배치 후에도 얼굴이 잘 보이나요?

어색한 부분이 있다면 한 번에 하나의 입력만 수정하세요. 더 선명한 원본 이미지, 더 단순한 문장, 더 느린 낭독 또는 더 깨끗한 오디오 파일이 시각 효과를 추가하는 것보다 더 효과적일 수 있습니다.

5. 내보내기 및 최종 편집 준비하기

가장 좋은 버전을 내보낸 다음 편집기에서 자막, 타이틀 카드, 보조 시각 요소 또는 배경 음악을 추가하세요. 자막이 입과 중요한 표정을 가리지 않도록 하세요. 최종 영상에 사실적인 합성 인물이나 복제 음성이 포함된다면 게시 전에 적절한 맥락을 추가하고 관련 플랫폼 라벨을 사용하세요.

텍스트 음성 변환, 업로드 오디오 및 음성 복제

각 음성 방식에는 서로 다른 제작상의 장단점이 있습니다.

텍스트 음성 변환

텍스트 음성 변환은 스크립트가 자주 바뀌거나 여러 언어 및 속도 버전이 필요할 때 실용적입니다. 자연스러운 문장부호와 짧은 절을 포함한 스크립트일수록 제어하기 쉽습니다. 생성하기 전에 문장을 소리 내어 읽어 보세요. 자신의 목소리로 어색하게 들린다면 합성 음성에서도 어색하게 들릴 가능성이 큽니다.

업로드한 오디오

업로드한 보이스오버는 화자의 자연스러운 리듬과 표현을 보존합니다. 조용한 공간에서 녹음하고, 마이크 거리를 일정하게 유지하며, 업로드 전에 불필요한 배경 소음을 제거하세요. 깨끗한 오디오 파일은 립싱크 시스템이 따라갈 더 명확한 신호를 제공합니다.

음성 복제

맞춤 음성 워크플로는 반복 등장하는 대변인이나 캐릭터의 목소리를 시리즈 전체에서 일관되게 유지하는 데 도움이 됩니다. 가장 높은 수준의 주의가 필요합니다. 소유하고 있거나 사용 허가를 문서로 받은 음성 샘플만 사용하고, 음성이 합성된 경우 투명하게 알리며, 기만적인 사칭을 절대 만들지 마세요.

PixVerse Speech (Lip Sync) 문서에는 내장 음성과 맞춤 음성 지원, 그리고 스크립트 및 오디오 기반 립싱크 워크플로가 설명되어 있습니다. 사용 가능한 설정과 제한은 바뀔 수 있으므로 제작을 시작하기 전에 현재 앱 내 문서와 플랫폼 문서를 확인하세요.

말하는 아바타를 더 자연스럽게 보이게 하는 방법

자연스러운 결과는 과도한 효과보다 일관된 입력에서 나옵니다. 시각적 스타일, 스크립트, 음성이 아바타가 맡는 역할에 맞도록 하세요.

  • 교육 설명 영상: 차분한 음성, 깔끔한 배경, 안정적인 속도, 직접적인 시선을 사용하세요.
  • 제품 또는 마케팅 영상: 간결한 장점, 브랜드에 맞는 배경, 세련되면서 읽기 쉬운 자막 스타일을 사용하세요.
  • 소셜 숏폼: 첫 몇 초에 핵심 문장을 시작하고, 세로 구성을 사용하며, 스크립트는 하나의 보상에 집중하세요.
  • 캐릭터 콘텐츠: 일반적인 기업식 전달을 억지로 적용하기보다 일러스트나 페르소나가 음성과 단어 선택을 이끌게 하세요.

지나치게 긴 문장, 빠른 감정 변화, 음성과 어울리지 않는 원본 이미지는 피하세요. 격식 있는 인물 사진에 급하고 캐주얼한 낭독을 결합하면 입 움직임이 기술적으로 정확해도 어색하게 느껴질 수 있습니다.

흔히 하는 말하는 아바타 실수

좋지 않은 원본 이미지로 시작하기

흐릿하거나 조명이 나쁘거나 각도가 있는 이미지는 모델이 활용할 얼굴 세부 정보를 줄입니다. 다른 설정을 모두 바꾸기 전에 원본 이미지를 교체하세요.

지나치게 빽빽한 스크립트 작성하기

말하는 아바타는 간결하게 말하는 아이디어에 적합합니다. 긴 프레젠테이션은 여러 클립으로 나누고, 보조 설명은 시각적 전환이나 자막으로 더하세요.

동의와 고지를 무시하기

허가 없이 실제 인물의 사진을 애니메이션화하거나 음성을 복제하지 마세요. 대상 플랫폼의 최신 규칙을 검토하고, 시청자가 편집하지 않은 실제 녹화물로 오해할 가능성이 있는 경우 합성 또는 변경 미디어임을 고지하세요.

모든 플랫폼에 하나의 크롭 내보내기

최종 게시처에 맞춰 원본 구성을 만드세요. 세로 숏폼에서 잘 작동하는 인물 사진은 가로 크롭에서는 얼굴이 잘릴 수 있고, YouTube에서 잘 보이는 자막도 다른 플랫폼에서는 인터페이스 컨트롤 아래에 놓일 수 있습니다.

다음 단계

말하는 아바타는 완전한 영상 워크플로의 한 부분입니다. 말하는 장면에 사용한 다음, 시청자가 메시지를 이해하는 데 도움이 되는 보조 장면, 제품 샷, 화면 녹화 또는 생성된 보조 영상과 결합하세요.

새로운 시각 장면은 PixVerse 텍스트 투 비디오로 시작하세요. 움직임이 필요한 캐릭터 또는 제품 이미지는 이미지 투 비디오를 사용하세요. 그런 다음 최고의 에셋을 편집에서 조합해 메시지를 명확하고 존중하는 방식으로 전달하고, 게시될 플랫폼에 맞게 준비하세요.

관련 자료