AI 영상 립싱크 — 이미지 속 인물이 말하게 만드는 법 (2026년 10월)
AI 립싱크는 사진이나 AI로 만든 인물 이미지에 음성을 붙여, 그 인물이 실제로 말하는 것처럼 입 모양과 표정을 움직이는 기술입니다. 제품 소개 숏폼, 강의 영상, 캐릭터 채널처럼 얼굴이 나와야 하지만 촬영하기 어려운 경우에 많이 쓰입니다. 이 글에서는 2026년 10월 기준으로 많이 쓰이는 립싱크 도구의 차이와 작업 순서, 자주 생기는 문제와 지켜야 할 규칙을 정리했습니다.
립싱크 영상을 만드는 세 가지 방식
립싱크 영상은 만드는 방식에 따라 준비물과 결과가 달라집니다. 먼저 어떤 방식이 내 작업에 맞는지 정하는 것이 좋습니다.
| 방식 | 준비물 | 특징 | 대표 도구 |
|---|---|---|---|
| 이미지 + 음성 | 인물 이미지 1장, 음성 파일 또는 대본 | 가장 간단함, 말하는 아바타 영상에 적합 | 클링 Avatar 2.0, HeyGen, Hedra, CapCut |
| 영상 + 음성 | 이미 만든 영상, 음성 파일 | 움직이는 장면에 입 모양만 맞춤 | 클링 Lip Sync |
| 연기 영상으로 움직이기 | 인물 이미지, 사람이 연기한 영상 | 표정·고개 움직임까지 따라 함 | 런웨이 Act-Two |
| 프롬프트로 대사까지 생성 | 프롬프트, 필요하면 이미지 | 소리와 영상을 한 번에 생성, 길이가 짧음 | 구글 Veo 3.1 |
대사가 길고 정확해야 하는 강의나 상품 설명은 이미지 + 음성 방식이, 짧은 드라마 장면처럼 인물의 움직임이 중요한 경우는 영상 + 음성이나 연기 영상 방식이 잘 맞습니다.
주요 립싱크 도구 비교
2026년 10월 기준 각 서비스의 공식 안내를 바탕으로 정리했습니다. 크레딧과 요금은 자주 바뀌므로 결제 전에 공식 페이지에서 다시 확인하세요.
| 도구 | 립싱크 기능 이름 | 입력 | 길이 기준 | 한국어 |
|---|---|---|---|---|
| 클링 (Kling) | Avatar 2.0 | 인물 이미지 + 음성 또는 대본(TTS) | 최대 5분 | 지원 (영어·중국어·일본어·한국어) |
| 클링 (Kling) | Lip Sync | 클링에서 만든 영상 + 음성 또는 TTS | 음성 2~60초 | 공식 페이지에서 확인 |
| HeyGen | Avatar IV | 사진 1장 + 대본 또는 음성 | 180초 이내 권장, 대본 5,000자 | 175개 이상 언어 지원 |
| Hedra | Character-3 | 이미지 + 음성 또는 대본 | 음성 길이에 맞춰 최대 10분 | 음성 언어를 그대로 따름 |
| 런웨이 (Runway) | Act-Two | 인물 이미지·영상 + 연기 영상 | 최대 30초 | 연기 영상의 입 모양을 따름 |
| 구글 Veo 3.1 | 대사 포함 영상 생성 | 프롬프트, 이미지 | 클립당 4·6·8초 | 공식 안내 언어는 영어 중심 |
| CapCut | Talking Photos | 사진 + 대본 또는 음성 | 공식 페이지에서 확인 | 공식 페이지에서 확인 |
비용 구조도 서비스마다 다릅니다.
| 도구 | 비용 기준 (2026년 10월) |
|---|---|
| 클링 Avatar 2.0 | 초당 4크레딧(Standard), 초당 8크레딧(Professional) |
| HeyGen Avatar IV | 사진 기반 분당 16크레딧, Creator 요금제 월 $29(연 결제 시 월 $24) |
| Hedra | 유료 요금제에 상업적 이용 권한과 워터마크 제거 포함, 요금은 공식 페이지에서 확인 |
| 런웨이 Act-Two | 초당 5크레딧, 최소 3초 |
| Veo 3.1 (API) | 소리 포함 초당 과금, 모델 등급(Lite·Fast·Standard)별로 다름 |
한국어 대사를 길게 말하는 영상이 목적이라면 한국어 지원이 명시된 클링 Avatar 2.0이나 다국어를 지원하는 HeyGen, Hedra를 먼저 검토하는 것을 추천합니다. Veo 3.1은 프롬프트만으로 소리까지 만들 수 있어 편리하지만 한 클립이 최대 8초라 짧은 장면에 더 어울립니다. Veo 사용법은 구글 Veo 3.1과 Flow 사용법 글에 따로 정리해 두었습니다.
립싱크 영상 만드는 순서
도구마다 화면은 다르지만 작업 흐름은 거의 같습니다.
| 단계 | 할 일 | 확인할 점 |
|---|---|---|
| 1. 인물 이미지 준비 | 정면에 가까운 얼굴, 입이 가려지지 않은 이미지 | 해상도가 높고 얼굴이 화면에서 충분히 큰지 |
| 2. 대본 쓰기 | 한 문장을 짧게, 숫자는 읽는 방식대로 적기 | 영상 길이에 맞는 분량인지 |
| 3. 음성 만들기 | 직접 녹음하거나 TTS 사용 | 잡음과 배경음악이 섞이지 않았는지 |
| 4. 립싱크 생성 | 도구에 이미지와 음성을 올리고 생성 | 짧은 구간으로 먼저 시험 생성 |
| 5. 결과 확인 | 입 모양, 치아, 눈 깜빡임 확인 | 발음이 많은 구간에서 어긋나지 않는지 |
| 6. 편집 | 자막, 배경음악, 컷 편집 | AI 생성 표시를 넣었는지 |
처음부터 긴 영상을 만들면 크레딧이 많이 들고, 문제가 생겼을 때 다시 만드는 비용도 커집니다. 5~10초 정도 짧은 구간으로 먼저 시험한 뒤 결과가 괜찮을 때 전체 대사를 넣는 방식을 추천합니다.
인물 이미지는 나노바나나나 미드저니 같은 이미지 도구로 만들 수 있습니다. 원본 이미지를 고르는 기준은 이미지 한 장으로 AI 영상 만들기 글에서 자세히 다뤘습니다.
음성 준비 요령
립싱크 품질은 이미지만큼 음성 파일의 상태에 영향을 많이 받습니다. AI는 소리에서 발음을 읽어 입 모양을 만들기 때문에, 소리가 깨끗할수록 입 모양도 자연스러워집니다.
| 항목 | 좋은 예 | 피할 예 |
|---|---|---|
| 녹음 환경 | 조용한 방, 마이크 가까이 | 울리는 공간, 주변 소음 |
| 배경음악 | 음성만 따로 준비, 음악은 편집 때 추가 | 음악이 섞인 음성 파일 |
| 말하는 속도 | 또박또박 보통 속도 | 너무 빠르게 이어 말하기 |
| 문장 길이 | 짧은 문장, 문장 사이 짧은 쉼 | 쉼 없이 긴 문장 |
| 숫자·영어 | “삼만 원”, “에이아이”처럼 읽는 대로 표기 (TTS 사용 시) | 기호와 숫자를 그대로 입력 |
TTS로 대사를 만들 때는 대본에 쉼표와 마침표를 넣어 쉬는 지점을 표시해 주면 말투가 덜 기계적으로 들립니다. Veo 3.1처럼 프롬프트로 대사를 만드는 도구는 대사를 따옴표로 감싸고 누가 말하는지 함께 적는 것이 기본입니다.
A young woman in a bright cafe looks at the camera and says warmly, "Today I'll show you three easy tips." Soft cafe ambience, no background music.
자주 생기는 문제와 해결법
립싱크 영상에서는 비슷한 문제가 반복해서 나타나는 경우가 많습니다.
| 문제 | 흔한 원인 | 해결 방법 |
|---|---|---|
| 입 모양이 소리와 어긋남 | 음성에 잡음·음악이 섞임 | 음성만 깨끗하게 다시 준비 |
| 치아나 입 안이 뭉개짐 | 얼굴이 작거나 해상도가 낮음 | 얼굴이 크게 나온 고해상도 이미지 사용 |
| 얼굴이 원본과 달라짐 | 옆모습, 가려진 얼굴 | 정면에 가까운 이미지로 교체 |
| 표정이 굳어 보임 | 감정 없는 TTS, 단조로운 대본 | 감정 설정이 있는 TTS 사용, 문장에 쉼 넣기 |
| 고개가 과하게 흔들림 | 움직임 프롬프트가 강함 | 프롬프트를 “가볍게 고개 끄덕임” 정도로 약하게 |
| 영상 후반으로 갈수록 어색함 | 한 번에 긴 영상 생성 | 대사를 30초~1분 단위로 나눠 생성 후 이어 붙이기 |
긴 영상을 여러 조각으로 나눠 만들었다면 컷 사이에 제품 화면이나 자료 화면을 끼워 넣으면 이음새가 덜 눈에 띕니다.
실존 인물과 AI 표시 규칙
립싱크는 특정 인물이 하지 않은 말을 한 것처럼 보이게 만들 수 있어 다른 AI 영상보다 주의가 더 필요합니다.
| 확인할 점 | 내용 |
|---|---|
| 실존 인물 사용 | 본인 동의 없이 실존 인물의 얼굴·목소리로 영상을 만들지 않기. HeyGen처럼 실제 인물의 디지털 트윈을 만들 때 동의 녹화를 요구하는 서비스도 있음 |
| 국내 법 | 2026년 1월 22일 시행된 인공지능기본법은 생성형 AI 결과물 표시를 요구하고, 실제와 구분하기 어려운 딥페이크는 눈에 보이는 표시를 하도록 정함 |
| 유튜브 | 실제 사람이 하지 않은 말을 하는 것처럼 보이는 사실적인 합성 영상은 업로드할 때 공개(AI 표시)해야 함 |
| 외주·광고 | 클라이언트와 AI 아바타 사용 여부, 사용 범위를 계약서에 미리 정하기 |
인공지능기본법은 주로 AI 서비스 사업자의 의무를 정하고 있지만, 영상을 올리는 개인도 플랫폼 정책에 따라 AI 표시를 해야 하는 경우가 많습니다. 영상 설명이나 화면 한쪽에 “AI로 생성한 인물입니다” 같은 문구를 넣어 두면 시청자 오해를 줄일 수 있습니다. 상업적 이용과 저작권 문제는 AI 영상 상업적 이용·저작권, 어디까지 괜찮을까 글을 참고하세요.
마무리
AI 립싱크는 인물 이미지와 음성만 있으면 촬영 없이 말하는 영상을 만들 수 있는 방법입니다. 한국어 대사를 길게 넣어야 한다면 한국어 지원이 명시된 클링 Avatar 2.0이나 다국어를 지원하는 HeyGen, Hedra를, 짧은 장면에 소리까지 한 번에 만들고 싶다면 Veo 3.1을, 표정 연기까지 살리고 싶다면 런웨이 Act-Two를 검토해 보는 것을 추천합니다.
어떤 도구를 쓰든 정면 고해상도 이미지와 깨끗한 음성 파일을 준비하고, 짧은 구간으로 먼저 시험해 보는 것이 크레딧을 아끼는 방법입니다. 실존 인물을 쓰지 않고 AI 생성 사실을 표시하는 것까지 챙기면 채널 운영과 외주 작업 모두에서 문제를 줄일 수 있습니다. 기능과 요금은 자주 바뀌므로 작업 전에 각 서비스의 공식 안내를 확인하시기 바랍니다.