프로페셔널 음성 복제
최고 수준의 모델을 사용해 전문적으로 음성을 복제하는 방법을 알아보세요.
프로페셔널 음성 복제 만들기
음성을 복제할 때는 AI가 어떤 언어와 어떤 유형의 데이터셋으로 학습되었는지 고려하는 것이 중요합니다. 각 모델과 그 강점에 관한 자세한 내용은 모델 페이지에서 확인하세요.
가이드
프로페셔널 음성 복제 페이지로 이동하기
ElevenLabs 대시보드에서 왼쪽의 Voices 섹션을 선택한 다음 Create Voice를 클릭하세요.
팝업에서 Professional Voice Clone을 선택하세요.
오디오 업로드하기
프로페셔널 음성 복제는 현재 노래를 지원하지 않습니다. 오디오 녹음에는 말하는 음성만 포함되어야 합니다.

Upload samples를 클릭하여 오디오 샘플을 업로드하세요.
미리 녹음한 학습용 오디오가 없다면 Record yourself를 선택하여 인터페이스에서 직접 녹음할 수도 있습니다. 내레이션, 대화, 광고용 샘플 스크립트가 제공되며, 직접 작성한 스크립트를 업로드할 수도 있습니다.
샘플 길이 피드백 확인하기
오디오를 업로드하면 샘플 길이에 대한 피드백이 표시됩니다. 최상의 결과를 위해 최소 1시간의 학습용 오디오를 업로드하고, 가능하면 3시간에 가깝게 준비하는 것이 좋습니다.

오디오 처리하기
오디오 샘플을 업로드한 후 품질을 높이기 위해 처리할 수 있습니다. 배경 소음을 제거할 수 있으며, 오디오에 여러 화자가 포함된 경우 화자를 분리할 수도 있습니다. 이러한 옵션에 액세스하려면 처리할 클립 옆의 Audio settings 버튼을 클릭하세요.

음성 인증하기
모든 녹음과 업로드가 완료되면 음성을 인증하라는 안내가 표시됩니다. 원활한 진행을 위해 샘플 녹음에 사용한 것과 같거나 유사한 장비를 사용하고, 샘플과 비슷한 톤과 전달 방식으로 음성을 인증하세요. 같은 장비를 사용할 수 없다면 가능한 한 최선의 환경에서 인증해 보세요. 인증에 실패하면 24시간 후 다시 시도하거나 지원팀에 문의할 수 있습니다.
샘플 업로드를 시작하기 전에 유의해야 할 몇 가지 사항과 최상의 결과를 위해 따라야 할 단계가 있습니다.
고품질 오디오 녹음하기
프로페셔널 음성 복제는 학습에 사용한 샘플을 매우 정확하게 복제합니다. 음성의 모든 세부 특징과 특성을 포함해 들리는 내용을 거의 완벽하게 복제하지만, 샘플에 포함된 아티팩트와 원치 않는 오디오도 함께 복제합니다. 즉, 배경 소음, 실내 잔향/에코 또는 음악이나 여러 사람이 말하는 소리처럼 원치 않는 소리가 포함된 저품질 샘플을 업로드하면 AI는 이러한 요소도 복제에 재현하려고 합니다.
말하는 음성이 하나만 포함되도록 하기
여러 화자가 있거나 과도한 소음 또는 위에서 언급한 요소가 있으면 AI가 혼동할 수 있으므로, 오디오 전체에 말하는 음성이 하나만 포함되도록 하세요. 이로 인해 AI가 어떤 음성을 복제해야 하는지 구분하지 못하거나 다른 소리에 가려진 실제 음성의 특성을 잘못 해석하여 최적의 품질보다 낮은 복제가 생성될 수 있습니다.
충분한 자료 제공하기
음성을 제대로 복제할 수 있도록 충분한 자료를 준비하세요. 권장하는 최소 길이는 오디오 30분이지만, 최적의 결과와 가장 정확한 복제를 위해서는 2~3시간에 가까운 오디오를 권장합니다. 제공하는 오디오가 많을수록 결과물의 품질이 좋아집니다.
스타일 일관성 유지하기
제공한 샘플의 말하기 스타일은 출력에 복제됩니다. 따라서 원하는 전달 방식에 맞게 학습 데이터를 준비해야 합니다(예: 자신의 음성을 복제해 오디오북을 녹음하려면, 학습용으로 제출하는 오디오는 사용하려는 목소리 톤으로 책을 읽는 녹음이어야 합니다). 일관성을 위해 업로드하는 샘플에는 하나의 스타일만 포함하는 것이 좋습니다.
PVC에 사용할 언어로 말한 샘플 사용하기
PVC가 주로 사용할 언어로 말한 샘플을 사용하는 것이 가장 좋습니다. 물론 AI는 현재 지원하는 모든 언어를 구사할 수 있습니다. 하지만 음성 자체가 AI가 말하게 할 언어의 원어민 음성이 아닌 경우, 즉 다른 언어를 말하는 음성을 복제한 경우에는 원래 언어의 억양이 남거나 단어와 억양을 잘못 발음할 수 있습니다. 예를 들어 영어를 말하는 음성을 복제한 후 스페인어를 말하게 하면, 스페인어를 말할 때 영어 억양이 매우 강하게 나타날 수 있습니다. 지원되는 언어 중 하나로 녹음된 샘플만 복제할 수 있으며, 지원하지 않는 언어로 녹음된 샘플은 애플리케이션에서 거부됩니다.
좋은 녹음과 좋지 않은 녹음에서 예상할 수 있는 결과는 아래 예시를 참고하세요.
현재는 본인 음성만 복제할 수 있습니다. Finetune 요청을 제출하기 전에 인증 절차를 거치게 됩니다.
팁 및 제안
전문 녹음 장비
전문 녹음 장비
AI는 오디오의 모든 요소를 복제하므로 최상의 결과를 위해 고품질 녹음 장비를 사용하세요. 고품질 입력 = 고품질 출력입니다. 어떤 마이크든 사용할 수 있지만, 전용 오디오 인터페이스에 연결한 XLR 마이크를 권장합니다. 저가형 장비로는 Focusrite 인터페이스 또는 유사 장비에 연결한 Audio Technica AT2020이나 Rode NT1 등을 추천합니다.
팝 필터 사용
팝 필터 사용
녹음할 때 팝 필터를 사용하세요. 파열음을 최소화할 수 있습니다.
마이크 거리
마이크 거리
마이크와 적절한 거리를 유지하세요. 마이크에서 주먹 두 개 정도 떨어진 거리를 권장하지만, 원하는 녹음 유형에 따라 달라질 수 있습니다.
소음 없는 녹음
소음 없는 녹음
오디오 입력에 배경 음악이나 소음 같은 간섭이 없도록 하세요. AI 음성 복제는 깨끗하고 잡음 없는 오디오에서 가장 잘 작동합니다.
실내 음향
실내 음향
가능하면 음향 처리가 된 공간에서 녹음하세요. 원치 않는 에코와 배경 소음을 줄여 AI에 더 선명한 오디오 입력을 제공할 수 있습니다. 두꺼운 이불이나 퀼트를 사용해 녹음 공간을 임시로 흡음 처리할 수도 있습니다.
오디오 전처리
오디오 전처리
AI가 특정한 사운드를 출력하도록 하려면 미리 오디오를 편집하는 것을 고려하세요. 예를 들어 완성도 높은 팟캐스트 같은 출력을 원한다면 그 품질에 맞게 오디오를 전처리하세요. 긴 침묵이나 단어 사이에 “음”, “어” 같은 말버릇이 많다면 AI도 이를 따라 합니다.
볼륨 제어
볼륨 제어
선명하게 들릴 만큼 충분히 크되 왜곡을 일으킬 정도로 크지 않은 일정한 볼륨을 유지하세요. 균형 잡히고 안정적인 오디오 레벨을 목표로 하세요. 이상적인 값은 true peak -3dB 기준 RMS -23dB~-18dB입니다.
충분한 오디오 길이
충분한 오디오 길이
최상의 결과를 위해 위 가이드라인을 따르는 고품질 오디오를 최소 30분 제공하세요. 가능하면 2시간 이상의 오디오가 좋습니다. AI에 제공하는 고품질 데이터가 많을수록 음성 복제 품질도 좋아집니다. 샘플 개수는 중요하지 않으며, 총 재생 시간이 중요합니다. 다만 여러 시간 분량의 오디오를 업로드할 계획이라면 약 30분 길이의 여러 샘플로 나누는 것이 좋습니다. 업로드가 더 쉬워집니다.






