텍스트 대화 생성
ElevenLabs로 몰입감 있고 자연스럽게 들리는 대화를 만드는 방법을 알아보세요.
개요
ElevenLabs 텍스트 대화 변환 API는 Eleven v4 및 Eleven v3를 사용하여 텍스트로 자연스럽고 표현력 있는 대화를 생성합니다. Eleven v4를 권장합니다. 주요 활용 사례는 다음과 같습니다.
- 비디오 게임을 위한 완벽한 대화 생성
- 팟캐스트 및 기타 오디오 콘텐츠를 위한 몰입감 있는 대화 제작
- 표현력 있는 내레이션으로 오디오북에 생동감 더하기
원하는 결과를 얻으려면 여러 번 생성해야 할 수 있습니다. 애플리케이션에 텍스트 대화 변환을 통합할 때는 여러 결과를 생성하고 사용자가 가장 좋은 결과를 선택할 수 있도록 하세요.
샘플을 들어 보세요.
음성 옵션
ElevenLabs는 여러 생성 방식을 통해 수천 개의 음성을 제공합니다. Eleven v4는 90개 이상의 언어를 지원하며, Eleven v3는 70개 이상의 언어를 지원합니다.
- 커뮤니티에서 공유한 3,000개 이상의 음성을 제공하는 보이스 라이브러리
- 가장 높은 충실도의 복제본을 위한 프로페셔널 음성 복제
- 빠른 음성 복제를 위한 즉석 음성 복제
- 텍스트 설명으로 맞춤형 음성을 생성하는 보이스 디자인
음성 옵션에 대해 자세히 알아보세요.
프롬프팅
모델은 텍스트 입력에서 감정적 맥락을 직접 해석합니다. 예를 들어, “그녀가 신나게 말했다”와 같은 설명 텍스트를 추가하거나 느낌표를 사용하면 음성의 감정에 영향을 줍니다. 안정성 및 유사성과 같은 음성 설정은 일관성을 제어하는 데 도움이 되며, 기본 감정은 텍스트 단서에서 비롯됩니다.
자세한 내용은 프롬프팅 가이드를 참조하세요.
오디오 태그를 활용한 감정 표현
Eleven v4와 Eleven v3에서는 비음성 오디오 이벤트를 사용하여 대화 전달 방식을 조정할 수 있습니다. 텍스트 입력에 대괄호로 묶은 오디오 이벤트를 삽입하면 됩니다.
텍스트 대화 변환에서는 각 대화 턴마다 별도의 텍스트와 음성을 사용합니다. 영향을 주려는 턴의 텍스트 안에 오디오 태그를 추가하세요. voice_id는 해당 턴의 화자 음성을 선택하고, 태그는 전달 방식을 안내합니다.
예를 들어, 한 화자는 텍스트가 [giggling]으로 시작하면서 하나의 음성을 사용할 수 있고, 다음 화자는 텍스트가 [whispering]으로 시작하면서 다른 음성을 사용할 수 있습니다. 태그와 voice_id를 함께 사용하는 API 예시는 텍스트 대화 변환 빠른 시작을 참조하세요.
오디오 태그는 enum 파라미터가 아니라 자연어 지침입니다. 지침을 대괄호로 묶어 전달 방식이 바뀌어야 하는 텍스트 위치에 배치하세요. 아래 예시는 전체 목록이 아닙니다. 효과적인 태그에 대한 자세한 안내는 프롬프팅 가이드를 참고하세요.
오디오 태그에는 몇 가지 형태가 있습니다.
감정 및 전달 방식
예: [sad], [laughing], [whispering]
오디오 이벤트
예: [leaves rustling], [gentle footsteps], [applause]
전체 방향
예: [football], [wrestling match], [auctioneer]
몇 가지 예시는 다음과 같습니다.
다음과 같이 끼어들기를 표현하기 위해 구두점을 사용하여 대화의 흐름을 나타낼 수도 있습니다.
말끝을 흐리는 문장을 나타내려면 줄임표를 사용할 수 있습니다.
지원되는 출력 형식
기본 응답 형식은 mp3이지만, pcm, ulaw 등 다른 형식도 사용할 수 있습니다.
- MP3
- 샘플 레이트: 22.05kHz - 44.1kHz
- 비트레이트: 32kbps - 192kbps
- 22.05kHz @ 32kbps
- 44.1kHz @ 32kbps, 64kbps, 96kbps, 128kbps, 192kbps
- PCM (S16LE)
- 샘플 레이트: 16kHz - 44.1kHz
- 비트레이트: 8kHz, 16kHz, 22.05kHz, 24kHz, 44.1kHz, 48kHz
- 16비트 깊이
- μ-law
- 8kHz 샘플 레이트
- 전화 애플리케이션에 최적화
- A-law
- 8kHz 샘플 레이트
- 전화 애플리케이션에 최적화
- Opus
- 샘플 레이트: 48kHz
- 비트레이트: 32kbps - 192kbps
고품질 오디오 옵션은 유료 요금제에서만 제공됩니다. 자세한 내용은 요금제 페이지를 참조하세요.
지원 언어
Eleven v4는 90개 이상의 언어를 지원합니다. Eleven v3는 70개 이상의 언어를 지원합니다. 전체 목록은 Eleven v4 및 Eleven v3를 참조하세요.
FAQ
어떤 모델을 사용할 수 있나요?
텍스트 대화 변환은 Eleven v4 및 Eleven v3 모델에서 사용할 수 있습니다.
오디오 출력물의 소유권은 저에게 있나요?
예. 생성한 모든 오디오의 소유권은 유지됩니다. 단, 상업적 사용 권한은 유료 요금제에서만 제공됩니다. 유료 구독을 이용하면 입력 콘텐츠의 IP 권리를 보유한 경우 생성된 오디오를 상업적 목적으로 사용하고 결과물로 수익을 창출할 수 있습니다.
무료 재생성의 조건은 무엇인가요?
무료 재생성을 이용하면 다음 조건에 따라 추가 비용 없이 동일한 텍스트 음성 변환 콘텐츠를 다시 생성할 수 있습니다.
- ElevenLabs 대시보드에서만 사용할 수 있습니다.
- 각 콘텐츠는 최대 2회까지 무료로 재생성할 수 있습니다.
- 콘텐츠는 이전 생성본과 정확히 동일해야 합니다. 텍스트, 음성 설정 또는 기타 파라미터를 변경하면 새 유료 생성이 필요합니다.
무료 재생성은 오디오 출력에 약간의 왜곡이 있을 때 유용합니다. ElevenLabs의 내부 벤치마크에 따르면 재생성은 품질 문제의 약 절반을 해결하며, 남은 문제는 대개 부실한 학습 데이터로 인해 발생합니다.
대화에 몇 명의 화자를 사용할 수 있나요?
대화의 화자 수에는 제한이 없습니다.
출력이 가끔 일관되지 않은 이유는 무엇인가요?
모델은 비결정적입니다. 일관성을 높이려면 선택 사항인 seed 파라미터를 사용하세요. 다만 미세한 차이는 여전히 발생할 수 있습니다.
긴 텍스트 변환의 모범 사례는 무엇인가요?
안정적인 생성을 위해 요청당 모든 inputs[].text 값의 총길이를 2,000자 이하로 유지하세요. 더 긴 텍스트는 청크로 나누고 애플리케이션에서 결과 오디오를 연결하세요.
핵심 정보
- 모델: Eleven v4 및 Eleven v3에서 사용 가능
- 화자: 대화당 화자 수 제한 없음
- 요청 크기: 요청당 모든
inputs[].text값의 총길이를 2,000자 이하로 유지 - 결정성: 출력은 비결정적 — 더 일관된 결과를 위해
seed파라미터 사용 - 무료 재생성: 생성당 최대 2회 무료 재생성(동일 콘텐츠, 동일 파라미터, 대시보드에서만 가능)
- 소유권: 생성된 오디오의 소유권은 유지되며, 상업적 사용에는 유료 요금제가 필요