탐색으로 건너뛰기

음성 텍스트 변환

ElevenLabs로 오디오를 텍스트로 변환하는 방법 안내

텍스트 음성 변환 제품 기능

개요

음성 텍스트 변환을 사용하면 최첨단 정확도로 음성 오디오를 텍스트로 변환할 수 있습니다. 자동 언어 감지 기능으로 다양한 언어의 오디오를 텍스트로 변환할 수 있습니다.

트랜스크립트 만들기

1

오디오 업로드

ElevenLabs 대시보드에서 음성 텍스트 변환 페이지로 이동한 후 “파일 트랜스크립션” 버튼을 클릭하세요. 모달에서 텍스트로 변환할 오디오 또는 비디오 파일을 업로드할 수 있습니다.

음성 텍스트 변환 업로드

2

옵션 선택

  • 알고 있다면 오디오의 기본 언어를 선택하세요. “감지”로 설정된 상태로 두면 오디오 내의 모든 언어가 자동으로 감지됩니다.

  • “오디오 이벤트 태그 지정” 토글을 사용해 웃음이나 박수 같은 오디오 이벤트에 태그를 지정할지 선택하세요.

  • 핵심 용어 프롬프팅을 사용하면 모델이 해당 단어나 구문을 우선적으로 텍스트로 변환하도록 최대 1,000개의 단어 또는 구문을 추가할 수 있습니다. 제품명, 이름 또는 기타 특정 용어처럼 오디오에서 흔하지 않은 특정 단어나 문장을 텍스트로 변환할 때 유용합니다.

준비가 되면 “파일 업로드” 버튼을 클릭해 제출하세요.

3

결과 보기

결과를 보려면 가운데 창에서 업로드한 오디오 파일 이름을 클릭하세요. 단어를 클릭하면 해당 지점부터 오디오를 재생할 수 있습니다.

오른쪽 상단의 “내보내기” 버튼을 클릭하면 다양한 형식으로 결과를 다운로드할 수 있습니다.

트랜스크립트 편집기

트랜스크립트를 만든 후 트랜스크립트 편집기에서 수정할 수 있습니다. 자세한 내용은 이 가이드를 참조하세요.

FAQ

예, 이 도구는 오디오와 비디오 파일 모두 업로드를 지원합니다. 두 파일 유형 모두 최대 파일 크기는 3GB입니다.

화자 이름 변경

예, “화자” 레이블 옆의 “편집” 버튼을 클릭해 화자 이름을 변경할 수 있습니다.

음성-텍스트는 음성 오디오를 글로 변환합니다. ElevenLabs의 음성-텍스트 모델은 Scribe입니다. 90개 이상의 언어로 음성을 정확하게 전사하여 오디오를 읽고 검색할 수 있는 텍스트로 쉽게 변환할 수 있습니다.

Scribe 주요 기능

  • 영어, 프랑스어, 이탈리아어, 포르투갈어, 스페인어, 독일어 등 주요 언어에서 98%의 정확도를 제공하는 업계 최고 수준의 정확도
  • 단어별 정확한 타임스탬프로 각 단어가 언제 발화되었는지 정확히 확인 가능
  • 서로 다른 화자를 자동으로 식별하고 분리하는 스마트 화자 분리
  • 비음성 소리를 감지하는 동적 오디오 태깅
  • 높은 정확도를 유지하면서 최대 32명의 화자 지원

Scribe v2의 새로운 기능

Scribe v2는 더 까다로운 사용 사례를 위해 설계된 추가 기능을 갖춘 핵심 모델입니다.

  • 키워드 프롬프팅. 중요한 용어를 올바르게 전사하도록 모델을 안내하기 위해 최대 100개의 단어 또는 문구를 제공할 수 있습니다. 키워드 프롬프팅을 사용하면 비용이 20% 증가합니다.
  • 엔터티 감지. 신용카드 번호, 이름 또는 질환 등 전사문에서 감지할 특정 정보 카테고리를 선택할 수 있습니다. 엔터티 감지는 API에서만 사용할 수 있으며 비용이 30% 증가합니다.
  • 스마트 다국어 지원. 여러 언어가 포함된 오디오를 제출하면 Scribe v2가 각 언어를 자동으로 감지하고 정확하게 전사합니다.
  • 향상된 안정성. Scribe v2는 일시 정지, 톤 변화, 긴 침묵도 끊김이나 정확도 저하 없이 처리합니다.

어떤 버전을 사용해야 하나요?

높은 정확도의 전사가 필요한 경우 Scribe v2를 권장합니다. 웹사이트와 API를 통해 사용할 수 있습니다. 웹사이트에서 음성-텍스트를 사용할 경우 Scribe v2가 기본 모델입니다.

의료 및 임상 오디오에는 동일한 API를 통해 Scribe v2 Medical (scribe_v2_medical)을 사용하세요. Scribe v2와 동일한 요금이 적용됩니다.

실시간 사용 사례에는 ElevenAgents 및 API를 통해 제공되는 Scribe v2 Realtime을 권장합니다.

자세한 내용은 음성-텍스트 문서를 참조하세요.

음성-텍스트는 90개 이상의 언어를 지원합니다. 

지원 언어의 전체 목록은 음성-텍스트 문서의 언어 지원 섹션을 참조하세요.

동시성 제한(병렬로 실행되는 동시 요청 수)은 구독 플랜과 음성-텍스트 또는 실시간 음성-텍스트 사용 여부에 따라 달라집니다.

현재 음성-텍스트 동시성 제한은 아래와 같습니다.

플랜음성-텍스트 동시성 제한실시간 음성-텍스트 동시성 제한
무료86
스타터129
크리에이터2015
프로4030
스케일6045
비즈니스6045
엔터프라이즈상향 적용상향 적용

더 많은 동시 요청이 필요하다면 이 웹페이지를 통해 엔터프라이즈 팀에 직접 문의하세요. 구체적인 요구 사항에 맞는 맞춤형 플랜을 기꺼이 논의해 드리겠습니다.

No results