트랜스크립트 생성
오디오 또는 비디오 파일을 전사합니다. webhook이 true로 설정되면 요청은 비동기적으로 처리되고 결과가 구성된 웹훅으로 전송됩니다. use_multi_channel이 true이고 제공된 오디오에 여러 채널이 있으면 각 채널의 전사본을 별도로 포함한 ‘transcripts’ 객체가 반환됩니다. 대신 모든 채널을 병합하고 시간순으로 정렬한 단일 전사본을 받으려면 multichannel_output_style=‘combined’로 설정하세요. 그 외에는 단일 전사본을 반환합니다. 선택 사항인 webhook_metadata 매개변수를 사용하면 요청 연계 및 추적을 위해 웹훅 응답에 포함될 사용자 지정 데이터를 첨부할 수 있습니다.
헤더
쿼리 매개변수
POST /v1/single-use-token/batch_scribe를 통해 생성된 일회용 인증 토큰입니다. 이 토큰은 한 번만 사용할 수 있으며 15분 후 만료됩니다. 프런트엔드 클라이언트에서 API 키 또는 bearer 토큰 인증을 대체할 수 있습니다.
enable_logging을 false로 설정하면 요청에 제로 보존 모드가 사용됩니다. 이 경우 로그 및 트랜스크립트 저장 기능을 이 요청에서 사용할 수 없습니다. 제로 보존 모드는 엔터프라이즈 고객만 사용할 수 있습니다.
요청
전사에 사용할 모델의 ID입니다.
트랜스크립션할 파일입니다(최소 오디오 길이 100ms). 모든 주요 오디오 및 비디오 형식이 지원됩니다. file 또는 cloud_storage_url 매개변수 중 정확히 하나를 제공해야 합니다. 파일 크기는 5.0GB 미만이어야 합니다.
오디오 파일의 언어에 해당하는 ISO-639-1 또는 ISO-639-3 language_code입니다. 미리 알고 있으면 트랜스크립션 성능을 향상할 수 있습니다. 기본값은 null이며, 이 경우 언어가 자동으로 예측됩니다.
최종 트랜스크립트에 적용할 자연어 지시문(최대 2,000자)입니다. 편집된 텍스트는 원본 트랜스크립트와 함께 'edited_transcript'로 반환됩니다. entity_detection, entity_redaction 또는 use_multi_channel과 함께 사용할 수 없습니다. 이 파라미터를 사용하면 기본 트랜스크립션 비용에 30%의 추가 요금이 부과되며, 최소 10초 분량의 오디오에 대해 청구됩니다.
트랜스크립션에서 (웃음), (발걸음) 등의 오디오 이벤트에 태그를 지정할지 여부입니다.
업로드한 파일에서 발화하는 최대 화자 수입니다. 누가 언제 말하는지 예측하는 데 도움이 됩니다. 예측 가능한 최대 화자 수는 32명입니다. 기본값은 null이며, 이 경우 화자 수는 모델이 지원하는 최대값으로 설정됩니다.
트랜스크립션 타임스탬프의 세분화 수준입니다. 'word'는 단어 수준 타임스탬프를 제공하고, 'character'는 단어별 문자 수준 타임스탬프를 제공합니다.
업로드된 파일에서 현재 발화 중인 화자를 주석으로 표시할지 여부입니다.
화자 분리 중 적용할 화자 분리 임곗값입니다. 값이 높을수록 한 화자가 서로 다른 두 화자로 분리될 가능성은 낮아지지만, 서로 다른 두 화자가 한 화자로 분리될 가능성은 높아집니다(예측되는 전체 화자 수 감소). 값이 낮을수록 한 화자가 서로 다른 두 화자로 분리될 가능성은 높아지지만, 서로 다른 두 화자가 한 화자로 분리될 가능성은 낮아집니다(예측되는 전체 화자 수 증가). diarize=True 및 num_speakers=None인 경우에만 설정할 수 있습니다. 기본값은 None이며, 이 경우 model_id를 기준으로 임곗값을 선택합니다(일반적으로 0.22).
스크립트를 내보낼 추가 형식 목록입니다.
입력 오디오 형식입니다. 옵션은 'pcm_s16le_16' 또는 'other'입니다. pcm_s16le_16의 경우 입력 오디오는 16kHz 샘플 레이트, 단일 채널(모노), 리틀 엔디언 바이트 순서의 16비트 PCM이어야 합니다. 인코딩된 파형을 전달하는 것보다 지연 시간이 더 낮습니다.
[지원 중단됨] 이 매개변수는 지원 중단되었으며 향후 제거될 예정입니다. 대신 'source_url'을 사용하세요. 트랜스크립션할 파일의 HTTPS URL입니다. file 또는 cloud_storage_url 매개변수 중 정확히 하나를 제공해야 합니다. 파일은 HTTPS를 통해 액세스할 수 있어야 하며 크기는 2GB 미만이어야 합니다. 클라우드 스토리지 제공업체(AWS S3, Google Cloud Storage, Cloudflare R2 등), CDN 또는 기타 HTTPS 소스의 URL을 포함하여 유효한 모든 HTTPS URL을 사용할 수 있습니다. URL은 사전 서명되거나 쿼리 매개변수에 인증 토큰을 포함할 수 있습니다.
트랜스크립션할 오디오 또는 비디오 파일의 URL입니다. 호스팅된 비디오 또는 오디오 파일, YouTube 비디오 URL, TikTok 비디오 URL 및 기타 비디오 호스팅 서비스를 지원합니다.
전사 결과를 구성된 음성-텍스트 웹훅으로 보낼지 여부입니다. 설정하면 요청은 전사 결과 없이 조기에 반환되며, 전사 결과는 나중에 웹훅을 통해 전달됩니다.
트랜스크립션 결과를 전송할 선택적 특정 웹훅 ID입니다. webhook이 true로 설정된 경우에만 유효합니다. 제공하지 않으면 트랜스크립션이 구성된 모든 음성-텍스트 웹훅으로 전송됩니다.
전사 결과의 무작위성을 제어합니다. 0.0에서 2.0 사이의 값을 허용하며, 값이 높을수록 결과가 더 다양하고 결정성이 낮아집니다. 생략하면 선택한 모델에 따른 temperature를 사용하며, 일반적으로 0입니다.
지정하면 시스템은 결정론적으로 샘플링하기 위해 최선을 다하므로, 동일한 시드와 매개변수로 반복 요청하면 동일한 결과가 반환됩니다. 결정론적 결과는 보장되지 않습니다. 0에서 2147483647 사이의 정수여야 합니다.
오디오 파일에 각 채널이 한 명의 화자를 포함하는 여러 채널이 있는지 여부입니다. 활성화하면 각 채널이 독립적으로 전사됩니다. 기본적으로 채널별로 별도의 전사 결과가 반환됩니다. 모든 채널을 병합하고 시간순으로 정렬한 단일 전사 결과를 받으려면 multichannel_output_style='combined'로 설정하세요. 응답의 각 단어에는 발화된 채널을 나타내는 'channel_index' 필드가 포함됩니다. 최대 5개 채널을 지원합니다. 각 채널은 전체 오디오 길이를 기준으로 독립적으로 청구되므로 비용은 채널 수에 비례하여 증가합니다.
use_multi_channel이 활성화되었을 때 응답 형식을 제어합니다. 'separate'(기본값)는 'transcripts' 아래에 채널별 전사본 하나를 반환합니다. 'combined'는 모든 채널을 시작 시간순으로 단어가 정렬된 단일 전사본으로 병합하며, 각 단어에는 단일 채널 응답 형식과 일치하는 'channel_index'가 포함됩니다. 'combined'에는 타임스탬프가 필요하며(timestamps_granularity는 'none'일 수 없음), 엔터티 감지 또는 수정은 지원하지 않습니다.
웹훅 응답에 포함할 선택적 메타데이터입니다. 최대 깊이 2단계, 최대 크기 16KB의 객체를 나타내는 JSON 문자열이어야 합니다. 내부 ID, 작업 참조 또는 기타 컨텍스트 정보를 추적하는 데 유용합니다.
트랜스크립트에서 엔터티를 감지합니다. 모든 엔터티를 감지하려면 'all'을, 단일 엔터티 유형 또는 카테고리 문자열을, 또는 엔터티 유형/카테고리 목록을 지정할 수 있습니다. 카테고리에는 'pii', 'phi', 'pci', 'other', 'offensive_language'가 포함됩니다. 활성화하면 감지된 엔터티는 텍스트, 유형 및 문자 위치와 함께 'entities' 필드에 반환됩니다.
true이면 트랜스크립션에 군더더기 말, 잘못 시작한 발화 및 비음성 소리가 포함되지 않습니다. scribe_v2 모델에서만 지원됩니다.
화자 분리 중 알려진 화자를 식별하기 위해 화자 라이브러리를 사용할지 여부입니다. 활성화되어 있고 diarize가 true이면 감지된 화자는 워크스페이스의 화자 라이브러리에 등록된 화자와 매칭됩니다.
화자 역할(에이전트 또는 고객)을 감지할지 여부입니다. diarize=true가 필요합니다. use_multi_channel=true와 함께 사용할 수 없습니다. 활성화하면 speaker_id 값은 'speaker_0', 'speaker_1' 등이 아닌 'agent'와 'customer'가 됩니다. 사용 시 기본 전사 비용에 10%의 추가 요금이 부과됩니다.
트랜스크립트 텍스트에서 엔터티를 삭제 처리합니다. entity_detection과 동일한 형식인 'all', 카테고리('pii', 'phi') 또는 특정 엔터티 유형을 사용할 수 있습니다. entity_detection의 하위 집합이어야 합니다. 삭제 처리를 활성화하면 entities 필드는 반환되지 않습니다.
삭제 처리된 엔터티의 형식입니다. 'redacted'는 {REDACTED}로, 'entity_type'은 {ENTITY_TYPE}으로, 'enumerated_entity_type'은 각 발생 항목에 N을 부여한 {ENTITY_TYPE_N}으로 대체합니다. entity_redaction이 설정된 경우에만 사용됩니다.
전사 결과가 특정 핵심 용어에 더 치우치도록 하는 핵심 용어 목록입니다. 핵심 용어는 모델이 더 정확하게 인식하기를 원하는 단어 또는 구문입니다. 핵심 용어는 최대 1,000개까지 지정할 수 있습니다. 각 핵심 용어의 길이는 50자 미만이어야 합니다. 핵심 용어에는 정규화 후 최대 5개의 단어를 포함할 수 있습니다. 예: ["hello", "world", "technical term"]. 다음 문자는 지원되지 않습니다: <, >, {, }, [, ], \. 이 파라미터를 사용하면 기본 전사 비용에 20%의 추가 요금이 부과됩니다. 핵심 용어를 100개 초과로 제공하면 요청당 최소 청구 시간이 20초 적용됩니다.
응답
동기식 전사 결과
타이밍 정보가 포함된 트랜스크립션의 청크 수준 세부 정보입니다.
다중 채널 음성-텍스트 전사의 응답 모델입니다.