音声を生成

選択した音声を使用してテキストを音声に変換し、オーディオを返します。

パスパラメータ

voice_idstring必須

使用する音声のID。利用可能なすべての音声は、音声を取得エンドポイントで一覧表示できます。

ヘッダー

xi-api-keystringオプション

クエリパラメータ

enable_loggingbooleanオプションデフォルト値 true
enable_loggingがfalseに設定されている場合、このリクエストにはゼロ保持モードが使用されます。この場合、リクエスト結合を含む履歴機能はこのリクエストでは利用できません。ゼロ保持モードを使用できるのはエンタープライズのお客様のみです。
optimize_streaming_latencyinteger or nullオプションDeprecated
品質を多少犠牲にして、レイテンシー最適化を有効にできます。達成可能な最終レイテンシーはモデルによって異なります。指定可能な値: 0 - デフォルトモード(レイテンシー最適化なし) 1 - 通常のレイテンシー最適化(オプション3で可能なレイテンシー改善量の約50%) 2 - 強力なレイテンシー最適化(オプション3で可能なレイテンシー改善量の約75%) 3 - 最大レイテンシー最適化 4 - 最大レイテンシー最適化に加え、さらなるレイテンシー削減のためテキストノーマライザーも無効化(最良のレイテンシーですが、数字や日付などを誤って発音する可能性があります)。 デフォルトはNoneです。
output_formatenumオプションデフォルト値 mp3_44100_128
生成されたオーディオの出力形式。codec_sample_rate_bitrate形式で指定します。たとえば、サンプルレート22.05kHz、32kbpsのmp3はmp3_22050_32で表します。ビットレート192kbpsのMP3を使用するには、クリエイター以上への加入が必要です。サンプルレート44.1kHzのPCMおよびWAV形式を使用するには、プロ以上への加入が必要です。μ-law形式(mu-lawとも表記され、u-lawと近似表記されることもあります)は、Twilioのオーディオ入力で一般的に使用されます。

リクエスト

This endpoint expects an object.
textstring必須

音声に変換するテキストです。

model_idstringオプションデフォルト値 eleven_multilingual_v2

使用するモデルの識別子。GET /v1/modelsで照会できます。モデルはテキスト読み上げをサポートしている必要があり、can_do_text_to_speechプロパティで確認できます。

language_codestring or nullオプション

モデルと言語正規化に適用する言語コード(ISO 639-1)です。モデルが指定された言語コードをサポートしていない場合は無視されます。このパラメータはmultilingual_v2モデルではサポートされません。

voice_settingsobject or nullオプション

指定した音声について、保存済みの設定をオーバーライドする音声設定。指定したリクエストにのみ適用されます。

pronunciation_dictionary_locatorslist of objects or nullオプション

テキストに適用する発音辞書ロケーター(id、version_id)の一覧です。指定した順序で適用されます。1リクエストにつき最大3つのロケーターを指定できます。

seedinteger or nullオプション

指定すると、同じシードとパラメータでリクエストを繰り返した場合に同じ結果が返るよう、システムは決定論的サンプリングを最大限試みます。決定性は保証されません。0から4294967295までの整数である必要があります。

previous_textstring or nullオプション

現在のリクエストのテキストより前にあるテキスト。複数の生成結果を連結する際の音声の連続性を改善したり、現在の生成における音声の連続性に影響を与えたりするために使用できます。

next_textstring or nullオプション

現在のリクエストのテキストより後にあるテキスト。複数の生成結果を連結する際の音声の連続性を改善したり、現在の生成における音声の連続性に影響を与えたりするために使用できます。

previous_request_idslist of strings or nullオプション

この生成より前に生成されたサンプルのrequest_idのリストです。大きなタスクを複数のリクエストに分割する際に、音声の連続性を向上させるために使用できます。すべての生成で同じモデルを使用すると、より良い結果が得られます。previous_textとprevious_request_idsの両方が送信された場合、previous_textは無視されます。送信できるrequest_idsは最大3件です。

next_request_idslist of strings or nullオプション

この生成の後に続くサンプルのrequest_idのリストです。next_request_idsは、音声品質に問題があるサンプルを再生成する際に、音声の連続性を維持するのに特に役立ちます。たとえば、3つの音声クリップを生成し、クリップ2を改善したい場合、クリップ3のリクエストIDをnext_request_idとして(クリップ1のIDをprevious_request_idとして)渡すことで、結合後の音声でも自然な流れを維持できます。すべての生成で同じモデルを使用すると、より良い結果が得られます。next_textとnext_request_idsの両方が送信された場合、next_textは無視されます。送信できるrequest_idsは最大3件です。

use_pvc_as_ivcbooleanオプションデフォルト値 false

プロフェッショナルボイスのIVCバージョンを使用するかどうかです。表現力が向上し、レイテンシーが低減する場合があります。

apply_text_normalizationenumオプションデフォルト値 auto

このパラメーターは、‘auto’、‘on’、‘off’の3つのモードでテキスト正規化を制御します。‘auto’に設定すると、システムがテキスト正規化(例:数値の読み上げ)を適用するかどうかを自動的に判断します。‘on’では常にテキスト正規化が適用され、‘off’ではスキップされます。

許可された値:
apply_language_text_normalizationbooleanオプションデフォルト値 false

このパラメーターは言語テキストの正規化を制御します。一部の対応言語でテキストを適切に発音するのに役立ちます。警告:このパラメーターはリクエストのレイテンシーを大幅に増加させる可能性があります。現在は日本語でのみ対応しています。

レスポンス

生成されたオーディオファイル

エラー

422
Unprocessable Entity Error