音声をデザイン。

プロンプトで音声をデザインします。このメソッドは音声プレビューのリストを返します。各プレビューにはgenerated_voice_idと、base64エンコードされたmp3オーディオ形式の音声サンプルが含まれます。音声を作成するには、希望するプレビューのgenerated_voice_idを/v1/text-to-voiceエンドポイントで使用します。

ヘッダー

xi-api-keystringオプション

クエリパラメータ

output_formatenumオプション
生成されたオーディオの出力形式。codec_sample_rate_bitrate形式で指定します。たとえば、サンプルレート22.05kHz、32kbpsのmp3はmp3_22050_32で表します。ビットレート192kbpsのMP3を使用するには、クリエイター以上への加入が必要です。サンプルレート44.1kHzのPCM形式を使用するには、プロ以上への加入が必要です。μ-law形式(mu-lawとも表記され、u-lawと近似表記されることもあります)は、Twilioのオーディオ入力で一般的に使用されます。

リクエスト

This endpoint expects an object.
voice_descriptionstring必須20-1000 characters

作成する音声に使用する説明。

model_idenumオプションデフォルト値 eleven_multilingual_ttv_v2

音声生成に使用するモデル。指定可能な値:eleven_multilingual_ttv_v2、eleven_ttv_v3。

許可された値:
textstring or nullオプション100-1000 characters

生成するテキスト。テキストの長さは100~1000文字である必要があります。

auto_generate_textbooleanオプションデフォルト値 false

音声説明に適したテキストを自動生成するかどうか。

loudnessdoubleオプション-1-1デフォルト値 0.5

生成される音声の音量レベルを制御します。-1が最も小さく、1が最も大きく、0はおよそ-24 LUFSに相当します。

seedinteger or nullオプション0-2147483647

音声生成を制御する乱数。同じ入力で同じシードを使用すると、同じ音声が生成されます。

guidance_scaledoubleオプション0-100デフォルト値 5

AIがプロンプトにどの程度厳密に従うかを制御します。値が低いほどAIはより自由に創造性を発揮でき、値が高いほどプロンプトに厳密に従います。値が高いと、音声が不自然またはロボットのように聞こえることがあります。Guidance Scaleが低い場合は、より長く詳細なプロンプトを使用することをおすすめします。

stream_previewsbooleanオプションデフォルト値 false

レスポンスにText to Voiceのプレビューを含めるかどうかを決定します。trueの場合、生成されたIDのみが返され、/v1/text-to-voice/:generated_voice_id/streamエンドポイントでストリーミングできます。

should_enhancebooleanオプションデフォルト値 false

AIを使用して音声説明をより詳細にし、音声生成の品質を向上させるかどうか。有効にすると、システムは簡単なプロンプトをより詳細な音声説明へ自動的に展開します。デフォルトはFalseです

remixing_session_idstring or nullオプション

リミックスセッションID。

remixing_session_iteration_idstring or nullオプション

これらの生成結果を紐付けるリミックスセッションのイテレーションID。指定しない場合、新しいイテレーションが作成されます。

qualitydouble or nullオプション-1-1

品質を高くすると音声出力は向上しますが、バリエーションは少なくなります。

reference_audio_base64string or nullオプション

音声生成に使用する参照オーディオです。オーディオはbase64エンコードする必要があります。eleven_ttv_v3モデル使用時のみサポートされます。

prompt_strengthdouble or nullオプション0-1

音声サンプル生成時のプロンプトと参照オーディオのバランスを制御します。0はプロンプトの影響がほとんどないことを、1は参照オーディオの影響がほとんどないことを意味します。eleven_ttv_v3モデル使用時のみサポートされます。

レスポンス

成功レスポンス。

previewslist of objects

生成された音声のプレビュー。

textstring

音声のプレビューに使用するテキストです。

エラー

409
Conflict Error
422
Unprocessable Entity Error