Eleven v4とは?
Eleven v4とは?
Eleven v4に切り替え、ご自身のコンテンツでテストすることをおすすめします。
Eleven v4は、最新かつ最も高度なテキスト読み上げモデルであり、新世代モデルの第一弾です。Eleven v3と比べて、出力品質、音声の正確性、感情表現、オーディオタグ、対応言語が向上しています。
Eleven v4では、ボイスクローンの精度が大きく向上しました。クローンされた音声は、これまでのどのモデルよりも忠実に、元となる音声の特徴(音色、リズム、話し方)を捉えます。
Eleven v4では、インスタントボイスクローン(IVC)の精度がこれまで以上に向上しています。元となる音声の特徴をより忠実に捉えるため、短いオーディオサンプルから説得力のあるクローンをすばやく作成しやすくなりました。
Eleven v4は、プロフェッショナルボイスクローン(PVC)を完全にサポートしています。音声精度における同じ進歩を活用し、最高レベルの一貫性と制御が求められるワークフロー向けに、元の音声をより忠実に再現します。
Eleven v4には2つのバリアントがあり、ユースケースに応じて品質と速度の最適なバランスを選べます:
- Eleven v4 (
eleven_v4)— 最高品質のモデルです。コンテンツ制作、オーディオブック、キャラクターのボイスオーバーなど、品質を最優先するあらゆるユースケースに最適です。 - Eleven v4 Turbo (
eleven_v4_turbo)— 優れた低レイテンシを維持しながら、非常に高い品質を実現します。会話型エージェントやインタラクティブな音声体験など、リアルタイムのユースケース向けに設計されています。
どちらのバリアントも、StabilityとSimilarityの2つの音声設定を使用します。Eleven v4ではStyleとSpeedのスライダーは利用できず、SSMLもサポートされていません。
生成する言語が参照音声の言語と一致する場合、元のアクセントは従来どおり正確に保持されます。生成する言語が参照音声の言語と異なる場合、Eleven v4は参照音声の元言語のアクセントを引き継ぐのではなく、対象言語で流暢かつ自然な音声を生成します。
モデルIDにeleven_v4を指定して、Create speechとStream speechで生成できます。複数話者には、Create dialogueとStream dialogueを使用してください。
クローン、アクセント、比較、詳細な説明については、Eleven v4をご覧ください。タグとプロンプトについては、Eleven v4のプロンプトをご覧ください。