Eleven v4

最新かつ最も高度なテキスト読み上げモデル。

Eleven v4は、最新かつ最も高度なテキスト読み上げモデルであり、新世代モデルの第一弾です。Eleven v3と比べて、出力品質、音声の精度、一貫性、感情表現、話し方、オーディオタグ、対応言語を改善しています。

全般的に、Eleven v4はEleven v3の正統なアップグレードであり、ほぼすべてのケースでより優れた結果を提供します。v4へ切り替え、自分の音声とコンテンツでテストして違いを確かめることを強くおすすめします。異なる選択肢が適する例外的なケースもありますが、ほとんどのユーザーにとってはv4のほうが適した選択肢です。

タグ、句読点、対話のプロンプトについては、Eleven v4のプロンプトを参照してください。

ボイスクローン

Eleven v4では、ボイスクローンの精度が大きく向上しました。クローン音声は、声質、リズム、話し方といった元の声の特徴を、従来のどのモデルよりも忠実に再現します。

Eleven v4では、インスタントボイスクローン(IVC)の精度もこれまで以上に高くなっています。元の声の決定的な特徴をより忠実に捉えるため、短いオーディオサンプルからでも説得力のあるクローンを簡単かつ迅速に作成できます。

プロフェッショナルボイスクローン(PVC)はEleven v4で完全にサポートされています。同じ音声精度の進歩を活用し、最高レベルの一貫性と制御が求められるワークフロー向けに、元の声をより忠実に再現します。

この精度の大幅な向上により、Eleven v4はEleven v3とは大きく異なる音に聞こえる場合があります。Eleven v3は、話し方と精度に重点を置いてEleven v4の基盤を築き、Eleven v4はその基盤の上で音声精度を大幅に改善しています。その結果、Eleven v4は元の声をより忠実に捉えるよう設計されていますが、Eleven v3での声の響みを好む場合もあるでしょう。精度と個人の好みは必ずしも同じではないため、ユースケースに最適なものを選ぶために、自分のコンテンツで両バージョンを比較することをおすすめします。

Eleven v4は、アクセント、話し方、音量、その他の特徴的な性質を含め、元の声の特徴をより忠実に再現します。そのため、元の録音の品質がこれまで以上に重要です。明瞭でクリーンなトレーニングオーディオは、不要な音や特徴を加えることなく、Eleven v4が音声を正確に捉えるのに役立ちます。バックグラウンドノイズ、歪み、その他の録音上の問題は結果に影響する可能性があります。

最適な使い方を理解するため、Eleven v4については引き続き検証中です。現時点では、特にプロフェッショナルボイスクローンのようにトレーニングオーディオが多い場合、微妙な音声ニュアンスの再現が大幅に向上しているようです。より柔軟なデータセットでモデルを制御する方法をテストし続けるなかで、多様なトレーニングデータの使用に関するガイダンスが変わる可能性があります。現時点では、トレーニングオーディオでは単一の話し方に統一することをおすすめします。Eleven v4は、以前のモデルよりもそれを適切に捉えられるはずです。

ネイティブアクセントの処理

これは、Eleven v4における従来モデルとの最大の変更点の一つであり、明確に理解しておく価値があります。

生成する言語が参照音声の言語と一致する場合、元のアクセントはこれまでどおり正確に保持されます。

生成する言語が参照音声の言語と異なる場合、Eleven v4は元の言語のアクセントを引き継ぐのではなく、対象言語で流暢かつ自然な音声を生成します。

実際には、韓国語話者の声をクローンして英語を生成した場合、Eleven v4は韓国語アクセントの英語ではなく、自然で流暢な英語を生成します。これにより、あらゆる音声を対応するすべての言語で利用でき、吹き替え、多言語コンテンツ、単一の音声で異なる言語のユーザーに対応する必要がある音声エージェントで特に役立ちます。

他の言語でもネイティブアクセントを維持する必要があるワークフローでは、移行前にEleven v4でこの動作を直接テストしてください。これはクロスランゲージ生成の仕組みにおける意図的な変更であり、バグではありません。

ただし、この新機能はまだ微調整中であり、常時有効ではなく切り替え可能にする方法を検討しています。これはまだ研究プロジェクト段階のため、現時点で時期や追加情報はありません。

モデルバリアント

Eleven v4には2つのバリアントがあり、ユースケースに適した品質と速度のバランスを選べます。

  • Eleven v4(eleven_v4)— 最高品質のモデルです。コンテンツ制作、オーディオブック、キャラクターのボイスオーバーなど、品質を最優先するあらゆるユースケースに最適です。
  • Eleven v4 Turbo(eleven_v4_turbo)— 非常に高い品質を維持しながら、優れた低レイテンシーを実現します。会話型エージェントやインタラクティブな音声体験など、リアルタイムのユースケース向けに設計されています。

どちらのバリアントでも、StabilityとSimilarityの2つの音声設定を使用します。

Stabilityは、生成間で話し方の一貫性をどの程度維持するかを制御します。値を低くすると表現豊かで変化のある話し方になり、値を高くすると一定の基準に近いパフォーマンスを維持します。

Similarityは、出力が参照音声にどの程度忠実に従うかを制御します。値を高くすると参照音声への追従性は高まりますが、自然さが多少損なわれる場合があります。

Eleven v4ではStyleとSpeedのスライダーは利用できず、SSMLもサポートされていません。

オーディオタグ(例:[whispering]、[shouting]、[laughing])を使うと、きめ細かく話し方を指示できます。Eleven v4は、従来モデルを超えるニュアンスでこれらを処理します。まだ完璧ではありませんが、タグの指示にモデルがどれほど確実に従うかについて、継続的に改善を進めています。これは現在も投資を続けている重点分野であり、今後も改善されていきます。

ショーケース

これらの例は未加工です。EQ、コンプレッション、 ノーマライズ、ディエッシング、破裂音の除去など、大がかりな後処理は一切行っていません。クリッピング、 破裂音、不均一なEQ、音量の急変など、繰り返し発生する問題が聞こえる場合、それらは その音声のトレーニングデータに含まれている可能性が非常に高いです。Eleven v4モデルは非常に高精度なため、 欠点も含めてそのまま捉えています。モデルが生成した音声を聞けるよう、オーディオには手を加えていません。

ボイスクローンの精度

各例はボイスライブラリのプレビューから始まります。続いて、テキストを用意し、その音声のインスタントボイスクローンを使用して、Eleven v3とEleven v4の両方で生成しました。

これは完全な比較ではありません。Eleven v4はプロフェッショナルボイスクローンにも対応しており、さらに一致度を高められます。ただし、より公平に比較するため、Eleven v3とEleven v4の両方でインスタントボイスクローンを使用しました。

これらの例は、モデルが元の声をどこまで捉えられるかを示しています。これには、EQ、品質、音量のほか、破裂音、耳障りな歯擦音、音量変動など、オーディオに含まれるその他の細かな要素や不完全さも含まれる点に注意してください。

プレビュー、Eleven v3、Eleven v4の順に聞いてください。

音声 NfUrCNRReUL9RXS9upG1。

"Brother... I must cross the sea, though I'd rather stay beside you. If the gods will it, we'll see each other again. Until then, when the sun sinks beyond the waves, know that I'll be looking toward home."
He clasped my forearm beneath the pale morning sky. I held on a moment longer, then watched him turn toward the waiting ship.

音声 HBDoL4wkcalemIO0nUAu。

"When I was young, I thought the mountain stood because it was strong. Then winter came, and the mountain wore its crown of snow without complaint. Spring followed, and it let every stream run free.
"So remember, traveler: strength is not always holding fast. Sometimes it is knowing what to carry, and what the season asks you to release."

ボイスアクティング

これらはEleven v4による生成です。テキスト内のオーディオタグが話し方を指示します。

音声 EkK5I93UQWFDigLMpZcX。

[casual] "You're looking for work, eh? Hmm, I might have something for you. Just outside the valley, there's a group of wild horned boars I need you to take care of - nasty little beasts. The village would be grateful if you could get that done, and I'll make it worth your while."
------------
[annoyed] [under his breath] "Oh, you again... [sigh] Did you take care of that little problem I mentioned earlier? No, not yet? All right, off you go. I don't have time to chitchat. I'm busy standing here... handing out quests."
------------
[ecstatic] "You did it, you crazy bastard! [dismissive] Not that I didn't have any faith in you, but you wouldn't be the first one to fail. Yes, yes, I know. One of them might have been a little bigger than the others. But hey, you survived. You got it done. You helped the village."

音声 t7VaN65ClS2VrEUwk1nR。

[quietly curious] "Hmm… that mark. I haven't seen one like it in years. Where did you get it? Oh, you gonna make me guess? [giggle]"
------------
[measured] "No need to explain, if you'd rather not. This town has a way of leaving its mark on people. [soft chuckle] Usually not quite so literally."
------------
[lower, thoughtful] "Keep it covered when you can. There are still a few who remember what it means, and they may not ask as politely as I have."

オーディオブック

これはEleven v4によるナレーションです。タグによってシーンのテンポと雰囲気を設定しています。

音声 KHRvDizAHFVPzoSehNY6。

[Quiet, measured narration] The moonlit training court lay beneath the keep, its stone walls silvered with frost. Beyond the battlements, a dragon's distant call rolled over the mountains.
Sir Alden lifted his blunted practice sword. "Ready?"
Bram, his broad shoulders wrapped in a travel-worn cloak, studied the wooden shield strapped to his arm. "I've faced worse odds."
[Pause, dry amusement] "You lost to a turnip cart yesterday," Sir Alden said.
"It was a very determined cart," Bran muttered
[Gradually building energy] They circled across the frost-dusted stones. One step. Another. Alden watched Bram's hands; Bram watched the faint blue glow gathering along Alden's blade. The air between them prickled with harmless magic.
[Quick, light, playful pace] Bram charged. Alden slipped aside. Clack! Wood met steel. Bram turned, his cloak flaring, and swung wide. Alden ducked beneath it. Bram's boot skidded on the frost; he windmilled, caught himself, and bowed as if he'd meant to do that all along.
"Magnificent," Alden said.
"I was giving you time to admire the cloak," Bran retorted.

モデルは進化を続けます

Eleven v4は継続的かつ活発に開発されています。リリース後もモデルのトレーニングと改善を続けるため、品質向上に伴って動作が時間とともに変化する可能性があります。モデルの進化に合わせて定期的にユースケースを再テストすることをおすすめします。重要な更新は順次お知らせします。

よくある質問

Eleven v4は、アフリカーンス語、アムハラ語、アラビア語、アルメニア語、アッサム語、アストゥリアス語、アゼルバイジャン語、 ベラルーシ語、ベンガル語、ボスニア語、ブルガリア語、ビルマ語、広東語、カタルーニャ語、セブアノ語、クロアチア語、チェコ語、 デンマーク語、オランダ語、英語、エストニア語、フィリピン語、フィンランド語、フランス語、フラ語(プラール語)、ガリシア語、ジョージア語、 ドイツ語、ギリシャ語、グジャラート語、ハウサ語、ヘブライ語、ヒンディー語、ハンガリー語、アイスランド語、インドネシア語、イタリア語、 日本語、カンナダ語、カザフ語、韓国語、キルギス語、ラオ語、リンガラ語、リトアニア語、ルガンダ語、ルクセンブルク語、 マケドニア語、マレー語、マラヤーラム語、マルタ語、中国語(北京語)、マオリ語、マラーティー語、モンゴル語、ネパール語、 ノルウェー語(ブークモール)、オック語、オディア語、パシュトー語、ペルシア語、ポーランド語、ポルトガル語(ブラジル)、パンジャブ語、ルーマニア語、 ロシア語、セルビア語、ショナ語、シンド語、スロバキア語、スロベニア語、ソマリ語、ソラニー語、スペイン語(ラテンアメリカ)、 スワヒリ語、スウェーデン語、タジク語、タミル語、テルグ語、タイ語、トルコ語、ウクライナ語、ウルドゥー語、ウズベク語、ベトナム語、ウェールズ語、 ウォロフ語に対応しています。

言語によって流暢さには差がありますが、全般的にEleven v4はこれらの大半を非常に適切に処理します。

参照音声と生成する音声が同じ言語の場合、音声のアクセントは保持されます。たとえば、 特定の英語アクセントで話す人の声をクローンし、英語の音声を生成した場合、そのアクセントは維持されます。

デフォルトでは、生成言語が参照音声の言語と異なる場合、Eleven v4は参照アクセントを 引き継ぐのではなく、対象言語で流暢かつ自然な音声を目指します。オーディオタグを使用して アクセントや話し方を指定することはできますが、結果は異なる場合があるため、特定の音声とユースケースでテストしてください。

全般的に、Eleven v4は声質、リズム、話し方、その他の話し方の癖を含め、 Eleven v3よりも元の声の特徴をはるかに正確に再現します。そのため、Eleven v4のクローンは通常、元の声により近く聞こえ、Eleven v3版とはかなり異なる場合があります。

Eleven v4は、インスタントボイスクローンとプロフェッショナルボイスクローンの両方に対応しています。

インスタントボイスクローンでは、個別のトレーニングステップなしで音声を作成できます。通常は1〜2分の短いサンプルをアップロードすると、数秒以内に利用可能な音声が完成します。

プロフェッショナルボイスクローンは、以前のモデルと同様に機能します。より長い録音セットを使って専用モデルをトレーニングします。

すでにプロフェッショナルボイスクローンがあり、Eleven v4でトレーニングしたい場合は、My Voicesを開き、リストから対象の音声を見つけてカーソルを合わせます。その音声で利用可能なモデルが表示されます。Eleven v4の横にあるプラスボタンをクリックすると、微調整を開始できます。

ボイスデザインの音声はEleven v4でも使用できますが、以前のモデルと比べて、 表現力や音質が十分でない場合があります。