テキスト読み上げ

ElevenLabsでテキストを音声に変換する方法のガイド

概要

ElevenLabsのテキスト読み上げ技術はサービスの中核であり、世界中のさまざまなアプリケーションで高品質なAI生成音声を支えています。すでに、リアルなオーディオ体験を提供する音声を耳にしたことがあるかもしれません。

テキスト読み上げで初めてのオーディオを生成するのはとても簡単です。ただし、この機能を最大限に活用するために、いくつか押さえておくべきポイントがあります。

ガイド

テキスト読み上げのデモ

1

テキスト入力

テキスト読み上げページの入力ボックスにテキストを入力するか、貼り付けます。

2

音声の選択

画面左下の「音声」から、使用する音声を選択します。

3

設定を調整(任意)

希望する出力に合わせて音声設定を変更します。
4

生成

「生成」ボタンをクリックして、オーディオファイルを作成します。

設定

高品質な音声を作成するために、音声、モデル、設定について理解しましょう。

使用する設定、特に音声とモデルは、出力に大きく影響します。これらに慣れ、ベストプラクティスを理解することは非常に重要です。ほかの設定も出力に影響しますが、選択する音声とモデルほど大きな影響はありません。

重要度の順序は次のとおりです。最も重要なのは音声の選択で、次にモデルの選択、そしてモデルの設定が続きます。これらすべてと、その組み合わせが出力に影響します。

音声

テキスト読み上げの音声
選択

厳選されたデフォルト音声、ほぼあらゆる音声を取りそろえた豊富なボイスライブラリ w、ボイスデザインツールで作成された完全合成音声、さらにインスタントボイスクローンとプロフェッショナルボイスクローンという2つの技術で作成できるクローン音声コレクションなど、多様な音声を提供しています。

すべての音声が同じ品質というわけではなく、その多くは作成元となるソースオーディオに左右されます。より人間らしい表現と話し方を提供する音声もあれば、より安定した音声もあります。

コンテンツに適した音声を選ぶことは非常に重要です。 最終出力に最も大きく影響する、最も重要な決定となる可能性があります。性別、トーン、アクセント、話すリズム、話し方が決まります。最適な音声を選び、一貫性があり期待に沿うことを確認するために、十分な時間をかけてテストする価値があります。

特定の言語で音声を生成する場合は、ボイスライブラリのネイティブ音声を使用するか、その言語を正しいアクセントで話す音声をクローンすると、最良の結果が得られます。技術的にはどの音声でもどの言語でも話せますが、元のアクセントは維持されます。たとえば、ネイティブ英語音声を使ってフランス語の音声を生成すると、AIは学習していない言語でその音声がどのように聞こえるかを一般化する必要があるため、フランス語でありながら英語アクセントの出力になる可能性があります。

音声の詳細

気に入った音声があるものの話し方を変えたい場合は、ボイスリミックスツールが役立ちます。自然言語のプロンプトを使って、音声の話し方、リズム、トーン、性別、さらにはアクセントまで変更できます。アクセントを変更する際は、ベース音声とターゲットアクセントが非常に重要です。結果はさまざまで、完璧に機能する場合もあれば、うまくいくまで数回試す必要がある場合もあります。

ボイスリミックスでは非常に良い結果を得られますが、通常は適切にクローンされたプロフェッショナルボイスクローンほどの品質にはなりません。インスタントボイスクローンに近い品質になります。

ボイスリミックスは特定の音声でのみ機能することにご注意ください。たとえば、ボイスライブラリの音声はリミックスできません。自分で作成した音声またはデフォルト音声のみリミックスできます。

モデル

テキスト読み上げのモデル
選択

2つのモデルファミリーを提供しています。高品質なStandard(高品質) モデルと、非常に低いレイテンシー向けに最適化されたFlashモデルです。ほとんどのファミリーには、英語専用版と多言語版の両方があります。

Eleven v4は最新モデルです。Eleven v4とEleven v4 Turboの2種類があります。

モデルの選択は、音声の選択に次いで、最終的なオーディオ出力に大きく影響します。選択した音声でさまざまなモデルをテストし、最適な組み合わせを見つけることをおすすめします。すべてのモデルには長所と短所があり、相性の良い音声も異なるため、良い組み合わせを見つけることが重要です。

出力が英語のみの場合は、英語専用モデルのいずれかを強くおすすめします。英語専用コンテンツでは、多くの場合扱いやすく、より安定しており、全般的に優れたパフォーマンスを発揮します。コンテンツが他の言語または多言語になる可能性がある場合は、多言語モデルのいずれかを使用する必要があります。

モデルの詳細

音声設定

テキスト読み上げの音声
設定

最も一般的な設定は、安定性を50前後、類似性を75前後、スタイルを0に保ち、それ以降の変更を最小限にすることです。もちろん、これはすべて元の音声と目指す表現スタイルによって異なります。

AIは非決定的である点に注意が必要です。スライダーを特定の値に設定しても、毎回同じ結果が得られる保証はありません。スライダーは、各生成間でどの程度ランダム性を持たせるかという範囲を決めるものです。

速度

速度設定では、生成される音声の速度を上げたり下げたりできます。デフォルト値は1.0で、速度は調整されません。1.0未満の値では音声が遅くなり、最小値は0.7です。1.0を超える値では音声が速くなり、最大値は1.2です。極端な値は、生成される音声の品質に影響する可能性があります。

速度はEleven v3モデルでは利用できません。

安定性

安定性スライダーは、音声の安定性と生成ごとのランダム性を決定します。このスライダーを下げると、音声の感情表現の幅が広がります。前述のとおり、これは元の音声からも大きな影響を受けます。スライダーを低くしすぎると、ランダム性が強すぎる不自然な表現になり、キャラクターが速すぎる速度で話す原因になる場合があります。一方、高くしすぎると、感情表現が限られた単調な音声になる可能性があります。

より生き生きとしたドラマチックな表現にしたい場合は、安定性スライダーを低めに設定し、好みの表現が見つかるまで数回生成することをおすすめします。

一方、より真剣な表現にしたい場合や、非常に高い値で単調に近い表現にしたい場合は、安定性スライダーを高めに設定することをおすすめします。より一貫性があり安定しているため、通常は望む結果を得るために多くのサンプルを生成する必要はありません。最適な設定を見つけるために試してみてください。

類似性

類似性スライダーは、AIが元の音声を再現しようとする際に、どの程度忠実に従うかを決定します。元のオーディオの品質が低く、類似性スライダーを高く設定しすぎると、元の録音にアーティファクトやバックグラウンドノイズが含まれていた場合、AIが音声を模倣しようとしてそれらも再現することがあります。

類似性はEleven v3モデルでは利用できません。

スタイルの誇張

新しいモデルの導入に伴い、スタイルの誇張設定も追加しました。この設定は、元の話者のスタイルを強調しようとするものです。追加の計算リソースを消費するため、0以外に設定するとレイテンシーが増える可能性があります。この設定を使用すると、元の音声のスタイルを強調・模倣しようとするため、モデルの安定性がわずかに低下することが確認されています。

一般的には、この設定は常に0のままにすることをおすすめします。

スピーカーブースト

この設定は、元の話者との類似性を高めます。ただし、この設定を使用すると計算負荷がやや高くなり、結果としてレイテンシーが増加します。この設定による違いは、一般的にかなり微妙です。

スピーカーブーストはEleven v3モデルでは利用できません。

生成

音声を選択し、モデルを選び、設定を構成したら、生成プロセスは簡単です。テキストを入力して「音声を生成」を押すと、オーディオが生成されます。

手順自体は非常にシンプルですが、望む出力を得るには入力するテキストが極めて重要です。奇妙な名前、一般的でない略語、記号、絵文字など、AIが学習中にほとんど遭遇していない「分布外」の単語を使用すると、AIが混乱し、出力が不安定になるおそれがあります。特に絵文字や一部の記号は、AIが正しく解釈するのが困難です。

UIでテキスト読み上げを使用する場合、テキストの読みやすさを向上させ、AIが処理しやすくするために、入力に対して自動正規化を実行します。通常、このステップでは記号や数字を文章として表記されたテキストに変換し、AIに正しい発音を案内します。

特に多言語モデルを使用する場合は、数字を数字のまま書いたり、記号を使用したりしないことを強くおすすめします。この点は英語専用モデルにも当てはまります。数字や記号は多くの言語で同じように表記されますが、発音は異なるため、数字に頼るとAIにとって曖昧になります。たとえば、数字の「1」は英語や多くの言語で同じように表記されますが、発音は異なります。「one」のように数字をテキストで書けば、AIが何をすべきか解釈する必要がなくなります。

オーディオタグと呼ばれる機能を使い、AIの話し方や表現に影響を与えられる、より高度なワークフローの開発を進めています。この機能はEleven v4とEleven v3で利用できます。この機能について詳しく知りたい場合は、プロンプト作成ガイドをお読みになることをおすすめします。

よくある質問

最初の、そして最も重要な要素の一つは、高品質で一貫性のある優れた入力が、高品質で一貫性のある優れた出力につながることです。

たとえばノイズが多い音声、明瞭な音声にリバーブがかかっている音声、複数の話者が含まれる音声、音量・演技・話し方にばらつきがある音声など、理想的ではない音声をAIに提供すると、AIはより不安定になり、出力も予測しにくくなります。

自分の声をクローンする場合は、適切なボイスクローンを作成するためのドキュメントのガイドラインを確認することを強くおすすめします。これにより、最適な基盤から始められます。インスタントボイスクローンのみを使用する予定であっても、プロフェッショナルボイスクローンのセクションも読むことをおすすめします。このセクションには、2つの技術で要件が多少異なる場合でも、ボイスクローンの作成に役立つ情報が含まれています。

次に考慮すべき要素は、選択する音声が出力に大きな影響を与えることです。最初の要素で触れたように、そのクローンの作成に使用したサンプルの品質と一貫性が非常に重要であるだけでなく、音声の言語やトーンも重要です。

明るく楽しそうな音声が必要な場合は、明るく楽しそうなサンプルを使ってクローンした音声を使用してください。反対に、内省的で陰鬱な印象の音声が必要な場合は、そのような特徴を持つ音声を選択してください。

ただし、正しい言語でトレーニングされた音声を使用することも重要です。たとえば、デフォルト音声として提供されるプロフェッショナルボイスクローンはすべて英語音声であり、英語のサンプルでトレーニングされています。そのため、別の言語を話させると、その言語でのパフォーマンスは予測しにくくなる可能性があります。AIに話させたい言語を話しているサンプルからクローンされた音声を使用することが不可欠です。

少し些細なことに思えるかもしれませんが、大きな違いを生むことがあります。AIは、使用される単語だけでなく、その組み合わせ方、句読点の使い方、文法、テキスト全体の書式といったテキスト自体の文脈に基づいて、読み方を理解しようとします。

これはAIの話し方に小さくても大きな影響を与えることがあります。単語のスペルを間違えても、AIは修正せず、書かれたとおりに読もうとします。

AIの設定は非決定的です。つまり、初期条件(音声、設定、モデル)が同じでも、ボイスアクターが毎回少し異なる演技をするのと同様に、出力はわずかに異なります。

このばらつきは、先述した音声、設定、モデルなど、さまざまな要因によって生じます。通常、このばらつきの幅は安定性スライダーで制御できます。安定性を低く設定すると、生成結果間のばらつきの幅が広がりますが、世代間のばらつきも生じ、AIの表現がやや豊かになります。

ばらつきが大きい方が望ましい場合もあります。安定性を高く設定しすぎると、AIがより変化に富んだコンテンツを生成する余地がなくなり、一部の音声が単調に聞こえることがあります。ただし、安定性を低く設定しすぎると、特にクローン処理に理想的ではない音声を使用した可能性がある特定の音声で、生成結果が不安定になるなどの問題が発生することもあります。

デフォルト設定の50は、ほとんどの用途で優れた開始点です。

Eleven v4に切り替え、ご自身のコンテンツでテストすることをおすすめします。

Eleven v4は、最新かつ最も高度なテキスト読み上げモデルであり、新世代モデルの第一弾です。Eleven v3と比べて、出力品質、音声の正確性、感情表現、オーディオタグ、対応言語が向上しています。

Eleven v4では、ボイスクローンの精度が大きく向上しました。クローンされた音声は、これまでのどのモデルよりも忠実に、元となる音声の特徴(音色、リズム、話し方)を捉えます。

Eleven v4では、インスタントボイスクローン(IVC)の精度がこれまで以上に向上しています。元となる音声の特徴をより忠実に捉えるため、短いオーディオサンプルから説得力のあるクローンをすばやく作成しやすくなりました。

Eleven v4は、プロフェッショナルボイスクローン(PVC)を完全にサポートしています。音声精度における同じ進歩を活用し、最高レベルの一貫性と制御が求められるワークフロー向けに、元の音声をより忠実に再現します。

Eleven v4には2つのバリアントがあり、ユースケースに応じて品質と速度の最適なバランスを選べます:

  • Eleven v4 (eleven_v4)— 最高品質のモデルです。コンテンツ制作、オーディオブック、キャラクターのボイスオーバーなど、品質を最優先するあらゆるユースケースに最適です。
  • Eleven v4 Turbo (eleven_v4_turbo)— 優れた低レイテンシを維持しながら、非常に高い品質を実現します。会話型エージェントやインタラクティブな音声体験など、リアルタイムのユースケース向けに設計されています。

どちらのバリアントも、StabilityとSimilarityの2つの音声設定を使用します。Eleven v4ではStyleとSpeedのスライダーは利用できず、SSMLもサポートされていません。

生成する言語が参照音声の言語と一致する場合、元のアクセントは従来どおり正確に保持されます。生成する言語が参照音声の言語と異なる場合、Eleven v4は参照音声の元言語のアクセントを引き継ぐのではなく、対象言語で流暢かつ自然な音声を生成します。

モデルIDにeleven_v4を指定して、Create speechとStream speechで生成できます。複数話者には、Create dialogueとStream dialogueを使用してください。

クローン、アクセント、比較、詳細な説明については、Eleven v4をご覧ください。タグとプロンプトについては、Eleven v4のプロンプトをご覧ください。

Eleven v4に切り替え、ご自身のコンテンツでテストすることをおすすめします。Eleven v4のプロンプト手法の多くは、 Eleven v3にも適用できます。

Eleven v3は、感情豊かで表現力に優れたテキスト読み上げモデルです。70以上の言語で、高い感情表現力と文脈理解を備えた、自然で人間らしい音声を生成します。

Eleven v3の特長:

  • オーディオタグに対応
    • 感情:[sad] [angry] [happily]
    • 読み上げの指示:[whispers] [shouts]
    • 非言語的な反応:[laughs] [clears throat] [sighs]
  • 複数話者による自然な音声のためのDialogueモード
  • 70以上の言語に対応

このモデルは、キャラクター同士の会話、オーディオブックのナレーション、感情的な対話に適しています。

APIでは、モデルIDにeleven_v3を指定し、Create speechおよびStream speechエンドポイントを使用してv3で生成できます。

Create dialogueおよびStream dialogueエンドポイントを使用して、複数話者による自然な対話を作成することもできます。

詳しくは、以下のリソースをご覧ください:

音声速度の調整は、音声合成、Studio、ElevenAgents、APIを介したテキスト読み上げで利用できます。

Speed設定で音声の速度を調整できます。

設定可能な値は0.7~1.2です。1未満の値では音声が遅くなり、1を超える値では速くなります。極端な値を設定すると、生成される音声の品質に影響する場合があります。 

この設定は、すべての音声とすべてのモデルで利用できます。音声設定から確認できます。

API使用時の音声制御については、APIリファレンスをご覧ください。

どの音声でも、対応しているすべての言語を話すことができます。

現在のモデルでは、特定の言語を選択するのではなく、AIに話させたい言語で入力します。AIが自動的に理解します。ただし、異なる言語間では、似た単語や語彙を使用していても発音やアクセントが大きく異なる場合があります。そのため、正しいアクセントの言語を話している音声を使ってクローンした音声を使用してください。

言語はテキストによって決まり、アクセントと発音は音声自体によって決まります。最適に機能するには、両方のコンテキストが必要です。

言語選択を容易にする新技術の開発を進めていますが、AIの構造上、すべてはまだ開発中です。

生成したファイルは、次の2つの方法でダウンロードできます:

コンテンツを生成した直後に、右下のダウンロードボタンをクリックしてダウンロードできます。

以前に生成したファイルは、履歴からダウンロードできます。 

履歴にアクセスするには、アカウントにログインし、サイドバーでテキスト読み上げを選択します。次に、画面右側のパネルにある履歴タブをクリックします。画面幅が狭い場合は、Generate speechボタンの上にある履歴アイコンをクリックして履歴にアクセスできます。

履歴では、ダウンロードアイコンをクリックすると、MP3(128kbps)またはWAVファイルとしてダウンロードするオプションが表示されます。 

Advancedをクリックすると、追加のファイル形式でダウンロードすることもできます:

  • MP3(192kbps)
  • MP3(256kbps)
  • M4A
  • FLAC

はい。Eleven v4およびEleven v3では、[sighs]や[exhales]などのオーディオタグを使用して、生成音声に呼吸や類似の反応を追加できます。

オーディオタグと話し方の制御について詳しくは、プロンプトガイドを参照してください。

FlashおよびTurboモデルは、低レイテンシーのアプリケーション向けに特別に開発されています。

Flash v2とFlash v2.5は、75ms未満でオーディオを生成する超低レイテンシーモデルです。Flash v2は英語のみ対応し、Flash v2.5は32言語に対応しています。対応言語の一覧は こちらをご覧ください。

Turboモデルも低レイテンシーですが、Flashモデルは非常によく似た結果を提供するため、TurboよりFlashモデルの使用をおすすめします。Turbo v2は英語のみ対応し、Turbo v2.5は32言語に対応しています。また、Turbo v2より25%高速で、約300msでオーディオを生成します。

FlashとTurboはいずれも高度に最適化されたモデルで、モデルに期待される品質基準を維持しながら、音声品質を損なうことなく低レイテンシーアプリケーション向けに特別に設計されています。

どちらのモデルも、API経由で生成すると割引が適用されます。詳細はAPI料金をご覧ください。

カスタマイズされたインタラクティブな音声エージェントを展開するプラットフォーム、ElevenAgentsも提供しています。詳しくはElevenAgentsのドキュメントをご覧ください。

間や区切りを追加し、話者のリズムや抑揚に影響を与える方法はいくつかあります。使用する方法はモデルによって異なります。

オーディオタグ(Eleven v4およびEleven v3)

Eleven v4およびEleven v3では、オーディオタグと句読点を使用してペースや話し方を制御します。これらのモデルはSSMLのbreakタグに対応していません。

間や話し方をプロンプトで指定する方法については、プロンプトガイドを参照してください。

breakタグ(Multilingual v2、Flash v2、Flash v2.5)

Multilingual v2、Flash v2、Flash v2.5で最も一貫して間を追加するには、SSMLのbreakタグ構文<break time="1.5s" />を使用します。これにより、音声に正確かつ自然な間が作られます。単に単語間に無音が挿入されるのではなく、モデルが構文を理解して自然な間を追加します。

モデルによるこれらの間の処理方法は異なる場合があります。使用する音声が出力に重要な役割を果たします。「uh」や「ah」をいくつか含む学習データで訓練された音声では、実際の話者のように、間の間にこうした発声の癖が挿入されることがあります。

次のようになります:

「少し考えさせてください。」<break time="1.0s" />「はい、それでうまくいきます。」

break時間は秒単位で指定してください。AIは最大3秒の間を処理でき、テキスト読み上げとAPIで使用できます。

テキスト内でSSMLのbreakを過度に多用すると、問題が発生する可能性があります。音声が速くなったり、オーディオにノイズやその他のアーティファクトが増えたりする場合があります。現在、この問題の解決に取り組んでいます。

句読点

これらの方法はbreakタグやオーディオタグほど一貫性はありませんが、ペースに影響を与えることはできます。

シンプルなハイフン-またはダッシュ—が効果的な場合があります。より長い間を作るには、-- --のように複数のダッシュを追加できます。

「もう - 遅く - なってきました。」

三点リーダー...は単語間に間を追加できる場合がありますが、通常は音声にためらいや緊張感も加わるため、常に適しているとは限りません。

「うーん…そうですね…たぶん。」

Eleven v3は国際音声記号(IPA)をネイティブでサポートしています。詳しくはEleven v3でのIPAをご覧ください。

SSML phonemeタグ(Flash v2およびTurbo v2のみ)

Flash v2およびTurbo v2では、SSML phonemeタグを使用して特定の発音を指定できます。IPAとCMUの両方をサポートしています。現在の実装では、CMUのほうがやや予測しやすく、一貫性があります。詳しくは発音ガイドをご覧ください。

代替スペル

別の方法として、代替スペルを見つけ、単語をより発音に近い形で記述する方法があります。大文字、ハイフン、アポストロフィ、あるいは単一の文字や複数の文字をシングルクォーテーションで囲むなど、さまざまな工夫ができます。

たとえば、「trapezii」のような単語は、「ii」をより強調するために「trapezIi」と表記できます。

Eleven v4とEleven v3はオーディオタグに対応しています。Eleven v4の使用をおすすめします。短い指示を角括弧で囲み、読み上げ方を変えたい箇所のテキスト内に配置してください。同じタグが両モデルで使えます。

  • 感情:[curious] [crying] [mischievously]
  • 読み上げの指示:[whispers] [shouts]
  • 人間らしい反応:[laughs] [clears throat] [sighs]

詳しくは、プロンプトガイドをご覧ください。

APIでは、モデルIDにeleven_v4またはeleven_v3を指定し、Create speechおよびStream speechエンドポイントを使用して生成できます。

Create dialogueおよびStream dialogueエンドポイントを使用して、複数話者による自然な対話を作成することもできます。

リアルタイムアプリケーションでは、Eleven v4 Turbo(eleven_v4_turbo)もオーディオタグに対応しています。

詳しくは、以下のリソースをご覧ください:

テキスト読み上げまたはボイスチェンジャーで生成したファイルは、MP3、WAV、M4A、FLACファイルとしてダウンロードできます。WAV、M4A、FLACファイルは履歴からダウンロードする必要があります。   

WAVファイルをダウンロードする方法

サイドバーでテキスト読み上げまたはボイスチェンジャーを選択し、画面右側のパネルにある履歴タブをクリックして履歴にアクセスします。画面幅が狭い場合は、Generate speechボタンの上にある履歴アイコンをクリックして履歴にアクセスできます。

履歴では、ダウンロードアイコンをクリックすると、MP3またはWAVファイルとしてダウンロードするオプションが表示されます。

FLACまたはM4Aファイルをダウンロードする方法

サイドバーでテキスト読み上げまたはボイスチェンジャーを選択し、画面右側のパネルにある履歴タブをクリックして履歴にアクセスします。画面幅が狭い場合は、Generate speechボタンの上にある履歴アイコンをクリックして履歴にアクセスできます。

履歴では、ダウンロードアイコンをクリックすると、MP3またはWAVファイルとしてダウンロードするオプションが表示されます。FLACやM4Aを含む追加のファイル形式にアクセスするには、Advancedをクリックして希望の形式を選択してください。

ウェブサイトで生成する場合の言語

ElevenLabsのウェブサイトでオーディオを生成する場合、AIはプロンプト内のテキストの文脈に基づいて言語を自動的に検出します。そのため、1つのプロンプトで複数の言語を使用することは避けるのが最適です。どの言語を使用すべきか混乱する可能性があります。現在、ウェブサイトで生成する際に言語を指定することはできません。 

API経由で生成する場合の言語

APIを通じてオーディオを生成する場合は、language_codeパラメータを使用してプロンプトの言語を手動で指定できます。これはISO 639-1言語コードを受け取る任意のパラメータです。 

これは、テキストに数字しか含まれていない場合など、短いプロンプトや曖昧なプロンプトで役立ちます。言語を指定することで、正規化機能がその言語に適したルールを適用できます。

正規化について詳しくは、こちらの記事をご覧ください。

アクセント

生成で使用されるアクセントは、使用する音声に由来します。生成する言語で学習していない音声を使用すると、その音声の元の言語のアクセントがわずかに出ることがあります。

最適な結果を得るには、生成する言語のオーディオで学習され、希望するアクセントを持つ音声を使用することをおすすめします。これにより、AIは発音とイントネーションをより正確に理解できます。

これは、似ている言語や共通する単語が多い言語では特に重要です。正しい言語で学習された音声を選ぶことで、AIが正しい発音とアクセントを使用できるようになります。

次のことができます:

  • 希望する言語とアクセントのオーディオを使用して、クローン音声を作成する。
  • ボイスライブラリを閲覧する。検索フィルターを使用して、ニーズに合った適切な音声を見つけられます。

ウェブサイトでEleven v3を使用して生成する場合、1文字あたり1クレジットです。APIでの生成には割引が適用されます。詳細はAPI料金をご覧ください。 

詳しくは、以下のリソースをご覧ください:

Eleven v4とEleven v3では、[laughs]などのオーディオタグを使って、生成された音声に笑い声やその他の反応を加えられます。詳しくはプロンプトガイドをご覧ください。

その他のモデルでは、感情表現のある読み上げは文脈、句読点、音声設定に左右されます。感情を表現するには?をご覧ください。

モデルは各発話を取り巻く広い文脈を考慮し、前後のテキストとのつながりから内容の自然さを判断します。この俯瞰的な視点により、複数の文にまたがる一連の思考に一貫した感情パターンを重ね、長い文章でも適切なイントネーションで読み上げられます。

感情を表現するためのヒント:

  • 特定の感情を生成するには文脈が重要です。笑いや面白さに関するテキストを入力すると、楽しげな出力になる場合があります。怒り、悲しみ、その他の感情についても同様に、文脈の設定が重要です。
  • 出力の読み上げ方は、句読点と音声設定によって大きく左右されます。
  • 強調したい単語やフレーズを引用符で囲んでください。
  • ボイスクローンで生成する音声では、クローン作成用にアップロードしたサンプルの話し方が出力に反映されます。アップロードしたサンプルの音声が単調な場合、モデルは表現力のある出力を生成しにくくなります。

Eleven v4とEleven v3では、[happy]、[sad]、[angry]、[whispers]、[laughs]などのオーディオタグを使って、感情や読み上げ方をより直接的に制御することもできます。詳しくはプロンプトガイドをご覧ください。

これらのヒントは感情表現のある読み上げを導くのに役立ちますが、特定の結果を保証するものではありません。

残念ながら現時点では、生成時のクォータ消費に代わる、ダウンロード時の消費は提供していません。クォータを消費せずに生成結果をプレビューする方法は現在ありません。

ウェブサイトで「生成」を押すと、サーバーの起動とオーディオの生成が必要になるため、クレジットが消費されます。クレジットを使わずに、自分のテキストで音声をテストまたはプレビューすることはできません。

ウェブサイトのテキスト読み上げでは、以下の条件を満たす場合に2回まで無料で再生成できます。

  • プロンプト(テキスト読み上げの場合)またはファイル(ボイスチェンジャーの場合)、音声、モデルが同一であること。音声設定のスライダーは変更できます。
  • 最初の生成から2時間以内であること。
  • 元のオーディオを生成してからページを更新していないこと。

この場合、「音声を再生成」と表示されます。「音声を再生成」ボタンにカーソルを合わせると、残りの無料再生成回数が表示されます。

無料再生成を使い切ると、ボタンは「音声を生成」に戻り、生成に使用されるクレジット数が表示されます。

無料再生成は、ウェブサイトのテキスト読み上げでのみ利用できます。APIでは利用できません。

価格やコストを上げずに、この品質でプレビューを実現する方法を検討しています。また、AIの制御性を高め、プレビューなしでも、できれば最初の試行で期待どおりの結果を得られるようにする方法も模索しています。

Eleven v4とEleven v3ではDialogueモードを利用できます。会話の文脈に応じて、自然な間合いで、割り込み、口調の変化、感情的な合図を処理する、動的な複数話者の会話を生成できます。

Dialogueモードは、ウェブサイトで複数の話者を使用する場合に利用できます。

Text to Dialogue APIエンドポイントを使用して、複数話者によるやり取りを生成することもできます。詳しくはAPIドキュメントをご覧ください:

詳しくは、以下のリソースをご覧ください:

どの音声でも、AIが現在サポートしているすべての言語を話せます。ただし、AIに話させたい言語を母語とする音声を使用しない場合、たとえば生成された音声や英語を話す音声からクローンした音声を使用すると、わずかに英語アクセントが出たり、類似した言語の間を行き来したりすることがあります。

サポートされているすべての言語の一覧については、こちらの記事をご覧ください:対応している言語は何ですか?

現在のモデルでは、特定の言語を選択する必要はありません。AIに話させたい言語で文章を書けば、AIが自動的に理解します。ただし、類似した単語や語彙を使いながら発音やアクセントが大きく異なる言語もあるため、正しいアクセントでその言語を話してクローンした音声を使用することをおすすめします。これにより、AIは何をどの言語で話すべきかを判断するための十分な文脈を得られます。

言語はテキストによって決まり、アクセントと発音は音声そのものによって決まります。

言語選択を可能にする新技術を開発中ですが、AIの仕組み上、現時点ではまだ開発途上です。

ウェブサイトのテキスト読み上げでは、有料プランなら1回の生成で最大5,000文字、無料プランなら最大2,500文字を生成できます。

ただし、数千文字を超える長文コンテンツを生成する場合は、書籍や小説などの非常に長いコンテンツを簡単に生成できるStudioの使用を強くおすすめします。詳細はこちらをご覧ください。

APIで生成する場合、入力の最大長は使用するモデルによって異なります。

テキスト読み上げ

Flash v2.5 - 最大40,000文字(約40分のオーディオ)

Turbo v2.5 - 最大40,000文字(約40分のオーディオ)

Flash v2 - 最大30,000文字(約30分のオーディオ)

Turbo v2 - 最大30,000文字(約30分のオーディオ)

Multilingual v2 - 最大10,000文字(約10分のオーディオ)

ボイスチェンジャー

Multilingual v2 - 最大10分のオーディオ

既製の音声と生成された音声はすべて英語です。そのため、他の言語を話す際には、正しいアクセントや発音にならない場合があります。

ボイスライブラリのプロフェッショナルカテゴリでは、コミュニティが共有した音声を見つけられます。これらは、それぞれの話者自身の音声をプロフェッショナルボイスクローンしたものです。通常、クローン作成時に話していた言語を示す言語タグが付いているため、その言語のネイティブ音声です。特定の言語で絞り込むには、言語検索フィルターも使用できます。

数字、日付、記号、頭字語は、正しく読み上げる方法が複数あることが多いため、AIにとって難しい場合があります。これは使用されている言語にも依存します。たとえば「11」は「Eleven」と読めますが、スペイン語では「Once」、ドイツ語では「Elf」と読むこともできます。  

数字、日付、頭字語、記号を正しく読み上げるための方法はいくつかあります。

単語で完全に書く

最良の結果を得るには、数字、頭字語、日付、記号を、AIに読み上げてほしい形式で完全に単語として書くことをおすすめします。これによりAIは十分な文脈を得られ、正しい出力を提供できます。たとえば「$100」の場合、期待どおりの結果を得るために、「a hundred dollars」または「one hundred dollars」と書くことをおすすめします。  

LLMの使用

たとえばElevenAgentsを使用する際など、大規模言語モデルでテキストプロンプトを生成している場合は、AIに読み上げてほしい形式で、数字、日付、記号、頭字語を常に単語として書くようモデルにプロンプトで指示できます。

正規化

API経由で生成する場合は、apply_text_normalizationパラメーターを使用してテキスト正規化を適用するかどうかを指定できます。テキスト正規化では、より正確に発音できるよう数字や日付を単語に展開します。このオプションでは、正規化処理に追加の処理時間が必要になるため、レイテンシーが増加します。

apply_text_normalizationパラメーターには3つのモードがあります。

  • on:常に適用されます
  • off:適用されません
  • auto:AIがテキスト正規化を適用するタイミングを自動的に判断します

language_codeパラメーターを使用して、プロンプトの言語を指定することもできます。これはISO 639-1言語コードを受け付けるオプションのパラメーターです。 

これは、テキストに数字や記号のみが含まれる場合など、短いプロンプトや曖昧なプロンプトで役立ちます。言語を指定すると、正規化機能がその言語に適したルールを適用できます。

詳細は、APIリファレンスをご覧ください。

ウェブサイトのテキスト読み上げで生成する場合、正規化はデフォルトで有効になっています。  

Studioでは、デフォルトで正規化が自動適用されます。つまり、AIがテキスト正規化を適用するタイミングを判断します。正規化を常に適用する設定も可能です。このオプションは、詳細設定タブのプロジェクト設定にあります。

誤発音にはいくつかの原因があります。最も一般的なのは、単語のスペルミスです。AIはスペルミスのある単語を修正しようとはせず、書かれたとおりに読み上げようとします。そのため、AIに読み上げさせる前に、テキストを校正し、完成していることを必ず再確認することが重要です。

特定の発音を指定したい場合は、Flash v2モデルでSSML音素タグを使用できます。詳細は発音ガイドをご覧ください。

AIが予期しない単語を誤発音したり、期待とは異なるアクセントで話したりすることがあります。これにはいくつかの理由があり、多くの場合、使用する音声と言語に大きく依存します。正しいアクセントと発音を確保する最善の方法は、正しいアクセントと発音で話す音声をクローンすることです。これにより、AIはオーディオ生成時に最も多くの文脈を得られます。

言語はテキストで指定され、アクセントは音声で指定されます。そのため、多くの共通単語を共有する言語や、別の言語とかなり近い関係にある言語で書いている場合、AIが特定の単語の発音を理解したり、アクセントを切り替えたりするのが難しいことがあります。

ただし、特定の状況では、英語であっても正しく書かれた単語をAIが誤発音することがあります。これは使用する音声とテキストに大きく依存するようですが、まれなケースです。

No results