良い入力は良い出力につながる 最初の、そして最も重要な要素の一つは、高品質で一貫性のある優れた入力が、高品質で一貫性のある優れた出力につながることです。
たとえばノイズが多い音声、明瞭な音声にリバーブがかかっている音声、複数の話者が含まれる音声、音量・演技・話し方にばらつきがある音声など、理想的ではない音声をAIに提供すると、AIはより不安定になり、出力も予測しにくくなります。
自分の声をクローンする場合は、適切なボイスクローンを作成するためのドキュメントのガイドラインを確認することを強くおすすめします。これにより、最適な基盤から始められます。インスタントボイスクローンのみを使用する予定であっても、プロフェッショナルボイスクローンのセクションも読むことをおすすめします。このセクションには、2つの技術で要件が多少異なる場合でも、ボイスクローンの作成に役立つ情報が含まれています。
適切な音声を使う 次に考慮すべき要素は、選択する音声が出力に大きな影響を与えることです。最初の要素で触れたように、そのクローンの作成に使用したサンプルの品質と一貫性が非常に重要であるだけでなく、音声の言語やトーンも重要です。
明るく楽しそうな音声が必要な場合は、明るく楽しそうなサンプルを使ってクローンした音声を使用してください。反対に、内省的で陰鬱な印象の音声が必要な場合は、そのような特徴を持つ音声を選択してください。
ただし、正しい言語でトレーニングされた音声を使用することも重要です。たとえば、デフォルト音声として提供されるプロフェッショナルボイスクローンはすべて英語音声であり、英語のサンプルでトレーニングされています。そのため、別の言語を話させると、その言語でのパフォーマンスは予測しにくくなる可能性があります。AIに話させたい言語を話しているサンプルからクローンされた音声を使用することが不可欠です。
適切な書式を使用する 少し些細なことに思えるかもしれませんが、大きな違いを生むことがあります。AIは、使用される単語だけでなく、その組み合わせ方、句読点の使い方、文法、テキスト全体の書式といったテキスト自体の文脈に基づいて、読み方を理解しようとします。
これはAIの話し方に小さくても大きな影響を与えることがあります。単語のスペルを間違えても、AIは修正せず、書かれたとおりに読もうとします。
非決定的 AIの設定は非決定的です。つまり、初期条件(音声、設定、モデル)が同じでも、ボイスアクターが毎回少し異なる演技をするのと同様に、出力はわずかに異なります。
このばらつきは、先述した音声、設定、モデルなど、さまざまな要因によって生じます。通常、このばらつきの幅は安定性スライダーで制御できます。安定性を低く設定すると、生成結果間のばらつきの幅が広がりますが、世代間のばらつきも生じ、AIの表現がやや豊かになります。
ばらつきが大きい方が望ましい場合もあります。安定性を高く設定しすぎると、AIがより変化に富んだコンテンツを生成する余地がなくなり、一部の音声が単調に聞こえることがあります。ただし、安定性を低く設定しすぎると、特にクローン処理に理想的ではない音声を使用した可能性がある特定の音声で、生成結果が不安定になるなどの問題が発生することもあります。
デフォルト設定の50は、ほとんどの用途で優れた開始点です。
Eleven v4とは?
Eleven v4に切り替え、ご自身のコンテンツでテストすることをおすすめします。
Eleven v4は、最新かつ最も高度なテキスト読み上げモデルであり、新世代モデルの第一弾です。Eleven v3と比べて、出力品質、音声の正確性、感情表現、オーディオタグ、対応言語が向上しています。
Eleven v4では、ボイスクローンの精度が大きく向上しました。クローンされた音声は、これまでのどのモデルよりも忠実に、元となる音声の特徴(音色、リズム、話し方)を捉えます。
Eleven v4では、インスタントボイスクローン(IVC)の精度がこれまで以上に向上しています。元となる音声の特徴をより忠実に捉えるため、短いオーディオサンプルから説得力のあるクローンをすばやく作成しやすくなりました。
Eleven v4は、プロフェッショナルボイスクローン(PVC)を完全にサポートしています。音声精度における同じ進歩を活用し、最高レベルの一貫性と制御が求められるワークフロー向けに、元の音声をより忠実に再現します。
Eleven v4には2つのバリアントがあり、ユースケースに応じて品質と速度の最適なバランスを選べます:
Eleven v4 (eleven_v4)— 最高品質のモデルです。コンテンツ制作、オーディオブック、キャラクターのボイスオーバーなど、品質を最優先するあらゆるユースケースに最適です。
Eleven v4 Turbo (eleven_v4_turbo)— 優れた低レイテンシを維持しながら、非常に高い品質を実現します。会話型エージェントやインタラクティブな音声体験など、リアルタイムのユースケース向けに設計されています。
どちらのバリアントも、StabilityとSimilarityの2つの音声設定を使用します。Eleven v4ではStyleとSpeedのスライダーは利用できず、SSMLもサポートされていません。
生成する言語が参照音声の言語と一致する場合、元のアクセントは従来どおり正確に保持されます。生成する言語が参照音声の言語と異なる場合、Eleven v4は参照音声の元言語のアクセントを引き継ぐのではなく、対象言語で流暢かつ自然な音声を生成します。
モデルIDにeleven_v4を指定して、Create speech とStream speech で生成できます。複数話者には、Create dialogue とStream dialogue を使用してください。
クローン、アクセント、比較、詳細な説明については、Eleven v4 をご覧ください。タグとプロンプトについては、Eleven v4のプロンプト をご覧ください。
Eleven v3とは? Eleven v3は、感情豊かで表現力に優れたテキスト読み上げモデルです。70以上の言語で、高い感情表現力と文脈理解を備えた、自然で人間らしい音声を生成します。
Eleven v3の特長:
オーディオタグに対応
感情:[sad] [angry] [happily]
読み上げの指示:[whispers] [shouts]
非言語的な反応:[laughs] [clears throat] [sighs]
複数話者による自然な音声のためのDialogueモード
70以上の言語に対応
このモデルは、キャラクター同士の会話、オーディオブックのナレーション、感情的な対話に適しています。
APIでは、モデルIDにeleven_v3を指定し、Create speech およびStream speech エンドポイントを使用してv3で生成できます。
Create dialogue およびStream dialogue エンドポイントを使用して、複数話者による自然な対話を作成することもできます。
詳しくは、以下のリソースをご覧ください:
音声の速度を変更できますか? 音声速度の調整は、音声合成、Studio、ElevenAgents、APIを介したテキスト読み上げで利用できます。
Speed設定で音声の速度を調整できます。
設定可能な値は0.7~1.2です。1未満の値では音声が遅くなり、1を超える値では速くなります。極端な値を設定すると、生成される音声の品質に影響する場合があります。
この設定は、すべての音声とすべてのモデルで利用できます。音声設定から確認できます。
API使用時の音声制御については、APIリファレンス をご覧ください。
同じクローン/デザインした音声を複数の言語で使えますか? どの音声でも、対応しているすべての言語を話すことができます。
現在のモデルでは、特定の言語を選択するのではなく、AIに話させたい言語で入力します。AIが自動的に理解します。ただし、異なる言語間では、似た単語や語彙を使用していても発音やアクセントが大きく異なる場合があります。そのため、正しいアクセントの言語を話している音声を使ってクローンした音声を使用してください。
言語はテキストによって決まり、アクセントと発音は音声自体によって決まります。最適に機能するには、両方のコンテキストが必要です。
言語選択を容易にする新技術の開発を進めていますが、AIの構造上、すべてはまだ開発中です。
テキスト読み上げで生成したファイルをダウンロードするには? 生成したファイルは、次の2つの方法でダウンロードできます:
コンテンツを生成した直後に、右下のダウンロードボタンをクリックしてダウンロードできます。
以前に生成したファイルは、履歴からダウンロードできます。
履歴にアクセスするには、アカウントにログインし、サイドバーでテキスト読み上げ を選択します。次に、画面右側のパネルにある履歴タブをクリックします。画面幅が狭い場合は、Generate speech ボタンの上にある履歴アイコンをクリックして履歴にアクセスできます。
履歴では、ダウンロードアイコンをクリックすると、MP3(128kbps)またはWAVファイルとしてダウンロードするオプションが表示されます。
Advanced をクリックすると、追加のファイル形式でダウンロードすることもできます:
MP3(192kbps)
MP3(256kbps)
M4A
FLAC
音声に呼吸音を出させることはできますか? はい。Eleven v4およびEleven v3では、[sighs]や[exhales]などのオーディオタグを使用して、生成音声に呼吸や類似の反応を追加できます。
オーディオタグと話し方の制御について詳しくは、プロンプトガイド を参照してください。
会話用途やチャットボット向けのAIモデルはありますか? FlashおよびTurboモデルは、低レイテンシーのアプリケーション向けに特別に開発されています。
Flash v2とFlash v2.5は、75ms未満でオーディオを生成する超低レイテンシーモデルです。Flash v2は英語のみ対応し、Flash v2.5は32言語に対応しています。対応言語の一覧は
こちら をご覧ください。
Turboモデルも低レイテンシーですが、Flashモデルは非常によく似た結果を提供するため、TurboよりFlashモデルの使用をおすすめします。Turbo v2は英語のみ対応し、Turbo v2.5は32言語に対応しています。また、Turbo v2より25%高速で、約300msでオーディオを生成します。
FlashとTurboはいずれも高度に最適化されたモデルで、モデルに期待される品質基準を維持しながら、音声品質を損なうことなく低レイテンシーアプリケーション向けに特別に設計されています。
どちらのモデルも、API経由で生成すると割引が適用されます。詳細はAPI料金をご覧ください。
カスタマイズされたインタラクティブな音声エージェントを展開するプラットフォーム、ElevenAgentsも提供しています。詳しくはElevenAgentsのドキュメントをご覧ください。
ポーズを追加するには? 間や区切りを追加し、話者のリズムや抑揚に影響を与える方法はいくつかあります。使用する方法はモデルによって異なります。
オーディオタグ(Eleven v4およびEleven v3) Eleven v4およびEleven v3では、オーディオタグと句読点を使用してペースや話し方を制御します。これらのモデルはSSMLのbreakタグに対応していません。
間や話し方をプロンプトで指定する方法については、プロンプトガイド を参照してください。
breakタグ(Multilingual v2、Flash v2、Flash v2.5) Multilingual v2、Flash v2、Flash v2.5で最も一貫して間を追加するには、SSMLのbreakタグ構文<break time="1.5s" />を使用します。これにより、音声に正確かつ自然な間が作られます。単に単語間に無音が挿入されるのではなく、モデルが構文を理解して自然な間を追加します。
モデルによるこれらの間の処理方法は異なる場合があります。使用する音声が出力に重要な役割を果たします。「uh」や「ah」をいくつか含む学習データで訓練された音声では、実際の話者のように、間の間にこうした発声の癖が挿入されることがあります。
次のようになります:
「少し考えさせてください。」<break time="1.0s" />「はい、それでうまくいきます。」
break時間は秒単位で指定してください。AIは最大3秒の間を処理でき、テキスト読み上げとAPIで使用できます。
テキスト内でSSMLのbreakを過度に多用すると、問題が発生する可能性があります。音声が速くなったり、オーディオにノイズやその他のアーティファクトが増えたりする場合があります。現在、この問題の解決に取り組んでいます。
句読点 これらの方法はbreakタグやオーディオタグほど一貫性はありませんが、ペースに影響を与えることはできます。
シンプルなハイフン-またはダッシュ—が効果的な場合があります。より長い間を作るには、-- --のように複数のダッシュを追加できます。
「もう - 遅く - なってきました。」
三点リーダー...は単語間に間を追加できる場合がありますが、通常は音声にためらいや緊張感も加わるため、常に適しているとは限りません。
「うーん…そうですね…たぶん。」
単語や名前の発音を指定するには? Eleven v3は国際音声記号(IPA)をネイティブでサポートしています。詳しくはEleven v3でのIPA をご覧ください。
SSML phonemeタグ(Flash v2およびTurbo v2のみ) Flash v2およびTurbo v2では、SSML phonemeタグを使用して特定の発音を指定できます。IPAとCMUの両方をサポートしています。現在の実装では、CMUのほうがやや予測しやすく、一貫性があります。詳しくは発音ガイド をご覧ください。
代替スペル 別の方法として、代替スペルを見つけ、単語をより発音に近い形で記述する方法があります。大文字、ハイフン、アポストロフィ、あるいは単一の文字や複数の文字をシングルクォーテーションで囲むなど、さまざまな工夫ができます。
たとえば、「trapezii」のような単語は、「ii」をより強調するために「trapezIi」と表記できます。
Eleven v3とv4でオーディオタグはどのように機能しますか? Eleven v4 とEleven v3はオーディオタグに対応しています。Eleven v4の使用をおすすめします。短い指示を角括弧で囲み、読み上げ方を変えたい箇所のテキスト内に配置してください。同じタグが両モデルで使えます。
感情:[curious] [crying] [mischievously]
読み上げの指示:[whispers] [shouts]
人間らしい反応:[laughs] [clears throat] [sighs]
詳しくは、プロンプトガイド をご覧ください。
APIでは、モデルIDにeleven_v4またはeleven_v3を指定し、Create speech およびStream speech エンドポイントを使用して生成できます。
Create dialogue およびStream dialogue エンドポイントを使用して、複数話者による自然な対話を作成することもできます。
リアルタイムアプリケーションでは、Eleven v4 Turbo(eleven_v4_turbo)もオーディオタグに対応しています。
詳しくは、以下のリソースをご覧ください:
WAV、M4A、FLACファイルをダウンロードするには? テキスト読み上げまたはボイスチェンジャーで生成したファイルは、MP3、WAV、M4A、FLACファイルとしてダウンロードできます。WAV、M4A、FLACファイルは履歴からダウンロードする必要があります。
WAVファイルをダウンロードする方法 サイドバーでテキスト読み上げ またはボイスチェンジャー を選択し、画面右側のパネルにある履歴タブをクリックして履歴にアクセスします。画面幅が狭い場合は、Generate speech ボタンの上にある履歴アイコンをクリックして履歴にアクセスできます。
履歴では、ダウンロードアイコンをクリックすると、MP3またはWAVファイルとしてダウンロードするオプションが表示されます。
FLACまたはM4Aファイルをダウンロードする方法 サイドバーでテキスト読み上げ またはボイスチェンジャー を選択し、画面右側のパネルにある履歴タブをクリックして履歴にアクセスします。画面幅が狭い場合は、Generate speech ボタンの上にある履歴アイコンをクリックして履歴にアクセスできます。
履歴では、ダウンロードアイコンをクリックすると、MP3またはWAVファイルとしてダウンロードするオプションが表示されます。FLACやM4Aを含む追加のファイル形式にアクセスするには、Advanced をクリックして希望の形式を選択してください。
言語とアクセントを選択するには? ウェブサイトで生成する場合の言語 ElevenLabsのウェブサイトでオーディオを生成する場合、AIはプロンプト内のテキストの文脈に基づいて言語を自動的に検出します。そのため、1つのプロンプトで複数の言語を使用することは避けるのが最適です。どの言語を使用すべきか混乱する可能性があります。現在、ウェブサイトで生成する際に言語を指定することはできません。
API経由で生成する場合の言語 APIを通じてオーディオを生成する場合は、language_codeパラメータを使用してプロンプトの言語を手動で指定できます。これはISO 639-1言語コードを受け取る任意のパラメータです。
これは、テキストに数字しか含まれていない場合など、短いプロンプトや曖昧なプロンプトで役立ちます。言語を指定することで、正規化機能がその言語に適したルールを適用できます。
正規化について詳しくは、こちらの記事をご覧ください。
アクセント 生成で使用されるアクセントは、使用する音声に由来します。生成する言語で学習していない音声を使用すると、その音声の元の言語のアクセントがわずかに出ることがあります。
最適な結果を得るには、生成する言語のオーディオで学習され、希望するアクセントを持つ音声を使用することをおすすめします。これにより、AIは発音とイントネーションをより正確に理解できます。
これは、似ている言語や共通する単語が多い言語では特に重要です。正しい言語で学習された音声を選ぶことで、AIが正しい発音とアクセントを使用できるようになります。
次のことができます:
希望する言語とアクセントのオーディオを使用して、クローン音声を作成する 。
ボイスライブラリを閲覧する 。検索フィルターを使用して、ニーズに合った適切な音声を見つけられます。
Eleven v3(Alpha)での生成にはいくらかかりますか? ウェブサイトでEleven v3を使用して生成する場合、1文字あたり1クレジットです。APIでの生成には割引が適用されます。詳細はAPI料金 をご覧ください。
詳しくは、以下のリソースをご覧ください:
音声を笑わせるには? Eleven v4とEleven v3では、[laughs]などのオーディオタグ を使って、生成された音声に笑い声やその他の反応を加えられます。詳しくはプロンプトガイド をご覧ください。
その他のモデルでは、感情表現のある読み上げは文脈、句読点、音声設定に左右されます。感情を表現するには? をご覧ください。
感情を表現するには? モデルは各発話を取り巻く広い文脈を考慮し、前後のテキストとのつながりから内容の自然さを判断します。この俯瞰的な視点により、複数の文にまたがる一連の思考に一貫した感情パターンを重ね、長い文章でも適切なイントネーションで読み上げられます。
感情を表現するためのヒント:
特定の感情を生成するには文脈が重要です。笑いや面白さに関するテキストを入力すると、楽しげな出力になる場合があります。怒り、悲しみ、その他の感情についても同様に、文脈の設定が重要です。
出力の読み上げ方は、句読点と音声設定によって大きく左右されます。
強調したい単語やフレーズを引用符で囲んでください。
ボイスクローンで生成する音声では、クローン作成用にアップロードしたサンプルの話し方が出力に反映されます。アップロードしたサンプルの音声が単調な場合、モデルは表現力のある出力を生成しにくくなります。
Eleven v4とEleven v3では、[happy]、[sad]、[angry]、[whispers]、[laughs]などのオーディオタグ を使って、感情や読み上げ方をより直接的に制御することもできます。詳しくはプロンプトガイド をご覧ください。
これらのヒントは感情表現のある読み上げを導くのに役立ちますが、特定の結果を保証するものではありません。
ダウンロード前にクォータを消費せずにオーディオをプレビューする方法はありますか? 残念ながら現時点では、生成時のクォータ消費に代わる、ダウンロード時の消費は提供していません。クォータを消費せずに生成結果をプレビューする方法は現在ありません。
ウェブサイトで「生成」を押すと、サーバーの起動とオーディオの生成が必要になるため、クレジットが消費されます。クレジットを使わずに、自分のテキストで音声をテストまたはプレビューすることはできません。
ウェブサイトのテキスト読み上げでは、以下の条件を満たす場合に2回まで無料で再生成できます。
プロンプト(テキスト読み上げの場合)またはファイル(ボイスチェンジャーの場合)、音声、モデルが同一であること。音声設定のスライダーは変更できます。
最初の生成から2時間以内であること。
元のオーディオを生成してからページを更新していないこと。
この場合、「音声を再生成」と表示されます。「音声を再生成」ボタンにカーソルを合わせると、残りの無料再生成回数が表示されます。
無料再生成を使い切ると、ボタンは「音声を生成」に戻り、生成に使用されるクレジット数が表示されます。
無料再生成は、ウェブサイトのテキスト読み上げでのみ利用できます。APIでは利用できません。
価格やコストを上げずに、この品質でプレビューを実現する方法を検討しています。また、AIの制御性を高め、プレビューなしでも、できれば最初の試行で期待どおりの結果を得られるようにする方法も模索しています。
Dialogueモードとは? Eleven v4 とEleven v3ではDialogueモードを利用できます。会話の文脈に応じて、自然な間合いで、割り込み、口調の変化、感情的な合図を処理する、動的な複数話者の会話を生成できます。
Dialogueモードは、ウェブサイトで複数の話者を使用する場合に利用できます。
Text to Dialogue APIエンドポイントを使用して、複数話者によるやり取りを生成することもできます。詳しくはAPIドキュメント をご覧ください:
詳しくは、以下のリソースをご覧ください:
AIはどの言語を話せますか? どの音声でも、AIが現在サポートしているすべての言語を話せます。ただし、AIに話させたい言語を母語とする音声を使用しない場合、たとえば生成された音声や英語を話す音声からクローンした音声を使用すると、わずかに英語アクセントが出たり、類似した言語の間を行き来したりすることがあります。
サポートされているすべての言語の一覧については、こちらの記事をご覧ください:対応している言語は何ですか?
現在のモデルでは、特定の言語を選択する必要はありません。AIに話させたい言語で文章を書けば、AIが自動的に理解します。ただし、類似した単語や語彙を使いながら発音やアクセントが大きく異なる言語もあるため、正しいアクセントでその言語を話してクローンした音声を使用することをおすすめします。これにより、AIは何をどの言語で話すべきかを判断するための十分な文脈を得られます。
言語はテキストによって決まり、アクセントと発音は音声そのものによって決まります。
言語選択を可能にする新技術を開発中ですが、AIの仕組み上、現時点ではまだ開発途上です。
生成できる文字数とテキスト量の上限は? ウェブサイトのテキスト読み上げ では、有料プランなら1回の生成で最大5,000文字、無料プランなら最大2,500文字を生成できます。
ただし、数千文字を超える長文コンテンツを生成する場合は、書籍や小説などの非常に長いコンテンツを簡単に生成できるStudio の使用を強くおすすめします。詳細はこちら をご覧ください。
APIで生成する場合、入力の最大長は使用するモデルによって異なります。
テキスト読み上げ Flash v2.5 - 最大40,000文字(約40分のオーディオ)
Turbo v2.5 - 最大40,000文字(約40分のオーディオ)
Flash v2 - 最大30,000文字(約30分のオーディオ)
Turbo v2 - 最大30,000文字(約30分のオーディオ)
Multilingual v2 - 最大10,000文字(約10分のオーディオ)
ボイスチェンジャー Multilingual v2 - 最大10分のオーディオ
ボイスライブラリの音声で、特定の言語を母語とするものはどれですか? 既製の音声と生成された音声はすべて英語です。そのため、他の言語を話す際には、正しいアクセントや発音にならない場合があります。
ボイスライブラリのプロフェッショナルカテゴリでは、コミュニティが共有した音声を見つけられます。これらは、それぞれの話者自身の音声をプロフェッショナルボイスクローン したものです。通常、クローン作成時に話していた言語を示す言語タグが付いているため、その言語のネイティブ音声です。特定の言語で絞り込むには、言語検索フィルターも使用できます。
数字、日付、記号、略語が適切に発音されない、または正しい言語で読まれないのはなぜですか? 数字、日付、記号、頭字語は、正しく読み上げる方法が複数あることが多いため、AIにとって難しい場合があります。これは使用されている言語にも依存します。たとえば「11」は「Eleven」と読めますが、スペイン語では「Once」、ドイツ語では「Elf」と読むこともできます。
数字、日付、頭字語、記号を正しく読み上げるための方法はいくつかあります。
単語で完全に書く 最良の結果を得るには、数字、頭字語、日付、記号を、AIに読み上げてほしい形式で完全に単語として書くことをおすすめします。これによりAIは十分な文脈を得られ、正しい出力を提供できます。たとえば「$100」の場合、期待どおりの結果を得るために、「a hundred dollars」または「one hundred dollars」と書くことをおすすめします。
LLMの使用 たとえばElevenAgents を使用する際など、大規模言語モデルでテキストプロンプトを生成している場合は、AIに読み上げてほしい形式で、数字、日付、記号、頭字語を常に単語として書くようモデルにプロンプトで指示できます。
正規化 API経由で生成する場合は、apply_text_normalizationパラメーターを使用してテキスト正規化を適用するかどうかを指定できます。テキスト正規化では、より正確に発音できるよう数字や日付を単語に展開します。このオプションでは、正規化処理に追加の処理時間が必要になるため、レイテンシーが増加します。
apply_text_normalizationパラメーターには3つのモードがあります。
on:常に適用されます
off:適用されません
auto:AIがテキスト正規化を適用するタイミングを自動的に判断します
language_codeパラメーターを使用して、プロンプトの言語を指定することもできます。これはISO 639-1言語コードを受け付けるオプションのパラメーターです。
これは、テキストに数字や記号のみが含まれる場合など、短いプロンプトや曖昧なプロンプトで役立ちます。言語を指定すると、正規化機能がその言語に適したルールを適用できます。
詳細は、APIリファレンス をご覧ください。
ウェブサイトのテキスト読み上げで生成する場合、正規化はデフォルトで有効になっています。
Studioでは、デフォルトで正規化が自動適用されます。つまり、AIがテキスト正規化を適用するタイミングを判断します。正規化を常に適用する設定も可能です。このオプションは、詳細設定 タブのプロジェクト設定 にあります。
音声が特定の単語を誤って発音するのはなぜですか? 誤発音にはいくつかの原因があります。最も一般的なのは、単語のスペルミスです。AIはスペルミスのある単語を修正しようとはせず、書かれたとおりに読み上げようとします。そのため、AIに読み上げさせる前に、テキストを校正し、完成していることを必ず再確認することが重要です。
特定の発音を指定したい場合は、Flash v2モデルでSSML音素タグを使用できます。詳細は発音ガイド をご覧ください。
AIが予期しない単語を誤発音したり、期待とは異なるアクセントで話したりすることがあります。これにはいくつかの理由があり、多くの場合、使用する音声と言語に大きく依存します。正しいアクセントと発音を確保する最善の方法は、正しいアクセントと発音で話す音声をクローンすることです。これにより、AIはオーディオ生成時に最も多くの文脈を得られます。
言語はテキストで指定され、アクセントは音声で指定されます。そのため、多くの共通単語を共有する言語や、別の言語とかなり近い関係にある言語で書いている場合、AIが特定の単語の発音を理解したり、アクセントを切り替えたりするのが難しいことがあります。
ただし、特定の状況では、英語であっても正しく書かれた単語をAIが誤発音することがあります。これは使用する音声とテキストに大きく依存するようですが、まれなケースです。