間を追加するには?

間や区切りを追加し、話者のリズムや抑揚に影響を与える方法はいくつかあります。使用する方法はモデルによって異なります。

オーディオタグ(Eleven v4およびEleven v3)

Eleven v4およびEleven v3では、オーディオタグと句読点を使用してペースや話し方を制御します。これらのモデルはSSMLのbreakタグに対応していません。

間や話し方をプロンプトで指定する方法については、プロンプトガイドを参照してください。

breakタグ(Multilingual v2、Flash v2、Flash v2.5)

Multilingual v2、Flash v2、Flash v2.5で最も一貫して間を追加するには、SSMLのbreakタグ構文<break time="1.5s" />を使用します。これにより、音声に正確かつ自然な間が作られます。単に単語間に無音が挿入されるのではなく、モデルが構文を理解して自然な間を追加します。

モデルによるこれらの間の処理方法は異なる場合があります。使用する音声が出力に重要な役割を果たします。「uh」や「ah」をいくつか含む学習データで訓練された音声では、実際の話者のように、間の間にこうした発声の癖が挿入されることがあります。

次のようになります:

「少し考えさせてください。」<break time="1.0s" />「はい、それでうまくいきます。」

break時間は秒単位で指定してください。AIは最大3秒の間を処理でき、テキスト読み上げとAPIで使用できます。

テキスト内でSSMLのbreakを過度に多用すると、問題が発生する可能性があります。音声が速くなったり、オーディオにノイズやその他のアーティファクトが増えたりする場合があります。現在、この問題の解決に取り組んでいます。

句読点

これらの方法はbreakタグやオーディオタグほど一貫性はありませんが、ペースに影響を与えることはできます。

シンプルなハイフン-またはダッシュ—が効果的な場合があります。より長い間を作るには、-- --のように複数のダッシュを追加できます。

「もう - 遅く - なってきました。」

三点リーダー...は単語間に間を追加できる場合がありますが、通常は音声にためらいや緊張感も加わるため、常に適しているとは限りません。

「うーん…そうですね…たぶん。」