テキストから対話へ

ElevenLabsで没入感があり自然に聞こえる対話を作成する方法を学びましょう。

概要

ElevenLabsのテキスト読み上げ対話APIは、Eleven v4とEleven v3を使用して、テキストから自然で表現力豊かな対話を生成します。Eleven v4を推奨します。主なユースケースは次のとおりです。

  • ビデオゲーム向けに完璧な会話を生成
  • ポッドキャストなどのオーディオコンテンツ向けに没入感のある対話を作成
  • 表現力豊かなナレーションでオーディオブックに命を吹き込む

望ましい結果を得るには、複数回の生成が必要になる場合があります。テキスト読み上げ対話をアプリケーションに統合する際は、複数の生成結果を用意し、ユーザーが最適なものを選べるようにすることをおすすめします。

サンプルをお聴きください:

音声オプション

ElevenLabsでは、複数の作成方法を通じて数千種類の音声を提供しています。Eleven v4は90以上の言語、Eleven v3は70以上の言語に対応しています。

音声オプションの詳細をご確認ください。

プロンプト

モデルは、テキスト入力から感情的な文脈を直接解釈します。たとえば、 「彼女は興奮して言った」のような説明文を追加したり、感嘆符を使用したりすると、発話の 感情に影響します。StabilityやSimilarityなどの音声設定で一貫性を制御でき、 根底にある感情はテキスト上の手がかりから生まれます。

詳細はプロンプトガイドをご覧ください。

オーディオタグによる感情表現

この機能は現在も積極的に開発中であり、実際の結果は異なる場合があります。

Eleven v4とEleven v3では、非発話のオーディオイベントを使用して対話の話し方に影響を与えられます。テキスト入力内に、オーディオイベントを角括弧で囲んで挿入します。

テキスト読み上げ対話では、各対話ターンに固有のテキストと音声があります。影響させたいターンのテキスト内にオーディオタグを追加します。voice_idはそのターンの話者の音声を選択し、タグは話し方を指定します。

たとえば、ある話者はテキストを[giggling]で始めて1つの音声を使い、次の話者はテキストを[whispering]で始めて別の音声を使うことができます。タグとvoice_idを組み合わせたAPIの例は、テキスト読み上げ対話クイックスタートをご覧ください。

オーディオタグはenumパラメーターではなく、自然言語の指示です。指示を角括弧で囲み、話し方を変えたい箇所のテキストに配置します。以下の例は網羅的なものではありません。効果的なタグについての詳しいガイダンスは、プロンプトガイドをご覧ください。

オーディオタグには、いくつかの形式があります。

感情と話し方

例:[sad]、[laughing]、[whispering]

オーディオイベント

例:[leaves rustling]、[gentle footsteps]、[applause]。

全体的な演出指示

例:[football]、[wrestling match]、[auctioneer]。

例:

"[giggling] That's really funny!"
"[groaning] That was awful."
"Well, [sigh] I'm not sure what to say."

中断など、対話の流れを示すために句読点を使用することもできます。

"[cautiously] Hello, is this seat-"
"[jumping in] Free? [cheerfully] Yes it is."

文が途切れることを示すには、省略記号を使用できます。

"[indecisive] Hi, can I get uhhh..."
"[quizzically] The usual?"
"[elated] Yes! [laughs] I'm so glad you knew!"

デフォルトのレスポンス形式はmp3ですが、pcmやulawなどの形式も利用できます。

  • MP3
    • サンプルレート:22.05kHz~44.1kHz
    • ビットレート:32kbps~192kbps
    • 22.05kHz @ 32kbps
    • 44.1kHz @ 32kbps、64kbps、96kbps、128kbps、192kbps
  • PCM(S16LE)
    • サンプルレート:16kHz~44.1kHz
    • ビットレート:8kHz、16kHz、22.05kHz、24kHz、44.1kHz、48kHz
    • 16ビット深度
  • μ-law
    • 8kHzサンプルレート
    • 電話アプリケーション向けに最適化
  • A-law
    • 8kHzサンプルレート
    • 電話アプリケーション向けに最適化
  • Opus
    • サンプルレート:48kHz
    • ビットレート:32kbps~192kbps

高音質のオーディオオプションは有料プランでのみ利用できます。詳細は料金 ページをご覧ください。

対応言語

Eleven v4は90以上の言語に対応しています。Eleven v3は70以上の言語に対応しています。完全なリストはEleven v4およびEleven v3をご覧ください。

よくある質問

テキスト読み上げ対話はEleven v4およびEleven v3モデルで利用できます。

はい。生成したオーディオの所有権は保持されます。ただし、商用利用権は有料プランでのみ 利用できます。有料サブスクリプションでは、入力コンテンツのIP権利を保有している場合、生成されたオーディオを商用目的で使用し、 出力を収益化できます。

無料再生成では、以下の条件に従い、同じテキスト読み上げコンテンツを追加料金なしで再生成できます。

  • ElevenLabsダッシュボード内でのみ利用できます。
  • 各コンテンツは最大2回まで無料で再生成できます。
  • コンテンツは前回の生成結果と完全に同一である必要があります。テキスト、音声設定、その他のパラメーターを変更すると、新たに有料で生成する必要があります。

無料再生成は、オーディオ出力にわずかな歪みがある場合に役立ちます。ElevenLabsの社内ベンチマークによると、再生成により品質上の問題のおよそ半分が解決され、残りの問題は通常、トレーニングデータの品質不足によるものです。

対話内の話者数に制限はありません。

モデルは非決定的です。一貫性を高めるには、任意のseed パラメーターを使用してください。ただし、わずかな 違いが生じる場合があります。

信頼性の高い生成のため、リクエストごとにすべてのinputs[].text値の合計文字数を2,000文字以下にしてください。長いテキストはチャンクに分割し、生成されたオーディオをアプリケーション内で連結してください。

主なポイント

  • モデル:Eleven v4およびEleven v3で利用可能
  • 話者:対話ごとの話者数に制限なし
  • リクエストサイズ:リクエストごとにすべてのinputs[].text値の合計文字数を2,000文字以下に維持
  • 決定性:出力は非決定的です。一貫性の高い結果にはseedパラメーターを使用
  • 無料再生成:生成ごとに最大2回無料で再生成可能(同一コンテンツ、同一パラメーター、ダッシュボードのみ)
  • 所有権:生成されたオーディオの所有権は保持されます。商用利用には有料プランが必要です