テキスト読み上げ

ElevenLabsでテキストを自然な話し声のオーディオに変換する方法をご紹介します。

概要

ElevenLabsのテキスト読み上げ(TTS)APIは、微妙なイントネーション、ペース、感情の認識を備えた自然なオーディオへテキストを変換します。モデルは、32言語と複数の音声スタイルにわたるテキストの手がかりに適応し、次の用途に使用できます。

  • グローバルなメディアキャンペーンや広告のナレーション
  • 複雑な感情表現を含む多言語オーディオブックの制作
  • テキストからリアルタイムオーディオをストリーミング

サンプルをお聴きください:

ボイスライブラリで、プロジェクトに最適な音声を見つけてください。

無料プランのユーザーは、API経由でボイスライブラリを利用できません。

音声品質

リアルタイムアプリケーションでは、Flash v2.5が超低遅延の75msを提供します。一方、Multilingual v2は、より微妙な表現を備えた最高品質のオーディオを提供します。

音声オプション

ElevenLabsでは、複数の作成方法を通じて32言語にわたる数千種類の音声を提供しています。

音声オプションの詳細をご確認ください。

デフォルトのレスポンス形式はmp3ですが、pcmやulawなどの形式も利用できます。

  • MP3
    • サンプルレート:22.05kHz~44.1kHz
    • ビットレート:32kbps~192kbps
    • 22.05kHz @ 32kbps
    • 44.1kHz @ 32kbps、64kbps、96kbps、128kbps、192kbps
  • PCM(S16LE)
    • サンプルレート:16kHz~44.1kHz
    • ビットレート:8kHz、16kHz、22.05kHz、24kHz、44.1kHz、48kHz
    • 16ビット深度
  • μ-law
    • 8kHzサンプルレート
    • 電話アプリケーション向けに最適化
  • A-law
    • 8kHzサンプルレート
    • 電話アプリケーション向けに最適化
  • Opus
    • サンプルレート:48kHz
    • ビットレート:32kbps~192kbps

高音質のオーディオオプションは有料プランでのみ利用できます。詳細は料金 ページをご覧ください。

対応言語

Multilingual v2モデルは、29言語に対応しています。

英語(米国、英国、オーストラリア、カナダ)、日本語、中国語、ドイツ語、ヒンディー語、フランス語(フランス、カナダ)、韓国語、ポルトガル語(ブラジル、ポルトガル)、イタリア語、スペイン語(スペイン、メキシコ)、インドネシア語、オランダ語、トルコ語、フィリピン語、ポーランド語、スウェーデン語、ブルガリア語、ルーマニア語、アラビア語(サウジアラビア、アラブ首長国連邦)、チェコ語、ギリシャ語、フィンランド語、クロアチア語、マレー語、スロバキア語、デンマーク語、タミル語、ウクライナ語、ロシア語。

Flash v2.5は、v2モデルのすべての言語に加え、以下を含む32言語に対応しています。

ハンガリー語、ノルウェー語、ベトナム語

対応言語のいずれかでテキストを入力し、ボイスライブラリから対応する音声を選択するだけです。最も自然な結果を得るには、対象の言語と地域に合ったアクセントの音声を選んでください。

プロンプト

モデルは、テキスト入力から感情的な文脈を直接解釈します。たとえば、 「彼女は興奮して言った」のような説明文を追加したり、感嘆符を使用したりすると、発話の 感情に影響します。StabilityやSimilarityなどの音声設定で一貫性を制御でき、 根底にある感情はテキスト上の手がかりから生まれます。

詳細はプロンプトガイドをご覧ください。

説明文はモデルによって読み上げられます。必要に応じて、オーディオから手動でトリミングまたは削除してください。

よくある質問

はい。短いオーディオクリップから、自分の声のインスタントボイスクローンを作成できます。 高精度なクローンについては、プロフェッショナルボイス クローン機能をご覧ください。

はい。生成したオーディオの所有権は保持されます。ただし、商用利用権は有料プランでのみ 利用できます。有料サブスクリプションでは、入力コンテンツのIP権利を保有している場合、生成されたオーディオを商用目的で使用し、 出力を収益化できます。

無料再生成では、以下の条件に従い、同じテキスト読み上げコンテンツを追加料金なしで再生成できます。

  • 各コンテンツは最大2回まで無料で再生成できます
  • コンテンツは前回の生成結果と完全に同一である必要があります。テキスト、音声設定、その他のパラメーターを変更すると、新たに有料で生成する必要があります

無料再生成は、オーディオ出力にわずかな歪みがある場合に役立ちます。ElevenLabsの社内ベンチマークによると、再生成により品質上の問題のおよそ半分が解決され、残りの問題は通常、トレーニングデータの品質不足によるものです。

ほぼリアルタイムの会話型またはインタラクティブなシナリオ向けに最適化された、低遅延のFlashモデル(Flash v2またはv2.5)を使用してください。 詳細は遅延最適化 ガイドをご覧ください。

モデルは非決定的です。一貫性を高めるには、任意のseed パラメーターを使用してください。ただし、わずかな 違いが生じる場合があります。

長いテキストをセグメントに分割し、リアルタイム再生と効率的な処理にはストリーミングを使用してください。 チャンク間で自然なプロソディの流れを維持するには、前後のテキストまたは前後の リクエストIDパラメーターを含めてください。

主なポイント

  • 決定性:出力は非決定的です。一貫性の高い結果にはseedパラメーターを使用
  • 無料再生成:生成ごとに最大2回無料で再生成可能(同一コンテンツとパラメーターのみ)
  • 所有権:生成されたオーディオの所有権は保持されます。商用利用には有料プランが必要です
  • 低遅延ユースケース:Flashモデル(eleven_flash_v2またはeleven_flash_v2_5)を使用。詳細は遅延最適化ガイドをご覧ください
  • 長文:長いテキストをセグメントに分割し、チャンク間で自然なプロソディを維持するためにprevious_text/next_textパラメーターを使用