ElevenLabs ドキュメント

ElevenLabs を統合するためのドキュメントとガイドをご覧ください

ElevenLabs の仕組み

ElevenLabs は、テキスト読み上げ、スピーチtoテキスト、ボイスクローン、会話型エージェント、生成オーディオを提供する AI音声インフラです。対象者に応じて、4つの方法で利用できます。

ElevenCreative は、クリエイター、プロデューサー、編集者がブラウザ上でボイスオーバー、音楽、吹き替え、スタジオプロジェクトを直接生成できるノーコードのウェブアプリケーションです。

ElevenAgents は、会話型音声エージェントを設計・運用するためのプラットフォームです。非技術者向けのビジュアルビルダーと、デベロッパー向けの完全なプログラム制御を備えています。

ElevenAPI は、すべての機能を REST インターフェースとして提供します。公式の Python および TypeScript SDK により、デベロッパーは自社のアプリケーションやワークフローに音声を組み込めます。

Reception AI は、中小企業向けにすぐ導入できる AI電話受付です。電話対応、予約受付、日常業務の管理を1つのダッシュボードで行えます。

基本概念

音声は、オーディオ生成で使用する話者の個性です。各音声には固有の ID があり、たとえば JBFqnCBsd6RMkjVDRZzb のような ID をダッシュボードで選択するか、API リクエストで指定します。ElevenLabs は 10,000種類以上の音声ライブラリ を提供しています。オーディオ録音から音声をクローンしたり、テキストによる説明から生成したりすることもできます。

モデルは、生成されるオーディオの品質、レイテンシー、対応言語を制御します。eleven_v4 は90以上の言語で最も表現力豊かな出力を生成します。eleven_v4_turbo は、推論レイテンシーの中央値が約100msで、リアルタイム用途に適しています。スピーチtoテキスト、音楽、サウンドエフェクトなど、各機能には専用モデルがあります。

クレジットは、すべてのプロダクトで共通して使用する消費単位です。テキスト読み上げは、入力テキスト1文字につき1クレジットです。その他の処理は、処理したオーディオの秒数に応じて課金されます。クレジットは毎月リセットされ、未使用分は最大2か月繰り越されます。詳細は料金をご覧ください。

用途を選択

モデルを見る

† アプリケーションとネットワークのレイテンシーを除く

機能から探す

で構築済み