ElevenLabsドキュメント
ElevenLabsドキュメント
ElevenLabsを統合するためのドキュメントとガイドをご覧ください
ElevenLabsの仕組み
ElevenLabsは、テキスト読み上げ、スピーチtoテキスト、ボイスクローン、会話型エージェント、生成AIオーディオのためのAI音声インフラを提供しています。用途や対象者に応じて、4つの方法で利用できます。
ElevenCreative は、クリエイター、プロデューサー、編集者がブラウザ上でボイスオーバー、音楽、吹き替え、スタジオプロジェクトを生成できるノーコードのウェブアプリケーションです。
ElevenAgents は、会話型音声エージェントを設計・運用するためのプラットフォームです。非技術者向けのビジュアルビルダーと、デベロッパー向けの完全なプログラム制御を提供します。
ElevenAPI は、すべての機能を公式のPythonおよびTypeScript SDKを備えたRESTインターフェースとして提供します。デベロッパーは自社のアプリケーションやワークフローに音声機能を組み込めます。
Reception AI は、中小企業向けのすぐに導入できるAI電話受付です。電話対応、予約受付、日常業務の管理を1つのダッシュボードで行えます。
基本概念
音声 は、オーディオ生成で使用する話者の人格です。各音声には一意のIDがあります。たとえば、JBFqnCBsd6RMkjVDRZzbです。このIDはダッシュボードで選択するか、APIリクエストで渡します。ElevenLabsは10,000種類以上の音声ライブラリを提供しています。オーディオ録音から音声をクローンしたり、テキストによる説明から音声を生成したりすることもできます。
モデル は、生成オーディオの品質、レイテンシー、対応言語を制御します。eleven_v4 は90以上の言語で最も表現力豊かな出力を生成します。eleven_flash_v2_5 は、約75msのレイテンシーでリアルタイム用途に対応します。スピーチtoテキスト、音楽、サウンドエフェクトなど、各機能には専用モデルがあります。
クレジット は、すべてのプロダクトで共通して使用する消費単位です。テキスト読み上げでは、入力テキスト1文字につき1クレジットかかります。その他の操作は、処理したオーディオの秒数に応じて課金されます。クレジットは毎月リセットされ、未使用分は最大2か月間繰り越せます。詳しくは料金をご覧ください。


