Modelle
Flaggschiffmodelle
Text to Speech
Speech to Text
Musik
Modellübersicht
Die ElevenLabs API bietet eine Reihe von Audiomodellen, die für unterschiedliche Anwendungsfälle, Qualitätsstufen und Leistungsanforderungen optimiert sind.
Veraltete Modelle
Die Modelle eleven_turbo_v2_5 und eleven_turbo_v2 entsprechen funktional den
Modellen eleven_flash_v2_5 bzw. eleven_flash_v2, mit Ausnahme der im Durchschnitt
niedrigeren Latenz der Flash-Modelle. Wir empfehlen, in allen Anwendungsfällen Flash- statt Turbo-Modelle
zu verwenden.
Eleven v4
Eleven v4 ist unser modernstes Modell für Sprachsynthese und liefert Audio in höchster Qualität, Ausdrucksstärke und Kontrolle über die Stimmwiedergabe. Eleven v4 unterstützt hochpräzises KI-Stimme klonen mit zuverlässigem Sprechererhalt bei langen Textgenerierungen.
Dieses Modell eignet sich gut für folgende Szenarien:
- Charakter-Voiceovers: Ideal für Spiele und Animationen dank seiner emotionalen Bandbreite.
- Emotionale Dialoge: Generieren Sie natürliche, lebensechte Dialoge mit großer emotionaler Bandbreite und Kontextverständnis.
- Hörbuchproduktion: Perfekt für lange Erzählungen mit komplexem emotionalem Ausdruck.
- Mehrsprachige Projekte: Bewahrt eine konsistente Stimmqualität bei Sprachwechseln.
Eleven v4 ist über die Text to Dialogue API verfügbar.
Unterstützte Sprachen
Die Modellfamilie Eleven v4 unterstützt über 90 Sprachen, darunter:
Afrikaans (afr), Amharisch (amh), Arabisch (ara), Armenisch (hye), Assamesisch (asm), Asturisch (ast), Aserbaidschanisch (aze), Belarussisch (bel), Bengalisch (ben), Bosnisch (bos), Bulgarisch (bul), Birmanisch (mya), Kantonesisch (yue), Katalanisch (cat), Cebuano (ceb), Kroatisch (hrv), Tschechisch (ces), Dänisch (dan), Niederländisch (nld), Englisch (eng), Estnisch (est), Filipino (fil), Finnisch (fin), Französisch (fra), Fulfulde/Pulaar (ful), Galicisch (glg), Georgisch (kat), Deutsch (deu), Griechisch (ell), Gujarati (guj), Hausa (hau), Hebräisch (heb), Hindi (hin), Ungarisch (hun), Isländisch (isl), Indonesisch (ind), Italienisch (ita), Japanisch (jpn), Javanisch (jav), Kamba (kam), Kannada (kan), Kasachisch (kaz), Koreanisch (kor), Kirgisisch (kir), Laotisch (lao), Lettisch (lav), Lingála (lin), Litauisch (lit), Luganda (lug), Luxemburgisch (ltz), Mazedonisch (mkd), Malaiisch (msa), Malayalam (mal), Maltesisch (mlt), Mandarin-Chinesisch (cmn), Māori (mri), Marathi (mar), Mongolisch (mon), Nepalesisch (nep), Norwegisch Bokmål (nob), Okzitanisch (oci), Odia (ori), Paschtunisch (pus), Persisch (fas), Polnisch (pol), Portugiesisch, Brasilien (por), Punjabi (pan), Rumänisch (ron), Russisch (rus), Serbisch (srp), Shona (sna), Sindhi (snd), Slowakisch (slk), Slowenisch (slv), Somali (som), Sorani-Kurdisch (ckb), Spanisch, Lateinamerika (spa), Suaheli (swa), Schwedisch (swe), Tadschikisch (tgk), Tamil (tam), Telugu (tel), Thailändisch (tha), Türkisch (tur), Ukrainisch (ukr), Urdu (urd), Usbekisch (uzb), Vietnamesisch (vie), Walisisch (cym), Wolof (wol), Zulu (zul).
Eleven v4 Turbo
Eleven v4 Turbo ist unser modernstes Modell für Echtzeit-Sprachsynthese und liefert Audio in hoher Qualität, Ausdrucksstärke und Kontrolle über die Stimmwiedergabe. Eleven v4 Turbo unterstützt hochpräzises KI-Stimme klonen und liefert Ergebnisse mit einer medianen Inferenzlatenz von ~100 ms.
Dieses Modell eignet sich gut für folgende Szenarien:
- Support-Agenten: Betreiben Sie Sprachagenten, die Kundenanfragen in Echtzeit lösen.
- KI-Assistenten: Generieren Sie natürliche, lebensechte Dialoge mit großer emotionaler Bandbreite und Kontextverständnis.
- Interaktive Charaktere: Ausgezeichnet für Audioerlebnisse mit ausdrucksstarken Charakteren.
Eleven v4 Turbo ist über den Text to Dialogue WebSocket verfügbar.
Unterstützte Sprachen
Die Modellfamilie Eleven v4 unterstützt über 90 Sprachen, darunter:
Afrikaans (afr), Amharisch (amh), Arabisch (ara), Armenisch (hye), Assamesisch (asm), Asturisch (ast), Aserbaidschanisch (aze), Belarussisch (bel), Bengalisch (ben), Bosnisch (bos), Bulgarisch (bul), Birmanisch (mya), Kantonesisch (yue), Katalanisch (cat), Cebuano (ceb), Kroatisch (hrv), Tschechisch (ces), Dänisch (dan), Niederländisch (nld), Englisch (eng), Estnisch (est), Filipino (fil), Finnisch (fin), Französisch (fra), Fulfulde/Pulaar (ful), Galicisch (glg), Georgisch (kat), Deutsch (deu), Griechisch (ell), Gujarati (guj), Hausa (hau), Hebräisch (heb), Hindi (hin), Ungarisch (hun), Isländisch (isl), Indonesisch (ind), Italienisch (ita), Japanisch (jpn), Javanisch (jav), Kamba (kam), Kannada (kan), Kasachisch (kaz), Koreanisch (kor), Kirgisisch (kir), Laotisch (lao), Lettisch (lav), Lingála (lin), Litauisch (lit), Luganda (lug), Luxemburgisch (ltz), Mazedonisch (mkd), Malaiisch (msa), Malayalam (mal), Maltesisch (mlt), Mandarin-Chinesisch (cmn), Māori (mri), Marathi (mar), Mongolisch (mon), Nepalesisch (nep), Norwegisch Bokmål (nob), Okzitanisch (oci), Odia (ori), Paschtunisch (pus), Persisch (fas), Polnisch (pol), Portugiesisch, Brasilien (por), Punjabi (pan), Rumänisch (ron), Russisch (rus), Serbisch (srp), Shona (sna), Sindhi (snd), Slowakisch (slk), Slowenisch (slv), Somali (som), Sorani-Kurdisch (ckb), Spanisch, Lateinamerika (spa), Suaheli (swa), Schwedisch (swe), Tadschikisch (tgk), Tamil (tam), Telugu (tel), Thailändisch (tha), Türkisch (tur), Ukrainisch (ukr), Urdu (urd), Usbekisch (uzb), Vietnamesisch (vie), Walisisch (cym), Wolof (wol), Zulu (zul).
Eleven v3
Eleven v3 ist unser Sprachsynthesemodell der vorherigen Generation. Es erzeugt natürliche, lebensechte Sprache mit großer emotionaler Bandbreite und Kontextverständnis in mehreren Sprachen.
Mit Eleven v3 gibt es eine neue Text to Dialogue API, mit der Sie natürliche, lebensechte Dialoge mit großer emotionaler Bandbreite und Kontextverständnis in mehreren Sprachen generieren können. Eleven v3 kann auch mit der Text to Speech API verwendet werden, um natürliche, lebensechte Sprache mit großer emotionaler Bandbreite und Kontextverständnis in mehreren Sprachen zu generieren.
Lesen Sie hier mehr über die Text to Dialogue API.
Unterstützte Sprachen
Das Modell Eleven v3 unterstützt mehr als 70 Sprachen, darunter:
Afrikaans (afr), Arabisch (ara), Armenisch (hye), Assamesisch (asm), Aserbaidschanisch (aze), Belarussisch (bel), Bengalisch (ben), Bosnisch (bos), Bulgarisch (bul), Katalanisch (cat), Cebuano (ceb), Chichewa (nya), Kroatisch (hrv), Tschechisch (ces), Dänisch (dan), Niederländisch (nld), Englisch (eng), Estnisch (est), Filipino (fil), Finnisch (fin), Französisch (fra), Galicisch (glg), Georgisch (kat), Deutsch (deu), Griechisch (ell), Gujarati (guj), Hausa (hau), Hebräisch (heb), Hindi (hin), Ungarisch (hun), Isländisch (isl), Indonesisch (ind), Irisch (gle), Italienisch (ita), Japanisch (jpn), Javanisch (jav), Kannada (kan), Kasachisch (kaz), Kirgisisch (kir), Koreanisch (kor), Lettisch (lav), Lingala (lin), Litauisch (lit), Luxemburgisch (ltz), Mazedonisch (mkd), Malaiisch (msa), Malayalam (mal), Mandarin-Chinesisch (cmn), Marathi (mar), Nepalesisch (nep), Norwegisch (nor), Paschtunisch (pus), Persisch (fas), Polnisch (pol), Portugiesisch (por), Panjabi (pan), Rumänisch (ron), Russisch (rus), Serbisch (srp), Sindhi (snd), Slowakisch (slk), Slowenisch (slv), Somali (som), Spanisch (spa), Suaheli (swa), Schwedisch (swe), Tamil (tam), Telugu (tel), Thailändisch (tha), Türkisch (tur), Ukrainisch (ukr), Urdu (urd), Vietnamesisch (vie), Walisisch (cym).
Eleven v3 Conversational
Eleven v3 Conversational ist unser Modell der vorherigen Generation für Echtzeit-Sprachsynthese. Es erzeugt natürliche, lebensechte Sprache mit großer emotionaler Bandbreite und Kontextverständnis in mehreren Sprachen.
Mit Eleven v3 Conversational gibt es einen neuen Text to Dialogue WebSocket, mit dem Sie natürliche, lebensechte Dialoge mit großer emotionaler Bandbreite und Kontextverständnis in mehreren Sprachen generieren können.
Mit Eleven v3 Conversational gibt es einen neuen Text to Dialogue WebSocket, mit dem Sie natürliche, lebensechte Dialoge mit großer emotionaler Bandbreite und Kontextverständnis in mehreren Sprachen generieren können.
Lesen Sie hier mehr über den Text to Dialogue WebSocket.
Unterstützte Sprachen
Das Modell Eleven v3 unterstützt mehr als 70 Sprachen, darunter:
Afrikaans (afr), Arabisch (ara), Armenisch (hye), Assamesisch (asm), Aserbaidschanisch (aze), Belarussisch (bel), Bengalisch (ben), Bosnisch (bos), Bulgarisch (bul), Katalanisch (cat), Cebuano (ceb), Chichewa (nya), Kroatisch (hrv), Tschechisch (ces), Dänisch (dan), Niederländisch (nld), Englisch (eng), Estnisch (est), Filipino (fil), Finnisch (fin), Französisch (fra), Galicisch (glg), Georgisch (kat), Deutsch (deu), Griechisch (ell), Gujarati (guj), Hausa (hau), Hebräisch (heb), Hindi (hin), Ungarisch (hun), Isländisch (isl), Indonesisch (ind), Irisch (gle), Italienisch (ita), Japanisch (jpn), Javanisch (jav), Kannada (kan), Kasachisch (kaz), Kirgisisch (kir), Koreanisch (kor), Lettisch (lav), Lingala (lin), Litauisch (lit), Luxemburgisch (ltz), Mazedonisch (mkd), Malaiisch (msa), Malayalam (mal), Mandarin-Chinesisch (cmn), Marathi (mar), Nepalesisch (nep), Norwegisch (nor), Paschtunisch (pus), Persisch (fas), Polnisch (pol), Portugiesisch (por), Panjabi (pan), Rumänisch (ron), Russisch (rus), Serbisch (srp), Sindhi (snd), Slowakisch (slk), Slowenisch (slv), Somali (som), Spanisch (spa), Suaheli (swa), Schwedisch (swe), Tamil (tam), Telugu (tel), Thailändisch (tha), Türkisch (tur), Ukrainisch (ukr), Urdu (urd), Vietnamesisch (vie), Walisisch (cym).
Multilingual v2
Eleven Multilingual v2 ist ein emotional sensibles Sprachsynthesemodell der vorherigen Generation. Es erzeugt natürliche, lebensechte Sprache mit großer emotionaler Bandbreite und Kontextverständnis in mehreren Sprachen.
Das Modell liefert in allen unterstützten Sprachen eine konsistente Stimmqualität und Persönlichkeit und bewahrt dabei die einzigartigen Merkmale und den Akzent des Sprechers.
Dieses Modell überzeugt besonders in Szenarien, die hochwertige, emotional nuancierte Sprache erfordern:
- Charakter-Voiceovers: Ideal für Spiele und Animationen dank seiner emotionalen Bandbreite.
- Professionelle Inhalte: Gut geeignet für Unternehmensvideos und E-Learning-Materialien.
- Mehrsprachige Projekte: Bewahrt eine konsistente Stimmqualität bei Sprachwechseln.
- Stabile Qualität: Erzeugt konsistente Audioausgaben in hoher Qualität.
Es hat zwar eine höhere Latenz und höhere Kosten pro Zeichen als Flash-Modelle, liefert jedoch eine überlegene Qualität für Projekte, bei denen lebensechte Sprache wichtig ist.
Unsere mehrsprachigen v2-Modelle unterstützen 29 Sprachen:
Englisch (USA, UK, Australien, Kanada), Japanisch, Chinesisch, Deutsch, Hindi, Französisch (Frankreich, Kanada), Koreanisch, Portugiesisch (Brasilien, Portugal), Italienisch, Spanisch (Spanien, Mexiko), Indonesisch, Niederländisch, Türkisch, Filipino, Polnisch, Schwedisch, Bulgarisch, Rumänisch, Arabisch (Saudi-Arabien, VAE), Tschechisch, Griechisch, Finnisch, Kroatisch, Malaiisch, Slowakisch, Dänisch, Tamil, Ukrainisch & Russisch.
Flash v2.5
Eleven Flash v2.5 ist unser schnellstes Sprachsynthesemodell, entwickelt für Echtzeitanwendungen und die Agents Platform. Es liefert hochwertige Sprache mit extrem niedriger Latenz (~75 ms†) in 32 Sprachen.
Das Modell vereint Geschwindigkeit und Qualität. Dadurch eignet es sich ideal für interaktive Anwendungen und bewahrt gleichzeitig eine natürlich klingende Ausgabe sowie konsistente Stimmmerkmale über alle Sprachen hinweg.
Dieses Modell eignet sich besonders für:
- Agents Platform: Perfekt für Sprachagenten und Chatbots in Echtzeit.
- Interaktive Anwendungen: Ideal für Spiele und Anwendungen, die eine sofortige Reaktion erfordern.
- Verarbeitung im großen Maßstab: Effizient für die Text-to-Speech-Konvertierung großer Mengen.
Mit seinem niedrigeren Preis für API-Generierungen und einer Latenz von 75 ms ist Flash v2.5 die kosteneffiziente Option für alle, die schnelle, zuverlässige Sprachsynthese in mehreren Sprachen benötigen.
Flash v2.5 unterstützt 32 Sprachen – alle Sprachen der v2-Modelle sowie:
Ungarisch, Norwegisch & Vietnamesisch
† Ohne Anwendungs- und NetzwerklatenzHinweise
Textnormalisierung mit Zahlen
Bei Flash v2.5 werden Zahlen standardmäßig möglicherweise nicht so normalisiert, wie Sie es erwarten. Telefonnummern könnten beispielsweise so vorgelesen werden, dass sie für Nutzer nicht eindeutig verständlich sind. Datumsangaben und Währungen sind ähnlich betroffen.
Standardmäßig ist die Normalisierung für Flash v2.5 deaktiviert, um die niedrige Latenz beizubehalten. Enterprise-Kunden können die Textnormalisierung für v2.5-Modelle jedoch aktivieren, indem sie in ihrer Anfrage den Parameter apply_text_normalization auf “on” setzen.
Das Modell Multilingual v2 normalisiert Zahlen besser. Daher empfehlen wir es für Telefonnummern und andere Fälle, in denen die Zahlennormalisierung wichtig ist.
Bei Anwendungen mit niedriger Latenz oder für die Agents Platform empfiehlt es sich, dass Ihr LLM den Text normalisiert, bevor er an das TTS-Modell übergeben wird, oder den Parameter apply_text_normalization zu verwenden (bei v2.5-Modellen nur für Enterprise-Pläne).
Leitfaden zur Modellauswahl
Hinweise dazu, welches Modell am besten zu Ihren Anforderungen und Ihrem Anwendungsfall passt, finden Sie im Leitfaden zur Modellauswahl.
Anforderungen
Anwendungsfall
Zeichenlimits
Die maximale Zeichenanzahl in einer einzelnen Text-to-Speech-Anfrage variiert je nach Modell.
Scribe v2
Scribe v2 ist unser modernes Spracherkennungsmodell für präzise Transkriptionen in über 90 Sprachen. Es liefert genaue Zeitstempel auf Wortebene sowie erweiterte Funktionen wie Sprecherdiarisierung und dynamische Audio-Tags.
Dieses Modell eignet sich besonders für Szenarien, die eine präzise Speech-to-Text-Konvertierung erfordern:
- Transkriptionsdienste: Perfekt für die Umwandlung von Audio- und Videoinhalten in Text
- Meeting-Dokumentation: Ideal zum Erfassen und Dokumentieren von Gesprächen
- Inhaltsanalyse: Gut geeignet für die Verarbeitung und Analyse von Audioinhalten
- Mehrsprachige Erkennung: Unterstützt präzise Transkriptionen in über 90 Sprachen
Wichtige Funktionen:
- Präzise Transkription mit Zeitstempeln auf Wortebene
- Sprecherdiarisierung für Audio mit mehreren Sprechern
- Dynamische Audio-Tags für mehr Kontext
- Unterstützung für über 90 Sprachen
- Entitätserkennung
- Keyterm-Prompting
- Transkriptbearbeitung
Weitere Informationen zu Scribe v2 finden Sie hier.
Scribe v2 Realtime
Scribe v2 Realtime, unser schnellstes und präzisestes Modell für Live-Spracherkennung, bietet modernste Genauigkeit in über 90 Sprachen bei einer extrem niedrigen Latenz von 150 ms.
Dieses Modell eignet sich besonders für dialogbasierte Anwendungsfälle:
- Live-Meeting-Transkription: Perfekt für Transkriptionen in Echtzeit
- KI-Agenten: Ideal für Live-Gespräche
- Mehrsprachige Erkennung: Unterstützt präzise Transkriptionen in über 90 Sprachen mit automatischer Spracherkennung
Wichtige Funktionen:
- Extrem niedrige Latenz: Erhalten Sie Teiltranskriptionen in ~150 Millisekunden
- Streaming-Unterstützung: Senden Sie Audio in Abschnitten und empfangen Sie Transkripte in Echtzeit
- Mehrere Audioformate: Unterstützung für PCM (8 kHz bis 48 kHz) und μ-law-Codierung
- Voice Activity Detection (VAD): Automatische Sprachsegmentierung anhand von Stilleerkennung
- Manuelle Commit-Steuerung: Volle Kontrolle darüber, wann Transkriptsegmente abgeschlossen werden
- Entitätserkennung
- Transkriptbearbeitung
Weitere Informationen zu Scribe v2 Realtime finden Sie hier.
Scribe v2 Medical
Scribe v2 Medical ist ein Batch-Spracherkennungsmodell, das auf medizinisches und klinisches Audio spezialisiert ist. Es ist ein Finetune von Scribe v2 und verbessert die Erkennung von Medikamentennamen, Anatomie, Pathologie und klinischen Diktaten, bei gleichbleibender Genauigkeit von Scribe v2 für Alltagssprache. Es verwendet dieselbe Speech-to-Text-API wie Scribe v2 und wird zum gleichen Preis abgerechnet. Übergeben Sie scribe_v2_medical als model_id.
Zweckbestimmung
Scribe v2 Medical ist ein Batch-Speech-to-Text-API-Modell für Entwickler und Organisationen zur Integration in Anwendungen, die klinisches Audio, einschließlich Gesprächen zwischen medizinischem Fachpersonal und Patienten, Diktaten, Erstaufnahme- und Versorgungskoordinationsanrufen, in Entwürfe von Transkripten für die Dokumentation und zugehörige administrative Workflows umwandeln. Der resultierende Text ist zur Überprüfung und Korrektur durch medizinisches Fachpersonal oder andere autorisierte Nutzer vor der Verwendung bestimmt. Scribe v2 Medical ist nicht zur Interpretation klinischer Informationen oder zur Bereitstellung von Diagnosen, Behandlungsempfehlungen, klinischen Entscheidungen oder anderen klinischen Hinweisen bestimmt.
Dieses Modell eignet sich besonders für:
- Klinische Dokumentation: Gespräche und Notizen, in denen medizinische Begriffe mitten im Gespräch auftauchen
- Diktate: Dichte Abfolgen von Medikamenten, Dosierungen und Befunden
- Erstaufnahme- und Koordinationsanrufe: Patienten beschreiben ihre eigenen Beschwerden, oft telefonisch
- Compliance-Workflows: Kombinieren Sie es mit der Entitätserkennung für PHI-Kategorien
Wichtige Funktionen:
- Gleiches Anfrageformat wie Scribe v2 (
keyterms,entity_detection,no_verbatim, Diarisierung, Zeitstempel) - Verbesserte Erkennung von Medikamentennamen sowie Begriffen aus Anatomie und Pathologie
- Keine Verschlechterung bei Alltagssprache im Vergleich zu Scribe v2
- Unterstützung für über 90 Sprachen
- Sprecherdiarisierung für Audio mit mehreren Sprechern
- Dynamische Audio-Tags
- Entitätserkennung, einschließlich PHI-Kategorien
Scribe v2 Medical ist ein Batch-Modell. Verwenden Sie für Live-Transkriptionen Scribe v2 Realtime.
Scribe v2 Medical ist HIPAA-konform nutzbar. Business Associate Agreements sind für Enterprise-Kunden verfügbar, ebenso der Zero Retention Mode (ZRM). Bei aktiviertem ZRM werden Audioeingaben und Textausgaben unmittelbar nach Abschluss jeder Anfrage gelöscht. ElevenLabs speichert nichts, und Ihre Anwendung erhält die vollständige API-Antwort und verwaltet Transkripte unter Ihrer eigenen Kontrolle.
Unternehmen, die HIPAA-Konformität benötigen, müssen ElevenLabs Sales kontaktieren, um vor dem Senden geschützter Gesundheitsinformationen ein Business Associate Agreement (BAA) zu unterzeichnen.
Weitere Informationen zu Speech to Text finden Sie hier.
Eleven Music
Eleven Music ist unser Musikgenerierungsmodell in Studioqualität. Damit können Sie Musik jeder Stilrichtung mit Prompts in natürlicher Sprache generieren.
Dieses Modell eignet sich hervorragend für folgende Szenarien:
- Game-Soundtracks: Erstellen Sie immersive Soundtracks für Spiele
- Podcast-Hintergründe: Werten Sie Podcasts mit professioneller Musik auf
- Marketing: Fügen Sie Werbe-Reels Hintergrundmusik hinzu
Wichtige Funktionen:
- Vollständige Kontrolle über Genre, Stil und Struktur
- Gesang oder nur Instrumental
- Mehrsprachig, einschließlich Englisch, Spanisch, Deutsch, Japanisch und weiteren Sprachen
- Bearbeiten Sie Sound und Liedtext einzelner Abschnitte oder des gesamten Songs
Weitere Informationen zu Eleven Music finden Sie hier.
Parallelität und Priorität
Ihr Abonnement bestimmt, wie viele Anfragen gleichzeitig verarbeitet werden können und welche Prioritätsstufe Ihre Anfragen in der Warteschlange haben. Speech to Text hat ein erhöhtes Parallelitätslimit. Sobald das Parallelitätslimit erreicht ist, werden weitere Anfragen zusammen mit Anfragen niedrigerer Priorität in einer Warteschlange verarbeitet. In der Praxis erhöht dies die Latenz typischerweise nur um etwa 50 ms.
Die Response-Header enthalten current-concurrent-requests und maximum-concurrent-requests, mit denen Sie Ihre Parallelität überwachen können.
API-Anfragen pro Minute im Vergleich zu parallelen Anfragen
Es ist wichtig zu verstehen, dass API-Anfragen pro Minute und parallele Anfragen unterschiedliche Kennzahlen sind, die von Ihren Nutzungsmustern abhängen.
API-Anfragen pro Minute können von parallelen Anfragen abweichen, da sie von der Dauer jeder Anfrage und der Bündelung der Anfragen abhängen.
Beispiel 1: Zeitlich versetzte Anfragen Wenn Sie 180 Anfragen pro Minute hätten, die jeweils 1 Sekunde zur Verarbeitung benötigen, und diese im Abstand von jeweils 0,33 Sekunden senden würden, läge die maximale Anzahl paralleler Anfragen bei 3 und der Durchschnitt ebenfalls bei 3, da stets 3 Anfragen gleichzeitig verarbeitet würden.
Beispiel 2: Gebündelte Anfragen Bei einem anderen Nutzungsmuster, etwa 180 Anfragen pro Minute, die jeweils 3 Sekunden zur Verarbeitung benötigen, aber alle gleichzeitig ausgelöst werden, läge die maximale Anzahl paralleler Anfragen bei 180 und der Durchschnitt bei 9 (in den ersten 3 Sekunden der Minute würden 180 Anfragen gleichzeitig eingehen, in den letzten 57 Sekunden 0 Anfragen).
Da unser System auf Parallelität achtet, sind Anfragen pro Minute weniger wichtig als die Dauer der einzelnen Anfragen und das Muster, wann sie gesendet werden.
Die Art, wie Endpoint-Anfragen gestellt werden, beeinflusst die Parallelitätslimits:
- Bei HTTP zählt jede Anfrage einzeln für Ihr Parallelitätslimit.
- Beim Text to Speech WebSocket zählt nur die Zeit, in der unser Modell Audio generiert, für Ihr Parallelitätslimit. Das bedeutet, dass ein offener WebSocket die meiste Zeit überhaupt nicht für Ihr Parallelitätslimit zählt.
- Die Text to Dialogue WebSockets funktionieren anders: Jede offene Verbindung reserviert eine Dialogsitzung aus einem separaten Pool, solange sie geöffnet bleibt. Über die Verbindung generiertes Audio zählt nicht für Ihr Standard-Parallelitätslimit. Dies vereinfacht die Planung, da eine Verbindung einer Sitzung entspricht. Ihre Dialogsitzungslimits sind auf diese neue Parallelitätsmethode ausgelegt. Siehe Text to Dialogue-Parallelität.
Parallelitätslimits verstehen
Das mit Ihrem Tarif verbundene Parallelitätslimit sollte nicht als maximale Anzahl gleichzeitig möglicher Gespräche, Telefonanrufe, Charakter-Voiceovers usw. interpretiert werden. Die tatsächliche Anzahl hängt von mehreren Faktoren ab, darunter den verwendeten KI-Stimmen und den Merkmalen des Anwendungsfalls.
Als Faustregel gilt: Ein Parallelitätslimit von 5 kann typischerweise bis zu etwa 100 gleichzeitige Audioübertragungen unterstützen.
Das liegt an der Geschwindigkeit, mit der Audio im Verhältnis zur Verarbeitungszeit der TTS-Anfrage generiert wird. Das folgende Diagramm zeigt beispielhaft, wie 4 parallele Anrufe mit verschiedenen Nutzern bei nur 2 parallelen Anfragen ermöglicht werden können.

KI-Sprachagenten entwickeln
Wenn TTS für Dialoge eingesetzt wird, kann ein Parallelitätslimit von 5 etwa 100 Übertragungen für ausgewogene Gespräche zwischen KI-Agenten und menschlichen Teilnehmern unterstützen.
Bei Anwendungsfällen, in denen der KI-Agent seltener spricht als der Mensch, etwa im Kundensupport, können mehr als 100 gleichzeitige Gespräche unterstützt werden.
Charakter-Voiceovers
Im Allgemeinen können mit einem Parallelitätslimit von 5 mehr als 100 gleichzeitige Charakter-Voiceovers unterstützt werden.
Die Anzahl kann je nach Dialoghäufigkeit der Figur, Länge der Pausen und In-Game-Aktionen zwischen den Zeilen variieren.
Live-Synchronisation
Gleichzeitige Synchronisationsstreams folgen im Allgemeinen der angegebenen Faustregel.
Wenn die Übertragung Phasen mit Gesprächspausen enthält, etwa aufgrund eines Soundtracks oder visueller Szenen, sind möglicherweise mehr gleichzeitige Synchronisationsstreams als angegeben möglich.
Wenn Sie die Parallelitätslimits Ihres Tarifs überschreiten und den Enterprise-Tarif nutzen, können Modellanfragen abhängig von der verfügbaren Kapazität nach bestem Bemühen weiterhin erfolgreich sein, allerdings langsamer.
Um Ihr Parallelitätslimit und Ihre Warteschlangenpriorität zu erhöhen, upgraden Sie Ihren Abonnementtarif.
Enterprise-Kunden können über ihren Account Manager ein höheres Parallelitätslimit anfordern.
Text to Dialogue-Parallelität
Text to Dialogue-Anfragen werden abhängig davon, wie Sie die API aufrufen, auf zwei unterschiedliche Arten gemessen:
- HTTP-Endpoints (Dialog erstellen und Dialog streamen) zählen während der Audiogenerierung wie jede andere Text to Speech-Anfrage für das Standard-Parallelitätslimit Ihres Tarifs.
- WebSocket-Endpoints wie der Text to Dialogue WebSocket werden als Dialogsitzungen gemessen. Eine offene Verbindung belegt eine Dialogsitzung, solange sie geöffnet bleibt, unabhängig davon, ob aktuell Audio generiert wird.
Sitzungsbasierte Messung vereinfacht die Kapazitätsplanung: Eine Verbindung entspricht einer Sitzung, sodass Ihre Nutzung nicht mit der Generierungsaktivität schwankt. Da eine Sitzung für die gesamte Verbindung belegt wird und nicht nur während der Audiogenerierung, sind Ihre Dialogsitzungslimits auf diese neue Parallelitätsmethode ausgelegt.
Wenn Sie eine Verbindung öffnen, während alle Dialogsitzungen Ihres Workspace belegt sind, wird die neue Verbindung mit einem too_many_concurrent_requests-Fehler abgelehnt. Um Sitzungen freizugeben, schließen Sie nicht mehr benötigte Verbindungen. Eine Verbindung wird auch nach 20 Sekunden Inaktivität automatisch geschlossen, sofern Sie keine keep_alive-Nachrichten senden.
Um Dialogsitzungen zu überwachen, öffnen Sie unten in der Dashboard-Seitenleiste Developers, wählen Sie den Tab Analytics und rufen Sie in der Nutzungsansicht die Kennzahl Concurrent requests auf. Dialogsitzungen werden als eigene Reihe TTD Websocket Sessions angezeigt, getrennt von Ihren anderen parallelen Anfragen.
Parallelitätslimits mit Skalierungstests prüfen
Skalierungstests können helfen, clientseitige Skalierungsprobleme zu erkennen und zu prüfen, ob Parallelitätslimits für Ihren Anwendungsfall korrekt festgelegt sind.
Es wird dringend empfohlen, End-to-End-Workflows möglichst nah an der realen Nutzung zu testen. Die empfohlene Methode dafür besteht darin, zu simulieren und zu messen, wie viele Nutzer unterstützt werden können. Dabei ist wichtig:
- Simulieren Sie Nutzer, nicht rohe Anfragen.
- Simulieren Sie typisches Nutzerverhalten, etwa das Warten auf die Audiowiedergabe, darauf, dass Nutzer sprechen, oder auf den Abschluss der Transkription, bevor Anfragen gestellt werden.
- Erhöhen Sie die Anzahl der Nutzer über mehrere Minuten hinweg langsam.
- Variieren Sie die Zeitpunkte und die Größe der Anfragen zufällig.
- Erfassen Sie Latenzkennzahlen und alle von der API zurückgegebenen Fehlercodes.
Um beispielsweise ein Agentensystem zu testen, das für 100 gleichzeitige Gespräche ausgelegt ist, würden Sie bis zu 100 einzelne „Nutzer“ erstellen, die jeweils ein Gespräch simulieren. Gespräche bestehen typischerweise aus einem sich wiederholenden Zyklus von etwa 10 Sekunden, in denen der Nutzer spricht, gefolgt von einem TTS-API-Aufruf für etwa 150 Zeichen und anschließend etwa 10 Sekunden Audiowiedergabe für den Nutzer. Daher sollte jeder Nutzer alle 20 Sekunden einen WebSocket-Text-to-Speech-API-Aufruf für 150 Textzeichen durchführen, wobei die Wartezeit und die Anzahl der angeforderten Zeichen leicht zufällig variiert werden. Der Test würde darin bestehen, eine Minute lang pro Sekunde einen Nutzer zu starten, bis 100 vorhanden sind, und anschließend insgesamt 10 Minuten lang die Gesamtstabilität zu testen.
Beispiel für ein Skalierungstest-Skript
Dieses Beispiel verwendet locust als Test-Framework mit direkten API-Aufrufen an die ElevenLabs API.
Es folgt dem oben genannten Beispiel und testet ein dialogorientiertes Agentensystem, bei dem jeder Nutzer alle 20 Sekunden eine Anfrage sendet.