Speech Engine
Fügen Sie Ihrem eigenen Chat-Agenten oder LLM mit ElevenLabs eine Stimme hinzu.
Überblick
Die ElevenLabs Speech Engine fügt jedem Chat-Agenten Sprachfunktionen hinzu. ElevenLabs übernimmt Speech to Text und Text to Speech, während Ihr Server die LLM-Logik bereitstellt. Das SDK verwaltet den Verbindungslebenszyklus, Sprecherwechsel und Unterbrechungserkennung, damit Sie sich auf das Verhalten Ihres Agenten konzentrieren können.
So funktioniert es
Speech Engine verbindet Ihren Server über WebSocket mit ElevenLabs. Jede Verbindung steht für eine Unterhaltung.
- Ein Nutzer spricht im Browser. ElevenLabs erfasst das Audio und transkribiert es.
- Das Transkript wird zusammen mit dem vollständigen Gesprächsverlauf an Ihren Server gesendet.
- Ihr Server übergibt das Transkript an Ihr LLM und streamt die Antwort zurück.
- ElevenLabs wandelt den Text in Sprache um und spielt ihn im Browser ab.
Wann Sie Speech Engine verwenden sollten
Speech Engine ist für Entwickler gedacht, die ihr eigenes LLM einsetzen und die Gesprächslogik auf ihrem eigenen Server steuern möchten. Verwenden Sie sie, wenn Sie:
- einem bestehenden textbasierten Chat-Agenten Sprache hinzufügen möchten
- ein bestimmtes LLM, ein feinabgestimmtes Modell oder eine eigene Inferenz-Pipeline verwenden möchten
- die vollständige Kontrolle über Gesprächsweiterleitung, Kontextverwaltung und Tool-Aufrufe behalten möchten
- Sprache in eine bestehende Serveranwendung integrieren möchten (Express, FastAPI usw.)
Wenn Sie eine vollständig gehostete Lösung möchten, bei der ElevenLabs das LLM, die Wissensdatenbank und die Tools bereitstellt, verwenden Sie stattdessen ElevenAgents.
Hauptfunktionen
- Beliebiges LLM – verwenden Sie OpenAI, Anthropic, Google Gemini oder jedes Modell, das Text erzeugt. Das SDK extrahiert Text automatisch aus den Stream-Formaten von OpenAI, Anthropic und Gemini.
- Unterbrechungsverarbeitung – wenn der Nutzer während einer Antwort spricht, bricht das SDK die laufende LLM-Anfrage automatisch über ein
AbortSignal(TypeScript) oder die Aufgabenabbruchfunktion (Python) ab. - Streaming – Antworten werden während der Generierung an den Browser gestreamt. Übergeben Sie einen String, ein asynchrones Iterable oder ein natives LLM-Stream-Objekt.
- Sprecherwechsel – das SDK verwaltet Gesprächszüge, sodass Ihr Server nur auf Transkripte reagieren muss.
IP-Allowlisting
Wenn Ihr Server hinter einer Firewall steht oder IP-basierte Zugriffskontrollen verwendet, können Sie die statischen ausgehenden IPs zulassen, von denen ElevenLabs-WebSocket-Verbindungen ausgehen. Die vollständige Liste der IP-Adressen finden Sie unter IP-Allowlisting.
Mit IP-Allowlisting stellen Sie sicher, dass Ihr Server nur WebSocket-Verbindungen von ElevenLabs- Systemen akzeptiert.
FAQ
Welche LLMs werden unterstützt?
Jedes LLM, das Text erzeugt. Das SDK bietet integrierte Stream-Extraktion für OpenAI (Responses API und Chat Completions API), Anthropic Messages API und Google Gemini API. Für andere Anbieter übergeben Sie einen einfachen String oder ein asynchrones Iterable aus String-Teilen.
Was ist der Unterschied zwischen Speech Engine und ElevenAgents?
ElevenAgents ist eine vollständig gehostete Plattform, bei der ElevenLabs das LLM, die Wissensdatenbank und die Tools bereitstellt. Speech Engine ist für Entwickler, die ihr eigenes LLM einsetzen und die Gesprächslogik auf ihrem eigenen Server steuern möchten.
Welche Server-Frameworks werden unterstützt?
In TypeScript können Sie Speech Engine an jeden Node.js-HTTP-Server anhängen (Express, Fastify oder
einfaches http.createServer()), oder einen eigenständigen WebSocket-Server ausführen. In Python stellt das SDK
über engine.serve() einen eigenständigen Server bereit. Alternativ können Sie es mit FastAPI, Starlette oder einem beliebigen
ASGI-Framework über engine.create_session() integrieren.