Speech Engine

Fügen Sie Ihrem eigenen Chat-Agenten oder LLM mit ElevenLabs eine Stimme hinzu.

Überblick

Die ElevenLabs Speech Engine fügt jedem Chat-Agenten Sprachfunktionen hinzu. ElevenLabs übernimmt Speech to Text und Text to Speech, während Ihr Server die LLM-Logik bereitstellt. Das SDK verwaltet den Verbindungslebenszyklus, Sprecherwechsel und Unterbrechungserkennung, damit Sie sich auf das Verhalten Ihres Agenten konzentrieren können.

So funktioniert es

Speech Engine verbindet Ihren Server über WebSocket mit ElevenLabs. Jede Verbindung steht für eine Unterhaltung.

  1. Ein Nutzer spricht im Browser. ElevenLabs erfasst das Audio und transkribiert es.
  2. Das Transkript wird zusammen mit dem vollständigen Gesprächsverlauf an Ihren Server gesendet.
  3. Ihr Server übergibt das Transkript an Ihr LLM und streamt die Antwort zurück.
  4. ElevenLabs wandelt den Text in Sprache um und spielt ihn im Browser ab.

Wann Sie Speech Engine verwenden sollten

Speech Engine ist für Entwickler gedacht, die ihr eigenes LLM einsetzen und die Gesprächslogik auf ihrem eigenen Server steuern möchten. Verwenden Sie sie, wenn Sie:

  • einem bestehenden textbasierten Chat-Agenten Sprache hinzufügen möchten
  • ein bestimmtes LLM, ein feinabgestimmtes Modell oder eine eigene Inferenz-Pipeline verwenden möchten
  • die vollständige Kontrolle über Gesprächsweiterleitung, Kontextverwaltung und Tool-Aufrufe behalten möchten
  • Sprache in eine bestehende Serveranwendung integrieren möchten (Express, FastAPI usw.)

Wenn Sie eine vollständig gehostete Lösung möchten, bei der ElevenLabs das LLM, die Wissensdatenbank und die Tools bereitstellt, verwenden Sie stattdessen ElevenAgents.

Hauptfunktionen

  • Beliebiges LLM – verwenden Sie OpenAI, Anthropic, Google Gemini oder jedes Modell, das Text erzeugt. Das SDK extrahiert Text automatisch aus den Stream-Formaten von OpenAI, Anthropic und Gemini.
  • Unterbrechungsverarbeitung – wenn der Nutzer während einer Antwort spricht, bricht das SDK die laufende LLM-Anfrage automatisch über ein AbortSignal (TypeScript) oder die Aufgabenabbruchfunktion (Python) ab.
  • Streaming – Antworten werden während der Generierung an den Browser gestreamt. Übergeben Sie einen String, ein asynchrones Iterable oder ein natives LLM-Stream-Objekt.
  • Sprecherwechsel – das SDK verwaltet Gesprächszüge, sodass Ihr Server nur auf Transkripte reagieren muss.

IP-Allowlisting

Wenn Ihr Server hinter einer Firewall steht oder IP-basierte Zugriffskontrollen verwendet, können Sie die statischen ausgehenden IPs zulassen, von denen ElevenLabs-WebSocket-Verbindungen ausgehen. Die vollständige Liste der IP-Adressen finden Sie unter IP-Allowlisting.

Mit IP-Allowlisting stellen Sie sicher, dass Ihr Server nur WebSocket-Verbindungen von ElevenLabs- Systemen akzeptiert.

FAQ

Jedes LLM, das Text erzeugt. Das SDK bietet integrierte Stream-Extraktion für OpenAI (Responses API und Chat Completions API), Anthropic Messages API und Google Gemini API. Für andere Anbieter übergeben Sie einen einfachen String oder ein asynchrones Iterable aus String-Teilen.

ElevenAgents ist eine vollständig gehostete Plattform, bei der ElevenLabs das LLM, die Wissensdatenbank und die Tools bereitstellt. Speech Engine ist für Entwickler, die ihr eigenes LLM einsetzen und die Gesprächslogik auf ihrem eigenen Server steuern möchten.

In TypeScript können Sie Speech Engine an jeden Node.js-HTTP-Server anhängen (Express, Fastify oder einfaches http.createServer()), oder einen eigenständigen WebSocket-Server ausführen. In Python stellt das SDK über engine.serve() einen eigenständigen Server bereit. Alternativ können Sie es mit FastAPI, Starlette oder einem beliebigen ASGI-Framework über engine.create_session() integrieren.