Aussprachewörterbücher verwenden

In diesem Leitfaden erfahren Sie, wie Sie Aussprachewörterbücher programmatisch verwalten.

Anleitung · Setzt voraus, dass Sie den ElevenAPI- Schnellstart abgeschlossen haben.

Überblick

Mit Aussprachewörterbüchern können Sie anpassen, wie Ihr KI-Agent bestimmte Wörter oder Ausdrücke ausspricht. Das ist besonders nützlich für:

  • Die Korrektur der Aussprache von Namen, Orten oder Fachbegriffen
  • Eine konsistente Aussprache über Gespräche hinweg
  • Die Anpassung regionaler Aussprachevarianten

ElevenLabs unterstützt sowohl IPA- als auch CMU-Alphabete.

Phonem-Tags in Aussprachewörterbüchern funktionieren nur mit den Modellen eleven_v4, eleven_flash_v2 und eleven_v3.

Andere Modelle überspringen Phonem-Tags aus Wörterbüchern und verwenden die Standardaussprache. Verwenden Sie für andere Modelle stattdessen Alias-Tags, um Schreibweisen oder Ausdrücke zu ersetzen, die die gewünschte Aussprache erzeugen.

Wenn Sie IPA- und CMU-Aussprache in anderen Sprachen als Englisch verwenden möchten, müssen Sie zum Modell eleven_v4 wechseln.

Schnellstart

Dieser Leitfaden setzt voraus, dass Sie Ihren API-Schlüssel und Ihr SDK eingerichtet haben. Schließen Sie zunächst den Schnellstart ab, falls noch nicht geschehen.

1

Datei für ein Aussprachewörterbuch erstellen

In diesem Beispiel erstellen wir eine Datei für ein Aussprachewörterbuch für das Wort tomato.

Diese Regel verwendet das Alphabet „IPA“ und aktualisiert die Aussprache für tomato und Tomato mit einer anderen Aussprache. PLS-Dateien unterscheiden zwischen Groß- und Kleinschreibung. Deshalb fügen wir das Wort sowohl mit als auch ohne großes „T“ ein.

Sie können KI-Tools wie Claude oder ChatGPT verwenden, um IPA- oder CMU-Notationen für bestimmte Wörter zu erstellen.

dictionary.pls
<?xml version="1.0" encoding="UTF-8"?>
<lexicon version="1.0"
xmlns="http://www.w3.org/2005/01/pronunciation-lexicon"
xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance"
xsi:schemaLocation="http://www.w3.org/2005/01/pronunciation-lexicon
http://www.w3.org/TR/2007/CR-pronunciation-lexicon-20071212/pls.xsd"
alphabet="ipa" xml:lang="en-US">
<lexeme>
<grapheme>tomato</grapheme>
<phoneme>/tə'meɪtoʊ/</phoneme>
</lexeme>
<lexeme>
<grapheme>Tomato</grapheme>
<phoneme>/tə'meɪtoʊ/</phoneme>
</lexeme>
</lexicon>
2

Aussprachewörterbuch über das SDK aus einer Datei erstellen

Erstellen Sie je nach gewählter Sprache eine neue Datei mit dem Namen example.py oder example.mts und fügen Sie den folgenden Code hinzu:

from elevenlabs import ElevenLabs, PronunciationDictionaryVersionLocator
from elevenlabs.play import play
elevenlabs = ElevenLabs()
with open("dictionary.pls", "rb") as f:
# this dictionary changes how tomato is pronounced
pronunciation_dictionary = elevenlabs.pronunciation_dictionaries.create_from_file(
file=f.read(), name="example"
)
audio_1 = elevenlabs.text_to_speech.convert(
text="Without the dictionary: tomato",
voice_id="aMSt68OGf4xUZAnLpTU8",
model_id="eleven_flash_v2",
)
audio_2 = elevenlabs.text_to_speech.convert(
text="With the dictionary: tomato",
voice_id="aMSt68OGf4xUZAnLpTU8",
model_id="eleven_flash_v2",
pronunciation_dictionary_locators=[
PronunciationDictionaryVersionLocator(
pronunciation_dictionary_id=pronunciation_dictionary.id,
version_id=pronunciation_dictionary.version_id,
)
],
)
# play the audio
play(audio_1)
play(audio_2)
3

Code ausführen

python example.py

Sie sollten zwei Audioversionen über Ihre Lautsprecher hören: eine mit und eine ohne Aussprachewörterbuch.

Nächste Schritte