Stimmgestaltung
Eine Anleitung zum Erstellen von Stimmen anhand eines Text-Prompts.
Überblick
Voice Design hilft Kreativen, Lücken zu schließen, wenn die gesuchte Stimme nicht in der Voice Library verfügbar ist. Wenn Sie keine passende Stimme für Ihr Projekt finden, können Sie eine erstellen. Voice Design eignet sich besonders für schnelle Erkundung und Iteration. Die Ausgabequalität kann je nach Prompt und Anwendungsfall variieren. Wenn Sie die konsistenteste, produktionsreife Qualität benötigen, bieten Professional Voice Clones (PVC) derzeit die höchste Stimmqualität auf unserer Plattform. Wenn in unserer Bibliothek ein passender PVC verfügbar ist, empfehlen wir daher, diesen zu verwenden.
Sie finden Voice Design in der ElevenLabs-App unter Stimmen -> Meine Stimmen -> Neue Stimme hinzufügen -> Voice Design oder über die API.
Wenn Sie auf „Generieren“ klicken, erstellen wir drei Stimmoptionen für Sie. Die einzige Gebühr für Voice Design sind die Credits zur Generierung Ihres Vorschautexts. Diese werden Ihnen nur einmal berechnet, obwohl wir drei Beispiele für Sie erstellen. Im Textfeld „Text für Vorschau“ sehen Sie, wie viele Zeichen abgezogen werden.
Nach der Generierung können Sie eine der erzeugten Stimmen auswählen und speichern. Sie belegt einen Ihrer Stimmplätze.
Prompt-Leitfaden
Der Prompt ist die Grundlage Ihrer Stimme. Er sagt dem Modell, welche Art von Stimme Sie erstellen möchten – vom Akzent und Charaktertyp bis zu Geschlecht und Stimmung der Stimme. Ein gut formulierter Prompt kann den Unterschied zwischen einer allgemeinen Stimme und einer Stimme ausmachen, die wirklich zu Ihrer Vorstellung passt. Generell liefern detailliertere und präzisere Prompts tendenziell genauere und nuanciertere Ergebnisse. Je mehr Details Sie angeben – etwa Alter, Geschlecht, Tonfall, Akzent, Sprechtempo, Emotion, Stil und mehr –, desto besser kann das Modell eine gezielt passende Stimme interpretieren und liefern.
Manchmal können jedoch auch kurze und einfache Prompts funktionieren, besonders wenn Sie eine neutralere oder breit einsetzbare Stimme anstreben. „Ein ruhiger männlicher Erzähler“ kann Ihnen beispielsweise genau das liefern, was Sie brauchen, ohne ins Detail zu gehen – insbesondere wenn Sie keinen sehr spezifischen Charakter oder Stil erstellen möchten. Der richtige Detailgrad hängt von Ihrem Anwendungsfall ab. Erstellen Sie einen Fantasy-Charakter? Einen virtuellen Assistenten? Eine müde New Yorkerin in ihren Sechzigern mit trockenem Humor? Je klarer Sie dies in Ihrem Prompt definieren, desto näher kommt die Ausgabe Ihrer Vorstellung.
Empfohlenes Prompt-Format
Für konsistente Ergebnisse strukturieren Sie Ihren Prompt in diesem Format:
Beispiel:
Native Spanish, español europeo (sin rasgos de español latinoamericano). Female, 35–40. Ok quality. Persona: operadora de soporte confiable. Emotion: reassuring, attentive, confident. Smooth, natural timbre with gentle intonation, forward proximity, and a noise-free signal. Delivers updates at a relaxed pace with clear emphasis on helpful information, projecting empathy and professionalism.
Häufige Fehler vermeiden
- Verwenden Sie nicht „accent“, wenn Sie Intonation meinen – dies kann unerwünschte Dialektverschiebungen auslösen. Beschreiben Sie stattdessen Intonation, Betonung oder Sprechmuster.
- Vermeiden Sie FX-Begriffe – Begriffe wie „reverb“, „echo“, „phone“ oder „tape“ können die Ausgabequalität beeinträchtigen.
- Geben Sie Sprache und Dialekt explizit an – nennen Sie immer die Sprache und regionale Variante im ersten Satz, um Abweichungen zu verhindern.
Audioqualität
Die Audioqualität beschreibt die Klarheit, Reinheit und allgemeine Wiedergabetreue der generierten Stimme. Standardmäßig erzeugt ElevenLabs klare und natürlich klingende Audiodateien. Wenn Ihr Projekt jedoch ein bestimmtes Qualitätsniveau erfordert, sollten Sie dies ausdrücklich in Ihrem Prompt angeben.
Für hochwertige Ergebnisse können Sie das Modell unterstützen, indem Sie Ihrer Stimmbeschreibung einen Ausdruck wie „perfekte Audioqualität“ oder „Aufnahme in Studioqualität“ hinzufügen. So wird die Stimme mit maximaler Klarheit, minimalen Verzerrungen und einem professionellen Finish gerendert.
Sie können auch spezifische Qualitätsbeschreibungen verwenden, die konsistente Ergebnisse liefern:
- Akzeptable Qualität
- Gute Qualität
- Sehr gute Qualität
- Ausgezeichnete Qualität
- Studioqualität
- Sendequalität
Diese Beschreibungen helfen dabei, die höchste Audioqualität zu erzielen, wenn Sie sie in Ihren Prompt aufnehmen.
Das Einfügen solcher Formulierungen kann die Genauigkeit des Prompts allgemein verringern, wenn die Stimme sehr spezifisch oder ungewöhnlich ist.
Es kann auch kreative Fälle geben, in denen eine geringere Audioqualität beabsichtigt ist, etwa bei der Simulation eines Telefongesprächs, einer alten Radiosendung oder Found Footage. Lassen Sie in diesen Situationen Qualitätsbeschreibungen entweder ganz weg oder fügen Sie ausdrücklich Formulierungen hinzu wie:
- „Audio mit geringer Wiedergabetreue“
- „Schlechte Audioqualität“
- „Klingt wie eine Voicemail“
- „Gedämpft und entfernt, wie auf einem alten Kassettenrekorder“
Die Position dieser Formulierung in Ihrem Prompt ist flexibel. Sie kann am Anfang oder Ende stehen; nach unserer Erfahrung funktioniert beides gut.
Alter, Ton/Klangfarbe und Geschlecht
Diese drei Merkmale bilden die Grundlage des Voice Designs und prägen die Gesamtidentität und emotionale Wirkung der Stimme. Je mehr Details Sie angeben, desto leichter kann die KI eine Stimme erzeugen, die Ihrer kreativen Vision entspricht – unabhängig davon, ob Sie einen glaubwürdigen Charakter entwickeln, einen überzeugenden Erzähler gestalten oder einen virtuellen Assistenten entwerfen.
Alter
Das Beschreiben des wahrgenommenen Alters einer Stimme hilft dabei, ihre Reife, Stimmtextur und Energie festzulegen. Verwenden Sie konkrete Begriffe, um die KI zur passenden Stimmqualität zu führen.
Nützliche Beschreibungen:
- „Männlicher Teenager“ / „weiblicher Teenager“
- „Junger Erwachsener“ / „Ende 20“ / „Anfang 30“
- „Mann mittleren Alters“ / „Frau in ihren 40ern“
- „Älterer Mann“ / „ältere Frau“ / „Mann in seinen 80ern“
Ton/Klangfarbe
Bezieht sich auf die physische Qualität der Stimme, die durch Tonhöhe, Resonanz und Stimmtextur geprägt wird. Sie unterscheidet sich von emotionaler Darbietung oder Haltung.
Häufige Beschreibungen für Ton/Klangfarbe:
- „Tief“ / „tiefe Tonlage“
- „Sanft“ / „voll“
- „Kiesig“ / „heiser“
- „Näselnd“ / „schrill“
- „Luftig“ / „verhaucht“
- „Klangvoll“ / „resonant“
- „Hell“ / „dünn“
- „Warm“ / „weich“
- „Blechernd“ / „metallisch“
Geschlecht
Das Geschlecht beeinflusst oft Tonhöhe, Stimmgewicht und tonale Präsenz. Sie können jedoch über einfache Kategorien hinausgehen, indem Sie den Klang statt der Identität beschreiben.
Beispiele:
- „Eine tiefer klingende, rauchige Frauenstimme“
- „Eine männliche Männerstimme, tief und resonant“
- „Ein neutrales Geschlecht – sanft und mittlere Tonlage“
Akzent
Der Akzent spielt eine entscheidende Rolle bei der Definition der regionalen, kulturellen und emotionalen Identität einer Stimme. Wenn Ihr Projekt auf einen authentischen Klang angewiesen ist – ob realistisch oder stilisiert für einen Charakter –, ist eine klare und bewusste Beschreibung des gewünschten Akzents essenziell.
Die Wortwahl ist wichtig – bestimmte Begriffe führen meist zu konsistenteren Ergebnissen. Beispielsweise liefert „deutlich“ bei der Beschreibung der Stärke eines Akzents oft bessere Ergebnisse als „stark“. Hier ist viel Ausprobieren gefragt. Experimentieren Sie mit der Formulierung und seien Sie möglichst kreativ und beschreibend.
Seien Sie vorsichtig mit dem Wort „Akzent“. Wenn Sie Intonation oder Betonungsmuster statt eines regionalen Dialekts meinen, verwenden Sie diese Begriffe. Die Verwendung von „Akzent“ für Intonation kann unerwünschte Dialektverschiebungen auslösen.
- Beispiele für klare Akzent-Prompts:
- „Ein Mann mittleren Alters mit einem deutlichen französischen Akzent“
- „Eine junge Frau mit einem leichten Südstaaten-Twang“
- „Ein alter Mann mit einem starken osteuropäischen Akzent“
- „Eine fröhliche Frau, die mit einem klaren britischen Akzent spricht“
- „Ein jüngerer Mann mit einem sanften irischen Singsang“
- „Eine autoritäre Stimme mit neutralem amerikanischem Akzent“
- „Ein Mann mit regionalem australischem Akzent, entspannt und näselnd“
Vermeiden Sie zu vage Beschreibungen wie „ausländisch“ oder „exotisch“ – sie sind ungenau und können uneinheitliche Ergebnisse erzeugen.
Kombinieren Sie Akzent mit anderen Merkmalen wie Ton, Alter oder Sprechtempo, um mehr Kontrolle zu erhalten. Zum Beispiel: „Eine sarkastische alte Frau mit einem deutlichen New Yorker Akzent, die langsam spricht.“
Für Fantasy- oder fiktive Stimmen können Sie Akzente aus der realen Welt als Inspiration vorschlagen:
- „Ein Elf mit einem ausgeprägten, korrekten britischen Akzent. Er wirkt königlich und lyrisch.“
- „Ein Goblin mit einem rauen osteuropäischen Akzent.“
Sprechtempo
Das Sprechtempo beschreibt die Geschwindigkeit und den Rhythmus, mit denen eine Stimme spricht. Es ist ein zentraler Faktor für die Persönlichkeit, den emotionalen Ton und die Verständlichkeit der Stimme. Eine klare Angabe des Sprechtempos ist besonders wichtig, wenn Sie Stimmen für konkrete Anwendungsfälle wie Storytelling, Werbung, Charakterdialoge oder Lerninhalte gestalten.
Beschreiben Sie mit klarer Sprache, wie schnell oder langsam die Stimme sprechen soll. Sie können auch beschreiben, wie sich das Tempo anfühlt – ob gleichmäßig, unregelmäßig, bewusst oder locker. Wenn sich das Tempo verändert, geben Sie an, wo und warum.
Beispiele für Beschreibungen des Sprechtempos:
- „Spricht schnell“ / „in hohem Tempo“
- „In normalem Tempo“ / „spricht normal“
- „Spricht langsam“ / „mit langsamem Rhythmus“
- „Bewusstes und gemessenes Tempo“
- „Gedehnt, als würde jedes Wort genossen“
- „Mit gehetztem Rhythmus, als wäre die Person in Eile“
- „Entspanntes und gesprächiges Tempo“
- „Rhythmisch und musikalisch im Tempo“
- „Unregelmäßiges Tempo mit abrupten Pausen und Schüben“
- „Gleichmäßiges Tempo mit konsistentem Abstand zwischen den Wörtern“
- „Stakkato-Darbietung“
Text für die Vorschau
Nachdem Sie einen aussagekräftigen Stimm-Prompt geschrieben haben, spielt der Text, mit dem Sie diese Stimme vorhören, eine entscheidende Rolle dafür, wie sie tatsächlich klingt. Der Vorschautext fungiert wie ein Sprechskript – er legt den Ton, das Tempo und die emotionale Darbietung fest, an denen sich die Stimme orientieren soll.
Für die besten Ergebnisse sollte Ihr Vorschautext die Stimmbeschreibung ergänzen und ihr nicht widersprechen. Wenn Ihr Prompt beispielsweise eine „ruhige und nachdenkliche jüngere Frauenstimme mit leichtem japanischen Akzent“ beschreibt, passt ein Satz wie „Hey! Ich kann es nicht ausstehen, was du mit diesem verdammten Ort gemacht hast!!!“ nicht zu dieser Absicht. Das Modell wird versuchen, diesen Widerspruch aufzulösen, was oft zu unnatürlichen oder uneinheitlichen Ergebnissen führt.
Verwenden Sie stattdessen Beispieltext, der die gewünschte Persönlichkeit und emotionale Tonalität der Stimme widerspiegelt. Für das obige Beispiel unterstützt etwas wie „In letzter Zeit war es ruhig … Ich hatte Zeit zum Nachdenken, und vielleicht war genau das das Wichtigste für mich.“ den Prompt und hilft, eine natürlichere, stimmigere Stimme zu erzeugen.
Wir haben außerdem festgestellt, dass längere Vorschautexte meist stabilere und ausdrucksstärkere Ergebnisse liefern. Kurze Formulierungen können manchmal abrupt oder uneinheitlich klingen, besonders wenn Sie subtile Eigenschaften wie Ton oder Tempo testen. Wenn Sie dem Modell mehr Kontext geben – einen vollständigen Satz oder sogar einen kurzen Absatz –, kann es die Stimme flüssiger und genauer wiedergeben.
Parameter
Lautstärke
Steuert die Lautstärke der Text-to-Preview-Generierung und letztlich der gespeicherten Stimme.
Guidance Scale
Legt fest, wie genau der Prompt befolgt wird. Höhere Werte halten sich strikter an den Prompt, können aber zu schlechterer Audioqualität führen, wenn der Prompt sehr speziell ist. Niedrigere Werte erlauben dem Modell mehr Kreativität, gehen jedoch zulasten der Prompt-Genauigkeit. Verwenden Sie einen niedrigeren Wert, wenn Darbietung und Audioqualität generell wichtiger sind als die perfekte Umsetzung des Prompts. Hohe Werte werden empfohlen, wenn die Genauigkeit von Akzent oder Ton oberste Priorität hat.
Attribute und Beispiele
Experimentieren Sie mit der Formulierung dieser Beschreibungen. „Perfekte Audioqualität“ kann beispielsweise auch als „die Audioqualität ist perfekt“ formuliert werden. Das kann manchmal unterschiedliche Ergebnisse liefern.