Stimmgestaltung

Eine Anleitung zum Erstellen von Stimmen anhand eines Text-Prompts.

Stimmgestaltung

Überblick

Voice Design hilft Kreativen, Lücken zu schließen, wenn die gesuchte Stimme nicht in der Voice Library verfügbar ist. Wenn Sie keine passende Stimme für Ihr Projekt finden, können Sie eine erstellen. Voice Design eignet sich besonders für schnelle Erkundung und Iteration. Die Ausgabequalität kann je nach Prompt und Anwendungsfall variieren. Wenn Sie die konsistenteste, produktionsreife Qualität benötigen, bieten Professional Voice Clones (PVC) derzeit die höchste Stimmqualität auf unserer Plattform. Wenn in unserer Bibliothek ein passender PVC verfügbar ist, empfehlen wir daher, diesen zu verwenden.

Sie finden Voice Design in der ElevenLabs-App unter Stimmen -> Meine Stimmen -> Neue Stimme hinzufügen -> Voice Design oder über die API.

Wenn Sie auf „Generieren“ klicken, erstellen wir drei Stimmoptionen für Sie. Die einzige Gebühr für Voice Design sind die Credits zur Generierung Ihres Vorschautexts. Diese werden Ihnen nur einmal berechnet, obwohl wir drei Beispiele für Sie erstellen. Im Textfeld „Text für Vorschau“ sehen Sie, wie viele Zeichen abgezogen werden.

Nach der Generierung können Sie eine der erzeugten Stimmen auswählen und speichern. Sie belegt einen Ihrer Stimmplätze.

Prompt-Leitfaden

Der Prompt ist die Grundlage Ihrer Stimme. Er sagt dem Modell, welche Art von Stimme Sie erstellen möchten – vom Akzent und Charaktertyp bis zu Geschlecht und Stimmung der Stimme. Ein gut formulierter Prompt kann den Unterschied zwischen einer allgemeinen Stimme und einer Stimme ausmachen, die wirklich zu Ihrer Vorstellung passt. Generell liefern detailliertere und präzisere Prompts tendenziell genauere und nuanciertere Ergebnisse. Je mehr Details Sie angeben – etwa Alter, Geschlecht, Tonfall, Akzent, Sprechtempo, Emotion, Stil und mehr –, desto besser kann das Modell eine gezielt passende Stimme interpretieren und liefern.

Manchmal können jedoch auch kurze und einfache Prompts funktionieren, besonders wenn Sie eine neutralere oder breit einsetzbare Stimme anstreben. „Ein ruhiger männlicher Erzähler“ kann Ihnen beispielsweise genau das liefern, was Sie brauchen, ohne ins Detail zu gehen – insbesondere wenn Sie keinen sehr spezifischen Charakter oder Stil erstellen möchten. Der richtige Detailgrad hängt von Ihrem Anwendungsfall ab. Erstellen Sie einen Fantasy-Charakter? Einen virtuellen Assistenten? Eine müde New Yorkerin in ihren Sechzigern mit trockenem Humor? Je klarer Sie dies in Ihrem Prompt definieren, desto näher kommt die Ausgabe Ihrer Vorstellung.

Empfohlenes Prompt-Format

Für konsistente Ergebnisse strukturieren Sie Ihren Prompt in diesem Format:

Native <Language>. <Gender>, <Age range>. <Quality level>.
Persona: <2–5 words>. Emotion: <2–3 adjectives>.
<1–2 sentences about timbre, pacing, delivery>

Beispiel:

Native Spanish, español europeo (sin rasgos de español latinoamericano). Female, 35–40. Ok quality. Persona: operadora de soporte confiable. Emotion: reassuring, attentive, confident. Smooth, natural timbre with gentle intonation, forward proximity, and a noise-free signal. Delivers updates at a relaxed pace with clear emphasis on helpful information, projecting empathy and professionalism.

Häufige Fehler vermeiden

  • Verwenden Sie nicht „accent“, wenn Sie Intonation meinen – dies kann unerwünschte Dialektverschiebungen auslösen. Beschreiben Sie stattdessen Intonation, Betonung oder Sprechmuster.
  • Vermeiden Sie FX-Begriffe – Begriffe wie „reverb“, „echo“, „phone“ oder „tape“ können die Ausgabequalität beeinträchtigen.
  • Geben Sie Sprache und Dialekt explizit an – nennen Sie immer die Sprache und regionale Variante im ersten Satz, um Abweichungen zu verhindern.

Audioqualität

Die Audioqualität beschreibt die Klarheit, Reinheit und allgemeine Wiedergabetreue der generierten Stimme. Standardmäßig erzeugt ElevenLabs klare und natürlich klingende Audiodateien. Wenn Ihr Projekt jedoch ein bestimmtes Qualitätsniveau erfordert, sollten Sie dies ausdrücklich in Ihrem Prompt angeben.

Für hochwertige Ergebnisse können Sie das Modell unterstützen, indem Sie Ihrer Stimmbeschreibung einen Ausdruck wie „perfekte Audioqualität“ oder „Aufnahme in Studioqualität“ hinzufügen. So wird die Stimme mit maximaler Klarheit, minimalen Verzerrungen und einem professionellen Finish gerendert.

Sie können auch spezifische Qualitätsbeschreibungen verwenden, die konsistente Ergebnisse liefern:

  • Akzeptable Qualität
  • Gute Qualität
  • Sehr gute Qualität
  • Ausgezeichnete Qualität
  • Studioqualität
  • Sendequalität

Diese Beschreibungen helfen dabei, die höchste Audioqualität zu erzielen, wenn Sie sie in Ihren Prompt aufnehmen.

Das Einfügen solcher Formulierungen kann die Genauigkeit des Prompts allgemein verringern, wenn die Stimme sehr spezifisch oder ungewöhnlich ist.

Es kann auch kreative Fälle geben, in denen eine geringere Audioqualität beabsichtigt ist, etwa bei der Simulation eines Telefongesprächs, einer alten Radiosendung oder Found Footage. Lassen Sie in diesen Situationen Qualitätsbeschreibungen entweder ganz weg oder fügen Sie ausdrücklich Formulierungen hinzu wie:

  • „Audio mit geringer Wiedergabetreue“
  • „Schlechte Audioqualität“
  • „Klingt wie eine Voicemail“
  • „Gedämpft und entfernt, wie auf einem alten Kassettenrekorder“

Die Position dieser Formulierung in Ihrem Prompt ist flexibel. Sie kann am Anfang oder Ende stehen; nach unserer Erfahrung funktioniert beides gut.

Alter, Ton/Klangfarbe und Geschlecht

Diese drei Merkmale bilden die Grundlage des Voice Designs und prägen die Gesamtidentität und emotionale Wirkung der Stimme. Je mehr Details Sie angeben, desto leichter kann die KI eine Stimme erzeugen, die Ihrer kreativen Vision entspricht – unabhängig davon, ob Sie einen glaubwürdigen Charakter entwickeln, einen überzeugenden Erzähler gestalten oder einen virtuellen Assistenten entwerfen.

Alter

Das Beschreiben des wahrgenommenen Alters einer Stimme hilft dabei, ihre Reife, Stimmtextur und Energie festzulegen. Verwenden Sie konkrete Begriffe, um die KI zur passenden Stimmqualität zu führen.

Nützliche Beschreibungen:

  • „Männlicher Teenager“ / „weiblicher Teenager“
  • „Junger Erwachsener“ / „Ende 20“ / „Anfang 30“
  • „Mann mittleren Alters“ / „Frau in ihren 40ern“
  • „Älterer Mann“ / „ältere Frau“ / „Mann in seinen 80ern“

Ton/Klangfarbe

Bezieht sich auf die physische Qualität der Stimme, die durch Tonhöhe, Resonanz und Stimmtextur geprägt wird. Sie unterscheidet sich von emotionaler Darbietung oder Haltung.

Häufige Beschreibungen für Ton/Klangfarbe:

  • „Tief“ / „tiefe Tonlage“
  • „Sanft“ / „voll“
  • „Kiesig“ / „heiser“
  • „Näselnd“ / „schrill“
  • „Luftig“ / „verhaucht“
  • „Klangvoll“ / „resonant“
  • „Hell“ / „dünn“
  • „Warm“ / „weich“
  • „Blechernd“ / „metallisch“

Geschlecht

Das Geschlecht beeinflusst oft Tonhöhe, Stimmgewicht und tonale Präsenz. Sie können jedoch über einfache Kategorien hinausgehen, indem Sie den Klang statt der Identität beschreiben.

Beispiele:

  • „Eine tiefer klingende, rauchige Frauenstimme“
  • „Eine männliche Männerstimme, tief und resonant“
  • „Ein neutrales Geschlecht – sanft und mittlere Tonlage“

Akzent

Der Akzent spielt eine entscheidende Rolle bei der Definition der regionalen, kulturellen und emotionalen Identität einer Stimme. Wenn Ihr Projekt auf einen authentischen Klang angewiesen ist – ob realistisch oder stilisiert für einen Charakter –, ist eine klare und bewusste Beschreibung des gewünschten Akzents essenziell.

Die Wortwahl ist wichtig – bestimmte Begriffe führen meist zu konsistenteren Ergebnissen. Beispielsweise liefert „deutlich“ bei der Beschreibung der Stärke eines Akzents oft bessere Ergebnisse als „stark“. Hier ist viel Ausprobieren gefragt. Experimentieren Sie mit der Formulierung und seien Sie möglichst kreativ und beschreibend.

Seien Sie vorsichtig mit dem Wort „Akzent“. Wenn Sie Intonation oder Betonungsmuster statt eines regionalen Dialekts meinen, verwenden Sie diese Begriffe. Die Verwendung von „Akzent“ für Intonation kann unerwünschte Dialektverschiebungen auslösen.

  • Beispiele für klare Akzent-Prompts:
    • „Ein Mann mittleren Alters mit einem deutlichen französischen Akzent“
    • „Eine junge Frau mit einem leichten Südstaaten-Twang“
    • „Ein alter Mann mit einem starken osteuropäischen Akzent“
    • „Eine fröhliche Frau, die mit einem klaren britischen Akzent spricht“
    • „Ein jüngerer Mann mit einem sanften irischen Singsang“
    • „Eine autoritäre Stimme mit neutralem amerikanischem Akzent“
    • „Ein Mann mit regionalem australischem Akzent, entspannt und näselnd“

Vermeiden Sie zu vage Beschreibungen wie „ausländisch“ oder „exotisch“ – sie sind ungenau und können uneinheitliche Ergebnisse erzeugen.

Kombinieren Sie Akzent mit anderen Merkmalen wie Ton, Alter oder Sprechtempo, um mehr Kontrolle zu erhalten. Zum Beispiel: „Eine sarkastische alte Frau mit einem deutlichen New Yorker Akzent, die langsam spricht.“

Für Fantasy- oder fiktive Stimmen können Sie Akzente aus der realen Welt als Inspiration vorschlagen:

  • „Ein Elf mit einem ausgeprägten, korrekten britischen Akzent. Er wirkt königlich und lyrisch.“
  • „Ein Goblin mit einem rauen osteuropäischen Akzent.“

Sprechtempo

Das Sprechtempo beschreibt die Geschwindigkeit und den Rhythmus, mit denen eine Stimme spricht. Es ist ein zentraler Faktor für die Persönlichkeit, den emotionalen Ton und die Verständlichkeit der Stimme. Eine klare Angabe des Sprechtempos ist besonders wichtig, wenn Sie Stimmen für konkrete Anwendungsfälle wie Storytelling, Werbung, Charakterdialoge oder Lerninhalte gestalten.

Beschreiben Sie mit klarer Sprache, wie schnell oder langsam die Stimme sprechen soll. Sie können auch beschreiben, wie sich das Tempo anfühlt – ob gleichmäßig, unregelmäßig, bewusst oder locker. Wenn sich das Tempo verändert, geben Sie an, wo und warum.

Beispiele für Beschreibungen des Sprechtempos:

  • „Spricht schnell“ / „in hohem Tempo“
  • „In normalem Tempo“ / „spricht normal“
  • „Spricht langsam“ / „mit langsamem Rhythmus“
  • „Bewusstes und gemessenes Tempo“
  • „Gedehnt, als würde jedes Wort genossen“
  • „Mit gehetztem Rhythmus, als wäre die Person in Eile“
  • „Entspanntes und gesprächiges Tempo“
  • „Rhythmisch und musikalisch im Tempo“
  • „Unregelmäßiges Tempo mit abrupten Pausen und Schüben“
  • „Gleichmäßiges Tempo mit konsistentem Abstand zwischen den Wörtern“
  • „Stakkato-Darbietung“

Text für die Vorschau

Nachdem Sie einen aussagekräftigen Stimm-Prompt geschrieben haben, spielt der Text, mit dem Sie diese Stimme vorhören, eine entscheidende Rolle dafür, wie sie tatsächlich klingt. Der Vorschautext fungiert wie ein Sprechskript – er legt den Ton, das Tempo und die emotionale Darbietung fest, an denen sich die Stimme orientieren soll.

Für die besten Ergebnisse sollte Ihr Vorschautext die Stimmbeschreibung ergänzen und ihr nicht widersprechen. Wenn Ihr Prompt beispielsweise eine „ruhige und nachdenkliche jüngere Frauenstimme mit leichtem japanischen Akzent“ beschreibt, passt ein Satz wie „Hey! Ich kann es nicht ausstehen, was du mit diesem verdammten Ort gemacht hast!!!“ nicht zu dieser Absicht. Das Modell wird versuchen, diesen Widerspruch aufzulösen, was oft zu unnatürlichen oder uneinheitlichen Ergebnissen führt.

Verwenden Sie stattdessen Beispieltext, der die gewünschte Persönlichkeit und emotionale Tonalität der Stimme widerspiegelt. Für das obige Beispiel unterstützt etwas wie „In letzter Zeit war es ruhig … Ich hatte Zeit zum Nachdenken, und vielleicht war genau das das Wichtigste für mich.“ den Prompt und hilft, eine natürlichere, stimmigere Stimme zu erzeugen.

Wir haben außerdem festgestellt, dass längere Vorschautexte meist stabilere und ausdrucksstärkere Ergebnisse liefern. Kurze Formulierungen können manchmal abrupt oder uneinheitlich klingen, besonders wenn Sie subtile Eigenschaften wie Ton oder Tempo testen. Wenn Sie dem Modell mehr Kontext geben – einen vollständigen Satz oder sogar einen kurzen Absatz –, kann es die Stimme flüssiger und genauer wiedergeben.

Parameter

Lautstärke

Steuert die Lautstärke der Text-to-Preview-Generierung und letztlich der gespeicherten Stimme.

Guidance Scale

Legt fest, wie genau der Prompt befolgt wird. Höhere Werte halten sich strikter an den Prompt, können aber zu schlechterer Audioqualität führen, wenn der Prompt sehr speziell ist. Niedrigere Werte erlauben dem Modell mehr Kreativität, gehen jedoch zulasten der Prompt-Genauigkeit. Verwenden Sie einen niedrigeren Wert, wenn Darbietung und Audioqualität generell wichtiger sind als die perfekte Umsetzung des Prompts. Hohe Werte werden empfohlen, wenn die Genauigkeit von Akzent oder Ton oberste Priorität hat.

Attribute und Beispiele

Experimentieren Sie mit der Formulierung dieser Beschreibungen. „Perfekte Audioqualität“ kann beispielsweise auch als „die Audioqualität ist perfekt“ formuliert werden. Das kann manchmal unterschiedliche Ergebnisse liefern.

AttributBeispiele
AlterJung, jünger, erwachsen, alt, älter, in seinen/ihren 40ern
Akzent„deutlicher“ schottischer Akzent, „leichter“ asiatisch-amerikanischer Akzent, amerikanischer Südstaaten-Akzent
GeschlechtMännlich, weiblich, geschlechtsneutral, uneindeutiges Geschlecht
Ton/Klangfarbe/TonhöheTief, warm, kiesig, sanft, schrill, samtig, heiser, näselnd, kehlig, hart, robotisch, ätherisch
SprechtempoNormale Kadenz, hohes Tempo, schnell, langsam, gedehnt, ruhiges Tempo, natürliches/gesprächiges Tempo
AudioqualitätPerfekte Audioqualität, Audioqualität ist „akzeptabel“, schlechte Audioqualität
Charakter / BerufPirat, Geschäftsmann, Landwirt, Politiker, Therapeut, Oger, gottgleiches Wesen, TV-Ansager
EmotionEnergiegeladen, begeistert, traurig, emotional, sarkastisch, trocken
TonhöheTiefe Tonlage, hohe Tonlage, normale Tonhöhe

Beispiel-Prompts und Textvorschauen

StimmtypPrompt/BeschreibungTextvorschauGuidance Scale
SportkommentatorinEine energiegeladene Sportkommentatorin mit starkem britischem Akzent, die leidenschaftlich und in sehr schnellem Tempo einen Fußballkommentar liefert. Ihre Stimme ist lebhaft, begeistert und voll im Geschehen.OH MEIN GOTT — WAS FÜR EIN TOR! Sie nimmt den Ball kurz hinter der Mittellinie auf, tanzt durch ZWEI Verteidiger, als wären sie gar nicht DA, und hämmert ihn direkt in den Winkel! Der Torwart hatte KEINE CHANCE! Das ist WELTKLASSE von der jungen Stürmerin, und die Menge steht auf den FÜSSEN! Dieses Spiel ist zum LEBEN erwacht, und man kann FÜHLEN, wie das Momentum KIPPT!25%
SchleiferEin Armee-Schleifer, der sein Soldatenteam anschreit. Er klingt wütend und spricht schnell.AUFGEPASST, ihr jämmerlicher Haufen! Ich bin nicht hier, um euch zu bemuttern — ich bin hier, um SOLDATEN ZU MACHEN! Ihr bewegt euch, wenn ich es sage, und ihr atmet, wenn ich es sage! Ihr habt zehn Sekunden, um anzutreten, sonst werdet ihr es bereuen!!25%
Bösartiger OgerEin riesiger, bösartiger Oger, der schnell spricht. Er hat einen albernen und resonanten Ton.”Eure Waffen sind für mich nur Zahnstocher. [laughs] Ergebt euch jetzt, und vielleicht gewähre ich euch ein schnelles Ende. Ich habe Königreiche gestürzt und Armeen verschlungen. Welche Hoffnung habt ihr gegen mich?“30%
Nahbarer britischer UnternehmerHervorragende Audioqualität. Ein Mann Anfang 30 bis Anfang 40 mit starkem britischem Akzent, der in natürlichem Tempo spricht, als würde er mit einem Freund reden.[laughs] Sehen Sie, das ist der Punkt. SIE sehen ein Unternehmen, während ich … [lip smacks] ich sehe ein Versprechen, wissen Sie, was ich meine? [exhales] Wir bauen nicht nur, um Profit zu machen, wir bauen, um, um zu ERHEBEN! Wenn unsere Technologie die Welt nicht freundlicher, klüger und vernetzter zurücklässt, als wir sie vorgefunden haben … [sighs] was machen wir dann überhaupt hier?40%
Frau aus den SüdstaatenEine ältere Frau mit starkem Südstaaten-Akzent. Sie ist liebenswürdig und sarkastisch.”Nun, Schätzchen, wenn wir immer nur Titeln und Trophäen hinterherjagen, verpassen wir den ganzen verdammten Punkt. [light chuckle] Ich würde lieber etwas bauen, das den Menschen das Leben leichter macht — und wenn ich das in High Heels, mit einem Lächeln und einer Prise Frechheit schaffe, umso besser.”35%
Filmtrailer-StimmeDramatische Stimme, die Spannung in Filmtrailern aufbaut und typischerweise mit Action- oder Thrillerfilmen verbunden ist”In einer Welt am Rande des Chaos wird sich ein Held erheben. Bereiten Sie sich auf eine Geschichte epischen Ausmaßes vor, bald auf der großen Leinwand.”20%
Quiekende MausEine niedliche, kleine, quiekende Maus”Ich mag klein sein, aber meine Einstellung ist alles andere als klein! [giggles] Pass auf, große Füße, sonst knabbere ich an deinen Zehen, das wirst du nicht vergessen!“20%
Wütender PiratEin wütender alter Pirat, laut und polternd”Ich habe Stürme überstanden, die dein Haar weiß werden lassen würden, und Seemonster, bei denen dir die Knie schlottern würden. Du glaubst, du kannst Captain Blackheart in die Quere kommen und davon erzählen?“30%
New YorkerTiefe, raue Stimme mit starkem New-York-Akzent, hart und vom Leben gezeichnet, oft zynisch”Ich laufe schon länger durch diese Straßen, als du dir vorstellen kannst, Kleiner. Es gibt nichts, was du sagen oder tun könntest, das mich noch überrascht.”40%
Spanische Support-MitarbeiterinSpanische Muttersprachlerin, europäisches Spanisch (ohne Merkmale des lateinamerikanischen Spanisch). Weiblich, 35–40. Gute Qualität. Persona: zuverlässige Support-Mitarbeiterin. Emotion: beruhigend, aufmerksam, selbstbewusst.Weicher, natürlicher Klang mit sanfter Intonation, präsenter Nähe und rauschfreiem Signal. Vermittelt Updates in entspanntem Tempo mit klarer Betonung hilfreicher Informationen und strahlt Empathie und Professionalität aus.30%
Arabischer KundenserviceArabische Muttersprachlerin, mit leichtem Golfakzent (VAE). Weiblich, 30–40. Hervorragende Qualität. Persona: professionelle Kundenservice-Mitarbeiterin. Emotion: warm, selbstbewusst, höflich.Samtiger Klang mit ruhigem Ton, gleichmäßigem Tempo und sanfter Intonation, bei enger Mikrofonierung für ein hochauflösendes, artefaktfreies Signal. Klare Präsenz und sanfte Betonung kundenfreundlicher Formulierungen sorgen für leichtes Verständnis.35%
Polnischer kreativer ErzählerPolnischer Muttersprachler. Männlich, 48–58. Hervorragende Qualität. Persona: kreativer Träumer. Emotion: neugierig, sanft, einladend.Die Stimme ist weich und artefaktfrei, mit warmer, fesselnder Textur und gleichmäßigem Tempo, aufgenommen in natürlicher Nähe. Helle Intonation und präzise Betonung führen die Zuhörer durch die Erzählung.32%
Verrückter WissenschaftlerDie Stimme eines exzentrischen wissenschaftlichen Genies mit schnellen, erratischen Sprechmustern, die sich mit zunehmender Begeisterung beschleunigen. Sein deutsch gefärbter Akzent wird deutlicher, wenn er aufgewühlt ist. Die Tonhöhe variiert stark zwischen nachdenklichem Murmeln und manischen Ausrufen, mit häufigen Ausbrüchen wahnsinnigen Gelächters.”Ich bin Doktor Heinrich, revolutionäres Genie, das vom engstirnigen wissenschaftlichen Establishment abgelehnt wurde! Bah! Sie nannten meine Theorien unmöglich, meine Methoden unethisch — aber wer lacht jetzt? (manisches Gelächter) Seit zwanzig Jahren perfektioniere ich meine Schöpfung in diesem Berglabor und nutze Energien jenseits menschlichen Begreifens! Die Narren an der Akademie werden ihren Spott bereuen, wenn mein Quantendestabilisator das Multiversum enthüllt. Oder vielleicht neue Lebensformen … das Experiment hat gewisse unvorhersehbare Variablen … FASZINIERENDE!“38%

FAQ

Mit Voice Design erstellen Sie aus einem Text-Prompt eine einzigartige Stimme.

Voice Design hilft Ihnen, wenn Sie in unserer Stimmbibliothek nicht genau die Stimme finden, die Sie benötigen. Statt aus bestehenden Optionen zu wählen, können Sie jetzt eine benutzerdefinierte Stimme generieren, indem Sie sie mit eigenen Worten beschreiben.

Geben Sie zum Start einfach einen Prompt ein, der die gewünschte Stimme beschreibt. Sie können Details wie Akzent, Geschlecht, Sprechtempo, Tonfall und Sprechstil angeben. Je genauer Ihr Prompt, desto besser entspricht die Stimme Ihrer Absicht. Wenn Sie unsicher sind, funktioniert aber auch ein einfacher Prompt wie „ein ruhiger männlicher Erzähler“.

Mit Voice Design erstellte Stimmen funktionieren mit Eleven v4, unserem neuesten Modell, sowie mit früheren Modellen einschließlich Eleven v3. Sie unterstützen Audio-Tags. In Eleven v4 können sie weniger ausdrucksstark sein als in früheren Modellen.

Weitere Tipps für effektive Prompts finden Sie in unserem Voice-Design-Leitfaden.

Hinweis: Voice Design ist noch experimentell. Professional Voice Clones bieten die höchste Qualität und Konsistenz. Wenn Sie einen PVC finden, der Ihren Anforderungen entspricht, empfehlen wir dessen Verwendung. Professional Voice Clones werden von Eleven v4 vollständig unterstützt. Für Eleven v3 sind sie nicht vollständig optimiert.

Voice Design kann eine breite Palette von Stimmen generieren: von realistischen, menschenähnlichen Stimmen bis zu kreativeren Charakterstimmen.

Wenn Sie nicht wissen, wo Sie anfangen sollen, versuchen Sie einen einfachen Prompt wie „Nachrichtensprecherin mittleren Alters“. Detailliertere Prompts liefern jedoch in der Regel präzisere und differenziertere Ergebnisse.

Sie können in Ihrem Prompt verschiedene Eigenschaften angeben, etwa:

  • Alter
  • Geschlecht
  • Akzent
  • Ton
  • Sprechtempo
  • Emotion
  • Sprechstil
  • Audioqualität

Zwei zusätzliche Regler helfen Ihnen, die Ausgabe zu gestalten:

  • Lautstärke passt die Lautstärke sowohl der Vorschau als auch der gespeicherten Stimme an.
  • Einflussstärke bestimmt, wie genau die generierte Stimme Ihrem Prompt folgt.

Weitere Hilfe beim Formulieren von Prompts finden Sie in unserem Voice-Design-Leitfaden.

Voice Design verbraucht nur Credits, wenn Sie Stimmen generieren.

Jedes Mal, wenn Sie auf Stimme generieren klicken, erstellen wir drei Stimmoptionen basierend auf Ihrem Prompt. Die Kosten richten sich nach der Anzahl der Zeichen in Ihrem Vorschautext.

Sie können einen eigenen Vorschautext eingeben oder mit der Schaltfläche Automatisch generieren einen erstellen lassen. Automatisch generierte Vorschauen enthalten passende Audio-Tags.

Weitere Informationen finden Sie in unserem Voice-Design-Leitfaden.

No results