Eleven v4

Unser neuestes und fortschrittlichstes Text to Speech-Modell.

Eleven v4 ist unser neuestes und fortschrittlichstes Text to Speech-Modell und das erste einer neuen Modellgeneration. Im Vergleich zu Eleven v3 verbessert es Ausgabequalität, Stimmgenauigkeit, Konsistenz, Emotion, Vortragsweise, Audio-Tags und Sprachabdeckung.

Generell ist Eleven v4 ein klares Upgrade gegenüber Eleven v3 und liefert in fast allen Fällen bessere Ergebnisse. Wir empfehlen dringend, auf v4 umzusteigen und es mit Ihren eigenen Stimmen und Inhalten zu testen, um den Unterschied selbst zu erleben. Einige Sonderfälle erfordern möglicherweise eine andere Lösung, doch für die meisten Nutzer ist v4 die bessere Wahl.

Informationen zu Tags, Zeichensetzung und Dialog-Prompting finden Sie unter Prompting Eleven v4.

KI-Stimme klonen

Die Genauigkeit beim Klonen von Stimmen macht mit Eleven v4 einen großen Schritt nach vorn. Geklonte Stimmen erfassen die Eigenschaften der Ausgangsstimme – Klangfarbe, Rhythmus und Vortragsweise – getreuer als jedes vorherige Modell.

Instant Voice Clones (IVCs) sind in Eleven v4 präziser als je zuvor. Sie erfassen die prägenden Merkmale einer Ausgangsstimme getreuer. So lässt sich aus einer kurzen Audioaufnahme schneller ein überzeugender Klon erstellen.

Professional Voice Clones (PVCs) werden in Eleven v4 vollständig unterstützt. Sie bauen auf denselben Fortschritten bei der Stimmgenauigkeit auf und bieten eine getreuere Wiedergabe der Ausgangsstimme für Workflows, die ein Höchstmaß an Konsistenz und Kontrolle erfordern.

Aufgrund dieses deutlichen Genauigkeitssprungs kann Eleven v4 wesentlich anders klingen als Eleven v3. Eleven v3 legte mit einem starken Fokus auf Vortragsweise und Genauigkeit die Grundlage für Eleven v4. Eleven v4 baut darauf mit deutlich verbesserter Stimmgenauigkeit auf. Dadurch erfasst Eleven v4 die Ausgangsstimme getreuer, auch wenn Sie möglicherweise bevorzugen, wie eine Stimme in Eleven v3 klang. Genauigkeit und persönliche Vorliebe sind nicht immer dasselbe. Wir empfehlen daher, beide Versionen mit Ihren eigenen Inhalten zu vergleichen, um die beste Lösung für Ihren Anwendungsfall zu wählen.

Da Eleven v4 die Eigenschaften der Ausgangsstimme – einschließlich Akzent, Vortragsweise, Lautstärke und anderer markanter Merkmale – getreuer wiedergibt, ist die Qualität der Ausgangsaufnahme wichtiger denn je. Klare, saubere Trainingsaudiodaten helfen Eleven v4, die Stimme präzise zu erfassen, ohne unerwünschte Geräusche oder Merkmale einzuführen. Hintergrundgeräusche, Verzerrungen oder andere Aufnahmeprobleme können das Ergebnis beeinträchtigen.

Wir experimentieren noch mit Eleven v4, um zu verstehen, wie es sich am besten einsetzen lässt. Bisher scheint es nuancierte Audiodaten deutlich besser zu erfassen, insbesondere bei umfangreichen Trainingsaudiodaten wie bei Professional Voice Clones. Unsere Empfehlungen zur Verwendung vielfältiger Trainingsdaten können sich ändern, während wir weiter testen, wie sich das Modell mit einem vielseitigeren Datensatz steuern lässt. Derzeit empfehlen wir, bei Ihren Trainingsaudiodaten bei einem einzigen Sprechstil zu bleiben. Eleven v4 sollte diesen besser erfassen als frühere Modelle.

Umgang mit nativen Akzenten

Dies ist eine der größten Änderungen von Eleven v4 gegenüber allen älteren Modellen, und sie sollte klar verstanden werden.

Wenn die Sprache, die Sie generieren, der Sprache Ihrer Referenzstimme entspricht, bleibt der ursprüngliche Akzent genau wie bisher erhalten.

Wenn sich die Sprache, die Sie generieren, von der Sprache der Referenzstimme unterscheidet, erzeugt Eleven v4 flüssige, natürlich klingende Sprache in der Zielsprache – statt den Akzent der Referenzstimme aus ihrer ursprünglichen Sprache zu übernehmen.

In der Praxis: Wenn Sie eine Stimme eines koreanischen Sprechers klonen und Englisch generieren, erzeugt Eleven v4 natürliches, flüssiges Englisch statt Englisch mit koreanischem Akzent. Dadurch ist jede Stimme in jeder unterstützten Sprache nutzbar. Das ist besonders nützlich für Synchronisationen, mehrsprachige Inhalte und Sprachagenten, die Nutzer mit einer einzelnen Stimme in verschiedenen Sprachen bedienen müssen.

Wenn Ihr Workflow davon abhängt, dass eine Stimme ihren nativen Akzent in andere Sprachen überträgt, testen Sie dieses Verhalten vor der Migration direkt mit Eleven v4 – es ist eine bewusste Änderung der sprachübergreifenden Generierung, kein Fehler.

Diese neue Funktion wird jedoch noch weiter optimiert. Wir prüfen Möglichkeiten, sie als Umschalter anzubieten, statt sie immer zu aktivieren. Das ist weiterhin ein Forschungsprojekt. Daher haben wir derzeit keinen Zeitplan und keine weiteren Informationen dazu.

Modellvarianten

Eleven v4 ist in zwei Varianten verfügbar, damit Sie für Ihren Anwendungsfall die passende Balance aus Qualität und Geschwindigkeit wählen können:

  • Eleven v4 (eleven_v4) – unser Modell mit der höchsten Qualität, ideal für Content-Erstellung, Hörbücher, Charakter-Voiceovers und jeden Anwendungsfall, bei dem Qualität oberste Priorität hat.
  • Eleven v4 Turbo (eleven_v4_turbo) – extrem hohe Qualität bei beeindruckend niedriger Latenz, speziell für Echtzeitanwendungen wie Dialogagenten und interaktive Spracherlebnisse entwickelt.

Beide Varianten verwenden zwei Stimmeinstellungen: Stabilität und Ähnlichkeit.

Stabilität steuert, wie konsistent die Vortragsweise über mehrere Generierungen hinweg bleibt. Niedrigere Werte ermöglichen eine ausdrucksstärkere, variablere Vortragsweise; höhere Werte halten die Darbietung näher an einer festen Grundlage.

Ähnlichkeit steuert, wie genau die Ausgabe der Referenzstimme entspricht. Höhere Werte sorgen für eine stärkere Übereinstimmung mit der Referenz, was auf Kosten der Natürlichkeit gehen kann.

Die Regler für Stil und Geschwindigkeit sind in Eleven v4 nicht verfügbar, und SSML wird nicht unterstützt.

Audio-Tags (z. B. [whispering], [shouting], [laughing]) ermöglichen eine präzise Steuerung der Vortragsweise. Eleven v4 verarbeitet sie mit einer Nuancierung, die über frühere Modelle hinausgeht. Sie sind noch nicht perfekt, und wir verbessern kontinuierlich, wie zuverlässig das Modell Tag-Anweisungen befolgt. Dies ist ein aktiver Bereich fortlaufender Investitionen und wird stetig besser.

Beispiele

Diese Beispiele sind unbearbeitet. Es wurde keine umfassende Nachbearbeitung durchgeführt: kein EQ, keine Kompression, Normalisierung, De-Essing, Entfernung von Plosivlauten oder Ähnliches. Falls Sie wiederkehrende Probleme hören, etwa Clipping, Plosivlaute, unausgewogenen EQ oder Lautstärkesprünge, stammen diese sehr wahrscheinlich aus den Trainingsdaten dieser Stimme. Das Eleven v4-Modell hat sie lediglich erfasst, da es sehr präzise ist – auch beim Erfassen von Unzulänglichkeiten. Wir haben die Audiodaten unverändert gelassen, damit Sie hören können, was das Modell erzeugt hat.

Genauigkeit beim Klonen von Stimmen

Jedes Beispiel beginnt mit einer Vorschau aus der Stimmbibliothek. Anschließend haben wir Text mit einem Instant Voice Clone dieser Stimme sowohl mit Eleven v3 als auch mit Eleven v4 generiert.

Dies ist kein perfekter Vergleich. Eleven v4 funktioniert auch mit Professional Voice Clones, die die Übereinstimmung weiter verbessern können. Um den Vergleich fairer zu halten, haben wir jedoch für Eleven v3 und Eleven v4 Instant Voice Clones verwendet.

Diese Beispiele zeigen, wie viel von der ursprünglichen Stimme das Modell erfasst. Wichtig ist, dass dies auch EQ, Qualität, Lautstärke sowie alle weiteren kleinen Details und Unvollkommenheiten der Audiodaten umfasst, etwa Plosivlaute, scharfe Zischlaute und Lautstärkeschwankungen.

Hören Sie zuerst die Vorschau, dann Eleven v3 und anschließend Eleven v4.

Stimme NfUrCNRReUL9RXS9upG1.

"Brother... I must cross the sea, though I'd rather stay beside you. If the gods will it, we'll see each other again. Until then, when the sun sinks beyond the waves, know that I'll be looking toward home."
He clasped my forearm beneath the pale morning sky. I held on a moment longer, then watched him turn toward the waiting ship.

Stimme HBDoL4wkcalemIO0nUAu.

"When I was young, I thought the mountain stood because it was strong. Then winter came, and the mountain wore its crown of snow without complaint. Spring followed, and it let every stream run free.
"So remember, traveler: strength is not always holding fast. Sometimes it is knowing what to carry, and what the season asks you to release."

Sprachschauspiel

Dies sind Generierungen mit Eleven v4. Die Audio-Tags im Text steuern die Vortragsweise.

Stimme EkK5I93UQWFDigLMpZcX.

[casual] "You're looking for work, eh? Hmm, I might have something for you. Just outside the valley, there's a group of wild horned boars I need you to take care of - nasty little beasts. The village would be grateful if you could get that done, and I'll make it worth your while."
------------
[annoyed] [under his breath] "Oh, you again... [sigh] Did you take care of that little problem I mentioned earlier? No, not yet? All right, off you go. I don't have time to chitchat. I'm busy standing here... handing out quests."
------------
[ecstatic] "You did it, you crazy bastard! [dismissive] Not that I didn't have any faith in you, but you wouldn't be the first one to fail. Yes, yes, I know. One of them might have been a little bigger than the others. But hey, you survived. You got it done. You helped the village."

Stimme t7VaN65ClS2VrEUwk1nR.

[quietly curious] "Hmm… that mark. I haven't seen one like it in years. Where did you get it? Oh, you gonna make me guess? [giggle]"
------------
[measured] "No need to explain, if you'd rather not. This town has a way of leaving its mark on people. [soft chuckle] Usually not quite so literally."
------------
[lower, thoughtful] "Keep it covered when you can. There are still a few who remember what it means, and they may not ask as politely as I have."

Hörbuch

Dies ist eine Eleven v4-Erzählung. Die Tags bestimmen Tempo und Ton der Szene.

Stimme KHRvDizAHFVPzoSehNY6.

[Quiet, measured narration] The moonlit training court lay beneath the keep, its stone walls silvered with frost. Beyond the battlements, a dragon's distant call rolled over the mountains.
Sir Alden lifted his blunted practice sword. "Ready?"
Bram, his broad shoulders wrapped in a travel-worn cloak, studied the wooden shield strapped to his arm. "I've faced worse odds."
[Pause, dry amusement] "You lost to a turnip cart yesterday," Sir Alden said.
"It was a very determined cart," Bran muttered
[Gradually building energy] They circled across the frost-dusted stones. One step. Another. Alden watched Bram's hands; Bram watched the faint blue glow gathering along Alden's blade. The air between them prickled with harmless magic.
[Quick, light, playful pace] Bram charged. Alden slipped aside. Clack! Wood met steel. Bram turned, his cloak flaring, and swung wide. Alden ducked beneath it. Bram's boot skidded on the frost; he windmilled, caught himself, and bowed as if he'd meant to do that all along.
"Magnificent," Alden said.
"I was giving you time to admire the cloak," Bran retorted.

Das Modell entwickelt sich weiter

Eleven v4 wird aktiv und kontinuierlich weiterentwickelt. Während wir das Modell nach der Veröffentlichung weiter trainieren und verbessern, kann sich sein Verhalten mit steigender Qualität im Laufe der Zeit verändern. Wir empfehlen, Ihren Anwendungsfall regelmäßig erneut zu testen, während sich das Modell weiterentwickelt. Über wichtige Updates informieren wir Sie bei ihrer Einführung.

FAQ

Eleven v4 unterstützt Afrikaans, Amharisch, Arabisch, Armenisch, Assamesisch, Asturisch, Aserbaidschanisch, Belarussisch, Bengalisch, Bosnisch, Bulgarisch, Birmanisch, Kantonesisch, Katalanisch, Cebuano, Kroatisch, Tschechisch, Dänisch, Niederländisch, Englisch, Estnisch, Filipino, Finnisch, Französisch, Fulfulde (Pulaar), Galicisch, Georgisch, Deutsch, Griechisch, Gujarati, Hausa, Hebräisch, Hindi, Ungarisch, Isländisch, Indonesisch, Italienisch, Japanisch, Kannada, Kasachisch, Koreanisch, Kirgisisch, Lao, Lingala, Litauisch, Luganda, Luxemburgisch, Mazedonisch, Malaiisch, Malayalam, Maltesisch, Mandarin-Chinesisch, Māori, Marathi, Mongolisch, Nepalesisch, Norwegisch Bokmål, Okzitanisch, Odia, Paschtu, Persisch, Polnisch, Portugiesisch (Brasilien), Punjabi, Rumänisch, Russisch, Serbisch, Shona, Sindhi, Slowakisch, Slowenisch, Somali, Sorani-Kurdisch, Spanisch (Lateinamerika), Swahili, Schwedisch, Tadschikisch, Tamil, Telugu, Thai, Türkisch, Ukrainisch, Urdu, Usbekisch, Vietnamesisch, Walisisch und Wolof.

Einige Sprachen werden flüssiger verarbeitet als andere. Generell verarbeitet Eleven v4 jedoch die große Mehrheit davon sehr gut.

Wenn Referenzstimme und generierte Sprache dieselbe Sprache verwenden, bleibt der Akzent der Stimme erhalten. Wenn Sie beispielsweise jemanden klonen, der Englisch mit einem bestimmten englischen Akzent spricht, und englische Sprache generieren, bleibt dieser Akzent erhalten.

Standardmäßig zielt Eleven v4 bei einer anderen generierten Sprache als der Sprache der Referenzstimme auf flüssige, natürlich klingende Sprache in der Zielsprache ab, statt den Referenzakzent zu übernehmen. Sie können versuchen, mit Audio-Tags einen Akzent oder Vortragsstil zu steuern, die Ergebnisse können jedoch variieren. Testen Sie daher Ihre konkrete Stimme und Ihren Anwendungsfall.

Generell gibt Eleven v4 die Eigenschaften der Ausgangsstimme deutlich präziser wieder als Eleven v3, einschließlich Klangfarbe, Rhythmus, Vortragsweise und anderer Eigenheiten. Daher wird ein Eleven v4-Klon in der Regel stärker wie die Ausgangsstimme klingen und kann deutlich anders klingen als seine Eleven v3-Version.

Eleven v4 funktioniert sowohl mit Instant Voice Cloning als auch mit Professional Voice Cloning.

Mit Instant Voice Cloning erstellen Sie eine Stimme ohne separaten Trainingsschritt. Laden Sie eine kurze Aufnahme hoch, in der Regel ein bis zwei Minuten, und innerhalb von Sekunden steht Ihnen eine nutzbare Stimme zur Verfügung.

Professional Voice Cloning funktioniert genauso wie bei früheren Modellen. Dabei wird ein dediziertes Modell mit einem längeren Satz von Aufnahmen trainiert.

Wenn Sie bereits einen Professional Voice Clone haben und ihn mit Eleven v4 trainieren möchten, öffnen Sie My Voices, suchen Sie die Stimme in der Liste und bewegen Sie den Mauszeiger darüber. Sie sehen die für diese Stimme verfügbaren Modelle. Klicken Sie auf die Plus-Schaltfläche neben Eleven v4, um das Fine-Tuning zu starten.

Voice Design-Stimmen funktionieren mit Eleven v4, sind aber möglicherweise nicht so ausdrucksstark und klingen eventuell nicht so gut wie mit früheren Modellen.