Vi presenterar Eleven v4Möt Eleven v4, vår mest uttrycksfulla modell hittills. Med 3× fler krediter inkluderade i Creator+ till och med den 12 oktober

Hoppa till innehållet

Nu lanserar vi Voice Changer

Publicerad

LyssnaLyssna på den här artikeln

Voice Changer kallades ursprungligen speech-to-speech. I samband med AI-röstassistenter syftar ”speech-to-speech” också på sammanslagna arkitekturer där en enda modell hanterar ljudindata och -utdata direkt. ElevenAgents använder en avancerad kaskadarkitektur för sin plattform. Läs mer: Kaskadmodeller jämfört med sammanslagna modeller.

Voice Changer

Vi har lagt till Voice Changer i Speech Synthesis. Voice Changer är ett verktyg för röstkonvertering som tar en inspelning av en röst och får den att låta som om den talades av en annan – samtidigt som det ursprungliga framförandet bevaras. Det innebär att känslorna, tajmingen, tempot och uttalet i inspelningen följer med till utdatarösten.

Det ger dig en nivå av kontroll som text-to-speech-prompter inte alltid kan ge på egen hand. Det finns två huvudsakliga sätt att använda det.

Få fram mer känsla i en röst. Alla röster reagerar inte lika bra på känslomässig vägledning via text-to-speech-prompter. Med Voice Changer kan du spela in eller ladda upp mycket uttrycksfullt tal och återskapa det känslomässiga omfånget i en annan röst. Om du vill att en professionell berättare ska låta varmare, eller att en karaktär i en barnbok ska låta mer lekfull, kan du själv framföra repliken och låta Voice Changer överföra den till målrösten.

Finjustera hur talet framförs. Våra text-to-speech-modeller hanterar vanligtvis intonation bra direkt. Men när du behöver exakt kontroll över hur en viss fras levereras – var betoningen hamnar, hur en paus faller, hur rytmen känns – kan du visa det med din egen röst och sedan tillämpa framförandet på valfri röst. Det blir ännu mer användbart när vi integrerar Voice Changer direkt i Studio, men målet är detsamma: att ge dig exakt kontroll över resultatet.

Här är en genomgång från en av medlemmarna i vår community:

Forskning

För att konvertera källtal till måltal behöver vi uttrycka innehållet i källtalet med måltalets egenskaper. En användbar liknelse är ansiktsbyte: appar som tar två ansikten och blandar dem, så att en persons drag återges i en annans mappade struktur.

För att göra detta tar man bilden av ett ansikte och kartlägger dess attribut. Markörerna i exemplet nedan gör just det – de är gränserna inom vilka det andra ansiktet skulle återges.

Comparison of facial recognition and facial mapping technology.
Audio waveform with a corresponding speech transcription in a visual format.

Tricket med röstkonvertering är att återge innehållet i källtalet med måltalets fonem. Men här finns en avvägning, precis som i exemplet med ansiktsbyte: ju fler markörer du använder för att kartlägga ett ansiktes attribut, desto fler begränsningar lägger du på ansiktet som kartläggs inom dem. Färre markörer innebär färre begränsningar.

Detsamma gäller röstkonvertering. Ju mer vi prioriterar måltalet, desto större är risken att det hamnar ur synk med källtalet. Men om vi inte prioriterar det tillräckligt riskerar vi att förlora mycket av det som gör talet karakteristiskt. Om vi till exempel skulle återge en inspelning av någon som argt skriker med en viskande röst, skulle vi få problem. Om vi ger för mycket företräde åt känslorna i källtalet förlorar vi intrycket av att det är en viskande röst som talar. Om vi lägger för stor vikt vid det viskande talmönstret förlorar vi källtalets känslomässiga laddning.

Produkt och senaste uppdateringar

Ändringar av färdiga röster

Vi gör ändringar i de standardröster som finns i Speech Synthesis. Vi kommer att ta bort några röster och ersätta dem med nya, med över 20 tillägg planerade under de kommande veckorna.

Vi kommer också att börja visa information i gränssnittet om hur länge varje röst förväntas vara tillgänglig. Under december kommer vi att förnya funktionerna för röstdelning och ersättning för användning för att förbättra röstvariationen. Mer information kommer snart.

Eleven Turbo v2 och uLaw-formatet 8 kHz

Turbo v2 är resultatet av månader av forskning från vårt team. Den är utformad för interaktioner i realtid men fungerar för alla användningsområden. Den stöder också standardformatet (m)uLaw 8 kHz för IVR-system.

Normalisering och metadata i Studio

Studio har nu stöd för branschstandarder för inlämning av ljudböcker, inklusive nivåjustering och dynamisk komprimering. Du kan också bädda in metadata (ISBN, författare och titel) direkt i ditt Studio-projekt.

Uttalslexikon

Det här har varit en av våra mest efterfrågade funktioner. Förra månaden lade vi till stöd för SSML-taggar som anger uttal med IPA- och CMU-lexikon i våra engelska modeller. Nu har vi lanserat stöd för uttalslexikon i Studios gränssnitt, så att du kan ladda upp en fil som anger uttal med IPA, CMU eller ordersättningar (alias). Lexikonfiler använder det branschstandardiserade öppna .PLS-lexikonfilformatet.

IPA och CMU stöds för närvarande av Turbo v2 English. Ordersättningar stöds av alla modeller och språk. Fullständig dokumentation finns här.

Upload area for a Lexicon file with instructions to click or drag and drop a .pls/.txt/.xml file, size limit 1.5MB.
Pronunciation diary

Om du har feedback, tveka inte att kontakta oss på Discord!

Prova Voice Changer

Säg det som du vill och hör det levereras med en helt annan röst, med full kontroll över framförandet. Fånga viskningar, skratt, accenter och subtila känslomässiga nyanser.

Säg det på ditt sätt och hör det levererat med en helt annan röst – med full kontroll över uttrycket. Fånga viskningar, skratt, dialekter och subtila känslouttryck.

Liknande artiklar

Skapa med AI-ljud av högsta kvalitet