Introducing Eleven v4Introducing Eleven v4, our fastest and most emotive voice model

Hoppa till innehållet

Den första AI:n som kan skratta

Publicerad

LyssnaLyssna på den här artikeln

I vårt senaste inlägg visade vi några längre exempel som genererats av vårt talsyntesverktyg och gav en kort översikt över hur vår modells unika utformning gör att den kan skapa tal med bra tempo och utan robotkänsla. I dag ska vi visa att den också är mer känslomässigt nyanserad och mer medveten om sammanhang än någon annan. Det gör den inte bara mycket engagerande att lyssna på, utan även väl lämpad för allt från röstläggning av böcker och videospel till reklam.

Känslor

Båda vår modells styrkor – flyt och korrekt intonation – kommer från den stora mängd träningsdata den har tagit del av (över 500 000 timmar!), men den avgörande faktorn är hur den lär sig av datan, vilket beror på hur den är byggd. I grunden är den skapad för att förstå känslorna i skriven text och avgöra om talaren ska låta glad, arg, ledsen eller neutral. Här är några exempel:

Alla skillnader i intonation och stämning kommer enbart från texten – inget annat påverkade resultatet. Interpunktion och ordens betydelse spelar en avgörande roll för hur en viss mening ska framföras, men lägg också märke till hur modellen, när talaren är glad över segern, övertygande skapar ljud som inte ingår i vanligt tal, som skratt (vi släpper snart en samling med de olika skratt som vår AI kan skapa!). På samma sätt förstärker den reaktionen på rätt sätt när talaren roas av något hysteriskt kul – det är ‘såååå roligt’.

Sammanhang

Men det räcker inte att känna till enskilda ords betydelse. Vår modell är lika känslig för det större sammanhanget kring varje yttrande – den bedömer om något är rimligt utifrån hur det hänger ihop med texten före och efter. Det här bredare perspektivet gör att den kan intonera längre stycken korrekt genom att lägga ett enhetligt känslomönster över en tankegång som sträcker sig över flera meningar, vilket vi visade i vårt tidigare inlägg med längre innehåll. Men det hjälper den också att undvika logiska misstag. Vissa ord stavas till exempel likadant men har olika betydelser, som engelska ‘read’ i presens och preteritum eller ‘minute’, som kan betyda en tidsenhet eller något mycket litet. Vilken betydelse som är rätt beror på sammanhanget:

Skrivet kontra talat språk

Eftersom vi utformar vår plattform för längre innehåll behöver vår modell också förstå att symboler, förkortningar och vissa skrivkonventioner ska uttalas på ett visst sätt – eller inte uttalas bokstavligt. Modellen måste till exempel veta att FBI, TNT och ATM uttalas annorlunda än UNESCO eller NASA. På samma sätt fungerar $3tr utmärkt i skrift, men när det läses upp behöver det bli ‘tre biljoner dollar’.

Mänsklig medverkan

Det är avgörande att känna igen dessa subtila skillnader, eftersom vårt mål är att minimera behovet av mänsklig medverkan i genereringsprocessen. Vi lyfter trots allt inte fram verktygets förmåga att skapa en ljudbok på några minuter för att någon sedan ska behöva lyssna igenom hela ljudet och skriva om hela texten. Även om vi kontinuerligt uppdaterar vår modells regler för uttal är det ändå möjligt att något förvirrar den. Därför utvecklar vi nu ett system som flaggar osäkerhet, så att användare direkt kan se vilka textdelar modellen hade problem med och lära den hur de ska uttalas.

Oräkneliga användningsområden

Alla funktioner vi har visat är steg på vägen mot att göra vår programvara till det mest mångsidiga AI-verktyget för röstläggning.

Nyhetsutgivare har redan upptäckt att en större ljudnärvaro är ett bra sätt att behålla prenumeranter. Den stora fördelen med att bädda in en ljudversion i varje artikel är att människor kan lyssna medan de gör något annat. Utgivare som gör det använder ofta röstskådespelare, vilket är dyrt, och alla artiklar får inte en ljudversion. Eller så låter de sina egna reportrar läsa upp artiklarna, vilket tar tid och därför också kostar pengar. De som använder syntetiskt tal för att röstlägga sitt innehåll sparar pengar, men får betala på ett annat sätt genom att kompromissa med kvaliteten. Nu, med ElevenLabs, behöver du inte kompromissa utan kan få det bästa av två världar.

Eller föreställ dig att skapa ljudböcker med distinkta, känslomässigt engagerande voice-overs för alla karaktärer – på bara några minuter. Det skapar inte bara nya sätt att uppleva böcker, utan förbättrar också tillgängligheten för personer med inlärningssvårigheter.

Tänk bara på alla möjligheter som nu öppnar sig för spelsutvecklare som inte längre behöver fundera på om en viss karaktär är tillräckligt viktig för att motivera den annars betydande kostnaden för att ge den röst med riktiga skådespelare. Alla NPC:er kan nu få egna röster och personligheter.

Reklambyråer och producenter kan nu fritt experimentera och anpassa voice-overs efter tonen i vilken kampanj som helst – oavsett om det gäller en sportkanal på tv eller ett lyxigt klockmärke. En skådespelares röst kan licensieras för kloning, så att ändringar kan göras direkt utan att skådespelaren behöver vara på plats. Om de väljer en helt syntetisk röst behöver annonsörer dessutom inte oroa sig för att betala ersättning för rösträttigheter.

Virtuella assistenter kan bli mer verklighetstrogna både eftersom Voice Cloning låter dem tala med en röst som är bekant för en viss användare, och eftersom det här nya djupet i framförandet gör dem mer naturliga att interagera med.

ElevenLabs Beta

Gå hit för att registrera dig för vår betaplattform och prova själv. Vi gör ständigt förbättringar, och all feedback från användare är mycket värdefull för oss i det här tidiga skedet. Ha det så kul!

Liknande artiklar

Skapa med AI-ljud av högsta kvalitet