Voice Design
En guide till hur du skapar röster från en textprompt.
Översikt
Voice Design hjälper kreatörer att fylla luckorna när den exakta röst de söker inte finns i Voice Library. Om du inte hittar en lämplig röst för ditt projekt kan du skapa en. Voice Design passar bäst för snabb utforskning och iteration, och kvaliteten på resultatet kan variera beroende på din prompt och ditt användningsområde. Om du behöver den mest konsekventa, produktionsklara kvaliteten är Professional Voice Clones (PVC) för närvarande rösterna av högst kvalitet på vår plattform. Om det finns en PVC i vårt bibliotek som passar dina behov rekommenderar vi därför att du använder den i stället.
Du hittar Voice Design genom att gå till Voices -> My Voices -> Add a new voice -> Voice Design i ElevenLabs-appen eller via API:et.
När du klickar på generera skapar vi tre röstalternativ åt dig. Den enda kostnaden för att använda Voice Design är antalet krediter för att generera din förhandsvisningstext. Du debiteras bara en gång, även om vi genererar tre exempel åt dig. Du kan se antalet tecken som dras av i textrutan “Text to preview”.
Efter genereringen kan du välja och spara en av de genererade rösterna, vilket tar upp en av dina röstplatser.
Guide till promptar
Prompten är grunden för din röst. Den talar om för modellen vilken typ av röst du försöker skapa – allt från accent och karaktärstyp till röstens kön och känsla. En välformulerad prompt kan vara skillnaden mellan en generisk röst och en som verkligen passar din vision. Generellt ger mer beskrivande och detaljerade promptar ofta mer träffsäkra och nyanserade resultat. Ju fler detaljer du ger – inklusive ålder, kön, ton, accent, tempo, känsla, stil och annat – desto bättre kan modellen tolka och skapa en röst som känns genomtänkt och anpassad.
Korta och enkla promptar kan dock också fungera, särskilt om du vill ha en mer neutral eller brett användbar röst. Till exempel kan ”En lugn manlig berättarröst” ge dig precis vad du behöver utan att gå in på detaljer – särskilt om du inte försöker skapa en mycket specifik karaktär eller stil. Rätt detaljnivå beror på ditt användningsområde. Skapar du en fantasykaraktär? En virtuell assistent? En trött New York-bo i 60-årsåldern med torr humor? Ju tydligare du definierar det i prompten, desto närmare kommer resultatet det du föreställer dig.
Rekommenderat promptformat
För konsekventa resultat bör du strukturera din prompt enligt det här formatet:
Exempel:
Spanska som modersmål, español europeo (sin rasgos de español latinoamericano). Kvinna, 35–40. Okej kvalitet. Persona: pålitlig supportoperatör. Känsla: lugnande, uppmärksam, självsäker. Mjuk, naturlig klang med mild intonation, nära mikrofonen och en brusfri signal. Levererar uppdateringar i ett avslappnat tempo med tydlig betoning på hjälpsam information och förmedlar empati och professionalism.
Vanliga fallgropar att undvika
- Använd inte ”accent” när du menar intonation – det kan utlösa oönskade dialektskiften. Beskriv i stället intonation, betoning eller leveransmönster.
- Undvik ord för effekter – termer som ”reverb”, ”echo”, ”phone” eller ”tape” kan påverka resultatets kvalitet negativt.
- Var tydlig med språk och dialekt – ange alltid språk och regional variant i den första meningen för att undvika att rösten glider iväg.
Ljudkvalitet
Ljudkvalitet avser tydligheten, renheten och den övergripande återgivningen hos den genererade rösten. Som standard strävar ElevenLabs efter att skapa rent och naturligt ljud – men om ditt projekt kräver en särskild kvalitetsnivå är det bäst att uttryckligen ange det i prompten.
För resultat av hög kvalitet kan du hjälpa modellen genom att lägga till en fras som ”perfekt ljudkvalitet” eller ”inspelning i studiokvalitet” i din röstbeskrivning. Det bidrar till att rösten återges med maximal tydlighet, minimal distorsion och en polerad finish.
Du kan också använda specifika kvalitetsbeskrivningar som ger konsekventa resultat:
- Okej kvalitet
- Bra kvalitet
- Mycket bra kvalitet
- Utmärkt kvalitet
- Studiokvalitet
- Sändningskvalitet
Dessa beskrivningar bidrar till högsta möjliga ljudkvalitet när de ingår i din prompt.
Att inkludera den här typen av fraser kan ibland minska promptens träffsäkerhet generellt, om rösten är mycket specifik eller nischad.
Det kan även finnas kreativa fall där lägre ljudkvalitet är avsiktlig, till exempel när du simulerar ett telefonsamtal, en gammal radiosändning eller upphittat videomaterial. I sådana situationer kan du antingen utelämna kvalitetsbeskrivningar helt eller uttryckligen inkludera fraser som:
- ”Ljud med låg återgivningskvalitet”
- ”Dålig ljudkvalitet”
- ”Låter som ett röstmeddelande”
- ”Dämpat och avlägset, som från en gammal bandspelare”
Var i prompten du placerar frasen är flexibelt – den kan stå i början eller slutet, även om vi har sett att båda fungerar bra.
Ålder, ton/klangfärg och kön
Dessa tre egenskaper utgör grunden för röstdesign och formar röstens övergripande identitet och känslomässiga uttryck. Ju fler detaljer du anger, desto lättare är det för AI:n att skapa en röst som passar din kreativa vision – oavsett om du bygger en trovärdig karaktär, skapar en fängslande berättarröst eller utformar en virtuell assistent.
Ålder
Att beskriva röstens upplevda ålder hjälper till att definiera dess mognad, rösttextur och energi. Använd specifika termer för att vägleda AI:n mot rätt röstkvalitet.
Användbara beskrivningar:
- ”Tonårskille” / ”tonårstjej”
- ”Ung vuxen” / ”i 20-årsåldern” / ”tidiga 30-årsåldern”
- ”Medelålders man” / ”kvinna i 40-årsåldern”
- ”Äldre man” / ”äldre kvinna” / ”man i 80-årsåldern”
Ton/klangfärg
Avser röstens fysiska kvalitet, som formas av tonhöjd, resonans och rösttextur. Det skiljer sig från känslomässig leverans eller attityd.
Vanliga beskrivningar av ton/klangfärg:
- ”Djup” / ”lågmäld”
- ”Len” / ”fyllig”
- ”Sträv” / ”hes”
- ”Nasal” / ”gäll”
- ”Luftig” / ”andasig”
- ”Kraftfull” / ”resonant”
- ”Ljus” / ”tunn”
- ”Varm” / ”mjuk”
- ”Burkig” / ”metallisk”
Kön
Kön påverkar ofta tonhöjd, rösttyngd och tonalt uttryck – men du kan gå bortom enkla kategorier genom att beskriva ljudet i stället för identiteten.
Exempel:
- ”En mörk, husky kvinnoröst”
- ”En maskulin mansröst, djup och resonant”
- ”Ett neutralt kön – mjuk och medelhög röst”
Accent
Accent spelar en avgörande roll för att definiera en rösts regionala, kulturella och känslomässiga identitet. Om ditt projekt är beroende av ett autentiskt ljud – oavsett om det bygger på realism eller är stiliserat för en karaktär – är det viktigt att vara tydlig och medveten om önskad accent.
Valet av formulering spelar roll – vissa termer ger ofta mer konsekventa resultat. Till exempel ger ”tydlig” ofta bättre resultat än ”stark” när du beskriver hur framträdande en accent ska vara. Mycket handlar om att testa sig fram, och vi uppmuntrar dig att experimentera med formuleringar och vara så kreativ och beskrivande som möjligt.
Var försiktig när du använder ordet ”accent” – om du menar intonations- eller betoningmönster snarare än en regional dialekt bör du använda dessa termer i stället. Om du använder ”accent” när du menar intonation kan det utlösa oönskade dialektförändringar.
- Exempel på tydliga accentprompter:
- ”En medelålders man med tydlig fransk accent”
- ”En ung kvinna med en lätt sydstatsdialekt”
- ”En gammal man med tung östeuropeisk accent”
- ”En glad kvinna som talar med en tydlig brittisk accent”
- ”En yngre man med en mjuk irländsk klang”
- ”En auktoritativ röst med neutral amerikansk accent”
- ”En man med regional australisk accent, avslappnad och nasal”
Undvik alltför vaga beskrivningar som ”utländsk” eller ”exotisk” – de är oprecisa och kan ge inkonsekventa resultat.
Kombinera accent med andra egenskaper som ton, ålder eller tempo för bättre kontroll. Till exempel: ”En sarkastisk gammal kvinna med tydlig New York-accent som talar långsamt.”
För fantasy- eller fiktiva röster kan du föreslå verkliga accenter som inspiration:
- ”En alv med en ordentlig, tydlig brittisk accent. Han är kunglig och lyrisk.”
- ”En goblin med en raspig östeuropeisk accent.”
Tempo
Tempo avser hastigheten och rytmen som en röst talar med. Det är en viktig del av att forma röstens personlighet, känslomässiga ton och tydlighet. Att vara tydlig med tempot är viktigt, särskilt när du utformar röster för specifika användningsområden som berättande, reklam, karaktärsdialog eller instruktionsinnehåll.
Använd tydligt språk för att beskriva hur snabbt eller långsamt rösten ska tala. Du kan också beskriva hur tempot känns – om det är jämnt, ryckigt, eftertänksamt eller ledigt. Om tempot förändras ska du ange var och varför.
Exempel på tempobeskrivningar:
- ”Talar snabbt” / ”i högt tempo”
- ”I normalt tempo” / ”talar normalt”
- ”Talar långsamt” / ”med långsam rytm”
- ”Eftertänksamt och avvägt tempo”
- ”Utdraget, som om varje ord avnjuts”
- ”Med stressad rytm, som om personen har bråttom”
- ”Avslappnat och samtalsmässigt tempo”
- ”Rytmiskt och musikaliskt tempo”
- ”Ryckigt tempo, med plötsliga pauser och utbrott”
- ”Jämnt tempo, med konsekvent timing mellan orden”
- ”Staccatoleverans”
Text för förhandsvisning
När du har skrivit en bra röstprompt spelar texten du använder för att förhandsvisa rösten en avgörande roll för hur den faktiskt låter. Förhandsvisningstexten fungerar som ett manus för framförandet – den anger tonen, tempot och det känslomässiga uttryck som rösten försöker matcha.
För bästa resultat bör förhandsvisningstexten komplettera röstbeskrivningen, inte motsäga den. Om din prompt till exempel beskriver ”en lugn och eftertänksam yngre kvinnoröst med lätt japansk accent”, kommer en mening som ”Hej! Jag står inte ut med vad du har gjort med det förbaskade stället!!!” att krocka med den avsikten. Modellen försöker förena den här skillnaden, vilket ofta leder till onaturliga eller inkonsekventa resultat.
Använd i stället exempeltext som återspeglar röstens avsedda personlighet och känslomässiga ton. För exemplet ovan stödjer något i stil med ”Det har varit tyst på sistone … Jag har haft tid att tänka, och kanske var det precis vad jag behövde mest.” prompten och hjälper till att skapa en mer naturlig och sammanhängande röst.
Dessutom har vi märkt att längre förhandsvisningstexter tenderar att ge stabilare och mer uttrycksfulla resultat. Korta fraser kan ibland låta abrupta eller inkonsekventa, särskilt när du testar subtila egenskaper som ton eller tempo. Genom att ge modellen mer kontext – en hel mening eller till och med ett kort stycke – kan den ge en jämnare och mer korrekt återgivning av rösten.
Parametrar
Volym
Styr volymen för Text to Preview-genereringen och i slutändan rösten när den har sparats.
Guidance Scale
Anger hur noga prompten följs. Högre värden följer prompten striktare, men kan ge sämre ljudkvalitet om prompten är mycket nischad. Lägre värden låter modellen vara mer kreativ på bekostnad av promptens träffsäkerhet. Använd ett lägre värde om framförande och ljudkvalitet generellt är viktigare än att följa prompten perfekt. Höga värden rekommenderas när korrekt accent eller ton är särskilt viktigt.
Attribut och exempel
Experimentera med hur dessa beskrivningar formuleras. Till exempel kan ”Perfekt ljudkvalitet” också skrivas som ”ljudkvaliteten är perfekt”. De kan ibland ge olika resultat!