Text till dialog
Lär dig hur du skapar uppslukande dialoger som låter naturliga med ElevenLabs.
Översikt
ElevenLabs Text to Dialogue-API skapar naturligt och uttrycksfullt tal från text med Eleven v4 och Eleven v3. Vi rekommenderar Eleven v4. Vanliga användningsområden är:
- Skapa träffsäkra samtal för tv-spel
- Skapa uppslukande dialog för poddar och annat ljudinnehåll
- Ge ljudböcker liv med uttrycksfull berättarröst
Flera genereringar kan krävas för att uppnå önskat resultat. När du integrerar Text to Dialogue i din applikation bör du överväga att skapa flera genereringar och låta användaren välja den bästa.
Lyssna på ett exempel:
Röstalternativ
ElevenLabs erbjuder tusentals röster genom flera olika skapandemetoder. Eleven v4 har stöd för över 90 språk och Eleven v3 har stöd för över 70 språk.
- Röstbibliotek med över 3 000 röster delade av communityn
- Professionell röstkloning för kopior med högsta möjliga kvalitet
- Omedelbar röstkloning för snabb röstkopiering
- Voice Design för att skapa anpassade röster från textbeskrivningar
Läs mer om våra röstalternativ.
Promptning
Modellerna tolkar känslomässig kontext direkt från textinmatningen. Att till exempel lägga till beskrivande text som “sa hon upphetsat” eller använda utropstecken påverkar talets känsla. Röstinställningar som stabilitet och likhet hjälper till att styra konsekvensen, medan den underliggande känslan kommer från textens signaler.
Läs promptguiden för mer information.
Känslomässig leverans med ljudtaggar
Eleven v4 och Eleven v3 gör det möjligt att använda ljudhändelser som inte är tal för att påverka hur dialogen levereras. Det gör du genom att lägga in ljudhändelser i textinmatningen inom hakparenteser.
I Text to Dialogue har varje replik sin egen text och röst. Lägg till ljudtaggar i texten för den replik de ska påverka. voice_id väljer fortfarande talarens röst för den repliken, medan taggarna styr leveransen.
En talare kan till exempel använda en röst medan texten börjar med [giggling], och nästa talare kan använda en annan röst medan texten börjar med [whispering]. Se snabbstartsguiden för Text to Dialogue för ett API-exempel som kombinerar taggar med voice_id.
Ljudtaggar är instruktioner på naturligt språk, inte en enum-parameter. Sätt instruktionen inom hakparenteser och placera den i texten där leveransen ska ändras. Exemplen nedan är inte uttömmande. Använd promptguiden för mer vägledning om effektiva taggar.
Ljudtaggar finns i några olika former:
Känslor och leverans
Till exempel [sad], [laughing] och [whispering]
Ljudhändelser
Till exempel [leaves rustling], [gentle footsteps] och [applause].
Övergripande instruktion
Till exempel [football], [wrestling match] och [auctioneer].
Några exempel:
Du kan också använda skiljetecken för att ange dialogens flöde, till exempel avbrott:
Ellipser kan användas för att ange avbrutna meningar:
Utdataformat som stöds
Standardformatet för svaret är mp3, men andra format som pcm och ulaw är också tillgängliga.
- MP3
- Samplingsfrekvenser: 22,05 kHz–44,1 kHz
- Bithastigheter: 32 kbps–192 kbps
- 22,05 kHz @ 32 kbps
- 44,1 kHz @ 32 kbps, 64 kbps, 96 kbps, 128 kbps, 192 kbps
- PCM (S16LE)
- Samplingsfrekvenser: 16 kHz–44,1 kHz
- Bithastigheter: 8 kHz, 16 kHz, 22,05 kHz, 24 kHz, 44,1 kHz, 48 kHz
- 16-bitars djup
- μ-law
- Samplingsfrekvens på 8 kHz
- Optimerat för telefoniapplikationer
- A-law
- Samplingsfrekvens på 8 kHz
- Optimerat för telefoniapplikationer
- Opus
- Samplingsfrekvens: 48 kHz
- Bithastigheter: 32 kbps–192 kbps
Ljudalternativ med högre kvalitet är endast tillgängliga i betalabonnemang – se vår prissida för mer information.
Språk som stöds
Eleven v4 har stöd för över 90 språk. Eleven v3 har stöd för över 70 språk. Se Eleven v4 och Eleven v3 för de fullständiga listorna.
Vanliga frågor
Vilka modeller kan jag använda?
Text to Dialogue är tillgängligt för modellerna Eleven v4 och Eleven v3.
Äger jag ljudutdata?
Ja. Du behåller äganderätten till allt ljud du genererar. Kommersiella användningsrättigheter är dock endast tillgängliga med betalabonnemang. Med en betald prenumeration kan du använda genererat ljud i kommersiella syften och tjäna pengar på resultatet om du äger IP-rättigheterna till innehållet du matar in.
Vad räknas som en kostnadsfri omgenerering?
En kostnadsfri omgenerering låter dig generera samma text till tal-innehåll igen utan extra kostnad, under följande villkor:
- Endast tillgängligt i ElevenLabs kontrollpanel.
- Du kan generera varje innehållsdel igen upp till 2 gånger utan kostnad.
- Innehållet måste vara exakt samma som i föregående generering. Alla ändringar av texten, röstinställningarna eller andra parametrar kräver en ny, betald generering.
Kostnadsfria omgenereringar är användbara om det finns en mindre förvrängning i ljudutdata. Enligt ElevenLabs interna jämförelser löser omgenereringar ungefär hälften av kvalitetsproblemen, medan återstående problem vanligtvis beror på dåliga träningsdata.
Hur många talare kan min dialog ha?
Det finns ingen gräns för antalet talare i en dialog.
Varför är mina utdata ibland inkonsekventa?
Modellerna är icke-deterministiska. För bättre konsekvens kan du använda den valfria seed- parametern, även om små skillnader fortfarande kan förekomma.
Vilken metod är bäst för stora textkonverteringar?
Håll den totala längden för alla inputs[].text-värden på högst 2 000 tecken per begäran för tillförlitlig generering. Dela upp längre text i delar och sammanfoga det resulterande ljudet i din applikation.
Viktiga fakta
- Modeller: Tillgängligt med Eleven v4 och Eleven v3
- Talare: Ingen gräns för antalet talare per dialog
- Begäransstorlek: Håll den totala längden för alla
inputs[].text-värden på högst 2 000 tecken per begäran - Determinism: Utdata är icke-deterministiska — använd parametern
seedför mer konsekventa resultat - Kostnadsfria omgenereringar: Upp till 2 kostnadsfria omgenereringar per generering (samma innehåll, samma parametrar, endast i kontrollpanelen)
- Äganderätt: Du behåller äganderätten till genererat ljud; kommersiell användning kräver ett betalabonnemang