Instant Voice Cloning
Lär dig hur du klonar din röst direkt med våra förstklassiga modeller.
Skapa en Instant Voice Clone
När du klonar en röst är det viktigt att tänka på vad AI:n har tränats på: vilka språk och vilken typ av data. Läs mer om varje enskild modell och deras styrkor på modellsidan.
Guide
Om du är osäker på vad som är tillåtet ur ett juridiskt perspektiv kan du läsa våra användningsvillkor och vår information om AI-säkerhet för mer information.
Gå till sidan Instant Voice Cloning
I ElevenLabs-panelen väljer du avsnittet Voices till vänster och klickar sedan på ikonen plus.
Välj Instant Voice Clone i dialogrutan.
Ladda upp eller spela in ditt ljud
Följ instruktionerna på skärmen för att ladda upp eller spela in ditt ljud.
Bästa praxis
Spela in minst 1 minuts ljud
Spela in minst 1 minuts ljud
Undvik att spela in mer än 3 minuter, eftersom det ger liten förbättring och i vissa fall till och med kan försämra klonen.
Hur ljudet spelades in är viktigare än den totala längden (speltiden) på proverna. Antalet prover du använder spelar ingen roll; det är den sammanlagda längden (speltiden) som är viktig.
Vi rekommenderar cirka 1–2 minuter med tydligt ljud utan reverb, artefakter eller bakgrundsbrus av något slag. När vi talar om ”ljud- eller inspelningskvalitet” menar vi inte kodeken, till exempel MP3 eller WAV, utan hur ljudet spelades in. När det gäller ljudkodekar rekommenderar vi dock MP3 med 128 kbps eller högre. Högre bithastigheter har ingen betydande påverkan på klonens kvalitet.
Håll ljudet konsekvent
Håll ljudet konsekvent
AI:n försöker efterlikna allt den hör i ljudet. Det omfattar talhastighet, böjningar, accent, tonläge, andningsmönster och styrka samt brus och munljud. Även brus och artefakter som kan förvirra den tas med i beräkningen.
Se till att rösten har en konsekvent ton och framförs konsekvent genom hela inspelningen. Se också till att röstens ljudkvalitet är konsekvent i alla prover. Även om du bara använder ett enda prov ska det vara konsekvent genom hela provet. Om du matar AI:n med mycket dynamiskt ljud, med stora variationer i tonhöjd och volym, blir resultaten mindre förutsägbara.
Återskapa ditt framförande
Återskapa ditt framförande
En annan viktig sak att tänka på är att AI:n försöker återskapa framförandet i rösten du tillhandahåller. Om du talar långsamt, monotont och utan mycket känsla är det vad AI:n efterliknar. Om du däremot talar snabbt och känslosamt är det vad AI:n försöker återskapa.
Det är avgörande att rösten är konsekvent i alla prover, inte bara i ton utan även i framförande. Om variationen är för stor kan AI:n bli förvirrad, vilket leder till mer varierad output mellan genereringar.
Hitta en bra balans för volymen
Hitta en bra balans för volymen
Hitta en bra balans för volymen så att ljudet varken är för tyst eller för högt. Helst bör det ligga mellan -23 dB och -18 dB RMS med en true peak på -3 dB.

