For AI agents: a documentation index is available at the root level at /llms.txt. Append /llms.txt to any URL for a page-level index, or .md for the markdown version of any page.
Guide de conversion de texte en parole avec ElevenLabs
Présentation
La technologie Text to Speech d’ElevenLabs est au cœur de nos solutions et fournit une parole générée par IA de haute qualité dans de nombreuses applications à travers le monde. Vous avez probablement déjà entendu nos voix à l’œuvre, offrant des expériences audio réalistes.
Créer votre premier audio avec Text to Speech est très simple. Toutefois, pour tirer le meilleur parti de cette fonctionnalité, gardez quelques points à l’esprit.
Cliquez sur le bouton « Générer » pour créer votre fichier audio.
Paramètres
Familiarisez-vous avec les voix, les modèles et les paramètres permettant de créer une synthèse vocale de haute qualité.
Les paramètres que vous utilisez, en particulier la voix et le modèle, ont un impact significatif sur le résultat. Il est important de les connaître et de comprendre les bonnes pratiques. D’autres paramètres influencent également le résultat, mais leur impact est moins important que celui de la voix et du modèle sélectionnés.
L’ordre d’importance est le suivant : la sélection de la voix est primordiale, suivie du choix du modèle, puis des paramètres du modèle. Tous ces éléments, ainsi que leur combinaison, influencent le résultat.
Voix
Voix
Nous proposons de nombreux types de voix, notamment les voix par défaut sélectionnées avec soin, notre vaste Voice Library with presque toutes les voix imaginables, des voix entièrement synthétiques créées avec notre outil Voice Design, ainsi que votre propre collection de voix clonées grâce à nos deux technologies : le Clonage de voix instantané et le Clonage de voix professionnel.
Toutes les voix ne se valent pas, et beaucoup dépend de l’audio source utilisé pour les créer. Certaines offrent une interprétation et un rendu plus naturels, tandis que d’autres sont plus stables.
Choisir la bonne voix pour votre contenu est essentiel. C’est probablement la décision qui aura le plus d’impact sur le résultat final. Elle détermine le genre, le ton, l’accent, le rythme et l’interprétation. Il vaut la peine de consacrer du temps supplémentaire à choisir la voix idéale et à la tester correctement pour vous assurer qu’elle est cohérente et répond à vos attentes.
Pour générer de la parole dans une langue donnée, les meilleurs résultats sont obtenus avec une voix native de la Voice Library ou en clonant une voix qui parle cette langue avec le bon accent. Si toute voix peut techniquement parler n’importe quelle langue, elle conservera son accent d’origine. Par exemple, utiliser une voix anglaise native pour générer de la parole en français produira probablement un résultat en français, mais avec un accent anglais, car l’IA doit généraliser la manière dont cette voix sonnerait dans une langue sur laquelle elle n’a pas été entraînée.
Si vous appréciez une voix, mais souhaitez une interprétation différente, notre outil de remixage vocal peut vous aider. Il vous permet d’utiliser des prompts en langage naturel pour modifier l’interprétation, le rythme, le ton, le genre et même les accents d’une voix. Lors de la modification d’un accent, la voix de base et l’accent cible sont très importants. Les résultats peuvent varier : parfois, cela fonctionne parfaitement, tandis que d’autres fois, plusieurs essais sont nécessaires.
Le remixage vocal peut donner d’excellents résultats, mais ils ne seront généralement pas aussi bons que ceux d’un clonage de voix professionnel correctement réalisé. Ils se rapprocheront davantage de ceux d’un clonage de voix instantané.
Gardez à l’esprit que le remixage vocal ne fonctionne qu’avec certaines voix. Par exemple, vous ne pouvez pas remixer les voix de la Voice Library ; vous pouvez uniquement remixer les voix que vous avez créées vous-même ou les voix par défaut.
Modèles
Modèles
Nous proposons deux familles de modèles : les modèles Standard (haute qualité) et les modèles Flash, optimisés pour une latence extrêmement faible. La plupart des familles comprennent des versions uniquement en anglais et des versions multilingues.
Eleven v4 est notre dernier modèle. Il existe en deux variantes : Eleven v4 et Eleven v4 Turbo.
Le choix du modèle est le deuxième facteur ayant le plus d’influence sur votre résultat audio final, juste après le choix de la voix. Nous vous recommandons de prendre le temps de tester différents modèles avec la voix choisie afin de trouver la meilleure combinaison. Tous nos modèles ont leurs forces et leurs faiblesses, et fonctionnent mieux avec certaines voix qu’avec d’autres. Il est donc important de trouver une bonne association.
Si votre résultat est exclusivement en anglais, nous vous recommandons vivement d’utiliser l’un de nos modèles uniquement en anglais. Ils sont souvent plus simples à utiliser, plus stables et offrent généralement de meilleures performances pour les contenus uniquement en anglais. Si votre contenu est dans une autre langue ou potentiellement multilingue, vous devez utiliser l’un des modèles multilingues.
Les paramètres les plus courants sont une stabilité autour de 50, une similarité autour de 75 et un style réglé sur 0, avec peu de modifications par la suite. Bien entendu, tout dépend de la voix d’origine et du style d’interprétation recherché.
Il est important de noter que l’IA n’est pas déterministe : régler les curseurs sur des valeurs précises ne garantit pas les mêmes résultats à chaque fois. Les curseurs définissent plutôt une plage déterminant l’ampleur de l’aléa entre chaque génération.
Vitesse
Le paramètre de vitesse vous permet d’accélérer ou de ralentir la parole générée. La valeur par défaut est 1,0, ce qui signifie que la vitesse n’est pas ajustée. Les valeurs inférieures à 1,0 ralentissent la voix, jusqu’à un minimum de 0,7. Les valeurs supérieures à 1,0 accélèrent la voix, jusqu’à un maximum de 1,2. Des valeurs extrêmes peuvent affecter la qualité de la parole générée.
La vitesse n’est pas disponible pour le modèle Eleven v3.
Stabilité
Le curseur de stabilité détermine la stabilité de la voix et le niveau d’aléa entre chaque génération. Réduire ce curseur élargit la palette émotionnelle de la voix. Comme indiqué précédemment, ce paramètre dépend également fortement de la voix d’origine. Un réglage trop bas peut entraîner des interprétations inhabituelles, excessivement aléatoires, et pousser le personnage à parler trop vite. À l’inverse, un réglage trop élevé peut produire une voix monotone avec peu d’émotion.
Pour une interprétation plus vivante et dramatique, il est recommandé de réduire le curseur de stabilité et de générer plusieurs fois jusqu’à obtenir une interprétation qui vous convient.
À l’inverse, si vous souhaitez une interprétation plus sérieuse, voire monotone à des valeurs très élevées, il est recommandé d’augmenter le curseur de stabilité. Le résultat étant plus cohérent et stable, vous n’avez généralement pas besoin de générer autant d’échantillons pour obtenir le résultat souhaité. Faites des essais pour trouver ce qui vous convient le mieux.
Similarité
Le curseur de similarité détermine à quel point l’IA doit respecter la voix d’origine lorsqu’elle tente de la reproduire. Si l’audio d’origine est de mauvaise qualité et que le curseur de similarité est réglé trop haut, l’IA peut reproduire des artefacts ou des bruits de fond en tentant d’imiter la voix, s’ils étaient présents dans l’enregistrement d’origine.
La similarité n’est pas disponible pour le modèle Eleven v3.
Exagération du style
Avec l’arrivée des modèles plus récents, nous avons également ajouté un paramètre d’exagération du style. Il vise à amplifier le style de l’interlocuteur d’origine. Il mobilise des ressources de calcul supplémentaires et peut augmenter la latence s’il est réglé sur une valeur autre que 0. Il est important de noter que l’utilisation de ce paramètre rend le modèle légèrement moins stable, car il cherche à accentuer et à imiter le style de la voix d’origine.
En règle générale, nous recommandons de toujours conserver ce paramètre à 0.
Speaker Boost
Ce paramètre augmente la similarité avec l’interlocuteur d’origine. Son utilisation exige toutefois une charge de calcul légèrement plus élevée, ce qui augmente la latence. Les différences apportées par ce paramètre sont généralement assez subtiles.
Speaker Boost n’est pas disponible pour le modèle Eleven v3.
Générer
Une fois votre voix sélectionnée, votre modèle choisi et vos paramètres configurés, le processus de génération est simple : saisissez du texte, appuyez sur « Générer la parole », puis l’audio est généré.
Bien que le processus soit très simple en apparence, le texte que vous saisissez est extrêmement important pour obtenir le résultat souhaité. Lorsque vous utilisez des mots susceptibles d’être « hors distribution », c’est-à-dire des éléments que l’IA a rarement rencontrés lors de son entraînement, comme des noms inhabituels, des abréviations peu courantes, des symboles ou même des emojis, vous risquez de perturber l’IA et de rendre le résultat moins stable. Les emojis et certains symboles sont particulièrement difficiles à interpréter correctement pour l’IA.
Lorsque vous utilisez Text to Speech via l’interface utilisateur, nous appliquons une étape de normalisation automatisée à votre saisie afin d’améliorer la lisibilité du texte et de faciliter son traitement par l’IA. En général, cette étape convertit les symboles et les nombres en toutes lettres afin d’indiquer à l’IA la prononciation correcte.
Nous vous recommandons vivement d’éviter d’écrire les nombres sous forme de chiffres ou d’utiliser des symboles, en particulier avec les modèles multilingues, bien que cela s’applique aussi aux modèles uniquement en anglais. Comme les nombres et les symboles s’écrivent de la même façon dans de nombreuses langues mais se prononcent différemment, l’utilisation de chiffres crée une ambiguïté pour l’IA. Par exemple, le nombre « 1 » s’écrit de façon identique en anglais et dans de nombreuses autres langues, mais se prononce différemment. Écrire le nombre en toutes lettres, comme « un », évite à l’IA d’avoir à interpréter ce qu’elle doit faire.
Nous travaillons sur des flux de travail plus avancés qui vous permettront d’influencer l’interprétation et le rendu de l’IA grâce à ce que nous appelons les balises audio. Cette fonctionnalité est disponible dans Eleven v4 et Eleven v3. Pour en savoir plus, nous vous recommandons de consulter notre guide de prompting.
FAQ
Une bonne entrée produit un bon résultat
Le premier facteur, et l’un des plus importants, est qu’une entrée de qualité, cohérente et de bonne qualité produira un résultat de qualité, cohérent et de bonne qualité.
Si vous fournissez à l’IA un audio loin d’être idéal, par exemple un audio très bruité, avec de la réverbération sur une parole claire, plusieurs locuteurs, ou des variations de volume, d’interprétation et de rendu, l’IA devient plus instable et le résultat plus imprévisible.
Si vous prévoyez de cloner votre propre voix, nous vous recommandons vivement de consulter les recommandations de notre documentation pour créer des clones de voix corrects. Elles vous fourniront la meilleure base possible. Même si vous comptez utiliser uniquement des clones de voix instantanés, il est conseillé de lire également la section sur le clonage de voix professionnel. Elle contient des informations précieuses sur la création de clones de voix, même si les exigences de ces deux technologies diffèrent légèrement.
Utiliser la bonne voix
Le deuxième facteur à prendre en compte est que la voix sélectionnée a un effet considérable sur le résultat. Comme indiqué dans le premier facteur, la qualité et la cohérence des échantillons utilisés pour créer ce clone sont extrêmement importantes, tout comme la langue et la tonalité de la voix.
Si vous souhaitez une voix joyeuse et enjouée, utilisez une voix clonée à partir d’échantillons joyeux et enjoués. À l’inverse, si vous recherchez une voix introspective et sombre, sélectionnez une voix présentant ces caractéristiques.
Il est également essentiel d’utiliser une voix entraînée dans la bonne langue. Par exemple, tous les clones de voix professionnels que nous proposons comme voix par défaut sont des voix anglaises entraînées à partir d’échantillons en anglais. Par conséquent, si vous leur faites parler d’autres langues, leur rendu dans ces langues peut être imprévisible. Il est essentiel d’utiliser une voix clonée à partir d’échantillons dans lesquels elle parlait la langue que vous souhaitez ensuite faire parler à l’IA.
Utiliser une mise en forme appropriée
Cela peut sembler anodin, mais peut faire une grande différence. L’IA tente de comprendre comment lire un texte en fonction de son contexte, c’est-à-dire non seulement des mots employés, mais aussi de leur agencement, de la ponctuation, de la grammaire et de la mise en forme générale du texte.
Cela peut avoir une influence limitée mais importante sur l’interprétation de l’IA. Si vous faites une faute d’orthographe, l’IA ne la corrigera pas et tentera de lire le mot tel qu’il est écrit.
Non déterministe
Les paramètres de l’IA sont non déterministes : même avec les mêmes conditions initiales, voix, paramètres et modèle, le résultat variera légèrement, de la même manière qu’un doubleur livrera une interprétation un peu différente à chaque prise.
Cette variabilité peut être due à différents facteurs, notamment aux options mentionnées précédemment : la voix, les paramètres et le modèle. En général, l’ampleur de cette variabilité peut être contrôlée par le curseur de stabilité. Un réglage de stabilité plus faible implique une plus grande variabilité entre les générations, mais introduit également une variabilité d’une génération à l’autre, où l’IA peut être un peu plus expressive.
Une plus grande variabilité est souvent souhaitable, car une stabilité trop élevée peut rendre certaines voix monotones en ne laissant pas à l’IA autant de latitude pour générer un contenu plus varié. Toutefois, une stabilité trop faible peut aussi entraîner d’autres problèmes et rendre les générations instables, surtout avec certaines voix dont l’audio utilisé pour le clonage était moins qu’idéal.
Le réglage par défaut de 50 est généralement un excellent point de départ pour la plupart des applications.
Qu'est-ce qu'Eleven v4 ?
Nous vous recommandons de passer à Eleven v4 et de le tester avec votre propre contenu.
Eleven v4 est notre modèle Text to Speech le plus récent et le plus avancé, le premier d’une nouvelle génération de modèles. Par rapport à Eleven v3, il améliore la qualité de sortie, la fidélité des voix, les émotions, les balises audio et la couverture linguistique.
La précision du clonage de voix franchit une étape majeure avec Eleven v4. Les voix clonées reproduisent plus fidèlement que tout modèle précédent les caractéristiques de la voix source, notamment le timbre, le rythme et le delivery.
Les clonages de voix instantanés (IVC) sont plus précis que jamais dans Eleven v4. Ils capturent plus fidèlement les caractéristiques distinctives d’une voix source, ce qui facilite la création rapide d’un clone convaincant à partir d’un court échantillon audio.
Les clonages de voix professionnels (PVC) sont entièrement pris en charge dans Eleven v4. Ils s’appuient sur les mêmes avancées en matière de fidélité vocale et offrent une reproduction plus fidèle de la voix source pour les workflows exigeant le plus haut niveau de cohérence et de contrôle.
Eleven v4 existe en deux variantes, afin de vous permettre de choisir le bon équilibre entre qualité et vitesse selon votre cas d’usage :
Eleven v4 (eleven_v4), notre modèle de la plus haute qualité, idéal pour la création de contenu, les livres audio, les voix off de personnages et tous les cas d’usage où la qualité est prioritaire.
Eleven v4 Turbo (eleven_v4_turbo), une qualité extrêmement élevée avec une latence remarquablement faible, conçu pour les cas d’usage en temps réel tels que les agents conversationnels et les expériences vocales interactives.
Les deux variantes utilisent deux paramètres vocaux : la stabilité et la similarité. Les curseurs de style et de vitesse ne sont pas disponibles dans Eleven v4, et le SSML n’est pas pris en charge.
Lorsque la langue que vous générez correspond à celle de votre voix de référence, l’accent d’origine est conservé exactement comme auparavant. Lorsque la langue générée diffère de celle de la voix de référence, Eleven v4 produit une voix fluide et naturelle dans la langue cible, plutôt que de conserver l’accent de la voix de référence dans sa langue d’origine.
Pour le clonage, les accents, les comparaisons et la description complète, consultez Eleven v4. Pour les balises et le prompting, consultez Prompting Eleven v4.
Qu'est-ce qu'Eleven v3 ?
Nous vous recommandons de passer à Eleven
v4 et de le tester avec votre propre contenu. De nombreuses techniques de prompting pour Eleven
v4 s’appliquent également à
Eleven v3.
Eleven v3 est un modèle Text to Speech expressif, doté d’une riche palette émotionnelle. Il produit une voix naturelle et réaliste, avec une large gamme d’émotions et une compréhension contextuelle dans plus de 70 langues.
Eleven v3 propose :
La prise en charge des balises audio
émotions : [sad][angry][happily]
indications de delivery : [whispers][shouts]
réactions non verbales : [laughs][clears throat][sighs]
Un mode dialogue pour un audio naturel avec plusieurs locuteurs
La prise en charge de plus de 70 langues
Ce modèle convient particulièrement aux discussions entre personnages, à la narration de livres audio et aux dialogues émotionnels.
Vous pouvez générer du contenu avec v3 via l’API, en utilisant nos endpoints Create speech et Stream speech, en indiquant l’ID de modèle eleven_v3.
Vous pouvez également utiliser nos endpoints Create dialogue et Stream dialogue pour créer un dialogue naturel entre plusieurs locuteurs.
Consultez les ressources suivantes pour en savoir plus :
Le contrôle de la vitesse de la voix est disponible pour Text to Speech via Speech Synthesis, Studio, ElevenAgents et notre API.
Vous pouvez contrôler la vitesse de la voix avec le réglage Speed.
Les valeurs possibles vont de 0,7 à 1,2. Les valeurs inférieures à 1 ralentissent la parole, tandis que les valeurs supérieures à 1 l’accélèrent. Les valeurs extrêmes peuvent affecter la qualité de la parole générée.
Ce réglage est disponible pour toutes les voix et tous les modèles. Vous le trouverez dans les paramètres de voix.
Pour savoir comment contrôler la parole via l’API, consultez notre Guide de l’API.
Puis-je utiliser la même voix clonée ou conçue dans plusieurs langues ?
Toute voix peut parler dans n’importe laquelle des langues prises en charge.
Avec le modèle actuel, vous ne sélectionnez pas de langue spécifique. Écrivez dans la langue que vous souhaitez faire parler à l’IA, et l’IA la comprend automatiquement. Toutefois, différentes langues peuvent avoir des mots et du vocabulaire similaires, mais avec des prononciations et des accents très différents. Vous devez donc utiliser une voix clonée à partir d’un enregistrement dans la langue et avec l’accent appropriés.
La langue est déterminée par le texte, tandis que l’accent et la prononciation le sont par la voix elle-même. Le modèle a besoin de ces deux contextes pour fonctionner de manière optimale.
Nous étudions le développement de nouvelles technologies pour faciliter la sélection de la langue, mais compte tenu de la conception de l’IA, tout cela est encore en cours.
Comment télécharger les fichiers générés depuis Text to Speech ?
Vous pouvez télécharger les fichiers générés de deux façons :
Vous pouvez télécharger un fichier généré immédiatement en cliquant sur le bouton de téléchargement situé en bas à droite après avoir généré le contenu.
Les fichiers générés précédemment peuvent être téléchargés depuis votre historique.
Pour accéder à votre historique, connectez-vous à votre compte et sélectionnez Text to Speech dans la barre latérale, puis accédez à votre historique en cliquant sur l’onglet d’historique dans le panneau situé à droite de l’écran. Sur les écrans étroits, vous pouvez accéder à votre historique en cliquant sur l’icône d’historique au-dessus du bouton Generate speech.
Depuis votre historique, cliquez sur l’icône de téléchargement pour afficher l’option de téléchargement au format MP3 (128 kbps) ou WAV.
Vous pouvez également cliquer sur Advanced pour télécharger d’autres formats de fichier :
MP3 (192 kbps)
MP3 (256 kbps)
M4A
FLAC
Les voix peuvent-elles produire un son de respiration ?
Oui. Avec Eleven v4 et Eleven v3, vous pouvez utiliser des balises audio telles que [sighs] ou [exhales] pour ajouter des respirations et des réactions similaires à la parole générée.
Consultez le guide de prompting pour en savoir plus sur les balises audio et le contrôle de l’interprétation.
Proposez-vous un modèle IA pour les usages conversationnels ou les chatbots ?
Nos modèles Flash et Turbo ont été spécialement développés pour les applications à faible latence.
Flash v2 et Flash v2.5 sont nos modèles à très faible latence, qui génèrent de l’audio en moins de 75 ms. Flash v2 est disponible uniquement en anglais, tandis que Flash v2.5 prend en charge 32 langues. Consultez la liste complète des langues prises en charge
ici.
Nos modèles Turbo offrent également une faible latence, mais les modèles Flash donnant des résultats très similaires, nous recommandons d’utiliser Flash plutôt que Turbo. Turbo v2 est disponible uniquement en anglais, tandis que Turbo v2.5 prend en charge 32 langues et est 25 % plus rapide que Turbo v2, générant de l’audio en environ 300 ms.
Flash et Turbo sont tous deux des modèles hautement optimisés, spécialement conçus pour les applications à faible latence sans compromettre les performances vocales ni le niveau de qualité attendu de nos modèles.
Les deux modèles bénéficient d’une réduction lorsque vous générez de l’audio via l’API. Pour en savoir plus, consultez la tarification de notre API.
Nous proposons également ElevenAgents, notre plateforme de déploiement d’agents vocaux interactifs et personnalisés. Consultez la documentation d’ElevenAgents pour en savoir plus.
Comment ajouter des pauses ?
Il existe plusieurs façons d’introduire une pause ou une interruption et d’influencer le rythme et la cadence de la voix. La méthode dépend du modèle.
Balises audio (Eleven v4 et Eleven v3)
Avec Eleven v4 et Eleven v3, utilisez des balises audio et la ponctuation pour contrôler le rythme et l’interprétation. Ces modèles ne prennent pas en charge les balises de pause SSML.
Consultez le guide de prompting pour savoir comment indiquer des pauses et contrôler l’interprétation.
Balises de pause (Multilingual v2, Flash v2 et Flash v2.5)
La façon la plus fiable d’ajouter une pause avec Multilingual v2, Flash v2 et Flash v2.5 consiste à utiliser la syntaxe de balise de pause SSML <break time="1.5s" />. Elle crée une pause précise et naturelle dans la parole. Il ne s’agit pas seulement de silence inséré entre les mots, le modèle comprend la syntaxe et ajoute une pause naturelle.
La manière dont le modèle gère ces pauses peut varier. La voix utilisée joue un rôle déterminant dans le résultat. Certaines voix, entraînées avec quelques « euh » et « ah », peuvent insérer ces tics de langage pendant les pauses, comme le ferait un interlocuteur réel.
Voici un exemple :
« Donnez-moi une seconde pour y réfléchir. » <break time="1.0s" /> « Oui, cela fonctionnerait. »
La durée de la pause doit être indiquée en secondes. L’IA peut gérer des pauses allant jusqu’à 3 secondes et peut être utilisée dans Text to Speech et via l’API.
Un nombre excessif de pauses SSML dans votre texte peut entraîner des problèmes. La parole peut s’accélérer, ou l’audio peut introduire davantage de bruit et d’autres artefacts. Nous travaillons à résoudre ce problème.
Ponctuation
Ces options sont moins fiables que les balises de pause ou les balises audio, mais elles peuvent tout de même influencer le rythme.
Un simple tiret - ou un tiret cadratin — fonctionne souvent bien. Vous pouvez ajouter plusieurs tirets, comme -- --, pour une pause plus longue.
« Il - se - fait tard. »
Les points de suspension ... peuvent parfois ajouter une pause entre les mots, mais ils ajoutent généralement aussi une certaine hésitation ou nervosité à la voix, ce qui n’est pas toujours adapté.
« Je… oui, je suppose… »
Comment imposer une certaine prononciation pour un mot ou un nom ?
Eleven v3 intègre une prise en charge native de l’alphabet phonétique international (API). Pour en savoir plus, consultez API avec Eleven v3.
Balises de phonèmes SSML (Flash v2 et Turbo v2 uniquement)
Avec Flash v2 et Turbo v2, vous pouvez imposer une prononciation précise à l’aide de balises de phonèmes SSML. Nous prenons en charge l’API et CMU. Avec l’implémentation actuelle, CMU tend à être un peu plus prévisible et cohérent. Pour en savoir plus, consultez notre guide de prononciation.
Orthographes alternatives
Vous pouvez également contourner le problème en trouvant une orthographe alternative et en écrivant un mot de manière plus phonétique. Vous pouvez recourir à différentes astuces, comme les majuscules, les tirets, les apostrophes ou même des guillemets simples autour d’une ou plusieurs lettres.
Par exemple, un mot comme « trapezii » peut être orthographié « trapezIi » pour accentuer le « ii » du mot.
Comment fonctionnent les balises audio avec Eleven v3 et v4 ?
Eleven v4 et Eleven v3 prennent en charge les balises audio. Nous recommandons Eleven v4. Encadrez une instruction courte de crochets et placez-la dans le texte à l’endroit où l’interprétation doit changer. Les mêmes balises fonctionnent avec les deux modèles.
Pour des informations plus détaillées, consultez notre guide de prompting.
Vous pouvez générer de l’audio via l’API en utilisant nos endpoints Create speech et Stream speech, en indiquant l’ID de modèle eleven_v4 ou eleven_v3.
Vous pouvez également utiliser nos endpoints Create dialogue et Stream dialogue pour créer un dialogue naturel avec plusieurs intervenants.
Pour les applications en temps réel, Eleven v4 Turbo (eleven_v4_turbo) prend également en charge les balises audio.
Consultez les ressources suivantes pour en savoir plus :
Comment télécharger des fichiers WAV, M4A et FLAC ?
Les fichiers générés avec Text to Speech ou Voice Changer peuvent être téléchargés aux formats MP3, WAV, M4A ou FLAC. Les fichiers WAV, M4A et FLAC doivent être téléchargés depuis votre historique.
Comment télécharger des fichiers WAV
Sélectionnez Text to Speech ou Voice Changer dans la barre latérale, puis accédez à votre historique en cliquant sur l’onglet d’historique dans le panneau situé à droite de l’écran. Sur les écrans étroits, vous pouvez accéder à votre historique en cliquant sur l’icône d’historique au-dessus du bouton Generate speech.
Depuis votre historique, cliquez sur l’icône de téléchargement pour afficher l’option de téléchargement au format MP3 ou WAV.
Comment télécharger des fichiers FLAC ou M4A
Sélectionnez Text to Speech ou Voice Changer dans la barre latérale, puis accédez à votre historique en cliquant sur l’onglet d’historique dans le panneau situé à droite de l’écran. Sur les écrans étroits, vous pouvez accéder à votre historique en cliquant sur l’icône d’historique au-dessus du bouton Generate speech.
Depuis votre historique, cliquez sur l’icône de téléchargement pour afficher l’option de téléchargement au format MP3 ou WAV. Pour accéder à d’autres formats, dont FLAC et M4A, cliquez sur Advanced et sélectionnez le format souhaité.
Comment sélectionner la langue et l'accent ?
Langue lors de la génération sur le site web
Lorsque vous générez de l’audio sur le site web d’ElevenLabs, notre IA détecte automatiquement la langue selon le contexte du texte de votre prompt. Il est donc préférable d’éviter d’utiliser plusieurs langues dans un même prompt, car cela peut créer une confusion sur la langue à utiliser. Pour le moment, il n’est pas possible de préciser une langue lors de la génération sur le site web.
Langue lors de la génération via l’API
Si vous générez de l’audio via l’API, vous pouvez préciser manuellement la langue de votre prompt à l’aide du paramètre language_code. Ce paramètre facultatif accepte les codes de langue ISO 639-1.
Cela peut être utile pour les prompts courts ou ambigus, par exemple lorsque le texte ne contient que des chiffres. Préciser la langue garantit que le normaliseur applique les règles correctes pour cette langue.
Pour en savoir plus sur la normalisation, consultez cet article.
Accent
L’accent utilisé pour votre génération dépend de la voix que vous utilisez. Si vous utilisez une voix qui n’a pas été entraînée dans la langue que vous générez, vous remarquerez peut-être un léger accent provenant de la langue d’origine de la voix.
Pour obtenir les meilleurs résultats, nous vous recommandons d’utiliser une voix entraînée sur de l’audio dans la langue que vous générez, avec l’accent de votre choix. Cela aide l’IA à mieux comprendre la prononciation et l’intonation.
C’est particulièrement important pour les langues similaires ou qui partagent de nombreux mots. Choisir une voix entraînée dans la bonne langue garantit que l’IA utilise la prononciation et l’accent appropriés.
Vous pouvez :
Créer une voix clonée à partir d’audio dans la langue et avec l’accent de votre choix.
Parcourir la Voice Library et utiliser les filtres de recherche pour trouver des voix adaptées à vos besoins.
Combien coûte la génération avec Eleven v3 (Alpha) ?
Le coût de génération avec Eleven v3 est de 1 crédit par caractère sur le site web. Les générations via l’API bénéficient d’une réduction, consultez la tarification de l’API pour en savoir plus.
Consultez les ressources suivantes pour en savoir plus :
Avec Eleven v4 et Eleven v3, vous pouvez utiliser des balises audio telles que [laughs] pour ajouter des rires et d’autres réactions à la parole générée. Consultez le guide de prompting pour en savoir plus.
Pour les autres modèles, l’expression émotionnelle dépend du contexte, de la ponctuation et des réglages de la voix. Consultez Comment produire des émotions ?.
Comment produire des émotions ?
Le modèle est sensible au contexte général de chaque énoncé : il évalue la cohérence d’un élément en fonction de ses liens avec le texte qui le précède et le suit. Cette vision d’ensemble lui permet d’intoner correctement des passages plus longs en appliquant un schéma émotionnel cohérent à un même fil de pensée sur plusieurs phrases.
Conseils pour produire des émotions :
Le contexte est essentiel pour générer des émotions précises. Si vous saisissez un texte drôle ou contenant des rires, vous pourriez obtenir un résultat joyeux. Il en va de même pour la colère, la tristesse et d’autres émotions : le contexte est déterminant.
La ponctuation et les réglages de la voix jouent un rôle central dans l’expression du résultat.
Ajoutez de l’emphase en plaçant les mots ou expressions concernés entre guillemets.
Pour la parole générée à l’aide d’une voix clonée, le style de parole des échantillons que vous importez pour le clonage est reproduit dans le résultat. Si la parole de l’échantillon importé est monotone, le modèle aura du mal à produire un résultat expressif.
Avec Eleven v4 et Eleven v3, vous pouvez également utiliser des balises audio pour contrôler plus directement l’émotion et l’expression, par exemple [happy], [sad], [angry], [whispers] et [laughs]. Consultez le guide de prompting pour en savoir plus.
Ces conseils aident à orienter l’expression émotionnelle, mais ne garantissent pas un résultat précis.
Peut-on prévisualiser l'audio sans perdre de quota avant le téléchargement ?
Malheureusement, nous ne proposons pas actuellement de déduction au téléchargement comme alternative à la déduction lors de la génération. Il n’est actuellement pas possible de préécouter les générations sans consommer de quota.
Lorsque vous appuyez sur « Generate » sur le site web, des crédits sont déduits, car les serveurs doivent démarrer et l’audio doit être généré. Il n’est pas possible de tester ou de préécouter une voix avec votre propre texte sans utiliser de crédits.
Nous autorisons deux régénérations gratuites dans Text to Speech via le site web dans les circonstances suivantes :
Le prompt (pour Text to Speech) ou le fichier (pour Voice Changer), la voix et le modèle restent identiques. Vous pouvez modifier les curseurs des réglages de la voix.
La première génération a été effectuée il y a moins de deux heures.
Vous n’avez pas actualisé la page depuis la génération de l’audio d’origine.
Si ces conditions sont remplies, « Regenerate speech » s’affiche. Le nombre de régénérations gratuites restantes s’affiche lorsque vous survolez le bouton « Regenerate speech » :
Une fois vos régénérations gratuites utilisées, le bouton redevient « Generate speech » et le nombre de crédits utilisés pour la génération s’affiche :
Les régénérations gratuites sont disponibles uniquement dans Text to Speech via le site web. Elles ne sont pas disponibles via l’API.
Nous étudions la possibilité de proposer des préécoutes de cette qualité sans augmenter les prix ou les coûts. Nous explorons également des moyens de rendre l’IA plus contrôlable, afin que vous obteniez le résultat souhaité sans avoir à préécouter, idéalement dès le premier essai.
Qu'est-ce que le mode Dialogue ?
Eleven v4 et Eleven v3 proposent le mode Dialogue, qui vous permet de générer des conversations dynamiques entre plusieurs intervenants, au rythme naturel, capables de gérer les interruptions, les changements de ton et les signaux émotionnels selon le contexte conversationnel.
Le mode Dialogue est disponible lorsque vous utilisez plusieurs intervenants sur le site web.
Vous pouvez également utiliser les points de terminaison de l’API Text to Dialogue pour générer des interactions entre plusieurs intervenants. Pour en savoir plus, consultez notre documentation de l’API :
Toute voix peut parler n’importe quelle langue actuellement prise en charge par l’IA. Toutefois, si vous n’utilisez pas une voix native de la langue que vous souhaitez faire parler à l’IA, par exemple une voix générée ou une voix clonée parlant anglais, l’IA peut avoir un léger accent anglais ou alterner entre des langues similaires.
Le modèle actuel ne nécessite pas de sélectionner une langue précise. Écrivez simplement dans la langue que vous souhaitez faire parler à l’IA, qui la reconnaîtra automatiquement. Toutefois, certaines langues peuvent se recouper, en utilisant des mots et un vocabulaire similaires mais avec des prononciations et des accents très différents. Nous vous recommandons donc d’utiliser une voix clonée dans la langue concernée, avec le bon accent. L’IA disposera ainsi d’un maximum de contexte sur la façon de prononcer le contenu et la langue à utiliser.
La langue est déterminée par le texte, tandis que l’accent et la prononciation dépendent de la
voix elle-même.
Nous étudions de nouvelles technologies pour faciliter la sélection de la langue, mais la conception même de l’IA signifie que ce travail est encore en cours.
Quel est le nombre maximal de caractères et de texte que je peux générer ?
Dans Text to Speech, sur le site web, vous pouvez générer jusqu’à 5 000 caractères en une seule génération avec n’importe quel forfait payant, et jusqu’à 2 500 caractères avec tous les forfaits gratuits.
Toutefois, si vous prévoyez de générer du contenu long de plus de quelques milliers de caractères, nous vous recommandons vivement d’utiliser Studio, qui permet de générer très facilement des contenus très longs, tels que des livres et des romans. Vous trouverez plus d’informations ici.
Si vous générez du contenu via l’API, la longueur maximale de l’entrée varie selon le modèle utilisé :
Quelles voix de la Voice Library sont natives d'une langue spécifique ?
Toutes les voix préconfigurées et générées sont anglaises. Elles peuvent donc ne pas avoir l’accent ou la prononciation corrects lorsqu’elles parlent d’autres langues.
Dans la Voice Library, sous la catégorie professionnelle, vous trouverez des voix que la communauté a partagées avec nous. Il s’agit de leurs propres clonages de voix professionnels. Ces voix comportent généralement une balise indiquant la langue dans laquelle elles ont été clonées, ce qui en fait des voix natives de cette langue. Vous pouvez également utiliser le filtre de recherche par langue pour sélectionner des langues spécifiques.
Pourquoi les nombres, dates, symboles et acronymes ne sont-ils pas correctement prononcés ou énoncés dans la bonne langue ?
Les nombres, les dates, les symboles et les acronymes peuvent représenter un défi pour l’IA, car il existe souvent plusieurs façons de les énoncer correctement. Cela peut également dépendre de la langue utilisée. Par exemple, « 11 » peut se lire « Eleven », mais aussi « Once » en espagnol ou « Elf » en allemand.
Vous pouvez appliquer plusieurs méthodes pour garantir l’énonciation correcte des nombres, des dates, des acronymes et des symboles.
Écrivez-les en toutes lettres
Pour de meilleurs résultats, nous vous recommandons d’écrire entièrement en lettres les nombres, les acronymes, les dates et les symboles, de la façon dont vous souhaitez que l’IA les énonce. L’IA dispose ainsi d’un maximum de contexte pour produire le résultat correct. Par exemple, pour « $100 », nous vous recommandons d’écrire « a hundred dollars » ou « one hundred dollars » afin d’obtenir le résultat souhaité.
Utiliser un LLM
Si vous utilisez un grand modèle de langage pour générer vos prompts textuels, par exemple avec ElevenAgents, vous pouvez demander au modèle de toujours écrire en toutes lettres les nombres, les dates, les symboles et les acronymes, selon la façon dont vous souhaitez que l’IA les énonce.
Normalisation
Si vous générez du contenu via l’API, vous pouvez indiquer si la normalisation de texte doit être appliquée à l’aide du paramètre apply_text_normalization. La normalisation de texte écrit les nombres et les dates en toutes lettres afin d’améliorer leur prononciation. Cette option augmente la latence, car le processus de normalisation nécessite un temps de traitement supplémentaire.
Le paramètre apply_text_normalization propose trois modes :
on, ce qui signifie qu’il est toujours appliqué
off, ce qui signifie qu’il n’est jamais appliqué
auto, ce qui signifie que l’IA décide automatiquement quand appliquer la normalisation de texte
Vous pouvez également indiquer la langue de votre prompt à l’aide du paramètre language_code. Il s’agit d’un paramètre facultatif qui accepte les codes de langue ISO 639-1.
Cette option peut être utile pour les prompts courts ou ambigus, par exemple lorsque le texte ne contient que des nombres ou des symboles. Indiquer la langue garantit que le normalisateur applique les règles correctes pour cette langue.
La normalisation est activée par défaut lorsque vous générez du contenu avec Text to Speech sur le site web.
Dans Studio, la normalisation est appliquée automatiquement par défaut, ce qui signifie que l’IA décide quand appliquer la normalisation de texte. Vous pouvez également choisir de toujours l’appliquer. Cette option se trouve dans les paramètres du projet, sous l’onglet Avancé.
Pourquoi ma voix prononce-t-elle mal certains mots ?
Les erreurs de prononciation peuvent avoir plusieurs causes. La plus fréquente est simplement une faute d’orthographe. L’IA ne cherchera pas à corriger les mots mal orthographiés et essaiera de les lire exactement tels qu’ils sont écrits. Il est donc important de vérifier que le texte a été relu et finalisé avant de le faire lire par l’IA.
Si vous souhaitez imposer une prononciation spécifique, vous pouvez utiliser des balises phonétiques SSML avec notre modèle Flash v2. Pour en savoir plus, consultez notre guide de prononciation.
L’IA peut parfois mal prononcer des mots ou adopter un accent inhabituel, différent de celui que vous attendiez. Cela peut avoir plusieurs causes et dépend, dans la plupart des cas, de la voix et de la langue. La meilleure façon de garantir le bon accent et la bonne prononciation consiste à cloner une voix avec l’accent et la prononciation appropriés. L’IA disposera ainsi d’un maximum de contexte lors de la génération de l’audio.
La langue est déterminée par le texte et l’accent par la voix. Ainsi, si vous écrivez dans une langue qui partage de nombreux mots avec une autre langue ou qui lui est étroitement apparentée, l’IA peut avoir des difficultés à comprendre comment prononcer certains mots ou à changer d’accent.
Toutefois, dans certaines circonstances, l’IA peut mal prononcer des mots correctement écrits, même en anglais. Ce phénomène semble dépendre fortement de la voix et du texte utilisés, mais devrait rester rare.