Inpainting musical

Modifier et combiner des sections de morceaux existants

L’inpainting musical avec le modèle music_v2 ou music_v2_5 vous permet de modifier des parties spécifiques d’un morceau tout en conservant le reste intact. Stockez un morceau généré, puis référencez ses parties dans un plan de composition pour les conserver inchangées, les régénérer ou conditionner de nouveaux fichiers audio à partir de l’original.

Fonctionnement

Un plan de composition music_v2 ou music_v2_5 est une liste ordonnée de segments. Chaque segment appartient à l’un des deux types suivants :

  • Segment de génération : génère un nouvel audio à partir de text et de styles. Utilisez-le pour régénérer une section ou ajouter du nouveau contenu.
  • Segment de référence audio : insère une portion d’un morceau stocké sans modification. Utilisez-le pour conserver une section d’un morceau existant exactement telle quelle.

Démarrage rapide

1

Stocker un morceau pour l’inpainting

Vous pouvez stocker un morceau pour l’inpainting de deux façons : générez un nouveau morceau avec store_for_inpainting ou importez un fichier audio existant.

import os
from dotenv import load_dotenv
from elevenlabs.client import ElevenLabs
load_dotenv()
elevenlabs = ElevenLabs(api_key=os.environ.get("ELEVENLABS_API_KEY"))
# Generate a song and store it for later inpainting
response = elevenlabs.music.compose_detailed(
prompt="An upbeat pop song with verse and chorus",
music_length_ms=60000,
model_id="music_v2_5",
store_for_inpainting=True
)
song_id = response.song_id
# Save the audio
with open("original.mp3", "wb") as f:
f.write(response.audio)
2

Conserver et régénérer des segments

Créez un plan qui mélange des segments de référence audio, conservés tels quels, et des segments de génération, régénérés, puis transmettez-le à compose avec model_id="music_v2_5" :

# Keep the first 30 seconds, regenerate the rest with a new style
composition_plan = {
"chunks": [
# Keep the original first 30 seconds unchanged
{
"song_id": song_id,
"range": {"start_ms": 0, "end_ms": 30000}
},
# Regenerate the chorus with a new style
{
"text": "[Chorus]\nWe're rising up tonight\nNothing can stop us now",
"duration_ms": 30000,
"positive_styles": ["bigger drums", "layered vocals", "anthemic"],
"negative_styles": ["sparse", "minimal"],
"context_adherence": "high"
}
]
}
audio = elevenlabs.music.compose(
composition_plan=composition_plan,
model_id="music_v2_5",
)
with open("edited.mp3", "wb") as f:
for chunk in audio:
f.write(chunk)

Conditionnement

Un segment de génération peut être conditionné sur une portion d’audio stocké avec conditioning_ref. Le modèle régénère le segment tout en restant proche des caractéristiques musicales de la référence. Contrôlez à quel point le segment suit la référence avec condition_strength (low, medium, high ou xhigh).

{
"text": "[Chorus]\nThis is my moment\nI won't let it go",
"duration_ms": 15000,
"positive_styles": ["powerful vocals", "full band", "anthemic"],
"negative_styles": [],
"context_adherence": "high",
"conditioning_ref": {
"song_id": "vVtPM1Sas70E2LIhQFch",
"range": { "start_ms": 30000, "end_ms": 45000 }
},
"condition_strength": "high"
}

Le premier segment influence la génération de tous les segments suivants. Pour conditionner l’ensemble du morceau sur une référence, appliquez conditioning_ref dès le premier segment.

Une référence de conditionnement peut durer au maximum 30 secondes (30 000 ms).

Adhérence au contexte

Chaque segment de génération possède un niveau context_adherence qui contrôle à quel point il suit les segments voisins :

  • high (par défaut) : reste cohérent avec les segments environnants. Utilisez-le pour des transitions fluides entre audio conservé et régénéré.
  • medium : équilibre cohérence et liberté créative.
  • low : permet au segment de s’écarter de son contexte et d’être plus créatif.

Exemples

Modifier une seule section

Générez une bande-annonce de film, puis régénérez uniquement l’outro avec des paroles différentes.

1

Générer l’original

composition_plan = {
"chunks": [
{
"text": "[Intro]\nIn a world beyond code\nWhere sound becomes life",
"duration_ms": 15000,
"positive_styles": ["cinematic", "epic", "orchestral", "low strings", "suspenseful"],
"negative_styles": ["acoustic", "pop", "minimalistic"],
"context_adherence": "high"
},
{
"text": "[Build]\nTechnology awakens the future\nShaping every word into power",
"duration_ms": 20000,
"positive_styles": ["rising brass", "full orchestra", "epic"],
"negative_styles": ["acoustic", "pop"],
"context_adherence": "high"
},
{
"text": "[Bridge]\n(ah ah ah ah)",
"duration_ms": 15000,
"positive_styles": ["ethereal choir", "crescendo"],
"negative_styles": [],
"context_adherence": "high"
},
{
"text": "[Outro]\nThe voice of tomorrow, unleashed\nElevenLabs",
"duration_ms": 10000,
"positive_styles": ["deep narration", "epic finale"],
"negative_styles": [],
"context_adherence": "high"
}
]
}
response = elevenlabs.music.compose_detailed(
composition_plan=composition_plan,
model_id="music_v2_5",
store_for_inpainting=True
)
song_id = response.song_id
2

Modifier uniquement l’outro

Conservez les trois premières sections, des secondes 0 à 50, avec un seul segment de référence audio, puis régénérez l’outro :

edited_plan = {
"chunks": [
# Keep the intro, build, and bridge unchanged
{
"song_id": song_id,
"range": {"start_ms": 0, "end_ms": 50000}
},
# Regenerate the outro with new lyrics
{
"text": "[Outro]\nThe future has arrived\nElevenLabs",
"duration_ms": 10000,
"positive_styles": ["deep narration", "epic finale"],
"negative_styles": [],
"context_adherence": "high"
}
]
}
audio = elevenlabs.music.compose(composition_plan=edited_plan, model_id="music_v2_5")

Prolonger un morceau

Ajoutez une nouvelle intro et une outro à un morceau existant.

1

Générer l’original

response = elevenlabs.music.compose_detailed(
prompt="Berlin night club techno",
music_length_ms=60000,
model_id="music_v2_5",
store_for_inpainting=True
)
song_id = response.song_id
2

Prolonger avec une nouvelle intro et une nouvelle outro

Encadrez une portion conservée de l’original par deux nouveaux segments de génération :

extend_plan = {
"chunks": [
# New intro
{
"text": "[Intro]",
"duration_ms": 30000,
"positive_styles": ["techno", "building tension", "filtered synths"],
"negative_styles": [],
"context_adherence": "high"
},
# Keep the core of the original (seconds 10-50)
{
"song_id": song_id,
"range": {"start_ms": 10000, "end_ms": 50000}
},
# New outro
{
"text": "[Outro]",
"duration_ms": 30000,
"positive_styles": ["techno", "fading out", "sparse"],
"negative_styles": [],
"context_adherence": "high"
}
]
}
audio = elevenlabs.music.compose(composition_plan=extend_plan, model_id="music_v2_5")

Créer une boucle fluide

Générez une phrase musicale et créez une boucle à l’aide d’un segment de « liaison » qui fait le pont entre la même portion répétée deux fois.

1

Générer un extrait court

composition_plan = {
"chunks": [
{
"text": "[Solo Acoustic]",
"duration_ms": 10000,
"positive_styles": ["acoustic guitar", "fingerpicking", "warm tone", "soft dynamics"],
"negative_styles": ["electric", "drums", "electronic"],
"context_adherence": "high"
}
]
}
response = elevenlabs.music.compose_detailed(
composition_plan=composition_plan,
model_id="music_v2_5",
store_for_inpainting=True
)
song_id = response.song_id
2

Créer une boucle avec un segment de liaison

loop_plan = {
"chunks": [
# Loop start - keep a slice of the original
{
"song_id": song_id,
"range": {"start_ms": 3000, "end_ms": 8000}
},
# Glue - generate a smooth transition between the two slices
{
"text": "[Glue]",
"duration_ms": 3000,
"positive_styles": ["acoustic guitar", "fingerpicking", "smooth transition"],
"negative_styles": [],
"context_adherence": "high"
},
# Loop end - keep the same slice again
{
"song_id": song_id,
"range": {"start_ms": 3000, "end_ms": 8000}
}
]
}
audio = elevenlabs.music.compose(composition_plan=loop_plan, model_id="music_v2_5")

Générer un morceau similaire

Conditionnez un tout nouveau morceau sur une courte portion d’un morceau existant afin d’en conserver les caractéristiques musicales. Comme le premier segment influence chaque segment qui suit, appliquer conditioning_ref au premier segment façonne l’ensemble de la génération, même si seul ce segment référence l’audio stocké.

1

Générer l’original

response = elevenlabs.music.compose_detailed(
prompt="An upbeat pop song with bright synths and driving drums",
music_length_ms=60000,
model_id="music_v2_5",
store_for_inpainting=True
)
song_id = response.song_id
2

Générer un nouveau morceau conditionné sur l’original

similar_plan = {
"chunks": [
# The first chunk conditions the whole song on the reference
{
"text": "[Verse]\nSalt on my skin from a borrowed sea\nCounting the heartbeats it takes to break free",
"duration_ms": 30000,
"positive_styles": ["pop", "energetic", "bright synths", "driving drums"],
"negative_styles": ["sparse", "minimal"],
"context_adherence": "high",
"conditioning_ref": {
"song_id": song_id,
"range": {"start_ms": 0, "end_ms": 10000}
},
"condition_strength": "high"
},
{
"text": "[Chorus]\nWe're rising up tonight\nNothing can stop us now",
"duration_ms": 30000,
"positive_styles": ["bigger drums", "layered vocals", "anthemic"],
"negative_styles": ["sparse", "minimal"],
"context_adherence": "high"
}
]
}
audio = elevenlabs.music.compose(composition_plan=similar_plan, model_id="music_v2_5")

Référence des segments

Un plan music_v2 contient jusqu’à 30 segments. Chaque segment est soit un segment de génération, soit un segment de référence audio.

Segment de génération

ChampTypeDescription
textchaîneNom de section entre crochets ([Verse 1]), lignes de paroles et indications en ligne entre accolades ({scratching}).
duration_msnombreDurée en millisecondes (3 000 - 120 000).
positive_stylestableauStyles et indications à inclure (50 maximum).
negative_stylestableauStyles et indications à éviter (50 maximum). Vide par défaut.
context_adherencechaînelow, medium ou high (valeur par défaut). Indique dans quelle mesure le segment suit les segments qui l’entourent.
conditioning_refobjet | nullExtrait facultatif { song_id, range } d’un audio stocké sur lequel conditionner la génération. null par défaut.
condition_strengthchaîne | nulllow, medium (valeur par défaut), high ou xhigh. Indique dans quelle mesure le segment suit la référence de conditionnement.

Les styles du premier segment sont les plus importants, car ils définissent le ton et le genre généraux. Visez au moins 6 à 7 styles dans les premiers segments, jusqu’à ce que l’orientation soit établie.

Segment de référence audio

ChampTypeDescription
song_idchaîneID du morceau stocké dont provient l’audio.
rangeobjetExtrait { start_ms, end_ms } du morceau stocké à insérer sans modification.

Contraintes

ContrainteValeur
Nombre maximal de segments par plan30
Durée minimale d’un segment3 secondes (3 000 ms)
Durée maximale d’un segment2 minutes (120 000 ms)
Référence de conditionnement maximale30 secondes (30 000 ms)
Plage de temps minimale50 ms

Étapes suivantes