Stream do Modificador de Voz IA

Transmita o áudio de uma voz para outra. Mantenha total controle sobre emoção, ritmo e interpretação.

Parâmetros de caminho

voice_idstringObrigatório

ID da voz a ser usada. Use o endpoint Get voices para listar todas as vozes disponíveis.

Cabeçalhos

xi-api-keystringOpcional

Parâmetros de consulta

enable_loggingbooleanOpcionalPadrão é true
Quando enable_logging for definido como false, o modo de retenção zero será usado para a solicitação. Isso significa que os recursos de histórico não estarão disponíveis para esta solicitação, incluindo a união de solicitações. O modo de retenção zero só pode ser usado por clientes empresariais.
optimize_streaming_latencyinteger or nullOpcionalDeprecated
Você pode ativar otimizações de latência com alguma perda de qualidade. A melhor latência final possível varia conforme o modelo. Valores possíveis: 0 - modo padrão (sem otimizações de latência) 1 - otimizações normais de latência (cerca de 50% da possível melhoria de latência da opção 3) 2 - otimizações fortes de latência (cerca de 75% da possível melhoria de latência da opção 3) 3 - otimizações máximas de latência 4 - otimizações máximas de latência, mas também com o normalizador de texto desativado para reduzir ainda mais a latência (melhor latência, mas pode pronunciar incorretamente, por exemplo, números e datas). O padrão é None.
output_formatenumOpcionalPadrão é mp3_44100_128
Output format of the generated audio. Formatted as codec_sample_rate_bitrate. So an mp3 with 22.05kHz sample rate at 32kbs is represented as mp3_22050_32. MP3 with 192kbps bitrate requires you to be subscribed to Creator tier or above. PCM with 44.1kHz sample rate requires you to be subscribed to Pro tier or above. Note that the μ-law format (sometimes written mu-law, often approximated as u-law) is commonly used for Twilio audio inputs.

Solicitação

This endpoint expects a multipart form containing a file.
audiofileObrigatório

O arquivo de áudio que contém o conteúdo e a emoção que controlarão a fala gerada.

model_idstringOpcionalPadrão é eleven_english_sts_v2

Identificador do modelo que será usado. Você pode consultá-lo usando GET /v1/models. O modelo precisa oferecer suporte a conversão de voz para voz, o que pode ser verificado pela propriedade can_do_voice_conversion.

voice_settingsstring or nullOpcional

Configurações de voz que substituem as configurações armazenadas para a voz fornecida. Elas são aplicadas somente à solicitação fornecida. Devem ser enviadas como uma string codificada em JSON.

seedinteger or nullOpcional

Se especificado, nosso sistema fará o possível para realizar a amostragem de forma determinística, de modo que solicitações repetidas com a mesma semente e os mesmos parâmetros retornem o mesmo resultado. O determinismo não é garantido. Deve ser um número inteiro entre 0 e 4294967295.

remove_background_noisebooleanOpcionalPadrão é false

Se definido, removerá o ruído de fundo da sua entrada de áudio usando nosso modelo de isolamento de áudio. Aplica-se somente ao Modificador de Voz IA.

file_formatenum or nullOpcionalPadrão é other

The format of input audio. Options are ‘pcm_s16le_16’ or ‘other’ For pcm_s16le_16, the input audio must be 16-bit PCM at a 16kHz sample rate, single channel (mono), and little-endian byte order. Latency will be lower than with passing an encoded waveform.

Valores permitidos:

Resposta

Dados de áudio em streaming

Erros

422
Unprocessable Entity Error