人声分离
人声分离
了解如何从任意音频中分离语音与背景噪声、音乐和环境声。
概览
ElevenLabs 人声分离 API 可将含有背景噪声的录音转换为干净的录音室级语音。尤其适用于在嘈杂环境中录制的音频,或包含不需要的环境声、音乐或其他背景干扰的录音。
试听示例:
使用方法
人声分离模型可从音频和视频文件的背景噪声中提取语音。
支持的文件类型
- 音频:AAC、AIFF、OGG、MP3、OPUS、WAV、FLAC、M4A
- 视频:MP4、AVI、MKV、MOV、WMV、FLV、WEBM、MPEG、3GPP
常见问题
- 费用:人声分离每分钟音频消耗 1000 个字符。
- 文件大小和时长:支持最大 500MB、最长 1 小时的文件。
- 音乐人声:未专门针对从音乐中分离人声优化,但可能会因内容而有效。