人声分离

了解如何从任意音频中分离语音与背景噪声、音乐和环境声。

概览

ElevenLabs 人声分离 API 可将含有背景噪声的录音转换为干净的录音室级语音。尤其适用于在嘈杂环境中录制的音频,或包含不需要的环境声、音乐或其他背景干扰的录音。

试听示例:

使用方法

人声分离模型可从音频和视频文件的背景噪声中提取语音。

支持的文件类型

  • 音频:AAC、AIFF、OGG、MP3、OPUS、WAV、FLAC、M4A
  • 视频:MP4、AVI、MKV、MOV、WMV、FLV、WEBM、MPEG、3GPP

常见问题

  • 费用:人声分离每分钟音频消耗 1000 个字符。
  • 文件大小和时长:支持最大 500MB、最长 1 小时的文件。
  • 音乐人声:未专门针对从音乐中分离人声优化,但可能会因内容而有效。