Skip to main content
SUNO允许我们通过任意音频文件创建自定义声音角色,实现声音克隆用于音乐生成。与已有的Persona API(使用Suno生成的audio_id)不同,该API接受一个公开可访问的audio_url,即你自己的人声录音。本文档讲解声音克隆API的对接方法。

第一步:创建声音角色

该API有三个输入参数:audio_url(必填),为一个公开可访问的MP3或WAV格式音频文件URL,其中包含单人清晰人声;namedescription(可选),为声音角色的名称和描述。
音频文件要求
  • 音频格式需为WAVMP3
  • 音频时长需在10~240秒之间,推荐使用30~60秒的干净单人干声素材
  • 音频中应包含清晰、可辨识的单人讲话或演唱人声
  • 请务必避免背景噪音、伴奏、回声、混响;带伴奏的完整歌曲通常无法通过声纹校验
  • 不要包含多位说话人多重人声
  • 音量过低、语音不清晰、噪声过重的素材,可能导致克隆失败生成效果较差 使用限制说明
  • 通过上传音频创建的声音角色为私有资源
  • 该声音角色不支持跨账号复用
  • 建议在创建成功后尽快使用,长时间不使用可能出现失效或不可用
  • 返回的name由系统自动生成,请以返回的persona_id为准
调用失败时请先重试 声音克隆为算力密集型任务,即使素材完全合规也存在一定概率的偶发失败,常见返回如 voices_sound_different(声纹校验未通过)等。这类失败与音频质量无关,使用同一素材重试通常即可成功, 建议在集成时对失败结果实现1~2次自动重试。失败的请求不会计费。
上述https://cdn.acedata.cloud/suno_demo.mp3为可直接调用的示例素材(MP3,41秒,单人干声)。 如需WAV格式示例,可使用 https://cdn.acedata.cloud/uploads/82d23b97-ec1c-4b41-91b8-989fc51f8765(WAV,41秒,单声道44.1kHz)。
结果如下:
可以看到,datapersona_id字段就是创建的声音角色ID。is_public字段始终为false,因为通过上传音频创建的声音角色是私有的。注意返回的name为系统自动生成,后续请使用persona_id引用该声音角色。

第二步:使用声音角色生成音乐

有了声音角色ID之后,我们便可以使用 Suno Audios Generation API 来进行音乐生成了。将action设为generate,并将persona_id设为上面返回的声音角色ID,生成的歌曲将使用克隆的声音进行演唱。
注意: 声音克隆仅支持chirp-v4-5及以上模型(如chirp-v4-5chirp-v5chirp-v5-5),不支持chirp-v4
结果如下:
可以看到,生成的歌曲使用了克隆的声音进行演唱。persona_id也可以与cover动作配合使用,用克隆的声音翻唱已有歌曲。