Skip to main content
让一段已有的可灵视频(5 秒或 10 秒)按音频或文本”开口说话”——即对口型(Lip Sync)。配合 /kling/videos 的 image2video(让照片动起来),即可串成完整的”会说话的照片 / 数字人口播”流程。
本接口是 AceDataCloud 提供的单步便捷封装,面向常见的音频/文本驱动场景;它不是 Kling 官方「人脸识别 → Advanced Lip Sync」多步接口的字段镜像。请以本页参数表为准。
  • 接口地址:POST https://api.acedata.cloud/kling/lip-sync
  • 请求格式:application/json
  • 响应格式:application/json
  • 计费:每次成功调用 2.45 Credits(固定)

请求头(Request Headers)

请求参数(Request Body)

请求示例

1)音频驱动(audio2video)

2)文本驱动(text2video)

响应示例(同步成功)

异步模式与查询

传入 callback_url 或 async: true 时,接口立即返回 task_id;之后可:
  • 轮询:POST /kling/tasks,body { "action": "retrieve", "id": "<task_id>" }(免费)
  • 回调:生成完成后,结果 POST 到你的 callback_url

完整流程:会说话的照片(image2video → lip-sync)

错误响应

注意事项

  • video_id 必须是30 天内生成的可灵视频,且为 5s 或 10s;否则请用 video_url 传入符合约束的视频。
  • 输入视频建议清晰正脸、单人,口型效果最佳。
  • 音频/文本时长应与视频时长匹配(音频不超过视频长度)。
  • 计费在成功时发生(2.45 Credits/次);参数校验失败(4xx)不计费。