/kling/videos 的 image2video(让照片动起来),即可串成完整的”会说话的照片 / 数字人口播”流程。
本接口是 AceDataCloud 提供的单步便捷封装,面向常见的音频/文本驱动场景;它不是 Kling 官方「人脸识别 → Advanced Lip Sync」多步接口的字段镜像。请以本页参数表为准。
- 接口地址:
POST https://api.acedata.cloud/kling/lip-sync - 请求格式:
application/json - 响应格式:
application/json - 计费:每次成功调用 2.45 Credits(固定)
请求头(Request Headers)
请求参数(Request Body)
请求示例
1)音频驱动(audio2video)
2)文本驱动(text2video)
响应示例(同步成功)
异步模式与查询
传入callback_url 或 async: true 时,接口立即返回 task_id;之后可:
- 轮询:
POST /kling/tasks,body{ "action": "retrieve", "id": "<task_id>" }(免费) - 回调:生成完成后,结果 POST 到你的
callback_url
完整流程:会说话的照片(image2video → lip-sync)
错误响应
注意事项
video_id必须是30 天内生成的可灵视频,且为 5s 或 10s;否则请用video_url传入符合约束的视频。- 输入视频建议清晰正脸、单人,口型效果最佳。
- 音频/文本时长应与视频时长匹配(音频不超过视频长度)。
- 计费在成功时发生(2.45 Credits/次);参数校验失败(4xx)不计费。

