/kling/videos 的 image2video(讓照片動起來),即可串成完整的「會說話的照片 / 數位人口播」流程。
本介面是 AceDataCloud 提供的單步便利封裝,面向常見的音訊/文字驅動場景;它不是 Kling 官方「人臉辨識 → Advanced Lip Sync」多步介面的欄位鏡像。請以本頁參數表為準。
- 介面位址:
POST https://api.acedata.cloud/kling/lip-sync - 請求格式:
application/json - 回應格式:
application/json - 計費:每次成功呼叫 2.45 Credits(固定)
請求標頭(Request Headers)
請求參數(Request Body)
請求範例
1)音訊驅動(audio2video)
2)文字驅動(text2video)
回應範例(同步成功)
非同步模式與查詢
傳入callback_url 或 async: true 時,介面立即回傳 task_id;之後可:
- 輪詢:
POST /kling/tasks,body{ "action": "retrieve", "id": "<task_id>" }(免費) - 回呼:生成完成後,結果 POST 到你的
callback_url
完整流程:會說話的照片(image2video → lip-sync)
錯誤回應
注意事項
video_id必須是30 天內生成的可靈影片,且為 5s 或 10s;否則請用video_url傳入符合約束的影片。- 輸入影片建議清晰正臉、單人,口型效果最佳。
- 音訊/文字時長應與影片時長匹配(音訊不超過影片長度)。
- 計費在成功時發生(2.45 Credits/次);參數驗證失敗(4xx)不計費。

