Skip to main content
讓一段已有的可靈影片(5 秒或 10 秒)按音訊或文字「開口說話」——即對口型(Lip Sync)。搭配 /kling/videos 的 image2video(讓照片動起來),即可串成完整的「會說話的照片 / 數位人口播」流程。
本介面是 AceDataCloud 提供的單步便利封裝,面向常見的音訊/文字驅動場景;它不是 Kling 官方「人臉辨識 → Advanced Lip Sync」多步介面的欄位鏡像。請以本頁參數表為準。
  • 介面位址:POST https://api.acedata.cloud/kling/lip-sync
  • 請求格式:application/json
  • 回應格式:application/json
  • 計費:每次成功呼叫 2.45 Credits(固定)

請求標頭(Request Headers)

請求參數(Request Body)

請求範例

1)音訊驅動(audio2video)

2)文字驅動(text2video)

回應範例(同步成功)

非同步模式與查詢

傳入 callback_url 或 async: true 時,介面立即回傳 task_id;之後可:
  • 輪詢:POST /kling/tasks,body { "action": "retrieve", "id": "<task_id>" }(免費)
  • 回呼:生成完成後,結果 POST 到你的 callback_url

完整流程:會說話的照片(image2video → lip-sync)

錯誤回應

注意事項

  • video_id 必須是30 天內生成的可靈影片,且為 5s 或 10s;否則請用 video_url 傳入符合約束的影片。
  • 輸入影片建議清晰正臉、單人,口型效果最佳。
  • 音訊/文字時長應與影片時長匹配(音訊不超過影片長度)。
  • 計費在成功時發生(2.45 Credits/次);參數驗證失敗(4xx)不計費。