Skip to main content
既存のKling動画(5秒または10秒)を、音声またはテキストに合わせて「口を開いて話す」ようにする——すなわちリップシンク(Lip Sync)です。/kling/videos の image2video(写真を動かす)と組み合わせることで、完全な「話す写真 / デジタルヒューマンによるナレーション」ワークフローを構築できます。
本インターフェースは、AceDataCloud が提供する一般的な音声/テキスト駆動シナリオ向けのワンステップ簡易ラッパーです。Kling公式の「顔認識 → Advanced Lip Sync」マルチステップインターフェースのフィールドをそのまま反映したものではありません。本ページのパラメータ表を基準にしてください。
  • エンドポイント:POST https://api.acedata.cloud/kling/lip-sync
  • リクエスト形式:application/json
  • レスポンス形式:application/json
  • 課金:成功した呼び出しごとに 2.45 Credits(固定)

リクエストヘッダー(Request Headers)

リクエストパラメータ(Request Body)

リクエスト例

1)音声駆動(audio2video)

2)テキスト駆動(text2video)

レスポンス例(同期成功)

非同期モードと照会

callback_url または async: true を渡すと、インターフェースは直ちに task_id を返します。その後、以下を行えます:
  • ポーリング:POST /kling/tasks、body { "action": "retrieve", "id": "<task_id>" }(無料)
  • コールバック:生成完了後、結果があなたの callback_url にPOSTされます

完全なフロー:話す写真(image2video → lip-sync)

エラーレスポンス

注意事項

  • video_id は30 日以内に生成された可霊動画であり、かつ 5 秒または 10 秒である必要があります。それ以外の場合は、video_url を使用して制約に適合する動画を渡してください。
  • 入力動画は鮮明な正面顔・1 人を推奨し、リップシンク効果が最も良くなります。
  • 音声/テキストの長さは動画の長さに合わせる必要があります(音声は動画の長さを超えないこと)。
  • 課金は成功時に発生します(2.45 Credits/回)。パラメータ検証の失敗(4xx)では課金されません。