/kling/videos の image2video(写真を動かす)と組み合わせることで、完全な「話す写真 / デジタルヒューマンによるナレーション」ワークフローを構築できます。
本インターフェースは、AceDataCloud が提供する一般的な音声/テキスト駆動シナリオ向けのワンステップ簡易ラッパーです。Kling公式の「顔認識 → Advanced Lip Sync」マルチステップインターフェースのフィールドをそのまま反映したものではありません。本ページのパラメータ表を基準にしてください。
- エンドポイント:
POST https://api.acedata.cloud/kling/lip-sync - リクエスト形式:
application/json - レスポンス形式:
application/json - 課金:成功した呼び出しごとに 2.45 Credits(固定)
リクエストヘッダー(Request Headers)
リクエストパラメータ(Request Body)
リクエスト例
1)音声駆動(audio2video)
2)テキスト駆動(text2video)
レスポンス例(同期成功)
非同期モードと照会
callback_url または async: true を渡すと、インターフェースは直ちに task_id を返します。その後、以下を行えます:
- ポーリング:
POST /kling/tasks、body{ "action": "retrieve", "id": "<task_id>" }(無料) - コールバック:生成完了後、結果があなたの
callback_urlにPOSTされます
完全なフロー:話す写真(image2video → lip-sync)
エラーレスポンス
注意事項
video_idは30 日以内に生成された可霊動画であり、かつ 5 秒または 10 秒である必要があります。それ以外の場合は、video_urlを使用して制約に適合する動画を渡してください。- 入力動画は鮮明な正面顔・1 人を推奨し、リップシンク効果が最も良くなります。
- 音声/テキストの長さは動画の長さに合わせる必要があります(音声は動画の長さを超えないこと)。
- 課金は成功時に発生します(2.45 Credits/回)。パラメータ検証の失敗(4xx)では課金されません。

