image2video von /kling/videos (um Fotos zu animieren) lässt sich daraus ein vollständiger Ablauf für „sprechende Fotos / digitale Personenansagen“ erstellen.
Diese Schnittstelle ist eine von AceDataCloud bereitgestellte praktische Einzelschritt-Kapselung für gängige audio-/textgesteuerte Szenarien; sie ist keine Feldspiegelung der mehrstufigen offiziellen Kling-Schnittstelle „Gesichtserkennung → Advanced Lip Sync“. Bitte orientiere dich an der Parametertabelle auf dieser Seite.
- Schnittstellenadresse:
POST https://api.acedata.cloud/kling/lip-sync - Anfrageformat:
application/json - Antwortformat:
application/json - Abrechnung: Pro erfolgreichem Aufruf 2.45 Credits (fest)
Anfrage-Header (Request Headers)
Anfrageparameter (Request Body)
Anfragebeispiele
1)Audiogesteuert (audio2video)
2)Textgesteuert (text2video)
Antwortbeispiel (synchroner Erfolg)
Asynchroner Modus und Abfrage
Bei Übergabe voncallback_url oder async: true gibt die Schnittstelle sofort task_id zurück; anschließend kannst du:
- Pollen:
POST /kling/tasks, Body{ "action": "retrieve", "id": "<task_id>" }(kostenlos) - Callback: Nach Abschluss der Generierung wird das Ergebnis per POST an deine
callback_urlgesendet
Vollständiger Ablauf: Sprechendes Foto (image2video → lip-sync)
Fehlerantwort
Hinweise
video_idmuss ein innerhalb von 30 Tagen generiertes Kling-Video sein und 5 s oder 10 s lang sein; andernfalls bittevideo_urlverwenden, um ein Video zu übergeben, das den Einschränkungen entspricht.- Für das Eingabevideo werden ein klares frontales Gesicht und eine einzelne Person empfohlen, um den besten Lippensynchronisationseffekt zu erzielen.
- Die Audio-/Textdauer sollte der Videodauer entsprechen (Audio darf die Videolänge nicht überschreiten).
- Die Abrechnung erfolgt bei Erfolg (2,45 Credits/Vorgang); bei fehlgeschlagener Parameterprüfung (4xx) fallen keine Kosten an.

