Skip to main content
Spraw, aby istniejący film Kling (5 lub 10 sekund) „mówił” zgodnie z dźwiękiem lub tekstem — czyli synchronizował ruch warg (Lip Sync). W połączeniu z image2video z /kling/videos (ożywianie zdjęcia) można stworzyć kompletny proces „mówiącego zdjęcia / cyfrowego prezentera”.
Ten interfejs jest wygodnym, jednoetapowym opakowaniem udostępnianym przez AceDataCloud, przeznaczonym dla typowych scenariuszy sterowanych dźwiękiem/tekstem; nie jest odwzorowaniem pól wieloetapowego oficjalnego interfejsu Kling „rozpoznawanie twarzy → Advanced Lip Sync”. Należy kierować się tabelą parametrów na tej stronie.
  • Adres interfejsu:POST https://api.acedata.cloud/kling/lip-sync
  • Format żądania:application/json
  • Format odpowiedzi:application/json
  • Rozliczenie:2.45 Credits za każde pomyślne wywołanie (stałe)

Nagłówki żądania(Request Headers)

Parametry żądania(Request Body)

Przykłady żądań

1)Sterowanie dźwiękiem(audio2video)

2)Sterowanie tekstem(text2video)

Przykład odpowiedzi(synchronizacja zakończona powodzeniem)

Tryb asynchroniczny i zapytania

Po przekazaniu callback_url lub async: true interfejs natychmiast zwraca task_id; następnie można:
  • Odpytywać:POST /kling/tasks, body { "action": "retrieve", "id": "<task_id>" } (bezpłatnie)
  • Wywołanie zwrotne:po zakończeniu generowania wynik zostanie wysłany metodą POST do Twojego callback_url

Pełny proces: mówiące zdjęcie(image2video → lip-sync)

Odpowiedź błędu

Uwagi

  • video_id musi być filmem Kling wygenerowanym w ciągu 30 dni i mieć długość 5 s lub 10 s; w przeciwnym razie użyj video_url, aby przekazać film spełniający ograniczenia.
  • Zaleca się, aby wejściowy film przedstawiał wyraźną twarz en face, jedną osobę, co zapewnia najlepszy efekt ruchu ust.
  • Długość dźwięku/tekstu powinna odpowiadać długości filmu (dźwięk nie może być dłuższy niż film).
  • Opłata jest naliczana przy sukcesie (2,45 Credits/raz); nieudana walidacja parametrów (4xx) nie jest płatna.