Skip to main content
Позволяет существующему видео Kling (5 или 10 секунд) «говорить» под аудио или текст — то есть выполнять синхронизацию губ (Lip Sync). В сочетании с image2video из /kling/videos (чтобы оживить фотографию) можно сформировать полный процесс «говорящей фотографии / цифрового человека с озвучкой».
Этот интерфейс является удобной одношаговой обёрткой, предоставляемой AceDataCloud, для распространённых сценариев управления аудио/текстом; он не является зеркалом полей многошагового официального интерфейса Kling «распознавание лица → Advanced Lip Sync». Ориентируйтесь на таблицу параметров на этой странице.
  • Адрес API: POST https://api.acedata.cloud/kling/lip-sync
  • Формат запроса: application/json
  • Формат ответа: application/json
  • Тарификация: 2.45 Credits за каждый успешный вызов (фиксированно)

Заголовки запроса (Request Headers)

Параметры запроса (Request Body)

Примеры запросов

1)Управление аудио (audio2video)

2)Управление текстом (text2video)

Пример ответа (успешный синхронный ответ)

Асинхронный режим и запросы

При передаче callback_url или async: true интерфейс немедленно возвращает task_id; после этого можно:
  • Опрос: POST /kling/tasks, body { "action": "retrieve", "id": "<task_id>" } (бесплатно)
  • Обратный вызов: после завершения генерации результат отправляется POST-запросом на ваш callback_url

Полный процесс: говорящая фотография (image2video → lip-sync)

Ответ с ошибкой

Примечания

  • video_id должен быть видео Kling, созданным в течение 30 дней, и иметь длительность 5 с или 10 с; в противном случае используйте video_url для передачи видео, соответствующего ограничениям.
  • Для входного видео рекомендуется чёткое анфас-лицо, один человек — это даёт наилучший эффект синхронизации губ.
  • Длительность аудио/текста должна соответствовать длительности видео (аудио не должно быть длиннее видео).
  • Оплата взимается при успешном выполнении (2,45 Credits/раз); при ошибке проверки параметров (4xx) оплата не взимается.