image2video de /kling/videos (para hacer que una foto se mueva), puede formar un flujo completo de “fotos parlantes / locución de avatar digital”.
Esta interfaz es un encapsulado práctico de un solo paso proporcionado por AceDataCloud, orientado a escenarios comunes impulsados por audio/texto; no es un reflejo de los campos de la interfaz oficial de múltiples pasos de Kling «reconocimiento facial → Advanced Lip Sync». Consulta la tabla de parámetros de esta página.
- Dirección de la interfaz:
POST https://api.acedata.cloud/kling/lip-sync - Formato de solicitud:
application/json - Formato de respuesta:
application/json - Facturación: 2.45 Credits por cada llamada exitosa (fijo)
Encabezados de solicitud (Request Headers)
Parámetros de solicitud (Request Body)
Ejemplos de solicitud
1)Impulsado por audio (audio2video)
2)Impulsado por texto (text2video)
Ejemplo de respuesta (éxito síncrono)
Modo asíncrono y consulta
Cuando se proporcionacallback_url o async: true, la interfaz devuelve inmediatamente task_id; después puedes:
- Sondear:
POST /kling/tasks, body{ "action": "retrieve", "id": "<task_id>" }(gratis) - Devolución de llamada: después de completar la generación, el resultado se envía mediante POST a tu
callback_url
Flujo completo: foto parlante (image2video → lip-sync)
Respuesta de error
Consideraciones
video_iddebe ser un video de Kling generado dentro de los últimos 30 días y ser de 5 s o 10 s; de lo contrario, usevideo_urlpara enviar un video que cumpla con las restricciones.- Se recomienda que el video de entrada tenga un rostro frontal claro y una sola persona para obtener el mejor efecto de sincronización labial.
- La duración del audio/texto debe coincidir con la duración del video (el audio no debe exceder la duración del video).
- La facturación ocurre al tener éxito (2.45 Credits/vez); los fallos de validación de parámetros (4xx) no se cobran.

