image2video de /kling/videos (para fazer uma foto se mover), é possível formar um fluxo completo de “fotos que falam / locução de avatar digital”.
Esta interface é um encapsulamento conveniente de etapa única fornecido pela AceDataCloud, voltado para cenários comuns orientados por áudio/texto; ela não é um espelho dos campos da interface oficial de múltiplas etapas do Kling de «reconhecimento facial → Advanced Lip Sync». Consulte a tabela de parâmetros desta página como referência.
- Endereço da interface:
POST https://api.acedata.cloud/kling/lip-sync - Formato da solicitação:
application/json - Formato da resposta:
application/json - Cobrança: 2.45 Credits por cada chamada bem-sucedida (fixo)
Cabeçalhos da solicitação (Request Headers)
Parâmetros da solicitação (Request Body)
Exemplos de solicitação
1)Orientado por áudio(audio2video)
2)Orientado por texto(text2video)
Exemplo de resposta (sucesso síncrono)
Modo assíncrono e consulta
Ao enviarcallback_url ou async: true, a interface retorna imediatamente task_id; depois é possível:
- Polling:
POST /kling/tasks, body{ "action": "retrieve", "id": "<task_id>" }(gratuito) - Callback: após a conclusão da geração, o resultado é enviado via POST para o seu
callback_url
Fluxo completo: fotos que falam(image2video → lip-sync)
Resposta de erro
Observações
video_iddeve ser um vídeo Kling gerado nos últimos 30 dias e ter 5s ou 10s; caso contrário, usevideo_urlpara enviar um vídeo que atenda às restrições.- Recomenda-se que o vídeo de entrada tenha um rosto frontal nítido, de uma única pessoa, para obter o melhor efeito de sincronização labial.
- A duração do áudio/texto deve corresponder à duração do vídeo (o áudio não deve exceder a duração do vídeo).
- A cobrança ocorre em caso de sucesso (2,45 Credits/vez); falhas na validação de parâmetros (4xx) não são cobradas.

