/kling/videos의 image2video(사진을 움직이게 하기)와 함께 사용하면 완전한 “말하는 사진 / 디지털 휴먼 나레이션” 워크플로를 구성할 수 있습니다.
본 인터페이스는 AceDataCloud가 제공하는 단일 단계 편의 래퍼로, 일반적인 오디오/텍스트 기반 시나리오를 대상으로 합니다. 이는 Kling 공식 「얼굴 인식 → Advanced Lip Sync」 다단계 인터페이스의 필드 미러링이 아닙니다. 이 페이지의 파라미터 표를 기준으로 하십시오.
- 인터페이스 주소:
POST https://api.acedata.cloud/kling/lip-sync - 요청 형식:
application/json - 응답 형식:
application/json - 과금:성공한 호출당 2.45 Credits(고정)
요청 헤더(Request Headers)
요청 파라미터(Request Body)
요청 예시
1)오디오 구동(audio2video)
2)텍스트 구동(text2video)
응답 예시(동기 성공)
비동기 모드 및 조회
callback_url 또는 async: true를 전달하면, 인터페이스가 즉시 반환하는 것은 task_id입니다;이후 다음을 수행할 수 있습니다:
- 폴링:
POST /kling/tasks, body{ "action": "retrieve", "id": "<task_id>" }(무료) - 콜백:생성이 완료된 후, 결과를 귀하의
callback_url로 POST
전체 워크플로: 말하는 사진(image2video → lip-sync)
오류 응답
주의 사항
video_id는 반드시 30일 이내에 생성된 Kling 비디오여야 하며, 5초 또는 10초여야 합니다. 그렇지 않으면video_url을 사용하여 제약 조건에 맞는 비디오를 전달하세요.- 입력 비디오는 선명한 정면 얼굴, 1인을 권장하며, 립싱크 효과가 가장 좋습니다.
- 오디오/텍스트 길이는 비디오 길이와 일치해야 합니다(오디오는 비디오 길이를 초과하지 않음).
- 과금은 성공 시 발생합니다(회당 2.45 Credits). 매개변수 검증 실패(4xx)는 과금되지 않습니다.

