Skip to main content
اجعل فيديو Kling موجودًا بالفعل (5 ثوانٍ أو 10 ثوانٍ) “يتحدث” وفقًا للصوت أو النص — أي مزامنة الشفاه (Lip Sync). وبالاقتران مع image2video في /kling/videos (لجعل الصور تتحرك)، يمكن ربطها في سير عمل كامل لـ “صور تتحدث / تقديم رقمي بشري”.
هذه الواجهة عبارة عن تغليف ملائم بخطوة واحدة توفره AceDataCloud، وموجه لسيناريوهات التشغيل الشائعة بالصوت/النص؛ وهي ليست مطابقة للحقول الخاصة بواجهة Kling الرسمية متعددة الخطوات «التعرف على الوجه → Advanced Lip Sync». يُرجى الاعتماد على جدول المعلمات في هذه الصفحة.
  • عنوان الواجهة: POST https://api.acedata.cloud/kling/lip-sync
  • تنسيق الطلب: application/json
  • تنسيق الاستجابة: application/json
  • الفوترة: 2.45 Credits لكل استدعاء ناجح (ثابتة)

رؤوس الطلب (Request Headers)

معلمات الطلب (Request Body)

أمثلة الطلب

1) التشغيل بالصوت (audio2video)

2) التشغيل بالنص (text2video)

مثال الاستجابة (نجاح متزامن)

الوضع غير المتزامن والاستعلام

عند تمرير callback_url أو async: true، تعيد الواجهة فورًا task_id؛ وبعد ذلك يمكن:
  • الاستعلام الدوري: POST /kling/tasks، الجسم { "action": "retrieve", "id": "<task_id>" } (مجاني)
  • رد النداء: بعد اكتمال التوليد، تُرسل النتيجة عبر POST إلى callback_url الخاص بك

العملية الكاملة: صور تتحدث (image2video → lip-sync)

استجابة الخطأ

ملاحظات

  • يجب أن يكون video_id لفيديو قابل تم إنشاؤه خلال 30 يومًا، وأن تكون مدته 5 ثوانٍ أو 10 ثوانٍ؛ وإلا يُرجى استخدام video_url لتمرير فيديو يستوفي القيود.
  • يُنصح بأن يكون فيديو الإدخال لوجه أمامي واضح، وشخص واحد، للحصول على أفضل تأثير لمزامنة حركة الشفاه.
  • يجب أن تتوافق مدة الصوت/النص مع مدة الفيديو (ألا يتجاوز الصوت طول الفيديو).
  • تتم الفوترة عند النجاح (2.45 Credits/مرة)؛ ولا تُفرض رسوم عند فشل التحقق من المعلمات (4xx).