/v1/audio/transcriptions من OpenAI. أي SDK من OpenAI يحتاج فقط إلى توجيه base_url إلى https://api.acedata.cloud، واستبدال المفتاح برمز AceData الخاص بك لاستخدامه مباشرة. يدعم الاستجابة الكاملة العادية، كما يدعم التحويل التدريجي لـ gpt-transcribe عبر SSE.
- عنوان الطلب:
POST https://api.acedata.cloud/v1/audio/transcriptions(اسم مستعارPOST /openai/audio/transcriptions) - المصادقة: رأس الطلب
Authorization: Bearer {token} - تنسيق الطلب:
multipart/form-data - الفوترة: يتم احتساب الرسوم بناءً على مدة الصوت (انظر الجدول أدناه)، وأي مدة أقل من 1 ثانية يتم احتسابها كـ 1 ثانية.
معلمات الطلب
أي نموذج تختار
تحتاج إلى ترجمة أو طابع زمني على مستوى الكلمة →
whisper-1؛ باقي السيناريوهات يوصى بـ gpt-transcribe (أكثر دقة وأرخص).
مثال
إنشاء ترجمة
قم بتعيينresponse_format إلى srt أو vtt، للحصول على ملف ترجمة قابل للاستخدام مباشرة:
Content-Type: text/plain ):
الطابع الزمني على مستوى الكلمة
عند الحاجة إلى وقت البدء والانتهاء لكل كلمة، استخدمverbose_json مع timestamp_granularities[]=word:
التحويل التدريجي
يمكن لـgpt-transcribe إرجاع Content-Type: text/event-stream عبر stream=true. ستقوم الخدمة بإرسال أحداث متوافقة مع OpenAI كما هي:
transcript.text.delta يحمل النص التدريجي، و transcript.text.done يحمل النص الكامل و usage ويشير إلى الانتهاء بشكل طبيعي.
transcript.text.done فقط يشير إلى الانتهاء بشكل طبيعي. إذا فشل المعالجة بعد إنشاء التدفق، ستنتهي الاتصال بعد حدث event: error؛ إذا قام العميل بفصل الاتصال، سيتم إلغاء المعالجة الحالية، ولن تستمر في الخلفية. حتى إذا تم تمرير stream=true، فإن whisper-1 سيظل يعيد استجابة عادية غير تدفقية.
استخدام SDK الرسمي
الأسعار
يتم احتساب الرسوم بناءً على الطول الفعلي للصوت، وأي جزء أقل من 1 ثانية يتم احتسابه كـ 1 ثانية، وأقصى مدة لمرة واحدة هي 1 ساعة.
ملاحظات
- الحد الأقصى لحجم الملف الواحد هو 25 ميغابايت. إذا تجاوز ذلك، يرجى تقسيمه أو ضغطه (تقليل معدل البت عادة يكفي، حيث أن التعرف على الصوت لا يتطلب جودة صوت عالية).
- يدعم
gpt-transcribestream=trueSSE؛ بينما سيتجاهلwhisper-1streamويعيد النتيجة الكاملة. - المعلمات متوافقة مع OpenAI الرسمية
/v1/audio/transcriptions، يمكن استخدام SDK الرسمي فقط بتغييرbase_url. include[]،chunking_strategy،known_speaker_names[]،known_speaker_references[]هي نماذج تحويل لم يتم طرحها بعد، تمريرها سيعيد 400 بدلاً من تجاهلها بصمت. المعلمات الخاصة بالنموذج (timestamp_granularities[]لـwhisper-1،languages[]/keywords[]لـgpt-transcribe) ستعيد أيضًا 400 عند تمريرها لنموذج غير مدعوم.- الطلبات تستغرق وقتًا طويلاً، يُنصح بتعيين مهلة العميل لا تقل عن 300 ثانية.

