Skip to main content
تحويل الصوت إلى نص، متوافق تمامًا مع /v1/audio/transcriptions من OpenAI. أي SDK من OpenAI يحتاج فقط إلى توجيه base_url إلى https://api.acedata.cloud، واستبدال المفتاح برمز AceData الخاص بك لاستخدامه مباشرة. يدعم الاستجابة الكاملة العادية، كما يدعم التحويل التدريجي لـ gpt-transcribe عبر SSE.
  • عنوان الطلب: POST https://api.acedata.cloud/v1/audio/transcriptions (اسم مستعار POST /openai/audio/transcriptions)
  • المصادقة: رأس الطلب Authorization: Bearer {token}
  • تنسيق الطلب: multipart/form-data
  • الفوترة: يتم احتساب الرسوم بناءً على مدة الصوت (انظر الجدول أدناه)، وأي مدة أقل من 1 ثانية يتم احتسابها كـ 1 ثانية.

معلمات الطلب

أي نموذج تختار

تحتاج إلى ترجمة أو طابع زمني على مستوى الكلمة → whisper-1؛ باقي السيناريوهات يوصى بـ gpt-transcribe (أكثر دقة وأرخص).

مثال

العودة:
يدعم الصوت باللغة الصينية أيضًا، دون الحاجة لتحديد اللغة:

إنشاء ترجمة

قم بتعيين response_format إلى srt أو vtt، للحصول على ملف ترجمة قابل للاستخدام مباشرة:
محتوى العودة ( Content-Type: text/plain ):

الطابع الزمني على مستوى الكلمة

عند الحاجة إلى وقت البدء والانتهاء لكل كلمة، استخدم verbose_json مع timestamp_granularities[]=word:
العودة:

التحويل التدريجي

يمكن لـ gpt-transcribe إرجاع Content-Type: text/event-stream عبر stream=true. ستقوم الخدمة بإرسال أحداث متوافقة مع OpenAI كما هي: transcript.text.delta يحمل النص التدريجي، و transcript.text.done يحمل النص الكامل و usage ويشير إلى الانتهاء بشكل طبيعي.
مثال على تدفق الأحداث:
استلام transcript.text.done فقط يشير إلى الانتهاء بشكل طبيعي. إذا فشل المعالجة بعد إنشاء التدفق، ستنتهي الاتصال بعد حدث event: error؛ إذا قام العميل بفصل الاتصال، سيتم إلغاء المعالجة الحالية، ولن تستمر في الخلفية. حتى إذا تم تمرير stream=true، فإن whisper-1 سيظل يعيد استجابة عادية غير تدفقية.

استخدام SDK الرسمي

الأسعار

يتم احتساب الرسوم بناءً على الطول الفعلي للصوت، وأي جزء أقل من 1 ثانية يتم احتسابه كـ 1 ثانية، وأقصى مدة لمرة واحدة هي 1 ساعة.

ملاحظات

  • الحد الأقصى لحجم الملف الواحد هو 25 ميغابايت. إذا تجاوز ذلك، يرجى تقسيمه أو ضغطه (تقليل معدل البت عادة يكفي، حيث أن التعرف على الصوت لا يتطلب جودة صوت عالية).
  • يدعم gpt-transcribe stream=true SSE؛ بينما سيتجاهل whisper-1 stream ويعيد النتيجة الكاملة.
  • المعلمات متوافقة مع OpenAI الرسمية /v1/audio/transcriptions، يمكن استخدام SDK الرسمي فقط بتغيير base_url.
  • include[]، chunking_strategy، known_speaker_names[]، known_speaker_references[] هي نماذج تحويل لم يتم طرحها بعد، تمريرها سيعيد 400 بدلاً من تجاهلها بصمت. المعلمات الخاصة بالنموذج (timestamp_granularities[] لـ whisper-1، languages[]/keywords[] لـ gpt-transcribe) ستعيد أيضًا 400 عند تمريرها لنموذج غير مدعوم.
  • الطلبات تستغرق وقتًا طويلاً، يُنصح بتعيين مهلة العميل لا تقل عن 300 ثانية.

رموز الخطأ