/v1/audio/transcriptions. Будь-який SDK OpenAI просто вказує base_url на https://api.acedata.cloud, а ключ замінює на ваш AceData Token, і ви можете використовувати його безпосередньо. Підтримує звичайну повну відповідь, а також підтримує інкрементальне транскрибування gpt-transcribe через SSE.
- Адреса запиту:
POST https://api.acedata.cloud/v1/audio/transcriptions(псевдонімPOST /openai/audio/transcriptions) - Аутентифікація: заголовок запиту
Authorization: Bearer {token} - Формат запиту:
multipart/form-data - Оплата: оплата за тривалість аудіо (див. таблицю нижче), менше 1 секунди оплачується як 1 секунда.
Параметри запиту
Яку модель вибрати
Потрібні субтитри або часові мітки на рівні слів →
whisper-1; для інших сценаріїв рекомендується gpt-transcribe (більш точний і дешевший).
Приклад
Генерація субтитрів
Встановітьresponse_format на srt або vtt, щоб безпосередньо отримати готовий файл субтитрів:
Часові мітки на рівні слів
Якщо потрібно знати час початку та закінчення кожного слова, використовуйтеverbose_json разом з timestamp_granularities[]=word:
Потокове транскрибування
gpt-transcribe може повертати Content-Type: text/event-stream через stream=true. Сервіс надсилає події, сумісні з OpenAI:
transcript.text.delta несе інкрементальний текст, transcript.text.done несе повний текст і usage, що вказує на нормальне завершення.
transcript.text.done означає нормальне завершення. Якщо обробка не вдалася після встановлення потоку, з’єднання завершиться після події event: error; активне відключення клієнта скасує цю обробку, не продовжуючи генерувати в фоновому режимі. whisper-1, навіть якщо передати stream=true, все ще повертає звичайну не потокову відповідь.
Використання офіційного SDK
Ціни
Оплата за фактичну тривалість аудіо, менше 1 секунди рахуються як 1 секунда, максимальна тривалість однієї транскрипції - 1 година.
Зверніть увагу
- Максимальний розмір одного файлу 25 MB. Якщо перевищує, спочатку розділіть або стисніть (зниження бітрейту зазвичай достатньо, вимоги до якості звуку для розпізнавання мови не високі).
gpt-transcribeпідтримуєstream=trueSSE;whisper-1ігноруєstreamі повертає повний результат.- Параметри відповідають офіційному OpenAI
/v1/audio/transcriptions, офіційний SDK потрібно лише змінитиbase_url. include[],chunking_strategy,known_speaker_names[],known_speaker_references[]належать до наших не представлених моделей транскрипції, передача призведе до повернення 400, а не до тихого ігнорування. Специфічні параметри моделі (timestamp_granularities[]дляwhisper-1,languages[]/keywords[]дляgpt-transcribe) також повернуть 400, якщо передані до несумісної моделі.- Запити можуть займати багато часу, рекомендується встановити тайм-аут клієнта не менше 300 секунд.

