Skip to main content
Перетворення аудіо в текст, повністю сумісно з OpenAI /v1/audio/transcriptions. Будь-який SDK OpenAI просто вказує base_url на https://api.acedata.cloud, а ключ замінює на ваш AceData Token, і ви можете використовувати його безпосередньо. Підтримує звичайну повну відповідь, а також підтримує інкрементальне транскрибування gpt-transcribe через SSE.
  • Адреса запиту: POST https://api.acedata.cloud/v1/audio/transcriptions (псевдонім POST /openai/audio/transcriptions)
  • Аутентифікація: заголовок запиту Authorization: Bearer {token}
  • Формат запиту: multipart/form-data
  • Оплата: оплата за тривалість аудіо (див. таблицю нижче), менше 1 секунди оплачується як 1 секунда.

Параметри запиту

Яку модель вибрати

Потрібні субтитри або часові мітки на рівні слів → whisper-1; для інших сценаріїв рекомендується gpt-transcribe (більш точний і дешевший).

Приклад

Повернення:
Китайське аудіо також підтримується, не потрібно вказувати мову:

Генерація субтитрів

Встановіть response_format на srt або vtt, щоб безпосередньо отримати готовий файл субтитрів:
Повернене вміст (тип вмісту: text/plain):

Часові мітки на рівні слів

Якщо потрібно знати час початку та закінчення кожного слова, використовуйте verbose_json разом з timestamp_granularities[]=word:
Повернення:

Потокове транскрибування

gpt-transcribe може повертати Content-Type: text/event-stream через stream=true. Сервіс надсилає події, сумісні з OpenAI: transcript.text.delta несе інкрементальний текст, transcript.text.done несе повний текст і usage, що вказує на нормальне завершення.
Приклад потоку подій:
Отримання transcript.text.done означає нормальне завершення. Якщо обробка не вдалася після встановлення потоку, з’єднання завершиться після події event: error; активне відключення клієнта скасує цю обробку, не продовжуючи генерувати в фоновому режимі. whisper-1, навіть якщо передати stream=true, все ще повертає звичайну не потокову відповідь.

Використання офіційного SDK

Ціни

Оплата за фактичну тривалість аудіо, менше 1 секунди рахуються як 1 секунда, максимальна тривалість однієї транскрипції - 1 година.

Зверніть увагу

  • Максимальний розмір одного файлу 25 MB. Якщо перевищує, спочатку розділіть або стисніть (зниження бітрейту зазвичай достатньо, вимоги до якості звуку для розпізнавання мови не високі).
  • gpt-transcribe підтримує stream=true SSE; whisper-1 ігнорує stream і повертає повний результат.
  • Параметри відповідають офіційному OpenAI /v1/audio/transcriptions, офіційний SDK потрібно лише змінити base_url.
  • include[], chunking_strategy, known_speaker_names[], known_speaker_references[] належать до наших не представлених моделей транскрипції, передача призведе до повернення 400, а не до тихого ігнорування. Специфічні параметри моделі (timestamp_granularities[] для whisper-1, languages[]/keywords[] для gpt-transcribe) також повернуть 400, якщо передані до несумісної моделі.
  • Запити можуть займати багато часу, рекомендується встановити тайм-аут клієнта не менше 300 секунд.

Код помилки