Skip to main content
Преобразуйте аудио в текст, полностью совместимо с OpenAI /v1/audio/transcriptions. Любой SDK OpenAI просто указывает base_url на https://api.acedata.cloud и заменяет ключ на ваш AceData Token для непосредственного использования. Поддерживает обычный полный ответ, а также инкрементальную транскрипцию SSE для gpt-transcribe.
  • Адрес запроса: POST https://api.acedata.cloud/v1/audio/transcriptions (псевдоним POST /openai/audio/transcriptions)
  • Аутентификация: заголовок запроса Authorization: Bearer {token}
  • Формат запроса: multipart/form-data
  • Оплата: по длительности аудио (см. таблицу ниже), менее 1 секунды считается как 1 секунда.

Параметры запроса

Какой модель выбрать

Нужны субтитры или временные метки на уровне слов → whisper-1; для остальных случаев рекомендуется gpt-transcribe (более точно и дешевле).

Пример

Возврат:
Китайское аудио также поддерживается, язык указывать не нужно:

Генерация субтитров

Установите response_format в srt или vtt, чтобы получить готовый файл субтитров:
Возвращаемое содержимое (Content-Type: text/plain):

Временные метки на уровне слов

Если нужны временные метки для каждого слова, используйте verbose_json вместе с timestamp_granularities[]=word:
Возврат:

Потоковая транскрипция

gpt-transcribe может возвращать Content-Type: text/event-stream с stream=true. Сервис будет отправлять события, совместимые с OpenAI: transcript.text.delta содержит инкрементальный текст, transcript.text.done содержит полный текст и usage, указывая на нормальное завершение.
Пример потока событий:
Получение transcript.text.done означает нормальное завершение. Если после установления потока произойдет ошибка обработки, соединение завершится после события event: error; если клиент отключится, это отменит текущую обработку и не будет продолжать в фоновом режиме. whisper-1, даже если передан stream=true, все равно вернет обычный не потоковый ответ.

Использование официального SDK

Цены

Оплата производится по фактической продолжительности аудио, менее 1 секунды округляется до 1 секунды, максимальная продолжительность одной транскрипции — 1 час.

Важные замечания

  • Максимальный размер одного файла 25 MB. Если превышает, сначала разделите или сожмите (обычно достаточно снизить битрейт, требования к качеству звука для распознавания речи не высоки).
  • gpt-transcribe поддерживает stream=true SSE; whisper-1 игнорирует stream и возвращает полный результат.
  • Параметры соответствуют официальному OpenAI /v1/audio/transcriptions, официальный SDK требует только изменения base_url для использования.
  • include[], chunking_strategy, known_speaker_names[], known_speaker_references[] относятся к нашим не выпущенным моделям транскрипции, передача приведет к ошибке 400, а не к тихому игнорированию. Специфические параметры модели (timestamp_granularities[] для whisper-1, languages[]/keywords[] для gpt-transcribe) также вернут 400 при передаче неподдерживаемым моделям.
  • Запросы могут занимать много времени, рекомендуется устанавливать тайм-аут клиента не менее 300 секунд.

Коды ошибок