/v1/audio/transcriptions. Любой SDK OpenAI просто указывает base_url на https://api.acedata.cloud и заменяет ключ на ваш AceData Token для непосредственного использования. Поддерживает обычный полный ответ, а также инкрементальную транскрипцию SSE для gpt-transcribe.
- Адрес запроса:
POST https://api.acedata.cloud/v1/audio/transcriptions(псевдонимPOST /openai/audio/transcriptions) - Аутентификация: заголовок запроса
Authorization: Bearer {token} - Формат запроса:
multipart/form-data - Оплата: по длительности аудио (см. таблицу ниже), менее 1 секунды считается как 1 секунда.
Параметры запроса
Какой модель выбрать
Нужны субтитры или временные метки на уровне слов →
whisper-1; для остальных случаев рекомендуется gpt-transcribe (более точно и дешевле).
Пример
Генерация субтитров
Установитеresponse_format в srt или vtt, чтобы получить готовый файл субтитров:
Content-Type: text/plain):
Временные метки на уровне слов
Если нужны временные метки для каждого слова, используйтеverbose_json вместе с timestamp_granularities[]=word:
Потоковая транскрипция
gpt-transcribe может возвращать Content-Type: text/event-stream с stream=true. Сервис будет отправлять события, совместимые с OpenAI:
transcript.text.delta содержит инкрементальный текст, transcript.text.done содержит полный текст и usage, указывая на нормальное завершение.
transcript.text.done означает нормальное завершение. Если после установления потока произойдет ошибка обработки, соединение завершится после события event: error; если клиент отключится, это отменит текущую обработку и не будет продолжать в фоновом режиме. whisper-1, даже если передан stream=true, все равно вернет обычный не потоковый ответ.
Использование официального SDK
Цены
Оплата производится по фактической продолжительности аудио, менее 1 секунды округляется до 1 секунды, максимальная продолжительность одной транскрипции — 1 час.
Важные замечания
- Максимальный размер одного файла 25 MB. Если превышает, сначала разделите или сожмите (обычно достаточно снизить битрейт, требования к качеству звука для распознавания речи не высоки).
gpt-transcribeподдерживаетstream=trueSSE;whisper-1игнорируетstreamи возвращает полный результат.- Параметры соответствуют официальному OpenAI
/v1/audio/transcriptions, официальный SDK требует только измененияbase_urlдля использования. include[],chunking_strategy,known_speaker_names[],known_speaker_references[]относятся к нашим не выпущенным моделям транскрипции, передача приведет к ошибке 400, а не к тихому игнорированию. Специфические параметры модели (timestamp_granularities[]дляwhisper-1,languages[]/keywords[]дляgpt-transcribe) также вернут 400 при передаче неподдерживаемым моделям.- Запросы могут занимать много времени, рекомендуется устанавливать тайм-аут клиента не менее 300 секунд.

