/v1/audio/transcriptions。任何 OpenAI SDK 只需把 base_url 指向 https://api.acedata.cloud、把密钥换成你的 AceData Token 即可直接使用。支持普通完整响应,也支持 gpt-transcribe 的 SSE 增量转写。
- 请求地址:
POST https://api.acedata.cloud/v1/audio/transcriptions(别名POST /openai/audio/transcriptions) - 鉴权:请求头
Authorization: Bearer {token} - 请求格式:
multipart/form-data - 计费:按音频时长计费(见下表),不足 1 秒按 1 秒计。
请求参数
选哪个模型
需要字幕或词级时间戳 →
whisper-1;其余场景推荐 gpt-transcribe(更准且更便宜)。
示例
生成字幕
把response_format 设为 srt 或 vtt,直接得到可用的字幕文件:
Content-Type: text/plain):
词级时间戳
需要每个词的起止时间时,用verbose_json 搭配 timestamp_granularities[]=word:
流式转写
gpt-transcribe 可通过 stream=true 返回 Content-Type: text/event-stream。服务会原样发送 OpenAI 兼容事件:
transcript.text.delta 携带增量文字,transcript.text.done 携带完整文字和 usage 并表示正常完成。
transcript.text.done 才表示正常完成。若流建立后处理失败,连接会在 event: error 事件后结束;客户端主动断开会取消本次处理,不会继续在后台生成。whisper-1 即使传入 stream=true 也仍按普通非流式响应返回。
使用官方 SDK
价格
按音频实际时长计费,不足 1 秒按 1 秒计,单次最长按 1 小时封顶。
注意事项
- 单个文件最大 25 MB。超过请先分段或压缩(降低码率通常即可,语音识别对音质要求不高)。
gpt-transcribe支持stream=trueSSE;whisper-1会忽略stream并返回完整结果。- 参数与 OpenAI 官方
/v1/audio/transcriptions保持一致,官方 SDK 只需改base_url即可使用。 include[]、chunking_strategy、known_speaker_names[]、known_speaker_references[]属于我们未上架的 转写模型,传入会返回 400 而不是静默忽略。模型专属参数(timestamp_granularities[]之于whisper-1、languages[]/keywords[]之于gpt-transcribe)传给不支持的模型时同样返回 400。- 请求较为耗时,建议客户端超时设置不低于 300 秒。

