Skip to main content
将音频转写为文字,完全兼容 OpenAI 的 /v1/audio/transcriptions。任何 OpenAI SDK 只需把 base_url 指向 https://api.acedata.cloud、把密钥换成你的 AceData Token 即可直接使用。支持普通完整响应,也支持 gpt-transcribe 的 SSE 增量转写。
  • 请求地址:POST https://api.acedata.cloud/v1/audio/transcriptions(别名 POST /openai/audio/transcriptions)
  • 鉴权:请求头 Authorization: Bearer {token}
  • 请求格式:multipart/form-data
  • 计费:按音频时长计费(见下表),不足 1 秒按 1 秒计。

请求参数

选哪个模型

需要字幕或词级时间戳 → whisper-1;其余场景推荐 gpt-transcribe(更准且更便宜)。

示例

返回:
中文音频同样支持,无需指定语种:

生成字幕

把 response_format 设为 srt 或 vtt,直接得到可用的字幕文件:
返回内容(Content-Type: text/plain):

词级时间戳

需要每个词的起止时间时,用 verbose_json 搭配 timestamp_granularities[]=word:
返回:

流式转写

gpt-transcribe 可通过 stream=true 返回 Content-Type: text/event-stream。服务会原样发送 OpenAI 兼容事件: transcript.text.delta 携带增量文字,transcript.text.done 携带完整文字和 usage 并表示正常完成。
事件流示例:
收到 transcript.text.done 才表示正常完成。若流建立后处理失败,连接会在 event: error 事件后结束;客户端主动断开会取消本次处理,不会继续在后台生成。whisper-1 即使传入 stream=true 也仍按普通非流式响应返回。

使用官方 SDK

价格

按音频实际时长计费,不足 1 秒按 1 秒计,单次最长按 1 小时封顶。

注意事项

  • 单个文件最大 25 MB。超过请先分段或压缩(降低码率通常即可,语音识别对音质要求不高)。
  • gpt-transcribe 支持 stream=true SSE;whisper-1 会忽略 stream 并返回完整结果。
  • 参数与 OpenAI 官方 /v1/audio/transcriptions 保持一致,官方 SDK 只需改 base_url 即可使用。
  • include[]、chunking_strategy、known_speaker_names[]、known_speaker_references[] 属于我们未上架的 转写模型,传入会返回 400 而不是静默忽略。模型专属参数(timestamp_granularities[] 之于 whisper-1、 languages[]/keywords[] 之于 gpt-transcribe)传给不支持的模型时同样返回 400。
  • 请求较为耗时,建议客户端超时设置不低于 300 秒。

错误码