Skip to main content
將音頻轉寫為文字,完全兼容 OpenAI 的 /v1/audio/transcriptions。任何 OpenAI SDK 只需把 base_url 指向 https://api.acedata.cloud、把密鑰換成你的 AceData Token 即可直接使用。支持普通完整響應,也支持 gpt-transcribe 的 SSE 增量轉寫。
  • 請求地址:POST https://api.acedata.cloud/v1/audio/transcriptions(別名 POST /openai/audio/transcriptions)
  • 鑑權:請求頭 Authorization: Bearer {token}
  • 請求格式:multipart/form-data
  • 計費:按音頻時長計費(見下表),不足 1 秒按 1 秒計。

請求參數

選哪個模型

需要字幕或詞級時間戳 → whisper-1;其餘場景推薦 gpt-transcribe(更準且更便宜)。

示例

返回:
中文音頻同樣支持,無需指定語種:

生成字幕

把 response_format 設為 srt 或 vtt,直接得到可用的字幕文件:
返回內容(Content-Type: text/plain):

詞級時間戳

需要每個詞的起止時間時,用 verbose_json 搭配 timestamp_granularities[]=word:
返回:

流式轉寫

gpt-transcribe 可通過 stream=true 返回 Content-Type: text/event-stream。服務會原樣發送 OpenAI 兼容事件: transcript.text.delta 攜帶增量文字,transcript.text.done 攜帶完整文字和 usage 並表示正常完成。
事件流示例:
收到 transcript.text.done 才表示正常完成。若流建立後處理失敗,連接會在 event: error 事件後結束;客戶端主動斷開會取消本次處理,不會繼續在後台生成。whisper-1 即使傳入 stream=true 也仍按普通非流式響應返回。

使用官方 SDK

價格

按音頻實際時長計費,不足 1 秒按 1 秒計,單次最長按 1 小時封頂。

注意事項

  • 單個文件最大 25 MB。超過請先分段或壓縮(降低碼率通常即可,語音識別對音質要求不高)。
  • gpt-transcribe 支持 stream=true SSE;whisper-1 會忽略 stream 並返回完整結果。
  • 參數與 OpenAI 官方 /v1/audio/transcriptions 保持一致,官方 SDK 只需改 base_url 即可使用。
  • include[]、chunking_strategy、known_speaker_names[]、known_speaker_references[] 屬於我們未上架的 轉寫模型,傳入會返回 400 而不是靜默忽略。模型專屬參數(timestamp_granularities[] 之於 whisper-1、 languages[]/keywords[] 之於 gpt-transcribe)傳給不支持的模型時同樣返回 400。
  • 請求較為耗時,建議客戶端超時設置不低於 300 秒。

錯誤碼