/v1/audio/transcriptions。任何 OpenAI SDK 只需把 base_url 指向 https://api.acedata.cloud、把密鑰換成你的 AceData Token 即可直接使用。支持普通完整響應,也支持 gpt-transcribe 的 SSE 增量轉寫。
- 請求地址:
POST https://api.acedata.cloud/v1/audio/transcriptions(別名POST /openai/audio/transcriptions) - 鑑權:請求頭
Authorization: Bearer {token} - 請求格式:
multipart/form-data - 計費:按音頻時長計費(見下表),不足 1 秒按 1 秒計。
請求參數
選哪個模型
需要字幕或詞級時間戳 →
whisper-1;其餘場景推薦 gpt-transcribe(更準且更便宜)。
示例
生成字幕
把response_format 設為 srt 或 vtt,直接得到可用的字幕文件:
Content-Type: text/plain):
詞級時間戳
需要每個詞的起止時間時,用verbose_json 搭配 timestamp_granularities[]=word:
流式轉寫
gpt-transcribe 可通過 stream=true 返回 Content-Type: text/event-stream。服務會原樣發送 OpenAI 兼容事件:
transcript.text.delta 攜帶增量文字,transcript.text.done 攜帶完整文字和 usage 並表示正常完成。
transcript.text.done 才表示正常完成。若流建立後處理失敗,連接會在 event: error 事件後結束;客戶端主動斷開會取消本次處理,不會繼續在後台生成。whisper-1 即使傳入 stream=true 也仍按普通非流式響應返回。
使用官方 SDK
價格
按音頻實際時長計費,不足 1 秒按 1 秒計,單次最長按 1 小時封頂。
注意事項
- 單個文件最大 25 MB。超過請先分段或壓縮(降低碼率通常即可,語音識別對音質要求不高)。
gpt-transcribe支持stream=trueSSE;whisper-1會忽略stream並返回完整結果。- 參數與 OpenAI 官方
/v1/audio/transcriptions保持一致,官方 SDK 只需改base_url即可使用。 include[]、chunking_strategy、known_speaker_names[]、known_speaker_references[]屬於我們未上架的 轉寫模型,傳入會返回 400 而不是靜默忽略。模型專屬參數(timestamp_granularities[]之於whisper-1、languages[]/keywords[]之於gpt-transcribe)傳給不支持的模型時同樣返回 400。- 請求較為耗時,建議客戶端超時設置不低於 300 秒。

