Skip to main content
音声をテキストに転写します。完全に OpenAI の /v1/audio/transcriptions と互換性があります。任意の OpenAI SDK は base_url を https://api.acedata.cloud に設定し、キーをあなたの AceData Token に置き換えるだけで直接使用できます。通常の完全な応答をサポートし、gpt-transcribe の SSE 増分転写もサポートしています。
  • リクエスト URL:POST https://api.acedata.cloud/v1/audio/transcriptions(別名 POST /openai/audio/transcriptions)
  • 認証:リクエストヘッダー Authorization: Bearer {token}
  • リクエスト形式:multipart/form-data
  • 課金:音声の長さに基づいて課金(下表参照)、1秒未満は1秒として計算されます。

リクエストパラメータ

どのモデルを選ぶか

字幕や単語レベルのタイムスタンプが必要 → whisper-1;その他のシナリオでは gpt-transcribe を推奨(より正確で安価)。

例

返却:
中国語の音声もサポートされており、言語を指定する必要はありません:

字幕の生成

response_format を srt または vtt に設定すると、直接使用可能な字幕ファイルが得られます:
返却内容(Content-Type: text/plain):

単語レベルのタイムスタンプ

各単語の開始と終了時間が必要な場合、verbose_json を使用し、timestamp_granularities[]=word を組み合わせます:
返却:

ストリーミング転写

gpt-transcribe は stream=true を使用して Content-Type: text/event-stream を返すことができます。サービスは OpenAI 互換のイベントをそのまま送信します: transcript.text.delta は増分テキストを含み、transcript.text.done は完全なテキストと usage を含み、正常に完了したことを示します。
イベントストリームの例:
transcript.text.done を受信した時点で正常に完了したことを示します。ストリームが確立された後に処理が失敗した場合、接続は event: error イベントの後に終了します;クライアントが積極的に切断すると、今回の処理はキャンセルされ、バックグラウンドで生成され続けることはありません。whisper-1 は stream=true を渡しても、通常の非ストリーミング応答として返されます。

公式 SDK の使用

価格

音声の実際の長さに基づいて請求され、1秒未満は1秒として計算され、単回の最大は1時間に制限されます。

注意事項

  • 単一ファイルの最大 25 MB。超える場合は、事前に分割または圧縮してください(ビットレートを下げるだけで通常は十分で、音声認識は音質に対する要求が高くありません)。
  • gpt-transcribe は stream=true SSE をサポートします;whisper-1 は stream を無視し、完全な結果を返します。
  • パラメータは OpenAI の公式 /v1/audio/transcriptions と一致しており、公式 SDK は base_url を変更するだけで使用できます。
  • include[]、chunking_strategy、known_speaker_names[]、known_speaker_references[] は、私たちがまだ提供していない 転写モデルに属し、渡すと 400 を返し、静かに無視されることはありません。モデル専用のパラメータ(timestamp_granularities[] は whisper-1 に、 languages[]/keywords[] は gpt-transcribe に)をサポートされていないモデルに渡すと同様に 400 を返します。
  • リクエストは時間がかかるため、クライアントのタイムアウト設定は 300 秒以上を推奨します。

エラーコード