/v1/audio/transcriptions と互換性があります。任意の OpenAI SDK は base_url を https://api.acedata.cloud に設定し、キーをあなたの AceData Token に置き換えるだけで直接使用できます。通常の完全な応答をサポートし、gpt-transcribe の SSE 増分転写もサポートしています。
- リクエスト URL:
POST https://api.acedata.cloud/v1/audio/transcriptions(別名POST /openai/audio/transcriptions) - 認証:リクエストヘッダー
Authorization: Bearer {token} - リクエスト形式:
multipart/form-data - 課金:音声の長さに基づいて課金(下表参照)、1秒未満は1秒として計算されます。
リクエストパラメータ
どのモデルを選ぶか
字幕や単語レベルのタイムスタンプが必要 →
whisper-1;その他のシナリオでは gpt-transcribe を推奨(より正確で安価)。
例
字幕の生成
response_format を srt または vtt に設定すると、直接使用可能な字幕ファイルが得られます:
Content-Type: text/plain):
単語レベルのタイムスタンプ
各単語の開始と終了時間が必要な場合、verbose_json を使用し、timestamp_granularities[]=word を組み合わせます:
ストリーミング転写
gpt-transcribe は stream=true を使用して Content-Type: text/event-stream を返すことができます。サービスは OpenAI 互換のイベントをそのまま送信します:
transcript.text.delta は増分テキストを含み、transcript.text.done は完全なテキストと usage を含み、正常に完了したことを示します。
transcript.text.done を受信した時点で正常に完了したことを示します。ストリームが確立された後に処理が失敗した場合、接続は event: error イベントの後に終了します;クライアントが積極的に切断すると、今回の処理はキャンセルされ、バックグラウンドで生成され続けることはありません。whisper-1 は stream=true を渡しても、通常の非ストリーミング応答として返されます。
公式 SDK の使用
価格
音声の実際の長さに基づいて請求され、1秒未満は1秒として計算され、単回の最大は1時間に制限されます。
注意事項
- 単一ファイルの最大 25 MB。超える場合は、事前に分割または圧縮してください(ビットレートを下げるだけで通常は十分で、音声認識は音質に対する要求が高くありません)。
gpt-transcribeはstream=trueSSE をサポートします;whisper-1はstreamを無視し、完全な結果を返します。- パラメータは OpenAI の公式
/v1/audio/transcriptionsと一致しており、公式 SDK はbase_urlを変更するだけで使用できます。 include[]、chunking_strategy、known_speaker_names[]、known_speaker_references[]は、私たちがまだ提供していない 転写モデルに属し、渡すと 400 を返し、静かに無視されることはありません。モデル専用のパラメータ(timestamp_granularities[]はwhisper-1に、languages[]/keywords[]はgpt-transcribeに)をサポートされていないモデルに渡すと同様に 400 を返します。- リクエストは時間がかかるため、クライアントのタイムアウト設定は 300 秒以上を推奨します。

