Skip to main content
Transkribieren Sie Audio in Text, vollständig kompatibel mit OpenAI’s /v1/audio/transcriptions. Jedes OpenAI SDK muss lediglich die base_url auf https://api.acedata.cloud setzen und den Schlüssel durch Ihr AceData Token ersetzen, um direkt verwendet zu werden. Unterstützt vollständige Antworten sowie die SSE-Inkrementaltranskription von gpt-transcribe.
  • Anforderungsadresse: POST https://api.acedata.cloud/v1/audio/transcriptions (Alias POST /openai/audio/transcriptions)
  • Authentifizierung: Anfrage-Header Authorization: Bearer {token}
  • Anforderungsformat: multipart/form-data
  • Abrechnung: Abrechnung nach Audio-Dauer (siehe Tabelle unten), weniger als 1 Sekunde wird als 1 Sekunde berechnet.

Anfrageparameter

Welches Modell wählen

Benötigen Sie Untertitel oder Wortzeitstempel → whisper-1; für alle anderen Szenarien wird gpt-transcribe empfohlen (genauer und günstiger).

Beispiel

Rückgabe:
Chinesische Audios werden ebenfalls unterstützt, ohne die Sprache anzugeben:

Untertitel generieren

Setzen Sie response_format auf srt oder vtt, um direkt eine verwendbare Untertiteldatei zu erhalten:
Rückgabeinhalt (Content-Type: text/plain):

Wortzeitstempel

Wenn die Start- und Endzeiten jedes Wortes benötigt werden, verwenden Sie verbose_json zusammen mit timestamp_granularities[]=word:
Rückgabe:

Stream-Transkription

gpt-transcribe kann durch stream=true Content-Type: text/event-stream zurückgeben. Der Dienst sendet OpenAI-kompatible Ereignisse unverändert: transcript.text.delta enthält inkrementellen Text, transcript.text.done enthält den vollständigen Text und usage und zeigt einen normalen Abschluss an.
Ereignisstrombeispiel:
Der Empfang von transcript.text.done zeigt einen normalen Abschluss an. Wenn die Verarbeitung nach dem Aufbau des Streams fehlschlägt, wird die Verbindung nach dem Ereignis event: error beendet; ein aktives Trennen des Clients annulliert die Verarbeitung und es wird nicht im Hintergrund weiter generiert. whisper-1 gibt auch bei Übertragung von stream=true weiterhin eine normale nicht-streamende Antwort zurück.

Verwendung des offiziellen SDK

Preise

Abrechnung erfolgt nach der tatsächlichen Dauer des Audios, weniger als 1 Sekunde wird als 1 Sekunde berechnet, maximal 1 Stunde pro Einzelvorgang.

Hinweise

  • Einzelne Dateien maximal 25 MB. Bei Überschreitung bitte zuerst aufteilen oder komprimieren (eine Senkung der Bitrate reicht normalerweise aus, die Spracherkennung hat keine hohen Anforderungen an die Audioqualität).
  • gpt-transcribe unterstützt stream=true SSE; whisper-1 ignoriert stream und gibt das vollständige Ergebnis zurück.
  • Die Parameter sind mit den offiziellen OpenAI /v1/audio/transcriptions konsistent, das offizielle SDK muss nur die base_url ändern, um verwendet zu werden.
  • include[], chunking_strategy, known_speaker_names[], known_speaker_references[] gehören zu unseren noch nicht veröffentlichten Transkriptionsmodellen, die Übermittlung führt zu einem 400-Fehler anstelle einer stillen Ignorierung. Modell-spezifische Parameter (timestamp_granularities[] für whisper-1, languages[]/keywords[] für gpt-transcribe) führen ebenfalls zu einem 400-Fehler, wenn sie an nicht unterstützte Modelle übergeben werden.
  • Anfragen können zeitaufwendig sein, es wird empfohlen, die Timeout-Einstellungen des Clients auf mindestens 300 Sekunden zu setzen.

Fehlercodes