/v1/audio/transcriptions. Jedes OpenAI SDK muss lediglich die base_url auf https://api.acedata.cloud setzen und den Schlüssel durch Ihr AceData Token ersetzen, um direkt verwendet zu werden. Unterstützt vollständige Antworten sowie die SSE-Inkrementaltranskription von gpt-transcribe.
- Anforderungsadresse:
POST https://api.acedata.cloud/v1/audio/transcriptions(AliasPOST /openai/audio/transcriptions) - Authentifizierung: Anfrage-Header
Authorization: Bearer {token} - Anforderungsformat:
multipart/form-data - Abrechnung: Abrechnung nach Audio-Dauer (siehe Tabelle unten), weniger als 1 Sekunde wird als 1 Sekunde berechnet.
Anfrageparameter
Welches Modell wählen
Benötigen Sie Untertitel oder Wortzeitstempel →
whisper-1; für alle anderen Szenarien wird gpt-transcribe empfohlen (genauer und günstiger).
Beispiel
Untertitel generieren
Setzen Sieresponse_format auf srt oder vtt, um direkt eine verwendbare Untertiteldatei zu erhalten:
Content-Type: text/plain):
Wortzeitstempel
Wenn die Start- und Endzeiten jedes Wortes benötigt werden, verwenden Sieverbose_json zusammen mit timestamp_granularities[]=word:
Stream-Transkription
gpt-transcribe kann durch stream=true Content-Type: text/event-stream zurückgeben. Der Dienst sendet OpenAI-kompatible Ereignisse unverändert:
transcript.text.delta enthält inkrementellen Text, transcript.text.done enthält den vollständigen Text und usage und zeigt einen normalen Abschluss an.
transcript.text.done zeigt einen normalen Abschluss an. Wenn die Verarbeitung nach dem Aufbau des Streams fehlschlägt, wird die Verbindung nach dem Ereignis event: error beendet; ein aktives Trennen des Clients annulliert die Verarbeitung und es wird nicht im Hintergrund weiter generiert. whisper-1 gibt auch bei Übertragung von stream=true weiterhin eine normale nicht-streamende Antwort zurück.
Verwendung des offiziellen SDK
Preise
Abrechnung erfolgt nach der tatsächlichen Dauer des Audios, weniger als 1 Sekunde wird als 1 Sekunde berechnet, maximal 1 Stunde pro Einzelvorgang.
Hinweise
- Einzelne Dateien maximal 25 MB. Bei Überschreitung bitte zuerst aufteilen oder komprimieren (eine Senkung der Bitrate reicht normalerweise aus, die Spracherkennung hat keine hohen Anforderungen an die Audioqualität).
gpt-transcribeunterstütztstream=trueSSE;whisper-1ignoriertstreamund gibt das vollständige Ergebnis zurück.- Die Parameter sind mit den offiziellen OpenAI
/v1/audio/transcriptionskonsistent, das offizielle SDK muss nur diebase_urländern, um verwendet zu werden. include[],chunking_strategy,known_speaker_names[],known_speaker_references[]gehören zu unseren noch nicht veröffentlichten Transkriptionsmodellen, die Übermittlung führt zu einem 400-Fehler anstelle einer stillen Ignorierung. Modell-spezifische Parameter (timestamp_granularities[]fürwhisper-1,languages[]/keywords[]fürgpt-transcribe) führen ebenfalls zu einem 400-Fehler, wenn sie an nicht unterstützte Modelle übergeben werden.- Anfragen können zeitaufwendig sein, es wird empfohlen, die Timeout-Einstellungen des Clients auf mindestens 300 Sekunden zu setzen.

