Skip to main content
Trascrivi audio in testo, completamente compatibile con OpenAI /v1/audio/transcriptions. Qualsiasi SDK OpenAI deve semplicemente puntare base_url a https://api.acedata.cloud e sostituire la chiave con il tuo AceData Token per essere utilizzato direttamente. Supporta risposte complete e anche la trascrizione incrementale SSE di gpt-transcribe.
  • URL della richiesta: POST https://api.acedata.cloud/v1/audio/transcriptions (alias POST /openai/audio/transcriptions)
  • Autenticazione: intestazione della richiesta Authorization: Bearer {token}
  • Formato della richiesta: multipart/form-data
  • Fatturazione: fatturato in base alla durata dell’audio (vedi tabella sottostante), meno di 1 secondo fatturato come 1 secondo.

Parametri della richiesta

Quale modello scegliere

Hai bisogno di sottotitoli o timestamp a livello di parola → whisper-1; per altri scenari si consiglia gpt-transcribe (più preciso e più economico).

Esempio

Risposta:
L’audio in cinese è supportato senza dover specificare la lingua:

Generazione di sottotitoli

Imposta response_format su srt o vtt per ottenere direttamente un file di sottotitoli utilizzabile:
Contenuto restituito (Content-Type: text/plain):

Timestamp a livello di parola

Se hai bisogno dei tempi di inizio e fine di ogni parola, utilizza verbose_json insieme a timestamp_granularities[]=word:
Risposta:

Trascrizione in streaming

gpt-transcribe può restituire Content-Type: text/event-stream tramite stream=true. Il servizio invierà eventi compatibili con OpenAI: transcript.text.delta porta il testo incrementale, transcript.text.done porta il testo completo e usage e indica il completamento normale.
Esempio di flusso di eventi:
Ricevere transcript.text.done indica che il completamento è avvenuto correttamente. Se si verifica un errore dopo l’instaurazione del flusso, la connessione terminerà dopo l’evento event: error; se il client si disconnette attivamente, il processo verrà annullato e non continuerà a generare in background. whisper-1, anche se si passa stream=true, restituirà comunque una risposta normale non in streaming.

Utilizzo dell’SDK ufficiale

Prezzi

La fatturazione è basata sulla durata effettiva dell’audio, con un minimo di 1 secondo per durate inferiori a 1 secondo, e un massimo di 1 ora per singola richiesta.

Note

  • La dimensione massima di un singolo file è 25 MB. Se supera, si prega di suddividere o comprimere (ridurre il bitrate di solito è sufficiente, il riconoscimento vocale non richiede alta qualità audio).
  • gpt-transcribe supporta stream=true SSE; whisper-1 ignorerà stream e restituirà il risultato completo.
  • I parametri sono coerenti con l’API ufficiale di OpenAI /v1/audio/transcriptions, l’SDK ufficiale richiede solo di modificare base_url per essere utilizzato.
  • include[], chunking_strategy, known_speaker_names[], known_speaker_references[] appartengono a modelli di trascrizione non ancora disponibili, l’invio restituirà 400 invece di essere silenziosamente ignorato. I parametri specifici del modello (timestamp_granularities[] per whisper-1, languages[]/keywords[] per gpt-transcribe) restituiranno anch’essi 400 se inviati a modelli non supportati.
  • Le richieste possono richiedere tempo, si consiglia di impostare un timeout del client non inferiore a 300 secondi.

Codici di errore