/v1/audio/transcriptions. Qualsiasi SDK OpenAI deve semplicemente puntare base_url a https://api.acedata.cloud e sostituire la chiave con il tuo AceData Token per essere utilizzato direttamente. Supporta risposte complete e anche la trascrizione incrementale SSE di gpt-transcribe.
- URL della richiesta:
POST https://api.acedata.cloud/v1/audio/transcriptions(aliasPOST /openai/audio/transcriptions) - Autenticazione: intestazione della richiesta
Authorization: Bearer {token} - Formato della richiesta:
multipart/form-data - Fatturazione: fatturato in base alla durata dell’audio (vedi tabella sottostante), meno di 1 secondo fatturato come 1 secondo.
Parametri della richiesta
Quale modello scegliere
Hai bisogno di sottotitoli o timestamp a livello di parola →
whisper-1; per altri scenari si consiglia gpt-transcribe (più preciso e più economico).
Esempio
Generazione di sottotitoli
Impostaresponse_format su srt o vtt per ottenere direttamente un file di sottotitoli utilizzabile:
Content-Type: text/plain):
Timestamp a livello di parola
Se hai bisogno dei tempi di inizio e fine di ogni parola, utilizzaverbose_json insieme a timestamp_granularities[]=word:
Trascrizione in streaming
gpt-transcribe può restituire Content-Type: text/event-stream tramite stream=true. Il servizio invierà eventi compatibili con OpenAI:
transcript.text.delta porta il testo incrementale, transcript.text.done porta il testo completo e usage e indica il completamento normale.
transcript.text.done indica che il completamento è avvenuto correttamente. Se si verifica un errore dopo l’instaurazione del flusso, la connessione terminerà dopo l’evento event: error; se il client si disconnette attivamente, il processo verrà annullato e non continuerà a generare in background. whisper-1, anche se si passa stream=true, restituirà comunque una risposta normale non in streaming.
Utilizzo dell’SDK ufficiale
Prezzi
La fatturazione è basata sulla durata effettiva dell’audio, con un minimo di 1 secondo per durate inferiori a 1 secondo, e un massimo di 1 ora per singola richiesta.
Note
- La dimensione massima di un singolo file è 25 MB. Se supera, si prega di suddividere o comprimere (ridurre il bitrate di solito è sufficiente, il riconoscimento vocale non richiede alta qualità audio).
gpt-transcribesupportastream=trueSSE;whisper-1ignoreràstreame restituirà il risultato completo.- I parametri sono coerenti con l’API ufficiale di OpenAI
/v1/audio/transcriptions, l’SDK ufficiale richiede solo di modificarebase_urlper essere utilizzato. include[],chunking_strategy,known_speaker_names[],known_speaker_references[]appartengono a modelli di trascrizione non ancora disponibili, l’invio restituirà 400 invece di essere silenziosamente ignorato. I parametri specifici del modello (timestamp_granularities[]perwhisper-1,languages[]/keywords[]pergpt-transcribe) restituiranno anch’essi 400 se inviati a modelli non supportati.- Le richieste possono richiedere tempo, si consiglia di impostare un timeout del client non inferiore a 300 secondi.

