/v1/audio/transcriptions de OpenAI. Cualquier SDK de OpenAI solo necesita apuntar base_url a https://api.acedata.cloud y cambiar la clave por tu AceData Token para usarlo directamente. Soporta respuestas completas y también la transcripción incremental SSE de gpt-transcribe.
- URL de solicitud:
POST https://api.acedata.cloud/v1/audio/transcriptions(aliasPOST /openai/audio/transcriptions) - Autenticación: encabezado de solicitud
Authorization: Bearer {token} - Formato de solicitud:
multipart/form-data - Facturación: se cobra según la duración del audio (ver tabla a continuación), menos de 1 segundo se cobra como 1 segundo.
Parámetros de solicitud
Qué modelo elegir
Necesitas subtítulos o marcas de tiempo a nivel de palabra →
whisper-1; en otros casos, se recomienda gpt-transcribe (más preciso y más barato).
Ejemplo
Generar subtítulos
Estableceresponse_format en srt o vtt para obtener directamente un archivo de subtítulos utilizable:
Content-Type: text/plain):
Marca de tiempo a nivel de palabra
Si necesitas el tiempo de inicio y fin de cada palabra, usaverbose_json junto con timestamp_granularities[]=word:
Transcripción en streaming
gpt-transcribe puede devolver Content-Type: text/event-stream a través de stream=true. El servicio enviará eventos compatibles con OpenAI:
transcript.text.delta lleva texto incremental, transcript.text.done lleva texto completo y usage y señala la finalización normal.
transcript.text.done indica que se ha completado correctamente. Si el procesamiento falla después de establecer el flujo, la conexión finalizará después del evento event: error; si el cliente se desconecta, se cancelará este procesamiento y no continuará generando en segundo plano. whisper-1, incluso si se pasa stream=true, seguirá devolviendo una respuesta normal no en streaming.
Usar el SDK oficial
Precio
Se cobra según la duración real del audio, menos de 1 segundo se cuenta como 1 segundo, el máximo por una sola vez es de 1 hora.
Consideraciones
- El tamaño máximo de un solo archivo es 25 MB. Si excede, divídalo o comprímalo (normalmente reducir la tasa de bits es suficiente, el reconocimiento de voz no requiere alta calidad de audio).
gpt-transcribesoportastream=trueSSE;whisper-1ignorarástreamy devolverá el resultado completo.- Los parámetros son consistentes con la API oficial de OpenAI
/v1/audio/transcriptions, el SDK oficial solo necesita cambiarbase_urlpara funcionar. include[],chunking_strategy,known_speaker_names[],known_speaker_references[]pertenecen a modelos de transcripción que no hemos lanzado, pasarlos devolverá 400 en lugar de ser ignorados silenciosamente. Los parámetros exclusivos del modelo (timestamp_granularities[]parawhisper-1,languages[]/keywords[]paragpt-transcribe) también devolverán 400 si se pasan a un modelo no soportado.- Las solicitudes pueden tardar, se recomienda que la configuración de tiempo de espera del cliente no sea inferior a 300 segundos.

