Skip to main content
Transcribe audio a texto, totalmente compatible con el /v1/audio/transcriptions de OpenAI. Cualquier SDK de OpenAI solo necesita apuntar base_url a https://api.acedata.cloud y cambiar la clave por tu AceData Token para usarlo directamente. Soporta respuestas completas y también la transcripción incremental SSE de gpt-transcribe.
  • URL de solicitud: POST https://api.acedata.cloud/v1/audio/transcriptions (alias POST /openai/audio/transcriptions)
  • Autenticación: encabezado de solicitud Authorization: Bearer {token}
  • Formato de solicitud: multipart/form-data
  • Facturación: se cobra según la duración del audio (ver tabla a continuación), menos de 1 segundo se cobra como 1 segundo.

Parámetros de solicitud

Qué modelo elegir

Necesitas subtítulos o marcas de tiempo a nivel de palabra → whisper-1; en otros casos, se recomienda gpt-transcribe (más preciso y más barato).

Ejemplo

Respuesta:
El audio en chino también es compatible, no es necesario especificar el idioma:

Generar subtítulos

Establece response_format en srt o vtt para obtener directamente un archivo de subtítulos utilizable:
Contenido de respuesta (Content-Type: text/plain):

Marca de tiempo a nivel de palabra

Si necesitas el tiempo de inicio y fin de cada palabra, usa verbose_json junto con timestamp_granularities[]=word:
Respuesta:

Transcripción en streaming

gpt-transcribe puede devolver Content-Type: text/event-stream a través de stream=true. El servicio enviará eventos compatibles con OpenAI: transcript.text.delta lleva texto incremental, transcript.text.done lleva texto completo y usage y señala la finalización normal.
Ejemplo de flujo de eventos:
Recibir transcript.text.done indica que se ha completado correctamente. Si el procesamiento falla después de establecer el flujo, la conexión finalizará después del evento event: error; si el cliente se desconecta, se cancelará este procesamiento y no continuará generando en segundo plano. whisper-1, incluso si se pasa stream=true, seguirá devolviendo una respuesta normal no en streaming.

Usar el SDK oficial

Precio

Se cobra según la duración real del audio, menos de 1 segundo se cuenta como 1 segundo, el máximo por una sola vez es de 1 hora.

Consideraciones

  • El tamaño máximo de un solo archivo es 25 MB. Si excede, divídalo o comprímalo (normalmente reducir la tasa de bits es suficiente, el reconocimiento de voz no requiere alta calidad de audio).
  • gpt-transcribe soporta stream=true SSE; whisper-1 ignorará stream y devolverá el resultado completo.
  • Los parámetros son consistentes con la API oficial de OpenAI /v1/audio/transcriptions, el SDK oficial solo necesita cambiar base_url para funcionar.
  • include[], chunking_strategy, known_speaker_names[], known_speaker_references[] pertenecen a modelos de transcripción que no hemos lanzado, pasarlos devolverá 400 en lugar de ser ignorados silenciosamente. Los parámetros exclusivos del modelo (timestamp_granularities[] para whisper-1, languages[]/keywords[] para gpt-transcribe) también devolverán 400 si se pasan a un modelo no soportado.
  • Las solicitudes pueden tardar, se recomienda que la configuración de tiempo de espera del cliente no sea inferior a 300 segundos.

Códigos de error