Skip to main content
Transcreva áudio para texto, totalmente compatível com o /v1/audio/transcriptions da OpenAI. Qualquer SDK da OpenAI pode simplesmente apontar base_url para https://api.acedata.cloud e trocar a chave pelo seu Token AceData para uso direto. Suporta resposta completa padrão e também transcrição incremental SSE do gpt-transcribe.
  • URL da solicitação: POST https://api.acedata.cloud/v1/audio/transcriptions (também conhecido como POST /openai/audio/transcriptions)
  • Autenticação: Cabeçalho da solicitação Authorization: Bearer {token}
  • Formato da solicitação: multipart/form-data
  • Cobrança: Cobrança com base na duração do áudio (veja a tabela abaixo), menos de 1 segundo é cobrado como 1 segundo.

Parâmetros da Solicitação

Qual modelo escolher

Precisa de legendas ou timestamps em nível de palavra → whisper-1; para outros cenários, recomenda-se gpt-transcribe (mais preciso e mais barato).

Exemplo

Retorno:
Áudio em chinês também é suportado, sem necessidade de especificar o idioma:

Gerar Legendas

Defina response_format como srt ou vtt para obter diretamente um arquivo de legenda utilizável:
Conteúdo retornado (Content-Type: text/plain):

Timestamp em Nível de Palavra

Se precisar do tempo de início e fim de cada palavra, use verbose_json junto com timestamp_granularities[]=word:
Retorno:

Transcrição em Fluxo

gpt-transcribe pode retornar Content-Type: text/event-stream com stream=true. O serviço enviará eventos compatíveis com a OpenAI: transcript.text.delta carrega texto incremental, transcript.text.done carrega texto completo e usage e indica conclusão normal.
Exemplo de fluxo de eventos:
Receber transcript.text.done indica conclusão normal. Se o processamento falhar após a conexão ser estabelecida, a conexão será encerrada após o evento event: error; desconectar ativamente do cliente cancelará o processamento atual e não continuará em segundo plano. whisper-1, mesmo com stream=true, ainda retornará como resposta não em fluxo.

Usando o SDK Oficial

Preços

Cobrança baseada na duração real do áudio, menos de 1 segundo é cobrado como 1 segundo, o máximo por vez é de 1 hora.

Observações

  • O tamanho máximo de um único arquivo é 25 MB. Se exceder, divida ou comprima (reduzir a taxa de bits geralmente é suficiente, o reconhecimento de voz não exige alta qualidade de áudio).
  • gpt-transcribe suporta stream=true SSE; whisper-1 ignorará stream e retornará o resultado completo.
  • Os parâmetros são consistentes com a API oficial da OpenAI /v1/audio/transcriptions, o SDK oficial só precisa alterar o base_url para funcionar.
  • include[], chunking_strategy, known_speaker_names[], known_speaker_references[] pertencem a modelos de transcrição que ainda não estão disponíveis, passar esses parâmetros retornará 400 em vez de ser ignorado silenciosamente. Parâmetros exclusivos do modelo (timestamp_granularities[] para whisper-1, languages[]/keywords[] para gpt-transcribe) também retornarão 400 se passados para um modelo não suportado.
  • As solicitações podem demorar, recomenda-se que o tempo limite do cliente não seja inferior a 300 segundos.

Códigos de erro