/v1/audio/transcriptions da OpenAI. Qualquer SDK da OpenAI pode simplesmente apontar base_url para https://api.acedata.cloud e trocar a chave pelo seu Token AceData para uso direto. Suporta resposta completa padrão e também transcrição incremental SSE do gpt-transcribe.
- URL da solicitação:
POST https://api.acedata.cloud/v1/audio/transcriptions(também conhecido comoPOST /openai/audio/transcriptions) - Autenticação: Cabeçalho da solicitação
Authorization: Bearer {token} - Formato da solicitação:
multipart/form-data - Cobrança: Cobrança com base na duração do áudio (veja a tabela abaixo), menos de 1 segundo é cobrado como 1 segundo.
Parâmetros da Solicitação
Qual modelo escolher
Precisa de legendas ou timestamps em nível de palavra →
whisper-1; para outros cenários, recomenda-se gpt-transcribe (mais preciso e mais barato).
Exemplo
Gerar Legendas
Definaresponse_format como srt ou vtt para obter diretamente um arquivo de legenda utilizável:
Content-Type: text/plain):
Timestamp em Nível de Palavra
Se precisar do tempo de início e fim de cada palavra, useverbose_json junto com timestamp_granularities[]=word:
Transcrição em Fluxo
gpt-transcribe pode retornar Content-Type: text/event-stream com stream=true. O serviço enviará eventos compatíveis com a OpenAI:
transcript.text.delta carrega texto incremental, transcript.text.done carrega texto completo e usage e indica conclusão normal.
transcript.text.done indica conclusão normal. Se o processamento falhar após a conexão ser estabelecida, a conexão será encerrada após o evento event: error; desconectar ativamente do cliente cancelará o processamento atual e não continuará em segundo plano. whisper-1, mesmo com stream=true, ainda retornará como resposta não em fluxo.
Usando o SDK Oficial
Preços
Cobrança baseada na duração real do áudio, menos de 1 segundo é cobrado como 1 segundo, o máximo por vez é de 1 hora.
Observações
- O tamanho máximo de um único arquivo é 25 MB. Se exceder, divida ou comprima (reduzir a taxa de bits geralmente é suficiente, o reconhecimento de voz não exige alta qualidade de áudio).
gpt-transcribesuportastream=trueSSE;whisper-1ignorarástreame retornará o resultado completo.- Os parâmetros são consistentes com a API oficial da OpenAI
/v1/audio/transcriptions, o SDK oficial só precisa alterar obase_urlpara funcionar. include[],chunking_strategy,known_speaker_names[],known_speaker_references[]pertencem a modelos de transcrição que ainda não estão disponíveis, passar esses parâmetros retornará 400 em vez de ser ignorado silenciosamente. Parâmetros exclusivos do modelo (timestamp_granularities[]parawhisper-1,languages[]/keywords[]paragpt-transcribe) também retornarão 400 se passados para um modelo não suportado.- As solicitações podem demorar, recomenda-se que o tempo limite do cliente não seja inferior a 300 segundos.

