Skip to main content
Transcrire l’audio en texte, entièrement compatible avec l’API /v1/audio/transcriptions d’OpenAI. Il suffit de pointer base_url vers https://api.acedata.cloud et de remplacer la clé par votre AceData Token pour utiliser n’importe quel SDK OpenAI. Prend en charge les réponses complètes ainsi que la transcription incrémentale SSE de gpt-transcribe.
  • URL de la requête : POST https://api.acedata.cloud/v1/audio/transcriptions (alias POST /openai/audio/transcriptions)
  • Authentification : En-tête de requête Authorization: Bearer {token}
  • Format de la requête : multipart/form-data
  • Facturation : Facturation selon la durée de l’audio (voir tableau ci-dessous), moins de 1 seconde facturé comme 1 seconde.

Paramètres de la requête

Quel modèle choisir

Besoin de sous-titres ou d’horodatages au niveau des mots → whisper-1 ; pour les autres scénarios, recommandez gpt-transcribe (plus précis et moins cher).

Exemple

Retour :
L’audio en chinois est également pris en charge, sans besoin de spécifier la langue :

Générer des sous-titres

Définissez response_format sur srt ou vtt pour obtenir directement un fichier de sous-titres utilisable :
Contenu retourné (Content-Type: text/plain) :

Horodatages au niveau des mots

Pour obtenir le temps de début et de fin de chaque mot, utilisez verbose_json avec timestamp_granularities[]=word :
Retour :

Transcription en continu

gpt-transcribe peut renvoyer Content-Type: text/event-stream via stream=true. Le service enverra des événements compatibles avec OpenAI : transcript.text.delta contient le texte incrémental, transcript.text.done contient le texte complet et usage et indique une fin normale.
Exemple de flux d’événements :
La réception de transcript.text.done indique une fin normale. Si le traitement échoue après l’établissement du flux, la connexion se terminera après l’événement event: error ; une déconnexion active du client annulera le traitement en cours, sans continuer à générer en arrière-plan. whisper-1, même avec stream=true, renverra toujours une réponse normale non en continu.

Utiliser le SDK officiel

Prix

Facturation selon la durée réelle de l’audio, toute durée inférieure à 1 seconde est facturée comme 1 seconde, la durée maximale par demande est plafonnée à 1 heure.

Remarques

  • Taille maximale d’un fichier 25 Mo. Si cela dépasse, veuillez d’abord le diviser ou le compresser (réduire le débit binaire suffit généralement, la reconnaissance vocale n’exige pas une qualité sonore élevée).
  • gpt-transcribe prend en charge stream=true SSE ; whisper-1 ignorera stream et renverra le résultat complet.
  • Les paramètres sont conformes à ceux de l’API officielle d’OpenAI /v1/audio/transcriptions, le SDK officiel nécessite simplement de modifier base_url pour être utilisé.
  • include[], chunking_strategy, known_speaker_names[], known_speaker_references[] appartiennent à des modèles de transcription que nous n’avons pas encore lancés, leur transmission renverra 400 au lieu d’être silencieusement ignorée. Les paramètres spécifiques au modèle (timestamp_granularities[] pour whisper-1, languages[]/keywords[] pour gpt-transcribe) renverront également 400 s’ils sont transmis à un modèle non pris en charge.
  • Les requêtes peuvent prendre du temps, il est conseillé de définir un délai d’attente client d’au moins 300 secondes.

Codes d’erreur