/v1/audio/transcriptions d’OpenAI. Il suffit de pointer base_url vers https://api.acedata.cloud et de remplacer la clé par votre AceData Token pour utiliser n’importe quel SDK OpenAI. Prend en charge les réponses complètes ainsi que la transcription incrémentale SSE de gpt-transcribe.
- URL de la requête :
POST https://api.acedata.cloud/v1/audio/transcriptions(aliasPOST /openai/audio/transcriptions) - Authentification : En-tête de requête
Authorization: Bearer {token} - Format de la requête :
multipart/form-data - Facturation : Facturation selon la durée de l’audio (voir tableau ci-dessous), moins de 1 seconde facturé comme 1 seconde.
Paramètres de la requête
Quel modèle choisir
Besoin de sous-titres ou d’horodatages au niveau des mots →
whisper-1 ; pour les autres scénarios, recommandez gpt-transcribe (plus précis et moins cher).
Exemple
Générer des sous-titres
Définissezresponse_format sur srt ou vtt pour obtenir directement un fichier de sous-titres utilisable :
Content-Type: text/plain) :
Horodatages au niveau des mots
Pour obtenir le temps de début et de fin de chaque mot, utilisezverbose_json avec timestamp_granularities[]=word :
Transcription en continu
gpt-transcribe peut renvoyer Content-Type: text/event-stream via stream=true. Le service enverra des événements compatibles avec OpenAI :
transcript.text.delta contient le texte incrémental, transcript.text.done contient le texte complet et usage et indique une fin normale.
transcript.text.done indique une fin normale. Si le traitement échoue après l’établissement du flux, la connexion se terminera après l’événement event: error ; une déconnexion active du client annulera le traitement en cours, sans continuer à générer en arrière-plan. whisper-1, même avec stream=true, renverra toujours une réponse normale non en continu.
Utiliser le SDK officiel
Prix
Facturation selon la durée réelle de l’audio, toute durée inférieure à 1 seconde est facturée comme 1 seconde, la durée maximale par demande est plafonnée à 1 heure.
Remarques
- Taille maximale d’un fichier 25 Mo. Si cela dépasse, veuillez d’abord le diviser ou le compresser (réduire le débit binaire suffit généralement, la reconnaissance vocale n’exige pas une qualité sonore élevée).
gpt-transcribeprend en chargestream=trueSSE ;whisper-1ignorerastreamet renverra le résultat complet.- Les paramètres sont conformes à ceux de l’API officielle d’OpenAI
/v1/audio/transcriptions, le SDK officiel nécessite simplement de modifierbase_urlpour être utilisé. include[],chunking_strategy,known_speaker_names[],known_speaker_references[]appartiennent à des modèles de transcription que nous n’avons pas encore lancés, leur transmission renverra 400 au lieu d’être silencieusement ignorée. Les paramètres spécifiques au modèle (timestamp_granularities[]pourwhisper-1,languages[]/keywords[]pourgpt-transcribe) renverront également 400 s’ils sont transmis à un modèle non pris en charge.- Les requêtes peuvent prendre du temps, il est conseillé de définir un délai d’attente client d’au moins 300 secondes.

