/v1/audio/transcriptions. Każde SDK OpenAI wystarczy, że ustawi base_url na https://api.acedata.cloud oraz zamieni klucz na swój token AceData, aby mogło być używane bezpośrednio. Obsługuje pełne odpowiedzi oraz inkrementalne transkrypcje SSE dla gpt-transcribe.
- Adres żądania:
POST https://api.acedata.cloud/v1/audio/transcriptions(aliasPOST /openai/audio/transcriptions) - Autoryzacja: nagłówek żądania
Authorization: Bearer {token} - Format żądania:
multipart/form-data - Rozliczenie: według długości audio (patrz poniższa tabela), poniżej 1 sekundy liczone jako 1 sekunda.
Parametry żądania
Który model wybrać
Potrzebujesz napisów lub znaczników czasowych na poziomie słów →
whisper-1; w pozostałych scenariuszach zaleca się gpt-transcribe (dokładniejszy i tańszy).
Przykład
Generowanie napisów
Ustawresponse_format na srt lub vtt, aby bezpośrednio uzyskać plik z napisami:
Content-Type: text/plain ):
Znaczniki czasowe na poziomie słów
Aby uzyskać czasy rozpoczęcia i zakończenia dla każdego słowa, użyjverbose_json w połączeniu z timestamp_granularities[]=word:
Transkrypcja strumieniowa
gpt-transcribe może zwracać Content-Type: text/event-stream poprzez stream=true. Serwis będzie wysyłał zdarzenia zgodne z OpenAI:
transcript.text.delta zawiera inkrementalny tekst, transcript.text.done zawiera pełny tekst i usage, co oznacza normalne zakończenie.
transcript.text.done oznacza normalne zakończenie. Jeśli po nawiązaniu strumienia wystąpi błąd przetwarzania, po zdarzeniu event: error połączenie zostanie zakończone; jeśli klient przerwie połączenie, przetwarzanie zostanie anulowane i nie będzie kontynuowane w tle. whisper-1, nawet jeśli przekaże stream=true, również zwróci odpowiedź w trybie normalnym, a nie strumieniowym.
Użycie oficjalnego SDK
Ceny
Opłata naliczana jest na podstawie rzeczywistego czasu trwania audio, poniżej 1 sekundy liczone jako 1 sekunda, maksymalnie 1 godzina na jedno zlecenie.
Uwagi
- Maksymalny rozmiar pojedynczego pliku to 25 MB. W przypadku przekroczenia proszę najpierw podzielić lub skompresować (zwykle wystarczy obniżenie bitrate’u, rozpoznawanie mowy nie wymaga wysokiej jakości dźwięku).
gpt-transcribeobsługujestream=trueSSE;whisper-1zignorujestreami zwróci pełny wynik.- Parametry są zgodne z oficjalnym
/v1/audio/transcriptionsOpenAI, oficjalne SDK wymaga jedynie zmianybase_url. include[],chunking_strategy,known_speaker_names[],known_speaker_references[]to modele transkrypcyjne, które nie są jeszcze dostępne, ich przesłanie zwróci 400 zamiast cichych ignorowań. Parametry specyficzne dla modelu (timestamp_granularities[]dlawhisper-1,languages[]/keywords[]dlagpt-transcribe) również zwrócą 400, gdy zostaną przekazane do modelu, który ich nie obsługuje.- Żądania mogą być czasochłonne, zaleca się ustawienie limitu czasu klienta na co najmniej 300 sekund.

