Skip to main content
Przekształcanie audio na tekst, w pełni zgodne z OpenAI /v1/audio/transcriptions. Każde SDK OpenAI wystarczy, że ustawi base_url na https://api.acedata.cloud oraz zamieni klucz na swój token AceData, aby mogło być używane bezpośrednio. Obsługuje pełne odpowiedzi oraz inkrementalne transkrypcje SSE dla gpt-transcribe.
  • Adres żądania: POST https://api.acedata.cloud/v1/audio/transcriptions (alias POST /openai/audio/transcriptions)
  • Autoryzacja: nagłówek żądania Authorization: Bearer {token}
  • Format żądania: multipart/form-data
  • Rozliczenie: według długości audio (patrz poniższa tabela), poniżej 1 sekundy liczone jako 1 sekunda.

Parametry żądania

Który model wybrać

Potrzebujesz napisów lub znaczników czasowych na poziomie słów → whisper-1; w pozostałych scenariuszach zaleca się gpt-transcribe (dokładniejszy i tańszy).

Przykład

Zwróci:
Chińskie audio również jest obsługiwane, nie trzeba określać języka:

Generowanie napisów

Ustaw response_format na srt lub vtt, aby bezpośrednio uzyskać plik z napisami:
Zwróci treść ( Content-Type: text/plain ):

Znaczniki czasowe na poziomie słów

Aby uzyskać czasy rozpoczęcia i zakończenia dla każdego słowa, użyj verbose_json w połączeniu z timestamp_granularities[]=word:
Zwróci:

Transkrypcja strumieniowa

gpt-transcribe może zwracać Content-Type: text/event-stream poprzez stream=true. Serwis będzie wysyłał zdarzenia zgodne z OpenAI: transcript.text.delta zawiera inkrementalny tekst, transcript.text.done zawiera pełny tekst i usage, co oznacza normalne zakończenie.
Przykład strumienia zdarzeń:
Otrzymanie transcript.text.done oznacza normalne zakończenie. Jeśli po nawiązaniu strumienia wystąpi błąd przetwarzania, po zdarzeniu event: error połączenie zostanie zakończone; jeśli klient przerwie połączenie, przetwarzanie zostanie anulowane i nie będzie kontynuowane w tle. whisper-1, nawet jeśli przekaże stream=true, również zwróci odpowiedź w trybie normalnym, a nie strumieniowym.

Użycie oficjalnego SDK

Ceny

Opłata naliczana jest na podstawie rzeczywistego czasu trwania audio, poniżej 1 sekundy liczone jako 1 sekunda, maksymalnie 1 godzina na jedno zlecenie.

Uwagi

  • Maksymalny rozmiar pojedynczego pliku to 25 MB. W przypadku przekroczenia proszę najpierw podzielić lub skompresować (zwykle wystarczy obniżenie bitrate’u, rozpoznawanie mowy nie wymaga wysokiej jakości dźwięku).
  • gpt-transcribe obsługuje stream=true SSE; whisper-1 zignoruje stream i zwróci pełny wynik.
  • Parametry są zgodne z oficjalnym /v1/audio/transcriptions OpenAI, oficjalne SDK wymaga jedynie zmiany base_url.
  • include[], chunking_strategy, known_speaker_names[], known_speaker_references[] to modele transkrypcyjne, które nie są jeszcze dostępne, ich przesłanie zwróci 400 zamiast cichych ignorowań. Parametry specyficzne dla modelu (timestamp_granularities[] dla whisper-1, languages[]/keywords[] dla gpt-transcribe) również zwrócą 400, gdy zostaną przekazane do modelu, który ich nie obsługuje.
  • Żądania mogą być czasochłonne, zaleca się ustawienie limitu czasu klienta na co najmniej 300 sekund.

Kody błędów