Skip to main content
오디오를 텍스트로 전사하며, OpenAI의 /v1/audio/transcriptions와 완전히 호환됩니다. 모든 OpenAI SDK는 base_url을 https://api.acedata.cloud로 설정하고, 키를 자신의 AceData Token으로 변경하면 바로 사용할 수 있습니다. 일반적인 전체 응답을 지원하며, gpt-transcribe의 SSE 증분 전사도 지원합니다.
  • 요청 주소: POST https://api.acedata.cloud/v1/audio/transcriptions (별칭 POST /openai/audio/transcriptions)
  • 인증: 요청 헤더 Authorization: Bearer {token}
  • 요청 형식: multipart/form-data
  • 요금: 오디오 길이에 따라 요금이 부과됩니다 (아래 표 참조), 1초 미만은 1초로 계산됩니다.

요청 매개변수

어떤 모델을 선택할까

자막이나 단어 수준 타임스탬프가 필요하다면 → whisper-1; 나머지 경우는 gpt-transcribe를 추천합니다 (더 정확하고 더 저렴합니다).

예시

반환:
중국어 오디오도 지원되며, 언어를 지정할 필요가 없습니다:

자막 생성

response_format을 srt 또는 vtt로 설정하면 바로 사용할 수 있는 자막 파일을 얻을 수 있습니다:
반환 내용 (Content-Type: text/plain):

단어 수준 타임스탬프

각 단어의 시작과 끝 시간을 필요로 할 경우, verbose_json과 timestamp_granularities[]=word를 조합하여 사용합니다:
반환:

스트리밍 전사

gpt-transcribe는 stream=true를 통해 Content-Type: text/event-stream을 반환할 수 있습니다. 서비스는 OpenAI 호환 이벤트를 그대로 전송합니다: transcript.text.delta는 증분 텍스트를 포함하고, transcript.text.done은 전체 텍스트와 usage를 포함하여 정상 완료를 나타냅니다.
이벤트 스트림 예시:
transcript.text.done을 수신해야 정상 완료를 나타냅니다. 스트림이 설정된 후 처리에 실패하면 연결은 event: error 이벤트 후 종료됩니다; 클라이언트가 적극적으로 연결을 끊으면 이번 처리가 취소되며 백그라운드에서 계속 생성되지 않습니다. whisper-1은 stream=true를 전달하더라도 여전히 일반 비스트리밍 응답으로 반환됩니다.

공식 SDK 사용

가격

음성의 실제 길이에 따라 요금이 부과되며, 1초 미만은 1초로 계산하고, 단일 최대 길이는 1시간으로 제한됩니다.

주의사항

  • 단일 파일 최대 25 MB. 초과 시 먼저 분할하거나 압축하십시오(비트 전송률을 낮추는 것으로 충분하며, 음성 인식은 음질 요구가 높지 않습니다).
  • gpt-transcribe는 stream=true SSE를 지원합니다; whisper-1은 stream을 무시하고 전체 결과를 반환합니다.
  • 매개변수는 OpenAI 공식 /v1/audio/transcriptions와 일치하며, 공식 SDK는 base_url만 변경하면 사용할 수 있습니다.
  • include[]、chunking_strategy、known_speaker_names[]、known_speaker_references[]는 우리가 출시하지 않은 전사 모델에 해당하며, 전달 시 400을 반환하고 조용히 무시되지 않습니다. 모델 전용 매개변수(timestamp_granularities[]는 whisper-1에, languages[]/keywords[]는 gpt-transcribe에 해당)도 지원하지 않는 모델에 전달 시 400을 반환합니다.
  • 요청이 다소 시간이 소요되므로 클라이언트의 타임아웃 설정은 300초 이상으로 설정하는 것이 좋습니다.

오류 코드