/v1/audio/transcriptions와 완전히 호환됩니다. 모든 OpenAI SDK는 base_url을 https://api.acedata.cloud로 설정하고, 키를 자신의 AceData Token으로 변경하면 바로 사용할 수 있습니다. 일반적인 전체 응답을 지원하며, gpt-transcribe의 SSE 증분 전사도 지원합니다.
- 요청 주소:
POST https://api.acedata.cloud/v1/audio/transcriptions(별칭POST /openai/audio/transcriptions) - 인증: 요청 헤더
Authorization: Bearer {token} - 요청 형식:
multipart/form-data - 요금: 오디오 길이에 따라 요금이 부과됩니다 (아래 표 참조), 1초 미만은 1초로 계산됩니다.
요청 매개변수
어떤 모델을 선택할까
자막이나 단어 수준 타임스탬프가 필요하다면 →
whisper-1; 나머지 경우는 gpt-transcribe를 추천합니다 (더 정확하고 더 저렴합니다).
예시
자막 생성
response_format을 srt 또는 vtt로 설정하면 바로 사용할 수 있는 자막 파일을 얻을 수 있습니다:
Content-Type: text/plain):
단어 수준 타임스탬프
각 단어의 시작과 끝 시간을 필요로 할 경우,verbose_json과 timestamp_granularities[]=word를 조합하여 사용합니다:
스트리밍 전사
gpt-transcribe는 stream=true를 통해 Content-Type: text/event-stream을 반환할 수 있습니다. 서비스는 OpenAI 호환 이벤트를 그대로 전송합니다:
transcript.text.delta는 증분 텍스트를 포함하고, transcript.text.done은 전체 텍스트와 usage를 포함하여 정상 완료를 나타냅니다.
transcript.text.done을 수신해야 정상 완료를 나타냅니다. 스트림이 설정된 후 처리에 실패하면 연결은 event: error 이벤트 후 종료됩니다; 클라이언트가 적극적으로 연결을 끊으면 이번 처리가 취소되며 백그라운드에서 계속 생성되지 않습니다. whisper-1은 stream=true를 전달하더라도 여전히 일반 비스트리밍 응답으로 반환됩니다.
공식 SDK 사용
가격
음성의 실제 길이에 따라 요금이 부과되며, 1초 미만은 1초로 계산하고, 단일 최대 길이는 1시간으로 제한됩니다.
주의사항
- 단일 파일 최대 25 MB. 초과 시 먼저 분할하거나 압축하십시오(비트 전송률을 낮추는 것으로 충분하며, 음성 인식은 음질 요구가 높지 않습니다).
gpt-transcribe는stream=trueSSE를 지원합니다;whisper-1은stream을 무시하고 전체 결과를 반환합니다.- 매개변수는 OpenAI 공식
/v1/audio/transcriptions와 일치하며, 공식 SDK는base_url만 변경하면 사용할 수 있습니다. include[]、chunking_strategy、known_speaker_names[]、known_speaker_references[]는 우리가 출시하지 않은 전사 모델에 해당하며, 전달 시 400을 반환하고 조용히 무시되지 않습니다. 모델 전용 매개변수(timestamp_granularities[]는whisper-1에,languages[]/keywords[]는gpt-transcribe에 해당)도 지원하지 않는 모델에 전달 시 400을 반환합니다.- 요청이 다소 시간이 소요되므로 클라이언트의 타임아웃 설정은 300초 이상으로 설정하는 것이 좋습니다.

