Skip to main content
Översätt ljud till text, helt kompatibel med OpenAI:s /v1/audio/transcriptions. Alla OpenAI SDK:er behöver bara peka base_url till https://api.acedata.cloud och byta ut nyckeln mot din AceData Token för att använda den direkt. Stöder både vanliga fullständiga svar och gpt-transcribe SSE inkrementell transkription.
  • Begärningsadress: POST https://api.acedata.cloud/v1/audio/transcriptions (alias POST /openai/audio/transcriptions)
  • Autentisering: Begärningshuvud Authorization: Bearer {token}
  • Begärningsformat: multipart/form-data
  • Avgift: Avgift baserat på ljudets längd (se tabellen nedan), mindre än 1 sekund räknas som 1 sekund.

Begärningsparametrar

Vilken modell ska väljas

Behöver undertexter eller ord-nivå tidsstämplar → whisper-1; för övriga scenarier rekommenderas gpt-transcribe (mer exakt och billigare).

Exempel

Svar:
Kinesiska ljud stöds också, ingen språkidentifiering krävs:

Generera undertexter

Sätt response_format till srt eller vtt för att direkt få en användbar undertextfil:
Returnerat innehåll (Content-Type: text/plain):

Ord-nivå tidsstämplar

För att få start- och sluttider för varje ord, använd verbose_json tillsammans med timestamp_granularities[]=word:
Svar:

Strömmande transkription

gpt-transcribe kan returnera Content-Type: text/event-stream genom att använda stream=true. Tjänsten skickar oförändrat OpenAI-kompatibla händelser: transcript.text.delta bär inkrementell text, transcript.text.done bär fullständig text och usage och indikerar normal avslutning.
Exempel på händelseflöde:
Mottagandet av transcript.text.done indikerar att det har avslutats normalt. Om behandlingen misslyckas efter att strömmen har etablerats, avslutas anslutningen efter händelsen event: error; om klienten stänger av sig själv avbryts behandlingen och den fortsätter inte i bakgrunden. whisper-1 returnerar fortfarande ett vanligt icke-strömmande svar även om stream=true anges.

Använda officiell SDK

Priser

Avgiften baseras på den faktiska längden av ljudet, och om den är mindre än 1 sekund räknas den som 1 sekund, med en maximal längd på 1 timme per enskild transkription.

Viktiga punkter

  • Den maximala storleken för en enskild fil är 25 MB. Om den överskrider detta, vänligen dela upp den eller komprimera (att sänka bithastigheten brukar vara tillräckligt, taligenkänning har inte höga krav på ljudkvalitet).
  • gpt-transcribe stöder stream=true SSE; whisper-1 kommer att ignorera stream och returnera hela resultatet.
  • Parametrarna är i linje med OpenAI:s officiella /v1/audio/transcriptions, den officiella SDK:n behöver bara ändra base_url för att kunna användas.
  • include[], chunking_strategy, known_speaker_names[], known_speaker_references[] tillhör våra ännu inte lanserade transkriptionsmodeller, att skicka in dem kommer att returnera 400 istället för att tyst ignoreras. Modell-specifika parametrar (timestamp_granularities[] för whisper-1, languages[]/keywords[] för gpt-transcribe) kommer också att returnera 400 om de skickas till en modell som inte stöder dem.
  • Begärningar kan ta tid, det rekommenderas att klientens timeout-inställning inte är lägre än 300 sekunder.

Felkoder