audio_id wygenerowanego przez Suno), to API akceptuje publicznie dostępny audio_url, czyli nagranie głosu osoby. Niniejszy dokument wyjaśnia metodę integracji API klonowania głosu.
Krok 1: Tworzenie roli głosowej
To API ma trzy parametry wejściowe:audio_url (wymagany), który jest publicznie dostępnym URL-em pliku audio w formacie MP3 lub WAV, zawierającym wyraźny głos jednej osoby; name i description (opcjonalne), które są nazwą i opisem roli głosowej.
Wymagania dotyczące pliku audio
- Format audio musi być
WAVlubMP3- Czas trwania audio musi wynosić od
10 do 240 sekund, zaleca się użycie materiału o czystym głosie jednej osoby trwającego od30 do 60 sekund- Audio powinno zawierać wyraźne, rozpoznawalne wypowiedzi lub śpiew jednej osoby
- Należy unikać hałasu w tle, akompaniamentu, echa, pogłosu; pełne piosenki z akompaniamentem zazwyczaj nie przechodzą weryfikacji głosu
- Nie należy zawierać wielu mówców ani wielu głosów
- Materiały o zbyt niskim poziomie głośności, nieczytelnej mowie lub zbyt dużym hałasie mogą prowadzić do niepowodzenia klonowania lub słabej jakości generacji Ograniczenia użytkowania
- Rola głosowa utworzona przez przesłanie audio jest zasobem prywatnym
- Ta rola głosowa nie wspiera ponownego użycia między kontami
- Zaleca się jak najszybsze użycie po utworzeniu, długotrwałe nieużywanie może prowadzić do wygaśnięcia lub braku dostępności
- Zwracane
namejest generowane automatycznie przez system, proszę kierować się zwróconympersona_id
W przypadku niepowodzenia wywołania, proszę spróbować ponownie
Klonowanie głosu to zadanie wymagające dużej mocy obliczeniowej, nawet jeśli materiał jest całkowicie zgodny, istnieje pewne prawdopodobieństwo sporadycznych niepowodzeń, takie jak
voices_sound_different (weryfikacja głosu nie powiodła się) itp. Te niepowodzenia nie mają związku z jakością audio, ponowne użycie tego samego materiału zazwyczaj kończy się sukcesem,
zaleca się wdrożenie 1-2 automatycznych prób ponownych w przypadku niepowodzenia. Nieudane żądania nie będą obciążane opłatami.
PowyższyWynik jest następujący:https://cdn.acedata.cloud/suno_demo.mp3to bezpośrednio dostępny przykład materiału (MP3, 41 sekund, czysty głos jednej osoby). Jeśli potrzebujesz przykładu w formacieWAV, możesz użyćhttps://cdn.acedata.cloud/uploads/82d23b97-ec1c-4b41-91b8-989fc51f8765(WAV, 41 sekund, mono 44.1kHz).
persona_id w data to ID utworzonej roli głosowej. Pole is_public zawsze wynosi false, ponieważ rola głosowa utworzona przez przesłanie audio jest prywatna. Należy pamiętać, że zwrócone name jest generowane automatycznie przez system, a w przyszłości należy używać persona_id do odwoływania się do tej roli głosowej.
Krok 2: Użycie roli głosowej do generowania muzyki
Mając ID roli głosowej, możemy użyć Suno Audios Generation API do generowania muzyki. Ustawaction na generate, a persona_id na zwrócone powyżej ID roli głosowej, a generowana piosenka będzie wykonywana przy użyciu sklonowanego głosu.
Uwaga: Klonowanie głosu wspiera tylko modelechirp-v4-5i wyższe (takie jakchirp-v4-5,chirp-v5,chirp-v5-5), nie wspierachirp-v4.
persona_id może być również używane w połączeniu z akcją cover, aby zaśpiewać istniejące piosenki sklonowanym głosem.
