audio_id verwendet, die mit Suno generiert wurde), akzeptiert diese API eine öffentlich zugängliche audio_url, also Ihre eigene Sprachaufnahme. Dieses Dokument erklärt, wie man die Sprachklon API integriert.
Schritt 1: Erstellen einer Sprachrolle
Diese API hat drei Eingabeparameter:audio_url (erforderlich), eine öffentlich zugängliche URL zu einer MP3- oder WAV-Audiodatei, die eine klare Einzelstimme enthält; name und description (optional), die den Namen und die Beschreibung der Sprachrolle angeben.
Anforderungen an die Audiodatei
- Das Audioformat muss
WAVoderMP3sein- Die Audio-Dauer muss zwischen
10~240 Sekundenliegen, empfohlen wird die Verwendung von30~60 Sekundensauberem Einzelstimmenmaterial- Das Audio sollte klare, erkennbare Einzelstimmen enthalten
- Bitte vermeiden Sie Hintergrundgeräusche, Begleitmusik, Echo, Hall; vollständige Lieder mit Begleitmusik können normalerweise nicht durch die Stimmverifikation validiert werden
- Es sollten keine mehreren Sprecher oder mehrfache Stimmen enthalten sein
- Materialien mit zu niedriger Lautstärke, unklarer Sprache oder übermäßigem Rauschen können zu Klonfehlern oder schlechten Ergebnissen führen Einschränkungen der Nutzung
- Sprachrollen, die durch das Hochladen von Audio erstellt wurden, sind private Ressourcen
- Diese Sprachrolle unterstützt keine plattformübergreifende Wiederverwendung
- Es wird empfohlen, die Rolle nach erfolgreicher Erstellung schnell zu verwenden, da eine lange Nichtnutzung zu Ungültigkeit oder Unbrauchbarkeit führen kann
- Der zurückgegebene
namewird vom System automatisch generiert, bitte verwenden Sie die zurückgegebenepersona_idals Referenz
Bei einem Fehler bitte zuerst erneut versuchen
Sprachklonierung ist eine rechenintensive Aufgabe, selbst wenn das Material vollständig konform ist, besteht eine gewisse Wahrscheinlichkeit für sporadische Fehler, häufige Rückgaben wie voices_sound_different (Stimmverifikation nicht bestanden) usw. Diese Art von Fehlern hängt nicht von der Audioqualität ab, ein erneuter Versuch mit demselben Material führt normalerweise zum Erfolg,
es wird empfohlen, bei der Integration 1-2 automatische Wiederholungen für fehlerhafte Ergebnisse zu implementieren. Fehlgeschlagene Anfragen werden nicht berechnet.
Die oben genannteDas Ergebnis sieht wie folgt aus:https://cdn.acedata.cloud/suno_demo.mp3ist ein direkt aufrufbares Beispielmaterial (MP3, 41 Sekunden, Einzelstimme). Für ein Beispiel imWAV-Format kann verwendet werdenhttps://cdn.acedata.cloud/uploads/82d23b97-ec1c-4b41-91b8-989fc51f8765(WAV, 41 Sekunden, Mono 44.1kHz).
persona_id-Feld in data die ID der erstellten Sprachrolle. Das Feld is_public ist immer false, da die durch das Hochladen von Audio erstellte Sprachrolle privat ist. Beachten Sie, dass der zurückgegebene name automatisch vom System generiert wird, verwenden Sie bitte die persona_id, um auf diese Sprachrolle zuzugreifen.
Schritt 2: Verwendung der Sprachrolle zur Musikgenerierung
Nachdem wir die Sprachrollen-ID haben, können wir die Suno Audios Generation API zur Musikgenerierung verwenden. Setzen Sieaction auf generate und persona_id auf die oben zurückgegebene Sprachrollen-ID, das generierte Lied wird mit der geklonten Stimme gesungen.
Hinweis: Sprachklonierung unterstützt nur Modellechirp-v4-5und höher (wiechirp-v4-5,chirp-v5,chirp-v5-5), nichtchirp-v4.
persona_id kann auch in Verbindung mit der cover-Aktion verwendet werden, um bestehende Lieder mit der geklonten Stimme zu covern.
