Skip to main content
SUNO ermöglicht es uns, benutzerdefinierte Sprachrollen aus beliebigen Audio-Dateien zu erstellen und Sprachklonierung für die Musikgenerierung zu nutzen. Im Gegensatz zur bestehenden Persona API (die audio_id verwendet, die mit Suno generiert wurde), akzeptiert diese API eine öffentlich zugängliche audio_url, also Ihre eigene Sprachaufnahme. Dieses Dokument erklärt, wie man die Sprachklon API integriert.

Schritt 1: Erstellen einer Sprachrolle

Diese API hat drei Eingabeparameter: audio_url (erforderlich), eine öffentlich zugängliche URL zu einer MP3- oder WAV-Audiodatei, die eine klare Einzelstimme enthält; name und description (optional), die den Namen und die Beschreibung der Sprachrolle angeben.
Anforderungen an die Audiodatei
  • Das Audioformat muss WAV oder MP3 sein
  • Die Audio-Dauer muss zwischen 10~240 Sekunden liegen, empfohlen wird die Verwendung von 30~60 Sekunden sauberem Einzelstimmenmaterial
  • Das Audio sollte klare, erkennbare Einzelstimmen enthalten
  • Bitte vermeiden Sie Hintergrundgeräusche, Begleitmusik, Echo, Hall; vollständige Lieder mit Begleitmusik können normalerweise nicht durch die Stimmverifikation validiert werden
  • Es sollten keine mehreren Sprecher oder mehrfache Stimmen enthalten sein
  • Materialien mit zu niedriger Lautstärke, unklarer Sprache oder übermäßigem Rauschen können zu Klonfehlern oder schlechten Ergebnissen führen Einschränkungen der Nutzung
  • Sprachrollen, die durch das Hochladen von Audio erstellt wurden, sind private Ressourcen
  • Diese Sprachrolle unterstützt keine plattformübergreifende Wiederverwendung
  • Es wird empfohlen, die Rolle nach erfolgreicher Erstellung schnell zu verwenden, da eine lange Nichtnutzung zu Ungültigkeit oder Unbrauchbarkeit führen kann
  • Der zurückgegebene name wird vom System automatisch generiert, bitte verwenden Sie die zurückgegebene persona_id als Referenz
Bei einem Fehler bitte zuerst erneut versuchen Sprachklonierung ist eine rechenintensive Aufgabe, selbst wenn das Material vollständig konform ist, besteht eine gewisse Wahrscheinlichkeit für sporadische Fehler, häufige Rückgaben wie voices_sound_different (Stimmverifikation nicht bestanden) usw. Diese Art von Fehlern hängt nicht von der Audioqualität ab, ein erneuter Versuch mit demselben Material führt normalerweise zum Erfolg, es wird empfohlen, bei der Integration 1-2 automatische Wiederholungen für fehlerhafte Ergebnisse zu implementieren. Fehlgeschlagene Anfragen werden nicht berechnet.
Die oben genannte https://cdn.acedata.cloud/suno_demo.mp3 ist ein direkt aufrufbares Beispielmaterial (MP3, 41 Sekunden, Einzelstimme). Für ein Beispiel im WAV-Format kann verwendet werden https://cdn.acedata.cloud/uploads/82d23b97-ec1c-4b41-91b8-989fc51f8765 (WAV, 41 Sekunden, Mono 44.1kHz).
Das Ergebnis sieht wie folgt aus:
Wie zu sehen ist, ist das persona_id-Feld in data die ID der erstellten Sprachrolle. Das Feld is_public ist immer false, da die durch das Hochladen von Audio erstellte Sprachrolle privat ist. Beachten Sie, dass der zurückgegebene name automatisch vom System generiert wird, verwenden Sie bitte die persona_id, um auf diese Sprachrolle zuzugreifen.

Schritt 2: Verwendung der Sprachrolle zur Musikgenerierung

Nachdem wir die Sprachrollen-ID haben, können wir die Suno Audios Generation API zur Musikgenerierung verwenden. Setzen Sie action auf generate und persona_id auf die oben zurückgegebene Sprachrollen-ID, das generierte Lied wird mit der geklonten Stimme gesungen.
Hinweis: Sprachklonierung unterstützt nur Modelle chirp-v4-5 und höher (wie chirp-v4-5, chirp-v5, chirp-v5-5), nicht chirp-v4.
Das Ergebnis sieht wie folgt aus:
Wie zu sehen ist, wurde das generierte Lied mit der geklonten Stimme gesungen. persona_id kann auch in Verbindung mit der cover-Aktion verwendet werden, um bestehende Lieder mit der geklonten Stimme zu covern.