Skip to main content
Diese Schnittstelle basiert auf der Fish Audio offiziellen Model API und dient dazu, ein wiederverwendbares Klon-Stimmenmodell basierend auf einer Audioprobe zu erstellen. Die Adresse lautet POST https://api.acedata.cloud/fish/model.
Wenn Sie die Referenzstimme nur vorübergehend verwenden möchten, müssen Sie kein Modell erstellen, sondern können direkt die references des Fish TTS API für eine einmalige sofortige Klonung verwenden. Für die paginierte Abfrage vorhandener Stimmen siehe Fish Model Query API; für die Abfrage der Details einer einzelnen Stimme nach _id siehe Fish Model Get API.

Antragsprozess

Um die Fish Model API zu nutzen, müssen Sie zunächst Ihr API-Token im Ace Data Cloud Dashboard abrufen und für zukünftige Verwendung aufbewahren. Wenn Sie noch nicht angemeldet oder registriert sind, werden Sie automatisch zur Anmeldeseite weitergeleitet, um sich zu registrieren und anzumelden. Nach Abschluss werden Sie automatisch zur aktuellen Seite zurückgeleitet. Ein API-Token reicht aus, um auf alle Dienste der Plattform zuzugreifen, es ist nicht erforderlich, für jeden Dienst separat zu beantragen. Bei der ersten Beantragung erhalten Sie ein kostenloses Kontingent zur kostenlosen Nutzung; wenn das Kontingent erschöpft ist, können Sie im Dashboard Ihr Guthaben aufladen.
📘 Vollständige Dokumentation: Fish Model API →

Anfragekörperfelder

Die Felder stimmen vollständig mit den upstream überein, bitte beziehen Sie sich auch auf die Fish offizielle Dokumentation.

Beispiel: Erstellen einer privaten Klonstimme

Hinweis: voices muss ein String (einzelne Audio-URL) sein, kein Array. Wenn es als ["..."] übergeben wird, wird es von upstream abgelehnt.
Die erfolgreiche Antwort gibt direkt das ModelEntity-Objekt der Fish-Plattform zurück (das folgende Beispiel zeigt die kleinste getestete verwendbare Stimme, wobei einige lange Felder zur besseren Lesbarkeit entfernt wurden):
_id kann als Wert für das reference_id Feld in der nachfolgenden Fish TTS API verwendet werden, um mit dieser Klonstimme Sprachsynthese durchzuführen:

Anforderungen an die Probe

Erfahrungswerte (übereinstimmend mit upstream, siehe auch Fish offizielle Dokumentation):
  • Die Dauer sollte idealerweise zwischen 30 Sekunden und 5 Minuten liegen; über 10 Minuten bringt nur geringe Vorteile.
  • Abtastrate von 16 kHz oder höher, sowohl Mono- als auch Stereo sind möglich.
  • Der Inhalt sollte möglichst sauber sein: keine Hintergrundmusik, Echo oder deutliche Umgebungsgeräusche; dieselbe sprechende Person.
  • Empfohlene Formate sind mp3 / wav.
Wenn Sie sich über die Qualität der Probe unsicher sind, können Sie gleichzeitig enhance_audio_quality: true übergeben, damit upstream zuerst eine Audioqualitätsverbesserung vornimmt.

Abrechnungsinformationen

Die Erstellung eines Klonmodells für Stimmen (POST /fish/model) ist kostenlos und es fallen keine Gebühren an; auch die Abfrage-Schnittstellen für Stimmen (Fish Model Query, Fish Model Get) sind ebenfalls gebührenfrei. Gebühren entstehen nur bei der nachfolgenden Verwendung des Fish TTS zur Sprachsynthese.

Fehlerbehandlung

  • 400 token_mismatched:Anforderungsparameter fehlen oder sind ungültig (am häufigsten ist voices keine URL oder wurde als Array übergeben).
  • 401 invalid_token:Authentifizierungs-Token existiert nicht oder ist ungültig.
  • 429 too_many_requests:Aktivierung der Kontosatzbeschränkung.
  • 500 api_error:Interner Serverfehler.
Beispiel für eine Fehlermeldung:

Fazit

Um diese Schnittstelle aufzurufen, muss nur eine öffentlich zugängliche Beispiel-Audio-URL vorbereitet werden, die in das Feld voices eingefügt wird, um die _id zu erhalten, die dann als reference_id an /fish/tts übergeben wird, um den End-to-End-Prozess „Klonen → Synthese“ abzuschließen. Häufige Fallstricke sind, dass voices ein String sein muss und kein Array sein darf.