POST https://api.acedata.cloud/fish/model.
Wenn Sie die Referenzstimme nur vorübergehend verwenden möchten, müssen Sie kein Modell erstellen, sondern können direkt diereferencesdes Fish TTS API für eine einmalige sofortige Klonung verwenden. Für die paginierte Abfrage vorhandener Stimmen siehe Fish Model Query API; für die Abfrage der Details einer einzelnen Stimme nach_idsiehe Fish Model Get API.
Antragsprozess
Um die Fish Model API zu nutzen, müssen Sie zunächst Ihr API-Token im Ace Data Cloud Dashboard abrufen und für zukünftige Verwendung aufbewahren.
Wenn Sie noch nicht angemeldet oder registriert sind, werden Sie automatisch zur Anmeldeseite weitergeleitet, um sich zu registrieren und anzumelden. Nach Abschluss werden Sie automatisch zur aktuellen Seite zurückgeleitet.
Ein API-Token reicht aus, um auf alle Dienste der Plattform zuzugreifen, es ist nicht erforderlich, für jeden Dienst separat zu beantragen. Bei der ersten Beantragung erhalten Sie ein kostenloses Kontingent zur kostenlosen Nutzung; wenn das Kontingent erschöpft ist, können Sie im Dashboard Ihr Guthaben aufladen.
📘 Vollständige Dokumentation: Fish Model API →
Anfragekörperfelder
Die Felder stimmen vollständig mit den upstream überein, bitte beziehen Sie sich auch auf die Fish offizielle Dokumentation.
Beispiel: Erstellen einer privaten Klonstimme
Hinweis:Die erfolgreiche Antwort gibt direkt das ModelEntity-Objekt der Fish-Plattform zurück (das folgende Beispiel zeigt die kleinste getestete verwendbare Stimme, wobei einige lange Felder zur besseren Lesbarkeit entfernt wurden):voicesmuss ein String (einzelne Audio-URL) sein, kein Array. Wenn es als["..."]übergeben wird, wird es von upstream abgelehnt.
_id kann als Wert für das reference_id Feld in der nachfolgenden Fish TTS API verwendet werden, um mit dieser Klonstimme Sprachsynthese durchzuführen:
Anforderungen an die Probe
Erfahrungswerte (übereinstimmend mit upstream, siehe auch Fish offizielle Dokumentation):- Die Dauer sollte idealerweise zwischen 30 Sekunden und 5 Minuten liegen; über 10 Minuten bringt nur geringe Vorteile.
- Abtastrate von 16 kHz oder höher, sowohl Mono- als auch Stereo sind möglich.
- Der Inhalt sollte möglichst sauber sein: keine Hintergrundmusik, Echo oder deutliche Umgebungsgeräusche; dieselbe sprechende Person.
- Empfohlene Formate sind
mp3/wav.
enhance_audio_quality: true übergeben, damit upstream zuerst eine Audioqualitätsverbesserung vornimmt.
Abrechnungsinformationen
Die Erstellung eines Klonmodells für Stimmen (POST /fish/model) ist kostenlos und es fallen keine Gebühren an; auch die Abfrage-Schnittstellen für Stimmen (Fish Model Query, Fish Model Get) sind ebenfalls gebührenfrei. Gebühren entstehen nur bei der nachfolgenden Verwendung des Fish TTS zur Sprachsynthese.
Fehlerbehandlung
400 token_mismatched:Anforderungsparameter fehlen oder sind ungültig (am häufigsten istvoiceskeine URL oder wurde als Array übergeben).401 invalid_token:Authentifizierungs-Token existiert nicht oder ist ungültig.429 too_many_requests:Aktivierung der Kontosatzbeschränkung.500 api_error:Interner Serverfehler.
Fazit
Um diese Schnittstelle aufzurufen, muss nur eine öffentlich zugängliche Beispiel-Audio-URL vorbereitet werden, die in das Feldvoices eingefügt wird, um die _id zu erhalten, die dann als reference_id an /fish/tts übergeben wird, um den End-to-End-Prozess „Klonen → Synthese“ abzuschließen. Häufige Fallstricke sind, dass voices ein String sein muss und kein Array sein darf.
