Skip to main content
Cette interface est basée sur Fish Audio Official Model API et est utilisée pour créer un modèle de voix cloné réutilisable à long terme à partir d’un échantillon audio. L’adresse est POST https://api.acedata.cloud/fish/model.
Si vous avez besoin d’utiliser une voix de référence temporairement, il n’est pas nécessaire de créer un modèle, vous pouvez directement utiliser le references de Fish TTS API pour un clonage instantané. Pour rechercher des voix existantes, veuillez consulter Fish Model Query API ; pour interroger les détails d’une voix unique par _id, veuillez consulter Fish Model Get API.

Processus de demande

Pour utiliser Fish Model API, commencez par obtenir votre API Token sur Ace Data Cloud Console pour référence. Si vous n’êtes pas encore connecté ou enregistré, vous serez automatiquement redirigé vers la page de connexion pour vous inviter à vous inscrire et à vous connecter, après quoi vous serez automatiquement renvoyé à la page actuelle. Un seul API Token suffit pour accéder à tous les services de la plateforme, il n’est pas nécessaire de demander un pour chaque service. La première demande vous donnera un quota gratuit pour une expérience sans frais ; si le quota est insuffisant, vous pouvez recharger le solde général dans la console.
📘 Documentation complète : Fish Model API →

Champs du corps de la requête

Les champs sont identiques à ceux de l’upstream, veuillez également consulter Fish Documentation Officielle.

Exemple : Créer une voix clonée privée

Remarque : voices doit être une chaîne (une seule URL audio), pas un tableau. Si vous le transmettez sous la forme ["..."], l’upstream le rejettera.
La réponse réussie renvoie directement l’objet ModelEntity de la plateforme Fish (l’exemple ci-dessous est le modèle de voix minimal que nous avons testé, certaines longues chaînes ont été supprimées pour faciliter la lecture) :
_id peut être utilisé comme valeur pour le champ reference_id dans le Fish TTS API pour synthétiser la voix clonée :

Exigences d’échantillon

Valeurs d’expérience (identiques à l’upstream, vous pouvez vous référer à Fish Documentation Officielle) :
  • La durée recommandée est de plus de 30 secondes et de moins de 5 minutes pour un meilleur effet ; au-delà de 10 minutes, le rendement marginal est faible.
  • Taux d’échantillonnage de 16 kHz ou plus, mono ou stéréo.
  • Le contenu doit être aussi propre que possible : pas de musique de fond, d’écho, de bruit ambiant évident ; même locuteur.
  • Formats recommandés : mp3 / wav.
Si vous n’êtes pas sûr de la qualité de l’échantillon, vous pouvez également transmettre enhance_audio_quality: true pour que l’upstream améliore d’abord la qualité audio.

Informations de facturation

La création d’un modèle de voix clonée (POST /fish/model) est gratuite, aucun frais n’est facturé ; les interfaces de requête de voix ([Fish Model Query](https://platform.acedata.cloud/documents/fish-model-query), [Fish Model Get](https://platform.acedata.cloud/documents/fish-model-get)) ne sont également pas facturées. Les frais ne sont générés que lors de l’appel ultérieur de Fish TTS pour synthétiser la voix.

Gestion des erreurs

  • 400 token_mismatched : Paramètre de demande manquant ou non valide (le plus souvent, voices n’est pas une URL, ou a été transmis sous forme de tableau).
  • 401 invalid_token : Le token d’authentification n’existe pas ou est invalide.
  • 429 too_many_requests : Limite de taux du compte atteinte.
  • 500 api_error : Erreur interne du serveur.
Exemple de réponse d’erreur :

Conclusion

Pour appeler cette interface, il suffit de préparer une URL d’échantillon audio accessible publiquement, de la placer dans le champ voices pour obtenir le _id, puis de l’alimenter dans le reference_id de /fish/tts pour compléter le processus de bout en bout « clonage → synthèse ». Un point de blocage courant est que voices doit être une chaîne de caractères, ne peut pas être un tableau.