Skip to main content
Questo API si basa su Fish Audio Official Model API ed è utilizzato per creare un modello di voce clonata riutilizzabile a lungo termine basato su un campione audio. L’indirizzo è POST https://api.acedata.cloud/fish/model.
Se hai bisogno di utilizzare una voce di riferimento temporaneamente, non è necessario creare un modello, puoi utilizzare direttamente il references dell’Fish TTS API per un clone istantaneo. Per la ricerca paginata delle voci esistenti, consulta il Fish Model Query API; per cercare i dettagli di una singola voce per _id, consulta il Fish Model Get API.

Processo di Richiesta

Per utilizzare il Fish Model API, prima vai al Ace Data Cloud Console per ottenere il tuo API Token, da conservare per uso futuro. Se non hai ancora effettuato il login o la registrazione, verrai automaticamente reindirizzato alla pagina di login che ti invita a registrarti e accedere; una volta completato, verrai riportato automaticamente alla pagina corrente. Un API Token è sufficiente per accedere a tutti i servizi della piattaforma, non è necessario richiederne uno separato per ogni servizio. La prima richiesta ti darà un credito gratuito per un’esperienza senza costi; se il credito è insufficiente, puoi ricaricare il saldo generale nel console.
📘 Documentazione completa: Fish Model API →

Campi del Corpo della Richiesta

I campi sono completamente coerenti con quelli upstream, si prega di consultare anche la documentazione ufficiale di Fish.

Esempio: Creare una Voce Clonata Privata

Nota: voices deve essere una stringa (singolo URL audio), non un array. Se inviato come ["..."], l’upstream rifiuterà.
La risposta di successo restituisce direttamente l’oggetto ModelEntity della piattaforma Fish (l’esempio seguente è il campione minimo utilizzabile che abbiamo testato, con alcune lunghe stringhe rimosse per facilitarne la lettura):
_id può essere utilizzato come valore del campo reference_id nell’Fish TTS API per utilizzare questa voce clonata per la sintesi vocale:

Requisiti per i Campioni

Valori di esperienza (coerenti con l’upstream, consultare la documentazione ufficiale di Fish):
  • La durata consigliata è superiore a 30 secondi e inferiore a 5 minuti; oltre 10 minuti il guadagno marginale è limitato.
  • Frequenza di campionamento di 16 kHz o superiore, mono o stereo va bene.
  • Contenuto il più pulito possibile: senza musica di sottofondo, eco, rumori ambientali evidenti; stesso parlante.
  • Formato consigliato mp3 / wav.
Se non sei sicuro della qualità del campione, puoi inviare anche enhance_audio_quality: true per far migliorare la qualità audio upstream.

Informazioni di Fatturazione

La creazione di un modello di voce clonata (POST /fish/model) è gratuita, non ci sono costi; anche le interfacce di query delle voci ([Fish Model Query](https://platform.acedata.cloud/documents/fish-model-query), [Fish Model Get](https://platform.acedata.cloud/documents/fish-model-get)) non comportano costi. I costi si generano solo durante le chiamate successive a Fish TTS per la sintesi vocale in base all’uso.

Gestione degli Errori

  • 400 token_mismatched:parametri della richiesta mancanti o non validi (il più comune è che voices non sia un URL, o sia passato come array).
  • 401 invalid_token:token di autenticazione assente o non valido.
  • 429 too_many_requests:limite di velocità dell’account attivato.
  • 500 api_error:errore interno del server.
Esempio di risposta di errore:

Conclusione

Per chiamare questa interfaccia è sufficiente preparare un URL di campione audio accessibile pubblicamente, metterlo nel campo voices per ottenere _id, e poi fornirlo a reference_id di /fish/tts per completare il processo end-to-end di “clonazione → sintesi”. Un comune punto critico è che voices deve essere una stringa, non può essere un array.