Skip to main content
Esta interface é baseada na API Model do Fish Audio e é utilizada para criar um modelo de voz clonada reutilizável a longo prazo com base em uma amostra de áudio. O endereço é POST https://api.acedata.cloud/fish/model.
Se você precisa usar uma voz de referência temporariamente, não é necessário criar um modelo, você pode usar diretamente o references da API Fish TTS para clonagem instantânea. Para pesquisar vozes existentes, consulte a API Fish Model Query; para consultar detalhes de uma única voz pelo _id, consulte a API Fish Model Get.

Processo de Solicitação

Para usar a API Fish Model, primeiro acesse o console da Ace Data Cloud para obter seu Token de API, que deve ser guardado. Se você ainda não estiver logado ou registrado, será redirecionado automaticamente para a página de login, onde será convidado a se registrar e logar. Após a conclusão, você será redirecionado de volta para a página atual. Um Token de API é suficiente para acessar todos os serviços da plataforma, não é necessário solicitar um para cada serviço. A primeira solicitação oferece um crédito gratuito para que você possa experimentar; se o crédito acabar, você pode recarregar o saldo geral no console.
📘 Documentação completa: API Fish Model →

Campos do Corpo da Solicitação

Os campos são idênticos aos da interface anterior, consulte também a documentação oficial do Fish.

Exemplo: Criar uma voz clonada privada

Atenção: voices deve ser uma string (uma única URL de áudio), não um array. Se for passado como ["..."], a interface anterior irá rejeitar.
A resposta bem-sucedida retorna diretamente o objeto ModelEntity da plataforma Fish (o exemplo abaixo é a voz mínima utilizável que testamos, com alguns campos longos removidos para facilitar a leitura):
_id pode ser usado como o valor do campo reference_id na API Fish TTS para sintetizar voz usando essa voz clonada:

Requisitos da Amostra

Valores recomendados (consistente com a interface anterior, consulte a documentação oficial do Fish):
  • Duração recomendada de mais de 30 segundos e até 5 minutos; mais de 10 minutos tem um retorno marginal baixo.
  • Taxa de amostragem de 16 kHz ou mais, mono ou estéreo.
  • O conteúdo deve ser o mais limpo possível: sem música de fundo, eco, ruído ambiental evidente; com o mesmo falante.
  • Formato recomendado mp3 / wav.
Se você não tiver certeza da qualidade da amostra, pode passar enhance_audio_quality: true para que a interface anterior faça a melhoria da qualidade do áudio.

Informações de Cobrança

Criar um modelo de voz clonada (POST /fish/model) é gratuito, não há cobrança; as interfaces de consulta de voz (Fish Model Query, Fish Model Get) também não têm custo. A cobrança ocorre apenas ao chamar a API Fish TTS para sintetizar voz, conforme o uso.

Tratamento de Erros

  • 400 token_mismatched:Parâmetros de solicitação ausentes ou inválidos (o mais comum é que voices não seja uma URL ou tenha sido passado como um array).
  • 401 invalid_token:Token de autenticação inexistente ou inválido.
  • 429 too_many_requests:Limite de taxa da conta acionado.
  • 500 api_error:Erro interno do servidor.
Exemplo de resposta de erro:

Conclusão

Para chamar esta interface, basta preparar uma URL de áudio de amostra acessível publicamente, colocá-la no campo voices para obter o _id, e então fornecer o reference_id para /fish/tts, completando assim o processo de “clonagem → síntese”. Um ponto comum de erro é que voices deve ser uma string, não pode ser um array.