Skip to main content
Esta interfaz se basa en la API Model de Fish Audio y se utiliza para crear un modelo de voz clonada reutilizable a largo plazo basado en una muestra de audio. La dirección es POST https://api.acedata.cloud/fish/model.
Si solo necesita usar una voz de referencia temporalmente, no es necesario crear un modelo, puede usar directamente el references de la API Fish TTS para clonar instantáneamente. Para buscar voces existentes, consulte la API Fish Model Query; para consultar los detalles de una sola voz por _id, consulte la API Fish Model Get.

Proceso de Solicitud

Para usar la API Fish Model, primero obtenga su API Token en la consola de Ace Data Cloud y guárdelo para uso futuro. Si aún no ha iniciado sesión o registrado, será redirigido automáticamente a la página de inicio de sesión que lo invitará a registrarse e iniciar sesión, y después volverá automáticamente a la página actual. Un API Token es suficiente para acceder a todos los servicios de la plataforma, no es necesario solicitar uno por cada servicio. La primera solicitud incluirá un crédito gratuito para que pueda probarlo; si se queda sin créditos, puede recargar el saldo general en la consola.
📘 Documentación completa: API Fish Model →

Campos del Cuerpo de Solicitud

Los campos son idénticos a los de la interfaz superior, consulte también la documentación oficial de Fish.

Ejemplo: Crear una voz clonada privada

Nota: voices debe ser una cadena (una sola URL de audio), no un array. Si se envía como ["..."], la interfaz superior lo rechazará.
La respuesta exitosa devuelve directamente el objeto ModelEntity de la plataforma Fish (el siguiente ejemplo es la voz mínima utilizable que hemos probado, se han eliminado algunos campos largos para facilitar la lectura):
_id se puede usar como el valor del campo reference_id en la posterior API Fish TTS para realizar la síntesis de voz con esta voz clonada:

Requisitos de la Muestra

Valores de experiencia (coinciden con la interfaz superior, consulte la documentación oficial de Fish):
  • Se recomienda una duración de más de 30 segundos y menos de 5 minutos; más de 10 minutos no ofrece grandes beneficios.
  • Tasa de muestreo de 16 kHz o más, se acepta mono o estéreo.
  • El contenido debe ser lo más limpio posible: sin música de fondo, ecos, ruidos ambientales evidentes; un solo hablante.
  • Formato recomendado mp3 / wav.
Si no está seguro de la calidad de la muestra, puede enviar enhance_audio_quality: true para que la interfaz superior mejore la calidad del audio primero.

Descripción de la Facturación

Crear un modelo de voz clonada (POST /fish/model) es gratuito, no se cobran tarifas; las interfaces de consulta de voz (Fish Model Query, Fish Model Get) también son gratuitas. Los costos solo se generan al llamar a Fish TTS para sintetizar voz según el uso.

Manejo de Errores

  • 400 token_mismatched:Faltan o son inválidos los parámetros de la solicitud (lo más común es que voices no sea una URL, o se haya pasado como un array).
  • 401 invalid_token:El token de autenticación no existe o es inválido.
  • 429 too_many_requests:Se ha activado el límite de velocidad de la cuenta.
  • 500 api_error:Error interno del servidor.
Ejemplo de respuesta de error:

Conclusión

Para llamar a esta interfaz, solo necesitas preparar una URL de audio de muestra que sea accesible públicamente, ponerla en el campo voices y podrás obtener el _id, luego alimentarlo al reference_id de /fish/tts para completar el proceso de “clonación → síntesis”. Un punto común de confusión es que voices debe ser una cadena, no puede ser un array.