kimi-k3 para programación a largo plazo, agentes, razonamiento complejo y trabajo de conocimiento, que se puede invocar a través de la API de Chat Completions compatible con OpenAI.
Este documento describe principalmente el proceso de uso de la API de Kimi Chat Completion, que nos permite utilizar fácilmente la función de conversación oficial de Kimi.
Proceso de Solicitud
Para usar la API de Kimi Chat Completion, primero dirígete a la consola de Ace Data Cloud para obtener tu token de API, que debes guardar como respaldo.
Si aún no has iniciado sesión o registrado, serás redirigido automáticamente a la página de inicio de sesión que te invitará a registrarte e iniciar sesión; una vez completado, volverás automáticamente a la página actual.
Un token de API es suficiente para acceder a todos los servicios de la plataforma, no es necesario solicitar uno por cada servicio. La primera solicitud te otorgará un crédito gratuito para que puedas probarlo; si el crédito es insuficiente, puedes recargar el saldo general en la consola.
📘 Documentación completa: Kimi Chat Completion API →
Uso Básico
A continuación, puedes completar los campos correspondientes en la interfaz, como se muestra en la imagen:
authorization que puedes seleccionar directamente de la lista desplegable; model que se utiliza para seleccionar el modelo Kimi, se recomienda usar kimi-k3; messages es un array de mensajes de conversación, cada mensaje contiene role y content, donde role admite user, assistant, system y tool.
También puedes notar que a la derecha hay un código de llamada correspondiente generado, puedes copiar el código para ejecutarlo directamente, o puedes hacer clic en el botón “Try” para realizar pruebas.

reasoning_effort: max (se omiten los campos de extensión no utilizados):
id, el ID que genera esta tarea de conversación, utilizado para identificar de manera única esta tarea de conversación.model, el modelo Kimi seleccionado en el sitio oficial.choices, la información de respuesta que Kimi proporciona en respuesta a la consulta.usage: información estadística sobre los tokens utilizados en esta pregunta y respuesta.
choices se incluye la información de respuesta de Kimi, donde choices contiene la información específica de la respuesta de Kimi, como se puede ver en la imagen.

content dentro de choices contiene el contenido específico de la respuesta de Kimi; K3 también puede devolver reasoning_content, que se utiliza para representar el proceso de razonamiento.
Intensidad de Razonamiento de K3
kimi-k3 siempre habilita el razonamiento. El cuerpo de la solicitud admite el campo reasoning_effort en el nivel superior, el único valor actualmente admitido es max; si se omite este campo, también se utilizará max. standard, high u otras cadenas pueden ser aceptadas de manera flexible por algunos sistemas compatibles, pero no garantizan un cambio en el comportamiento del razonamiento, no se debe depender de ello.
messages, incluyendo reasoning_content y tool_calls.
Referencia Oficial
- Thinking Effort: explica que Kimi K3 siempre habilita el razonamiento, el único valor actualmente admitido para
reasoning_effortesmax. - Model Parameter Reference: compara los parámetros de razonamiento, la ventana de contexto y las diferencias en las llamadas a herramientas entre K3 y la serie K2.
- Create Chat Completion: solicitudes, respuestas y definiciones de campos de OpenAPI de Chat Completions oficiales de Moonshot.
Respuesta en Flujo
Esta interfaz también admite respuestas en flujo, lo cual es muy útil para la integración web, ya que permite mostrar el contenido palabra por palabra. Si deseas que la respuesta se devuelva en flujo, puedes cambiar el parámetrostream en el encabezado de la solicitud a true.
El cambio se muestra en la imagen, pero el código de llamada necesita tener los cambios correspondientes para admitir respuestas en flujo.

stream a true, la API devolverá los datos JSON correspondientes línea por línea, y a nivel de código, necesitamos hacer los cambios necesarios para obtener los resultados línea por línea.
Código de ejemplo en Python:
data en la respuesta, donde data contiene el choices, que es el contenido de la respuesta más reciente, consistente con lo que se describió anteriormente. choices es el contenido de respuesta nuevo, que puede integrarse en su sistema según los resultados. Al mismo tiempo, el final de la respuesta en flujo se determina según el contenido de data; si el contenido es [DONE], significa que la respuesta en flujo ha terminado por completo. El resultado devuelto de data tiene varios campos, que se describen a continuación:
id, el ID que genera esta tarea de conversación, utilizado para identificar de manera única esta tarea de conversación.model, el modelo seleccionado de la página oficial de Kimi.choices, la información de respuesta que Kimi proporciona en respuesta a la consulta.
Diálogo en múltiples turnos
Si desea integrar la función de diálogo en múltiples turnos, necesita cargar múltiples consultas en el campomessages, ejemplos específicos de múltiples consultas se muestran en la imagen a continuación:

choices es consistente con el contenido de uso básico, que incluye el contenido específico de respuesta de Kimi para múltiples diálogos, lo que permite responder a las preguntas correspondientes según el contenido de múltiples diálogos.
Manejo de errores
Al llamar a la API, si se encuentra con un error, la API devolverá el código de error y la información correspondiente. Por ejemplo:400 token_mismatched: Solicitud incorrecta, posiblemente debido a parámetros faltantes o inválidos.400 api_not_implemented: Solicitud incorrecta, posiblemente debido a parámetros faltantes o inválidos.401 invalid_token: No autorizado, token de autorización inválido o faltante.429 too_many_requests: Demasiadas solicitudes, ha superado el límite de tasa.500 api_error: Error interno del servidor, algo salió mal en el servidor.
Ejemplo de respuesta de error
Conclusión
A través de este documento, ha aprendido cómo usar la API de Kimi Chat Completion para implementar conversaciones normales, respuestas en flujo, diálogos en múltiples turnos, y cómo controlar la intensidad de razonamiento de K3 a través dereasoning_effort.
