Proceso de Solicitud
Para usar la API de GLM Chat Completion, primero dirígete a la consola de Ace Data Cloud para obtener tu Token de API, que debes guardar como respaldo.
Si aún no has iniciado sesión o registrado, serás redirigido automáticamente a la página de inicio de sesión que te invitará a registrarte e iniciar sesión; una vez completado, volverás automáticamente a la página actual.
Un Token de API es suficiente para acceder a todos los servicios de la plataforma, no es necesario solicitar uno por cada servicio. La primera solicitud incluirá un crédito gratuito, que te permitirá experimentar sin costo; si el crédito es insuficiente, puedes recargar el saldo general en la consola.
📘 Documentación completa: GLM Chat Completion API →
Uso Básico
La dirección de solicitud de la API de GLM Chat Completion eshttps://api.acedata.cloud/glm/chat/completions, utilizando autenticación Bearer Token, y el cuerpo de la solicitud es compatible con el protocolo de OpenAI Chat Completions.
En la primera vez que uses esta interfaz, necesitamos completar al menos tres contenidos:
authorization: selecciona directamente Bearer Token en la lista desplegable.model: elige el modelo GLM que deseas invocar, los modelos actualmente soportados incluyen:glm-5.3: el modelo insignia más reciente, soporta 1M de contexto y hasta 128K de salida, adecuado para razonamientos complejos, tareas de código y de Agente. El razonamiento está siempre habilitado, y puedes elegirreasoning_effortcomolow,highomax.glm-5.2: modelo insignia de la generación anterior, con fuertes capacidades generales.glm-5.1: modelo insignia maduro, adecuado para tareas complejas generales.glm-4.7: destaca en razonamiento, llamadas a herramientas y tareas de código.glm-4.6: modelo de diálogo general, equilibrando efectividad y costo.glm-3-turbo: modelo de diálogo clásico, adecuado para tareas generales de generación de texto.
messages: array de mensajes, cada mensaje incluyeroleycontent, donderoleadmite tres tipos:user,assistant,system.
max_tokens: limita el número máximo de tokens en una sola respuesta.temperature: aleatoriedad en la generación, entre 0-2, cuanto mayor sea el valor, más dispersa será la respuesta.top_p: parámetro de muestreo nuclear, controla el umbral de probabilidad acumulativa de los tokens candidatos.n: cuántas respuestas candidatas generar en una sola vez.stream: si habilitar o no la respuesta en streaming, por defectofalse.stop: secuencia de parada personalizada.
id: ID único de la tarea de diálogo actual.created: hora de creación de la tarea de diálogo actual (marca de tiempo Unix, en segundos).model: nombre del modelo GLM realmente invocado.choices: lista de respuestas generadas por el modelo.choices[i].message.contentes el texto específico de la respuesta del modelo,finish_reasonindica la razón de finalización (stop,length,tool_calls,content_filter, etc.).usage: estadísticas del uso de tokens en esta solicitud, que incluyeprompt_tokens,completion_tokens,total_tokens.
Respuesta en Streaming
Esta interfaz soporta respuestas en streaming (Eventos Enviados por el Servidor), lo cual es muy útil para la integración en páginas web, permitiendo mostrar el contenido palabra por palabra. Si deseas que la respuesta se devuelva en streaming, simplemente establece el parámetrostream en true en el cuerpo de la solicitud.
Código de ejemplo en Python para la llamada:
data en la respuesta, cada data contiene un fragmento incremental. choices[i].delta.content es el fragmento de texto nuevo añadido en el chunk actual, puedes concatenar estos fragmentos para formar una respuesta completa. Cuando el contenido de data es [DONE], indica que la respuesta en streaming ha terminado. El último chunk que lleva usage resumirá el uso de tokens de esta solicitud.
Ejemplo en JavaScript (Node.js):
Diálogo en múltiples turnos
Si deseas implementar la función de diálogo en múltiples turnos, necesitas colocar el historial de conversación en el arreglomessages, manteniendo el orden alternado de user y assistant.
Ejemplo de código en Python:
choices es consistente con el uso básico, el modelo proporciona una respuesta basada en el historial completo de la conversación, lo que permite la interacción contextual en múltiples turnos.
Mensaje de sistema (System Prompt)
Puedes agregar un mensaje conrole de system al principio de messages para restringir el rol, estilo o comportamiento del modelo:
Llamada a funciones (Function Calling)
El modelo GLM soporta llamadas a funciones compatibles con OpenAI, puedes declarar funciones llamables a través del parámetrotools, el modelo devolverá información estructurada de la llamada a la función en choices[i].message.tool_calls cuando sea necesario.
finish_reason cambiado a tool_calls, y en message.tool_calls se proporcionará el nombre de la función y los parámetros en forma de cadena JSON. Puedes ejecutar esa función y devolver el resultado como un mensaje con role de tool al modelo, completando así el ciclo de llamada a la herramienta.
Sugerencias para la selección de modelos
api_error y el mensaje es El servicio está temporalmente no disponible, por favor intente de nuevo más tarde., generalmente indica que el servicio GLM upstream está temporalmente no disponible, se sugiere reintentar con retroceso exponencial, o cambiar a otro modelo GLM disponible (por ejemplo, cambiar temporalmente de glm-5.1 a glm-4.7 o glm-4.6).

