Процесс заявки
Чтобы использовать GLM Chat Completion API, сначала перейдите в консоль Ace Data Cloud, чтобы получить ваш API Token и сохранить его для дальнейшего использования.
Если вы еще не вошли в систему или не зарегистрированы, вы будете автоматически перенаправлены на страницу входа, где вас пригласят зарегистрироваться и войти в систему, после чего вы будете автоматически возвращены на текущую страницу.
Один API Token позволяет вызывать все услуги платформы, не требуя отдельной заявки для каждой услуги. При первой заявке предоставляется бесплатный лимит, который можно использовать бесплатно; если лимит исчерпан, вы можете пополнить общий баланс в консоли.
📘 Полная документация: GLM Chat Completion API →
Основное использование
Адрес запроса GLM Chat Completion API:https://api.acedata.cloud/glm/chat/completions, используется аутентификация Bearer Token, тело запроса совместимо с протоколом OpenAI Chat Completions.
При первом использовании этого интерфейса нам необходимо заполнить как минимум три поля:
authorization: просто выберите Bearer Token из выпадающего списка.model: выберите модель GLM, которую хотите вызвать, в настоящее время поддерживаемые модели включают:glm-5.3: новейшая флагманская модель, поддерживающая 1M контекста и максимальный вывод 128K, подходит для сложных выводов, задач кода и Agent. Вывод всегда включен, можно выбратьreasoning_effortкакlow,highилиmax.glm-5.2: предшествующая флагманская модель, обладающая сильными комплексными способностями.glm-5.1: зрелая флагманская модель, подходящая для общих сложных задач.glm-4.7: демонстрирует отличные результаты в выводах, вызовах инструментов и задачах кода.glm-4.6: универсальная диалоговая модель, сбалансированная по эффективности и стоимости.glm-3-turbo: классическая диалоговая модель, подходящая для общих задач генерации текста.
messages: массив подсказок, каждое сообщение содержитroleиcontent,roleподдерживает три роли:user,assistant,system.
max_tokens: ограничение на максимальное количество токенов в одном ответе.temperature: случайность генерации, от 0 до 2, чем больше значение, тем более разнообразным будет ответ.top_p: параметр ядерной выборки, контролирующий порог накопленной вероятности кандидатов токенов.n: сколько кандидатов ответов генерировать за раз.stream: включить ли потоковый ответ, по умолчаниюfalse.stop: пользовательская последовательность остановки.
id: уникальный ID текущей задачи диалога.created: время создания текущей задачи диалога (Unix временная метка, в секундах).model: название фактически вызванной модели GLM.choices: список ответов, сгенерированных моделью.choices[i].message.content— это конкретный текст ответа модели,finish_reasonуказывает причину завершения (stop,length,tool_calls,content_filterи т.д.).usage: статистика использования токенов для текущего запроса, включаетprompt_tokens,completion_tokens,total_tokens.
Потоковый ответ
Этот интерфейс поддерживает потоковые ответы (Server-Sent Events), что очень полезно для веб-интеграции, позволяя веб-странице реализовать эффект отображения по буквам. Если вы хотите получить потоковый ответ, просто установите параметрstream в true в теле запроса.
Пример кода вызова на Python:
data, каждая data содержит фрагмент инкремента. choices[i].delta.content — это текущий новый текстовый фрагмент, который вы можете соединить, чтобы сформировать полный ответ. Когда содержимое data равно [DONE], это означает, что потоковый ответ завершен. Последний фрагмент с usage подводит итог использованию токенов в этом запросе.
Пример на JavaScript (Node.js):
Многоуровневый диалог
Если вы хотите реализовать функцию многоуровневого диалога, вам нужно последовательно помещать историю диалога в массивmessages, сохраняя порядок чередования user и assistant.
Пример вызова на Python:
choices, соответствует основному использованию, модель дает ответ на основе полной истории диалога, поддерживая многоуровневое взаимодействие в контексте.
Системные подсказки (System Prompt)
Вы можете добавить сообщение сrole равным system в начале messages, чтобы ограничить роль, стиль или поведение модели:
Вызов функций (Function Calling)
Модель GLM поддерживает совместимый с OpenAI вызов функций, вы можете объявить вызываемые функции через параметрtools, модель вернет структурированную информацию о вызове функции в choices[i].message.tool_calls, когда это необходимо.
tool_calls, и в message.tool_calls будет указано имя функции и параметры в формате JSON-строки. Вы можете выполнить эту функцию и вернуть результат как сообщение с role, равным tool, модели, чтобы завершить полный цикл вызова инструмента.
Рекомендации по выбору модели
api_error и сообщение Сервис временно недоступен, пожалуйста, попробуйте позже., это обычно означает, что upstream GLM сервис временно недоступен, рекомендуется повторить попытку с экспоненциальной задержкой или переключиться на другую доступную модель GLM (например, временно переключиться с glm-5.1 на glm-4.7 или glm-4.6).

