Processo di Richiesta
Per utilizzare l’API GLM Chat Completion, prima di tutto vai al Pannello di Controllo di Ace Data Cloud per ottenere il tuo API Token, da conservare per uso futuro.
Se non hai ancora effettuato il login o la registrazione, verrai automaticamente reindirizzato alla pagina di login che ti invita a registrarti e accedere; una volta completato, verrai riportato automaticamente alla pagina corrente.
Un API Token è sufficiente per accedere a tutti i servizi della piattaforma, senza necessità di richiederne uno separato per ogni servizio. La prima richiesta riceverà un credito gratuito, che consente di provare gratuitamente; se il credito è insufficiente, puoi ricaricare il saldo generale nel pannello di controllo.
📘 Documentazione Completa: GLM Chat Completion API →
Utilizzo di Base
L’indirizzo di richiesta per l’API GLM Chat Completion èhttps://api.acedata.cloud/glm/chat/completions, utilizzando l’autenticazione Bearer Token; il corpo della richiesta è compatibile con il protocollo OpenAI Chat Completions.
Quando utilizzi per la prima volta questa interfaccia, è necessario compilare almeno tre contenuti:
authorization: seleziona direttamente il Bearer Token dal menu a discesa.model: scegli il modello GLM da chiamare; i modelli attualmente supportati includono:glm-5.3: il modello di punta più recente, supporta 1M di contesto e un massimo di 128K di output, adatto per inferenze complesse, codice e compiti di Agent. L’inferenza è sempre attivata e puoi sceglierereasoning_efforttralow,highomax.glm-5.2: il modello di punta della generazione precedente, con forti capacità complessive.glm-5.1: modello di punta maturo, adatto per compiti complessi generali.glm-4.7: eccelle in inferenza, chiamate a strumenti e compiti di codice.glm-4.6: modello di dialogo generale, bilancia effetti e costi.glm-3-turbo: modello di dialogo classico, adatto per compiti generali di generazione di testo.
messages: array di messaggi, ogni messaggio contieneroleecontent,rolesupporta tre ruoli:user,assistant,system.
max_tokens: limita il numero massimo di token per una singola risposta.temperature: casualità nella generazione, tra 0-2, valori più alti portano a maggiore dispersione.top_p: parametro di campionamento nucleare, controlla la soglia di probabilità cumulativa dei token candidati.n: quante risposte candidate generare in una volta.stream: se abilitare la risposta in streaming, predefinitofalse.stop: sequenza di arresto personalizzata.
id: ID unico per il compito di dialogo attuale.created: data di creazione del compito di dialogo attuale (timestamp Unix, in secondi).model: nome del modello GLM effettivamente chiamato.choices: elenco delle risposte generate dal modello.choices[i].message.contentè il testo specifico della risposta del modello,finish_reasonindica il motivo di fine (stop,length,tool_calls,content_filter, ecc.).usage: statistiche sull’uso dei token per questa richiesta, includendoprompt_tokens,completion_tokens,total_tokens.
Risposta in Streaming
Questa interfaccia supporta la risposta in streaming (Server-Sent Events), il che è molto utile per l’integrazione con pagine web, consentendo di visualizzare il testo parola per parola. Se desideri restituire la risposta in streaming, imposta il parametrostream nel corpo della richiesta su true.
Codice di esempio per la chiamata Python:
data nella risposta, ogni data contiene un frammento incrementale. choices[i].delta.content è il frammento di testo aggiunto nel chunk corrente, puoi concatenare questi frammenti per formare una risposta completa. Quando il contenuto di data è [DONE], indica che la risposta in streaming è terminata. L’ultimo chunk con usage riassumerà l’uso dei token per questa richiesta.
Esempio in JavaScript (Node.js):
Conversazione multipla
Se desideri implementare una funzionalità di conversazione multipla, devi inserire le conversazioni storiche nell’arraymessages, mantenendo l’ordine alternato tra user e assistant.
Esempio di chiamata in Python:
choices sono coerenti con l’uso di base, il modello fornisce una risposta basata sulla storia completa della conversazione, supportando così l’interazione contestuale multipla.
Messaggio di sistema (System Prompt)
Puoi aggiungere un messaggio conrole di system all’inizio di messages per vincolare il ruolo, lo stile o il comportamento del modello:
Chiamata a strumenti (Function Calling)
Il modello GLM supporta la chiamata a funzioni compatibile con OpenAI, puoi dichiarare le funzioni chiamabili tramite il parametrotools, il modello restituirà informazioni strutturate sulla chiamata della funzione in choices[i].message.tool_calls quando necessario.
finish_reason come tool_calls, e fornirà il nome della funzione e i parametri in forma di stringa JSON in message.tool_calls. Puoi eseguire quella funzione e restituire il risultato come un messaggio con role di tool al modello, completando così il ciclo di chiamata dello strumento.
Suggerimenti per la scelta del modello
api_error e il messaggio è Il servizio è temporaneamente non disponibile, riprovare più tardi., di solito indica che il servizio GLM upstream è temporaneamente non disponibile, si consiglia di riprovare con un backoff esponenziale o di passare a un altro modello GLM disponibile (ad esempio, passare temporaneamente da glm-5.1 a glm-4.7 o glm-4.6).

