Antragsprozess
Um die GLM Chat Completion API zu nutzen, müssen Sie zunächst im Ace Data Cloud Dashboard Ihr API-Token abrufen und für zukünftige Verwendung aufbewahren.
Wenn Sie noch nicht angemeldet oder registriert sind, werden Sie automatisch zur Anmeldeseite weitergeleitet, wo Sie zur Registrierung und Anmeldung eingeladen werden. Nach Abschluss werden Sie automatisch zur aktuellen Seite zurückgeleitet.
Ein API-Token reicht aus, um alle Dienste der Plattform aufzurufen, es ist nicht erforderlich, für jeden Dienst separat zu beantragen. Bei der ersten Beantragung erhalten Sie ein kostenloses Kontingent, um es kostenlos auszuprobieren; wenn das Kontingent nicht ausreicht, können Sie im Dashboard Ihr allgemeines Guthaben aufladen.
📘 Vollständige Dokumentation: GLM Chat Completion API →
Grundlegende Nutzung
Die Anforderungsadresse der GLM Chat Completion API lautethttps://api.acedata.cloud/glm/chat/completions, die Authentifizierung erfolgt über Bearer Token, der Anforderungstext ist mit dem OpenAI Chat Completions-Protokoll kompatibel.
Bei der ersten Nutzung dieser Schnittstelle müssen wir mindestens drei Inhalte ausfüllen:
authorization: Wählen Sie einfach Bearer Token aus der Dropdown-Liste aus.model: Wählen Sie das GLM-Modell aus, das Sie aufrufen möchten. Die derzeit unterstützten Modelle sind:glm-5.3: Neuestes Flaggschiffmodell, unterstützt 1M Kontext und maximal 128K Ausgabe, geeignet für komplexe Schlussfolgerungen, Code- und Agentenaufgaben. Schlussfolgerungen sind immer aktiviert, Sie könnenreasoning_effortauflow,highodermaxsetzen.glm-5.2: Vorgängermodell mit starken Gesamtfähigkeiten.glm-5.1: Reifes Flaggschiffmodell, geeignet für allgemeine komplexe Aufgaben.glm-4.7: Hervorragende Leistung bei Schlussfolgerungen, Toolaufrufen und Codeaufgaben.glm-4.6: Universelles Dialogmodell, das Effektivität und Kosten ausbalanciert.glm-3-turbo: Klassisches Dialogmodell, geeignet für allgemeine Textgenerierungsaufgaben.
messages: Array von Eingabewörtern, jede Nachricht enthältroleundcontent,roleunterstützt die drei Rollenuser,assistant,system.
max_tokens: Begrenzung der maximalen Token-Anzahl pro Antwort.temperature: Zufälligkeit der Generierung, zwischen 0-2, je höher der Wert, desto divergenter.top_p: Kernsampling-Parameter, der die kumulative Wahrscheinlichkeitsgrenze der Kandidaten-Token steuert.n: Anzahl der zu generierenden Kandidatenantworten.stream: Ob die Streaming-Antwort aktiviert werden soll, standardmäßigfalse.stop: Benutzerdefinierte Stoppsequenz.
id: Die eindeutige ID der aktuellen Dialogaufgabe.created: Die Erstellungszeit der aktuellen Dialogaufgabe (Unix-Zeitstempel, in Sekunden).model: Der tatsächlich aufgerufene Name des GLM-Modells.choices: Liste der vom Modell generierten Antworten.choices[i].message.contentist der spezifische Text der Modellantwort,finish_reasonkennzeichnet den Grund für das Ende (stop,length,tool_calls,content_filterusw.).usage: Statistiken zur Token-Nutzung dieser Anfrage, einschließlichprompt_tokens,completion_tokens,total_tokens.
Streaming-Antwort
Diese Schnittstelle unterstützt Streaming-Antworten (Server-Sent Events), was für die Integration in Webseiten sehr nützlich ist, da es ermöglicht, die Ausgabe Wort für Wort anzuzeigen. Wenn Sie eine Streaming-Antwort zurückgeben möchten, setzen Sie denstream-Parameter im Anforderungstext auf true.
Python-Beispielaufruf:
data enthält, wobei jede data einen inkrementellen Abschnitt enthält. choices[i].delta.content ist der aktuell hinzugefügte Textabschnitt, den Sie zusammenfügen können, um die vollständige Antwort zu bilden. Wenn der Inhalt von data [DONE] ist, bedeutet dies, dass die Streaming-Antwort beendet ist. Der letzte Abschnitt mit usage fasst den Tokenverbrauch dieser Anfrage zusammen.
JavaScript (Node.js) Beispiel:
Mehrere Runden im Dialog
Wenn Sie eine Funktion für mehrere Runden im Dialog implementieren möchten, müssen Sie die historischen Dialoge nacheinander in dasmessages-Array einfügen und die abwechselnde Reihenfolge von user und assistant beibehalten.
Python Beispielaufrufcode:
choices mit der grundlegenden Nutzung übereinstimmen, das Modell gibt basierend auf der vollständigen Dialoghistorie eine Antwort, um mehrere Runden kontextuelle Interaktionen zu unterstützen.
System-Prompt
Sie können am Anfang vonmessages eine Nachricht mit der Rolle system hinzufügen, um die Rolle, den Stil oder das Verhalten des Modells einzuschränken:
Funktionsaufruf
Das GLM-Modell unterstützt OpenAI-kompatible Funktionsaufrufe, die über den Parametertools deklarierte Funktionen aufrufen können. Das Modell gibt bei Bedarf in choices[i].message.tool_calls strukturierte Informationen zu Funktionsaufrufen zurück.
finish_reason in tool_calls, und in message.tool_calls werden der Funktionsname und die Parameter im JSON-String-Format angegeben. Sie können diese Funktion ausführen und das Ergebnis als Nachricht mit der Rolle tool an das Modell zurückgeben, um den vollständigen Funktionsaufrufzyklus abzuschließen.
Empfehlungen zur Modellauswahl
api_error zurückgegeben wird und die Nachricht Der Dienst ist vorübergehend nicht verfügbar, bitte später erneut versuchen. lautet, bedeutet dies normalerweise, dass der upstream GLM-Dienst vorübergehend nicht verfügbar ist. Es wird empfohlen, mit exponentiellem Backoff erneut zu versuchen oder auf ein anderes verfügbares GLM-Modell umzuschalten (zum Beispiel vorübergehend von glm-5.1 auf glm-4.7 oder glm-4.6 zu wechseln).

