Skip to main content
OpenAI hat kürzlich eine Schnittstelle zur Erstellung von Modellantworten bereitgestellt. Geben Sie Text- oder Bilddaten ein, um Text- oder Bildausgaben zu generieren. Lassen Sie das Modell Ihren eigenen benutzerdefinierten Code aufrufen oder verwenden Sie integrierte Tools wie Websuche oder Dateisuche, um Ihre eigenen Daten als Eingabe für die Modellantwort zu verwenden. Dieses Dokument beschreibt hauptsächlich den Ablauf der Nutzung der OpenAI Responses API, mit der wir die offizielle Funktion zur Erstellung von Modellantworten von OpenAI einfach nutzen können.

Antragsprozess

Um die OpenAI Responses API zu nutzen, müssen Sie zunächst im Ace Data Cloud Dashboard Ihr API-Token abrufen und für spätere Verwendung aufbewahren. Wenn Sie noch nicht angemeldet oder registriert sind, werden Sie automatisch zur Anmeldeseite weitergeleitet, die Sie zur Registrierung und Anmeldung einlädt. Nach Abschluss werden Sie automatisch zur aktuellen Seite zurückgeleitet. Ein API-Token reicht aus, um auf alle Dienste der Plattform zuzugreifen, ohne dass für jeden Dienst separat ein Antrag gestellt werden muss. Bei der ersten Beantragung erhalten Sie ein kostenloses Kontingent, um es kostenlos auszuprobieren; wenn das Kontingent erschöpft ist, können Sie im Dashboard Ihr allgemeines Guthaben aufladen.
📘 Vollständige Dokumentation: OpenAI Responses API →

Grundlegende Nutzung

Als Nächstes können Sie im Interface die entsprechenden Inhalte ausfüllen, wie im Bild gezeigt:

Bei der ersten Nutzung dieser Schnittstelle müssen wir mindestens drei Inhalte ausfüllen: einer ist authorization, den Sie einfach aus der Dropdown-Liste auswählen können. Ein weiterer Parameter ist model, model ist die Modellkategorie, die wir von der offiziellen OpenAI ChatGPT-Website auswählen. Hier haben wir hauptsächlich 20 Modelle zur Auswahl, die Details können Sie in den von uns bereitgestellten Modellen einsehen. Der letzte Parameter ist input, input ist unser Array von Fragen, das ein Array darstellt, das mehrere Fragen gleichzeitig hochladen kann. Jede Frage enthält role und content, wobei role die Rolle des Fragestellers angibt. Wir bieten drei Identitäten an: user, assistant, system. Das andere content ist der spezifische Inhalt unserer Frage. Gleichzeitig können Sie auf der rechten Seite den entsprechenden Code zur Aufrufgenerierung sehen. Sie können den Code kopieren und direkt ausführen oder einfach auf die Schaltfläche „Try“ klicken, um einen Test durchzuführen. Häufig verwendete optionale Parameter:
  • max_tokens: Begrenzung der maximalen Token-Anzahl pro Antwort.
  • temperature: Generierungsrandomisierung, zwischen 0-2, je höher der Wert, desto divergenter.
  • n: Anzahl der zu generierenden Antwortvorschläge.
  • response_format: Einstellung des Rückgabeformats.
  • tools: Definition von Funktions-/Toolaufrufen.
  • background: Ob im Hintergrund asynchron ausgeführt werden soll.

Nach dem Aufruf stellen wir fest, dass das Rückgabeergebnis wie folgt aussieht:
Das Rückgabeergebnis hat mehrere Felder, die wie folgt beschrieben werden:
  • id, die ID der generierten Dialogaufgabe, die zur eindeutigen Identifizierung dieser Dialogaufgabe dient.
  • model, das gewählte OpenAI ChatGPT-Modell.
  • output, die Antwortinformationen von ChatGPT auf die Fragen.
  • usage: Statistische Informationen zu den Tokens für diese Frage-Antwort-Interaktion.
Dabei ist output die Antwortinformation von ChatGPT, in der das output von ChatGPT enthalten ist, wie im Bild zu sehen.

Wie zu sehen ist, enthält das content-Feld im output die spezifischen Inhalte der Antwort von ChatGPT.

Stream-Antwort

Diese Schnittstelle unterstützt auch Stream-Antworten, was für die Integration in Webseiten sehr nützlich ist, da es ermöglicht, die Ausgabe zeilenweise anzuzeigen. Wenn Sie eine Stream-Antwort zurückgeben möchten, können Sie den stream-Parameter im Header der Anfrage auf true ändern. Die Änderung ist wie im Bild gezeigt, jedoch muss der Aufrufcode entsprechend geändert werden, um Stream-Antworten zu unterstützen.

Nachdem Sie stream auf true geändert haben, gibt die API die entsprechenden JSON-Daten zeilenweise zurück. Auf der Code-Ebene müssen wir entsprechende Änderungen vornehmen, um die zeilenweisen Ergebnisse zu erhalten. Python-Beispielaufrufcode:
Die Ausgabe sieht wie folgt aus:
Es ist zu sehen, dass die Antwort viele data enthält, wobei delta in data den neuesten Antwortinhalt darstellt, der mit dem oben beschriebenen Inhalt übereinstimmt. delta ist der neu hinzugefügte Antwortinhalt, den Sie entsprechend den Ergebnissen in Ihr System integrieren können. Das Ende der Streaming-Antwort wird anhand des Inhalts von data bestimmt. Wenn der Inhalt von type response.completed ist, bedeutet dies, dass die Streaming-Antwort vollständig beendet ist. Die zurückgegebenen data-Ergebnisse bestehen aus mehreren Feldern, die wie folgt beschrieben werden:
  • item_id, die ID der generierten Dialogaufgabe, die zur eindeutigen Identifizierung dieser Dialogaufgabe verwendet wird.
  • type, der Typ der generierten Dialogantworten.
  • model, das gewählte OpenAI ChatGPT-Modell.
  • delta, die Antwortinformationen, die ChatGPT auf die Fragen gibt.
JavaScript wird ebenfalls unterstützt, zum Beispiel sieht der Code für den Streaming-Aufruf in Node.js wie folgt aus:
Java-Beispielcode:
Andere Sprachen können ebenfalls entsprechend umgeschrieben werden, das Prinzip ist dasselbe.

Mehrere Runden im Dialog

Wenn Sie die Funktion für mehrere Runden im Dialog integrieren möchten, müssen Sie mehrere Fragen im input-Feld hochladen. Ein konkretes Beispiel für mehrere Fragen ist im folgenden Bild dargestellt:

Python-Beispielaufrufcode:
Durch das Hochladen mehrerer Fragen können Sie problemlos mehrere Runden im Dialog realisieren und erhalten folgende Antwort:
Es ist zu sehen, dass die Informationen in output mit den grundlegenden Inhalten übereinstimmen, die die spezifischen Inhalte der Antworten von ChatGPT auf mehrere Dialoge enthalten, sodass Sie basierend auf mehreren Dialoginhalten die entsprechenden Fragen beantworten können.

Visuelles Modell

gpt-4o ist ein multimodales großes Sprachmodell, das von OpenAI entwickelt wurde und die Fähigkeit zur visuellen Verarbeitung hinzugefügt hat. Dieses Modell kann gleichzeitig Text- und Bilddaten verarbeiten und ermöglicht ein multimodales Verständnis und eine Generierung. Die Textverarbeitung mit dem gpt-4o-Modell ist mit den oben beschriebenen grundlegenden Inhalten identisch. Im Folgenden wird kurz erläutert, wie die Bildverarbeitungsfähigkeiten des Modells genutzt werden können. Die Bildverarbeitungsfähigkeiten des gpt-4o-Modells werden hauptsächlich durch das Hinzufügen eines type-Feldes zu den ursprünglichen content-Inhalten aktiviert, durch das festgestellt werden kann, ob Text oder Bilder hochgeladen werden, um die Bildverarbeitungsfähigkeiten des gpt-4o-Modells zu nutzen. Im Folgenden werden hauptsächlich zwei Methoden zur Nutzung dieser Funktion beschrieben: Curl und Python.
  • Curl-Skript-Methode
  • Python-Skript-Methode
Dann kann man das folgende Ergebnis erhalten, die Feldinformationen im Ergebnis sind mit dem obigen Text konsistent, konkret wie folgt:
Man kann sehen, dass der Inhalt der Antwort auf dem Bild basiert, daher kann man mit den oben genannten beiden Methoden die Text- und Bildverarbeitungsfähigkeiten des gpt-4.1-Modells leicht nutzen. Neben gpt-4.1 gibt es ein kostengünstigeres Modell namens gpt-4o-mini. gpt-4o-mini ist das neueste große Sprachmodell, das von OpenAI entwickelt wurde. Es ist nicht nur schnell in der Reaktionszeit, sondern auch günstiger und unterstützt multimodale Funktionen. Die Nutzung der Vision-Funktion kann auf den oben genannten Inhalten zur Verwendung des gpt-4.1-Modells basieren.

Erstellung des Dateiverarbeitungsmodells

Beispielanfrage:
Beispielergebnis: