Skip to main content
Google Gemini ist ein sehr leistungsstarkes KI-Dialogsystem, das in der Lage ist, innerhalb von Sekunden flüssige und natürliche Antworten zu generieren, sobald ein Eingabewort eingegeben wird. Gemini bietet erstaunliche intelligente Unterstützung und steigert erheblich die Effizienz und Kreativität der Menschen. Dieses Dokument beschreibt hauptsächlich den Ablauf der Nutzung der Gemini Chat Completion API, mit der wir die offiziellen Dialogfunktionen von Gemini einfach nutzen können.

Antragsprozess

Um die Gemini Chat Completion API zu nutzen, müssen Sie zunächst zum Ace Data Cloud Dashboard gehen, um Ihr API-Token zu erhalten, das Sie für später aufbewahren sollten. Wenn Sie noch nicht angemeldet oder registriert sind, werden Sie automatisch zur Anmeldeseite weitergeleitet, die Sie zur Registrierung und Anmeldung einlädt. Nach Abschluss werden Sie automatisch zur aktuellen Seite zurückgeleitet. Ein API-Token reicht aus, um auf alle Dienste der Plattform zuzugreifen, ohne dass für jeden Dienst separat ein Antrag gestellt werden muss. Bei der ersten Beantragung erhalten Sie ein kostenloses Kontingent, um es kostenlos auszuprobieren; wenn das Kontingent nicht ausreicht, können Sie im Dashboard Ihr allgemeines Guthaben aufladen.
📘 Vollständige Dokumentation: Gemini Chat Completion API →

Grundlegende Nutzung

Als Nächstes können Sie im Interface die entsprechenden Inhalte ausfüllen, wie im Bild gezeigt:

Bei der ersten Nutzung dieser Schnittstelle müssen wir mindestens drei Inhalte ausfüllen: einer ist authorization, den Sie einfach aus der Dropdown-Liste auswählen können. Ein weiterer Parameter ist model, model ist die Kategorie des Modells, das wir von der Gemini-Website verwenden möchten. Hier haben wir hauptsächlich 6 Modelle zur Auswahl, die Details können Sie in den von uns bereitgestellten Modellen einsehen. Der letzte Parameter ist messages, messages ist das Array der von uns eingegebenen Fragen, es handelt sich um ein Array, das mehrere Fragen gleichzeitig hochladen kann, wobei jede Frage role und content enthält. Dabei steht role für die Rolle des Fragestellers, wir bieten drei Identitäten an: user, assistant, system. Das andere content ist der spezifische Inhalt unserer Frage. Gleichzeitig können Sie auf der rechten Seite den entsprechenden Code zur Aufrufgenerierung sehen, den Sie kopieren und direkt ausführen oder einfach auf die Schaltfläche „Try“ klicken können, um einen Test durchzuführen.

Hinweis: Die gemini-3.x-Serie Flash ist ein Denkmodell, das zuerst Reasoning-Tokens verbraucht; bitte setzen Sie max_tokens auf über 512, da sonst möglicherweise nur leere Inhalte zurückgegeben werden. gemini-3.6-flash ist das derzeit empfohlene Flash-Modell, das bis zu 1 Million Token Kontext, Bildeingaben, Toolaufrufe und Streaming-Antworten unterstützt; derzeit wird es über die Chat Completions-Schnittstelle aufgerufen.
Nach dem Aufruf stellen wir fest, dass das Rückgabeergebnis wie folgt aussieht:
Das Rückgabeergebnis enthält mehrere Felder, die wie folgt beschrieben werden:
  • id, die ID, die für diese Dialogaufgabe generiert wurde, um diese Dialogaufgabe eindeutig zu kennzeichnen.
  • model, das gewählte Gemini-Modell von der Website.
  • choices, die Antwortinformationen von Gemini auf die Fragen.
  • usage: die Token-Statistik für diese Frage-Antwort-Paar.
Dabei enthält choices die Antwortinformationen von Gemini, und die choices darin sind die spezifischen Informationen, die Gemini gegeben hat, wie im Bild gezeigt.

Wie zu sehen ist, enthält das content-Feld in choices den spezifischen Inhalt der Antwort von Gemini.

Bildverständnis (multimodale Eingabe)

Gemini ist ein nativ multimodales Modell, das direkt „Bilder sehen“ kann. Um ein Bild zu übergeben, ändern Sie den content einer Nachricht von einem String in ein Array von Inhaltsblöcken, das sowohl text-Blöcke als auch image_url-Blöcke enthält – dies entspricht dem vollständig kompatiblen Format von OpenAI sowie dem offiziellen Gemini. image_url.url unterstützt zwei Schreibweisen:
  • base64 data: URI (empfohlen, stabilste): Das Format ist data:<Medientyp>;base64,<Daten>, zum Beispiel data:image/jpeg;base64,/9j/4AAQ.... Der Medientyp (MIME) ist bereits im data:-Präfix enthalten, daher ist kein separates media_type-Feld erforderlich oder vorhanden.
  • Öffentlich zugängliche Bild-URL: Zum Beispiel https://cdn.acedata.cloud/4hfydw.jpg.
Unterstützte Bildtypen: png, jpeg, webp, heic, heif. Python-Beispielaufrufcode (base64-Daten-URI):
Man kann auch direkt eine öffentlich zugängliche Bild-URL übergeben:
💡 image_url akzeptiert nur das Feld url (der Wert kann eine Bild-URL oder base64 data: URI sein) sowie das optionale Feld detail. Übergebe kein media_type — das gehört zum Bildfeld von Anthropic Claude und nicht zum image_url-Format von OpenAI / Gemini.

Stream-Antwort

Diese Schnittstelle unterstützt auch Stream-Antworten, was für die Integration in Webseiten sehr nützlich ist, da es ermöglicht, die Ausgabe Wort für Wort anzuzeigen. Wenn eine Stream-Antwort gewünscht ist, kann der stream-Parameter im Header der Anfrage auf true geändert werden. Ändern Sie es wie im Bild gezeigt, aber der Aufrufcode muss entsprechend geändert werden, um Stream-Antworten zu unterstützen.

Nachdem stream auf true geändert wurde, gibt die API die entsprechenden JSON-Daten zeilenweise zurück, und auf der Code-Ebene müssen wir entsprechende Änderungen vornehmen, um die zeilenweisen Ergebnisse zu erhalten. Python-Beispielaufrufcode:
Die Ausgabe sieht wie folgt aus:
Wie man sehen kann, gibt es viele data in der Antwort, und die choices in data sind die neuesten Antwortinhalte, die mit den oben beschriebenen Inhalten übereinstimmen. choices sind die neuen Antwortinhalte, die Sie entsprechend in Ihr System integrieren können. Gleichzeitig wird das Ende der Stream-Antwort anhand des Inhalts von data bestimmt; wenn der Inhalt [DONE] ist, bedeutet dies, dass die Stream-Antwort vollständig beendet ist. Die zurückgegebenen data-Ergebnisse haben mehrere Felder, die wie folgt beschrieben werden:
  • id,generiert die ID der aktuellen Dialogaufgabe, um diese eindeutig zu kennzeichnen.
  • model , das ausgewählte Modell von der Gemini-Website.
  • choices, die Antwortinformationen, die Gemini auf die Fragen gibt.
JavaScript wird ebenfalls unterstützt, zum Beispiel der folgende Code für den Streaming-Aufruf in Node.js:
Java-Beispielcode:
Andere Sprachen können ebenfalls angepasst werden, das Prinzip bleibt dasselbe.

Mehrere Dialoge

Wenn Sie die Funktion für mehrere Dialoge integrieren möchten, müssen Sie mehrere Fragen im Feld messages hochladen. Ein konkretes Beispiel für mehrere Fragen ist im folgenden Bild dargestellt:

Python-Beispielaufruf:
Durch das Hochladen mehrerer Fragen können Sie problemlos mehrere Dialoge führen und erhalten folgende Antwort:
Wie zu sehen ist, enthält die Information in choices die gleichen Inhalte wie die grundlegende Nutzung, die spezifischen Inhalte der Antworten von Gemini auf mehrere Dialoge, sodass Fragen basierend auf mehreren Dialoginhalten beantwortet werden können.

Gemini-3.0 Multimodales Modell

Beispielanfrage:
Beispielergebnis:
Natürlich können Sie auch einen Link zu einem Video senden, die spezifische Eingabe lautet wie folgt:
Beispielergebnis:
Wie aus dem obigen Beispiel hervorgeht, unterstützt das Gemini 3.0-Modell multimodales Verständnis.

Gemini-3.1 Multimodales Modell

gemini-3.1-pro-preview ist die offizielle Modell-ID von Gemini 3.1 Pro, die Text-, Bild-, Video- und andere multimodale Eingaben unterstützt und für komplexe Schlussfolgerungen, Codierung und Verständnisaufgaben geeignet ist. Beispielanfrage:
Gemini 3.1 Pro unterstützt ebenfalls das Verständnis von Videos:
Das Rückgabeformat ist identisch mit dem von Gemini 3.0 Pro, siehe die obige Beschreibung des Kapitels über das Gemini-3.0 multimodale Modell.

Fehlerbehandlung

Wenn beim Aufruf der API ein Fehler auftritt, gibt die API den entsprechenden Fehlercode und die Informationen zurück. Zum Beispiel:
  • 400 token_mismatched: Ungültige Anfrage, möglicherweise aufgrund fehlender oder ungültiger Parameter.
  • 400 api_not_implemented: Ungültige Anfrage, möglicherweise aufgrund fehlender oder ungültiger Parameter.
  • 401 invalid_token: Unbefugt, ungültiger oder fehlender Autorisierungstoken.
  • 429 too_many_requests: Zu viele Anfragen, Sie haben das Kontingent überschritten.
  • 500 api_error: Interner Serverfehler, etwas ist auf dem Server schiefgelaufen.

Beispiel für eine Fehlerantwort

Schlussfolgerung

Durch dieses Dokument haben Sie gelernt, wie Sie die Gemini Chat Completion API einfach nutzen können, um die Gesprächsfunktionalität des offiziellen Gemini zu implementieren. Wir hoffen, dass dieses Dokument Ihnen hilft, die API besser zu integrieren und zu nutzen. Bei Fragen wenden Sie sich bitte jederzeit an unser technisches Support-Team.