Skip to main content
Google Gemini är ett mycket kraftfullt AI-konversationssystem som kan generera flytande och naturliga svar på bara några sekunder genom att ange en prompt. Gemini kan erbjuda fantastiskt intelligent assistans och avsevärt öka människors arbetsproduktivitet och kreativitet. Detta dokument beskriver huvudsakligen användningsflödet för Gemini Chat Completion API, vilket gör att vi enkelt kan använda den officiella Gemini-konversationsfunktionen.

Ansökningsprocess

För att använda Gemini Chat Completion API, börja med att gå till Ace Data Cloud-konsolen för att hämta din API-token, som du kan spara för framtida bruk. Om du inte har loggat in eller registrerat dig kommer du automatiskt att omdirigeras till inloggningssidan för att registrera dig och logga in, och efter att ha slutfört detta kommer du automatiskt att återvända till den aktuella sidan. En API-token kan användas för att anropa alla plattformens tjänster, utan att behöva ansöka om varje tjänst separat. Första gången du ansöker får du en gratis kvot för att prova; om kvoten tar slut kan du ladda på allmänna saldot i konsolen.
📘 Fullständig dokumentation: Gemini Chat Completion API →

Grundläggande Användning

Nu kan du fylla i motsvarande innehåll på gränssnittet, som visas i bilden:

Vid första användningen av detta API behöver vi fylla i minst tre fält, ett är authorization, som du enkelt väljer från rullgardinsmenyn. Det andra parametern är model, där model är den Gemini-modellkategori vi väljer att använda, här har vi huvudsakligen 6 olika modeller, detaljer kan ses i de modeller vi tillhandahåller. Det sista parametern är messages, där messages är en array av våra inmatade frågor, vilket innebär att vi kan ladda upp flera frågor samtidigt, där varje fråga innehåller role och content, där role representerar frågeställarens roll, och vi erbjuder tre identiteter: user, assistant, system. Den andra content är det specifika innehållet i vår fråga. Samtidigt kan du notera att det finns motsvarande anropskod som genereras till höger, du kan kopiera koden och köra den direkt, eller klicka på “Try” knappen för att testa.

Tips: gemini-3.x serien flash är en tänkande modell som först kommer att förbruka reasoning tokens; vänligen ställ in max_tokens till 512 eller mer, annars kan det hända att det bara returnerar tomt innehåll. gemini-3.6-flash är den nuvarande rekommenderade Flash-modellen, som stöder upp till 1 miljon tokens kontext, bildinmatning, verktygsanrop och strömmande svar; för närvarande anropas den via Chat Completions API.
Efter anropet upptäckte vi att returresultatet ser ut som följer:
Returresultatet innehåller flera fält, som beskrivs nedan:
  • id, ID för att generera denna konversationsuppgift, används för att unikt identifiera denna konversationsuppgift.
  • model, den valda Gemini-modellen.
  • choices, information om svar från Gemini på frågorna.
  • usage: statistik över tokens för denna fråge- och svarsinteraktion.
Där choices innehåller Gemini:s svarsinformation, och choices inuti det är den specifika informationen som Gemini svarade med, vilket kan ses i bilden.

Det kan ses att choices inuti content-fältet innehåller det specifika innehållet i Gemini:s svar.

Bildförståelse (Multimodal Inmatning)

Gemini är en inbyggd multimodal modell som kan “se bilder” direkt. För att skicka in bilder, ändra content för ett meddelande från en sträng till en innehållsblock-array, där arrayen innehåller både text block och image_url block - detta är helt kompatibelt med OpenAI och den officiella Gemini:s OpenAI-format. image_url.url stöder två skrivsätt:
  • base64 data: URI (rekommenderas, mest stabil): formatet är data:<media-typ>;base64,<data>, till exempel data:image/jpeg;base64,/9j/4AAQ.... Media-typen (MIME) är redan skriven i data: prefixet, så det behövs inte, och det finns ingen separat media_type-fält.
  • Offentligt tillgänglig bild-URL: till exempel https://cdn.acedata.cloud/4hfydw.jpg.
Stödda bildtyper: png, jpeg, webp, heic, heif. Python-exempel på anropskod (base64 data URI):
Du kan också direkt skicka en offentligt tillgänglig bild-URL:
💡 image_url accepterar endast url fältet (värdet kan vara bild-URL eller base64 data: URI), samt ett valfritt detail fält. Skicka inte media_type — det är ett bildfält för Anthropic Claude och tillhör inte OpenAI / Gemini:s image_url format.

Strömmande svar

Detta API stöder också strömmande svar, vilket är mycket användbart för webbgränssnitt och kan ge en ord-för-ord visningseffekt. Om du vill ha ett strömmande svar kan du ändra stream parametern i begäran till true. Ändringen görs som på bilden, men anropskoden behöver också motsvarande ändringar för att stödja strömmande svar.

När stream ändras till true, kommer API:t att returnera motsvarande JSON-data rad för rad, och på kodnivå behöver vi göra nödvändiga ändringar för att få rad-för-rad resultat. Python exempel på anropskod:
Utdata ser ut som följer:
Som du kan se finns det många data i svaret, där choices är det senaste svaret, vilket överensstämmer med det som beskrivits ovan. choices är det nya svaret, och du kan koppla det till ditt system baserat på resultaten. Samtidigt är slutet av det strömmande svaret baserat på innehållet i data, om innehållet är [DONE], indikerar det att det strömmande svaret har avslutats helt. De returnerade data resultaten har flera fält, som beskrivs nedan:
  • id,generera ID för denna dialoguppgift, används för att unikt identifiera denna dialoguppgift.
  • model , den valda Gemini-modellen från den officiella webbplatsen.
  • choices, Gemini:s svarsinformation på frågorna.
JavaScript stöds också, till exempel Node.js:s strömmande anropskod ser ut så här:
Java-exempel på kod:
Andra språk kan skrivas om på egen hand, principen är densamma.

Flera rundor av dialog

Om du vill ansluta till funktionen för flera rundor av dialog måste du ladda upp flera frågor i messages-fältet, specifika exempel på flera frågor visas nedan:

Python-exempel på anropskod:
Genom att ladda upp flera frågor kan du enkelt genomföra flera rundor av dialog och få följande svar:
Som du kan se innehåller choices information som är konsekvent med grundläggande användning, vilket inkluderar Gemini:s specifika innehåll för svar på flera dialoger, så att du kan svara på motsvarande frågor baserat på flera dialoginnehåll.

Gemini-3.0 multimodala modeller

Exempel på begäran:
Exempelresultat:
Självklart kan du också skicka en länk till en video, den specifika inmatningen är som följer:
Exempelresultat:
Från ovan kan vi se att Gemini 3.0-modellen kan stödja multimodal förståelse.

Gemini-3.1 Multimodal Modell

gemini-3.1-pro-preview är den officiella modell-ID:n för nuvarande Gemini 3.1 Pro, som stöder text, bilder, video och andra multimodala inmatningar, lämplig för komplexa resonemang, kodning och förståelseuppgifter. Begärningsexempel:
Gemini 3.1 Pro stöder också videoförståelse:
Returformatet är detsamma som Gemini 3.0 Pro, se ovanstående avsnitt om Gemini-3.0 multimodala modeller för mer information.

Felhantering

Vid anrop av API:et, om ett fel uppstår, kommer API:et att returnera motsvarande felkod och information. Till exempel:
  • 400 token_mismatched: Felaktig begäran, möjligtvis på grund av saknade eller ogiltiga parametrar.
  • 400 api_not_implemented: Felaktig begäran, möjligtvis på grund av saknade eller ogiltiga parametrar.
  • 401 invalid_token: Obemyndigad, ogiltig eller saknad auktoriseringstoken.
  • 429 too_many_requests: För många begärningar, du har överskridit hastighetsgränsen.
  • 500 api_error: Intern serverfel, något gick fel på servern.

Exempel på felrespons

Slutsats

Genom detta dokument har du fått en förståelse för hur du enkelt kan implementera den officiella Geminis chattfunktionalitet med Gemini Chat Completion API. Vi hoppas att detta dokument kan hjälpa dig att bättre integrera och använda detta API. Om du har några frågor, tveka inte att kontakta vårt tekniska supportteam.