Skip to main content
Google Gemini to bardzo potężny system AI do rozmów, który potrafi w ciągu kilku sekund wygenerować płynne i naturalne odpowiedzi na wprowadzone zapytania. Gemini oferuje zdumiewającą inteligentną pomoc, znacznie zwiększając wydajność i kreatywność ludzi. Dokument ten głównie opisuje proces korzystania z Gemini Chat Completion API, dzięki któremu możemy łatwo korzystać z oficjalnych funkcji rozmowy Gemini.

申请流程

Aby korzystać z Gemini Chat Completion API, najpierw przejdź do Ace Data Cloud 控制台, aby uzyskać swój token API, który należy zachować na przyszłość. Jeśli nie jesteś zalogowany lub zarejestrowany, automatycznie zostaniesz przekierowany na stronę logowania, aby zarejestrować się i zalogować, a po zakończeniu zostaniesz automatycznie przekierowany z powrotem na bieżącą stronę. Jeden token API wystarczy do wywołania wszystkich usług platformy, nie ma potrzeby składania osobnych wniosków dla każdej usługi. Przy pierwszym wniosku otrzymasz darmowy limit, aby móc go przetestować; gdy limit się wyczerpie, możesz doładować saldo ogólne w kontrolerze.
📘 Pełna dokumentacja: Gemini Chat Completion API →

基本使用

Następnie możesz wypełnić odpowiednie treści na interfejsie, jak pokazano na obrazku:

Podczas pierwszego korzystania z tego interfejsu musimy wypełnić co najmniej trzy pola: jedno to authorization, które można wybrać bezpośrednio z rozwijanej listy. Kolejnym parametrem jest model, model to kategoria modelu, którą wybieramy z oficjalnej strony Gemini, mamy tutaj głównie 6 rodzajów modeli, szczegóły można znaleźć w dostarczonych przez nas modelach. Ostatnim parametrem jest messages, messages to tablica naszych zapytań, jest to tablica, która pozwala na jednoczesne przesyłanie wielu zapytań, każde zapytanie zawiera role i content, gdzie role oznacza rolę pytającego, oferujemy trzy tożsamości: user, assistant, system. Drugim content jest konkretna treść naszego zapytania. Możesz również zauważyć, że po prawej stronie znajduje się odpowiedni kod wywołania, który możesz skopiować i uruchomić, lub możesz bezpośrednio kliknąć przycisk „Try”, aby przetestować.

提示gemini-3.x 系列 flash 为思考模型,会先消耗 reasoning tokens;请把 max_tokens 设到 512 以上,否则可能只返回空内容。gemini-3.6-flash 是当前推荐的 Flash 模型,支持最多 100 万 Token 上下文、图像输入、工具调用和流式响应;当前通过 Chat Completions 接口调用。
Po wywołaniu zauważamy, że zwrócone wyniki są następujące:
Zwrócone wyniki zawierają wiele pól, które są opisane poniżej:
  • id, identyfikator generowanego zadania rozmowy, używany do unikalnego oznaczenia tego zadania rozmowy.
  • model, wybrany model z oficjalnej strony Gemini.
  • choices, informacje o odpowiedziach udzielonych przez Gemini na zapytania.
  • usage: statystyki dotyczące tokenów dla tej sesji pytania i odpowiedzi.
Wśród choices znajduje się informacja o odpowiedzi Gemini, a w niej choices to konkretne informacje o odpowiedzi Gemini, co można zobaczyć na obrazku.

Można zauważyć, że pole content w choices zawiera konkretną treść odpowiedzi Gemini.

图片理解(多模态输入)

Gemini to natywny model wielomodalny, który potrafi „widzieć obrazy”. Aby przesłać obraz, zmień content w danej wiadomości z ciągu znaków na tablicę bloków treści, w której jednocześnie umieszczone są bloki text i image_url — jest to całkowicie zgodne z formatem OpenAI oraz oficjalnym formatem Gemini. image_url.url obsługuje dwa sposoby zapisu:
  • base64 data: URI (zalecane, najbardziej stabilne): format to data:<typ mediów>;base64,<dane>, na przykład data:image/jpeg;base64,/9j/4AAQ.... Typ mediów (MIME) jest już zapisany w prefiksie data:, więc nie ma potrzeby ani nie istnieje osobne pole media_type.
  • Publicznie dostępny URL obrazu: na przykład https://cdn.acedata.cloud/4hfydw.jpg.
Obsługiwane typy obrazów: png, jpeg, webp, heic, heif. Przykładowy kod wywołania w Pythonie (base64 data URI):
Można również bezpośrednio przesłać publicznie dostępny URL obrazu:
💡 image_url akceptuje tylko pole url (wartość może być URL obrazu lub base64 data: URI), oraz opcjonalne pole detail. Nie przesyłaj media_type — to pole obrazu Anthropic Claude, które nie należy do formatu image_url OpenAI / Gemini.

Odpowiedź strumieniowa

Ten interfejs obsługuje również odpowiedzi strumieniowe, co jest bardzo przydatne w integracji z stronami internetowymi, umożliwiając wyświetlanie efektu słowo po słowie. Jeśli chcesz, aby odpowiedź była zwracana strumieniowo, możesz zmienić parametr stream w nagłówku żądania na true. Zmiana jak na obrazku, jednak kod wywołania musi być odpowiednio zmodyfikowany, aby obsługiwać odpowiedzi strumieniowe.

Po zmianie stream na true, API zwróci dane JSON linia po linii, a w kodzie musimy wprowadzić odpowiednie zmiany, aby uzyskać wyniki linia po linii. Przykładowy kod wywołania w Pythonie:
Efekt wyjściowy wygląda następująco:
Można zauważyć, że w odpowiedzi znajduje się wiele data, a choices w data to najnowsza treść odpowiedzi, zgodna z wcześniej przedstawioną treścią. choices to nowa treść odpowiedzi, którą można zintegrować z systemem. Zakończenie odpowiedzi strumieniowej jest określane na podstawie zawartości data, a jeśli zawartość to [DONE], oznacza to, że odpowiedź strumieniowa została całkowicie zakończona. Zwracane wyniki data mają wiele pól, które są opisane poniżej:
  • id,generuje ID zadania rozmowy, używanego do unikalnej identyfikacji tego zadania rozmowy.
  • model , wybrany model Gemini z oficjalnej strony.
  • choices, odpowiedzi udzielone przez Gemini na zadane pytania.
JavaScript również jest wspierany, na przykład kod do strumieniowego wywołania w Node.js wygląda następująco:
Przykładowy kod w Javie:
Inne języki można przekształcić samodzielnie, zasada jest taka sama.

Wieloetapowa rozmowa

Jeśli chcesz zintegrować funkcję wieloetapowej rozmowy, musisz przesłać wiele pytań w polu messages, konkretne przykłady wielu pytań przedstawione są na poniższym obrazku:

Przykładowy kod wywołania w Pythonie:
Przesyłając wiele pytań, można łatwo zrealizować wieloetapową rozmowę, co pozwala uzyskać następującą odpowiedź:
Można zauważyć, że informacje zawarte w choices są zgodne z podstawowym użyciem, zawierają konkretne treści odpowiedzi Gemini na wiele rozmów, co pozwala na odpowiadanie na odpowiednie pytania na podstawie wielu treści rozmowy.

Model wielomodalny Gemini-3.0

Przykład żądania:
Przykład wyniku:
Oczywiście możesz również przesłać link do wideo, konkretne dane wejściowe są następujące:
Przykładowy wynik:
Z powyższego można zauważyć, że model Gemini 3.0 obsługuje zrozumienie multimodalne.

Model multimodalny Gemini-3.1

gemini-3.1-pro-preview to aktualny oficjalny identyfikator modelu Gemini 3.1 Pro, obsługujący tekst, obrazy, wideo i inne multimodalne wejścia, odpowiedni do złożonych zadań wnioskowania, kodowania i zrozumienia. Przykład żądania:
Gemini 3.1 Pro również obsługuje zrozumienie wideo:
Format odpowiedzi jest zgodny z Gemini 3.0 Pro, szczegóły można znaleźć w powyższej sekcji dotyczącej modelu multimodalnego Gemini-3.0.

Obsługa błędów

Podczas wywoływania API, jeśli wystąpią błędy, API zwróci odpowiedni kod błędu i informacje. Na przykład:
  • 400 token_mismatched: Złe żądanie, prawdopodobnie z powodu brakujących lub nieprawidłowych parametrów.
  • 400 api_not_implemented: Złe żądanie, prawdopodobnie z powodu brakujących lub nieprawidłowych parametrów.
  • 401 invalid_token: Nieautoryzowany, nieprawidłowy lub brakujący token autoryzacyjny.
  • 429 too_many_requests: Zbyt wiele żądań, przekroczono limit szybkości.
  • 500 api_error: Błąd wewnętrzny serwera, coś poszło nie tak na serwerze.

Przykład odpowiedzi błędu

Wnioski

Dzięki temu dokumentowi zrozumiałeś, jak łatwo zrealizować funkcję czatu oficjalnego Gemini za pomocą API Gemini Chat Completion. Mamy nadzieję, że ten dokument pomoże Ci lepiej zintegrować i korzystać z tego API. W razie jakichkolwiek pytań, skontaktuj się z naszym zespołem wsparcia technicznego.