Skip to main content
Google Gemini est un système de dialogue AI très puissant, capable de générer des réponses fluides et naturelles en quelques secondes simplement en saisissant des mots-clés. Gemini peut fournir une assistance intelligente impressionnante, augmentant considérablement l’efficacité et la créativité humaines. Ce document présente principalement le processus d’utilisation de l’API Gemini Chat Completion, qui nous permet d’utiliser facilement les fonctionnalités de dialogue officielles de Gemini.

Processus de demande

Pour utiliser l’API Gemini Chat Completion, commencez par vous rendre sur le tableau de bord Ace Data Cloud pour obtenir votre token API, à conserver en réserve. Si vous n’êtes pas encore connecté ou inscrit, vous serez automatiquement redirigé vers la page de connexion qui vous invite à vous inscrire et à vous connecter, après quoi vous serez automatiquement renvoyé à la page actuelle. Un token API suffit pour appeler tous les services de la plateforme, sans avoir à en demander un pour chaque service. La première demande vous donnera un quota gratuit pour une expérience sans frais ; lorsque le quota est insuffisant, vous pouvez recharger le solde général dans le tableau de bord.
📘 Documentation complète : Gemini Chat Completion API →

Utilisation de base

Vous pouvez ensuite remplir le contenu correspondant sur l’interface, comme indiqué sur l’image :

Lors de la première utilisation de cette interface, nous devons remplir au moins trois éléments : le premier est authorization, que vous pouvez sélectionner directement dans la liste déroulante. L’autre paramètre est model, qui correspond à la catégorie de modèle que nous choisissons d’utiliser sur le site officiel de Gemini. Ici, nous avons principalement 6 types de modèles, pour plus de détails, vous pouvez consulter les modèles que nous proposons. Le dernier paramètre est messages, qui est un tableau de nos mots-clés de question, représentant plusieurs mots-clés pouvant être téléchargés simultanément, chaque mot-clé contenant role et content, où role indique le rôle du questionneur, avec trois identités proposées : user, assistant, system. L’autre content est le contenu spécifique de notre question. Vous pouvez également remarquer qu’il y a un code d’appel correspondant généré à droite, que vous pouvez copier et exécuter directement, ou cliquer sur le bouton « Essayer » pour effectuer un test.

Remarque : La série gemini-3.x flash est un modèle de réflexion, qui consommera d’abord des tokens de raisonnement ; veuillez définir max_tokens à 512 ou plus, sinon il se peut qu’il ne renvoie que du contenu vide. gemini-3.6-flash est le modèle Flash recommandé actuellement, prenant en charge jusqu’à 1 million de tokens de contexte, l’entrée d’images, les appels d’outils et les réponses en continu ; actuellement accessible via l’interface Chat Completions.
Après l’appel, nous constatons que le résultat retourné est le suivant :
Le résultat retourné contient plusieurs champs, décrits comme suit :
  • id, l’ID généré pour cette tâche de dialogue, utilisé pour identifier de manière unique cette tâche de dialogue.
  • model, le modèle choisi sur le site officiel de Gemini.
  • choices, les informations de réponse fournies par Gemini pour les mots-clés de question.
  • usage : les statistiques sur les tokens pour cette question-réponse.
Parmi ces choices, on trouve les informations de réponse de Gemini, où choices contient les informations spécifiques de la réponse de Gemini, comme illustré sur l’image.

On peut voir que le champ content dans choices contient le contenu spécifique de la réponse de Gemini.

Compréhension d’images (entrée multimodale)

Gemini est un modèle multimodal natif, capable de « voir des images ». Pour transmettre une image, il suffit de modifier le content d’un message en un tableau de blocs de contenu, contenant à la fois des blocs text et des blocs image_url — cela est entièrement compatible avec le format OpenAI et le format officiel de Gemini. image_url.url prend en charge deux formats :
  • base64 data: URI (recommandé, le plus stable) : le format est data:<type de média>;base64,<données>, par exemple data:image/jpeg;base64,/9j/4AAQ.... Le type de média (MIME) est déjà inclus dans le préfixe data:, donc il n’est pas nécessaire d’avoir un champ media_type séparé.
  • URL d’image accessible publiquement : par exemple https://cdn.acedata.cloud/4hfydw.jpg.
Types d’images pris en charge : png, jpeg, webp, heic, heif. Exemple de code d’appel Python (base64 data URI) :
Vous pouvez également transmettre directement une URL d’image accessible publiquement :
💡 image_url n’accepte que le champ url (la valeur peut être une URL d’image ou un base64 data: URI), ainsi qu’un champ detail optionnel. Ne pas transmettre media_type — c’est un champ d’image d’Anthropic Claude, qui ne fait pas partie du format image_url d’OpenAI / Gemini.

Réponse en streaming

Cette interface prend également en charge les réponses en streaming, ce qui est très utile pour l’intégration web, permettant d’afficher le texte mot par mot. Si vous souhaitez renvoyer la réponse en streaming, vous pouvez modifier le paramètre stream dans l’en-tête de la requête, en le changeant en true. Modifiez comme indiqué sur l’image, mais le code d’appel doit également être modifié pour prendre en charge la réponse en streaming.

Après avoir modifié stream en true, l’API renverra les données JSON ligne par ligne, et au niveau du code, nous devons faire les modifications nécessaires pour obtenir les résultats ligne par ligne. Exemple de code d’appel en Python :
L’effet de sortie est le suivant :
On peut voir que la réponse contient de nombreux data, et que les choices à l’intérieur de data correspondent au contenu de la réponse la plus récente, en accord avec ce qui a été présenté précédemment. choices est le contenu de réponse nouvellement ajouté, que vous pouvez intégrer dans votre système. De plus, la fin de la réponse en streaming est déterminée par le contenu de data, si le contenu est [DONE], cela signifie que la réponse en streaming est entièrement terminée. Les résultats data retournés contiennent plusieurs champs, décrits comme suit :
  • id, l’ID généré pour cette tâche de dialogue, utilisé pour identifier de manière unique cette tâche de dialogue.
  • model, le modèle choisi sur le site officiel de Gemini.
  • choices, les informations de réponse fournies par Gemini en fonction des mots de la question. JavaScript est également pris en charge, par exemple, le code d’appel en flux de Node.js est le suivant :
Exemple de code Java :
D’autres langages peuvent être réécrits séparément, le principe est le même.

Dialogue multi-tours

Si vous souhaitez intégrer une fonctionnalité de dialogue multi-tours, vous devez télécharger plusieurs questions dans le champ messages, des exemples concrets de plusieurs questions sont illustrés ci-dessous :

Exemple de code d’appel en Python :
En téléchargeant plusieurs questions, vous pouvez facilement réaliser un dialogue multi-tours et obtenir la réponse suivante :
On peut voir que les informations contenues dans choices sont cohérentes avec le contenu de l’utilisation de base, cela inclut le contenu spécifique des réponses de Gemini à plusieurs dialogues, permettant ainsi de répondre aux questions correspondantes en fonction de plusieurs contenus de dialogue.

Modèle multimodal Gemini-3.0

Exemple de requête :
Exemple de résultat :
Bien sûr, vous pouvez également transmettre un lien vidéo, les entrées spécifiques sont les suivantes :
Exemple de résultat :
On peut voir que le modèle Gemini 3.0 prend en charge la compréhension multimodale.

Modèle multimodal Gemini-3.1

Gemini 3.1 Pro est une version améliorée de Gemini 3.0 Pro, avec un modèle sous-jacent de gemini-3.1-pro-preview, prenant également en charge les entrées multimodales telles que texte, image, vidéo, et possédant de meilleures capacités de raisonnement et de compréhension. L’utilisation est identique à celle de Gemini 3.0 Pro, il suffit de remplacer le paramètre model par gemini-3.1-pro. Exemple de requête :
Gemini 3.1 Pro prend également en charge la compréhension vidéo :
Le format de retour est identique à celui de Gemini 3.0 Pro, voir la section ci-dessus sur le modèle multimodal Gemini-3.0 pour plus de détails.

Gestion des erreurs

Lors de l’appel de l’API, si une erreur se produit, l’API renverra le code d’erreur et les informations correspondantes. Par exemple :
  • 400 token_mismatched : Mauvaise requête, probablement en raison de paramètres manquants ou invalides.
  • 400 api_not_implemented : Mauvaise requête, probablement en raison de paramètres manquants ou invalides.
  • 401 invalid_token : Non autorisé, jeton d’autorisation invalide ou manquant.
  • 429 too_many_requests : Trop de requêtes, vous avez dépassé la limite de taux.
  • 500 api_error : Erreur interne du serveur, quelque chose s’est mal passé sur le serveur.

Exemples de réponse d’erreur

Conclusion

Grâce à ce document, vous avez compris comment utiliser l’API de Complétion de Chat Gemini pour réaliser facilement les fonctionnalités de conversation officielles de Gemini. Nous espérons que ce document vous aidera à mieux intégrer et utiliser cette API. Si vous avez des questions, n’hésitez pas à contacter notre équipe de support technique.