Skip to main content
Google Gemini es un sistema de conversación AI muy potente, que puede generar respuestas fluidas y naturales en cuestión de segundos al ingresar una palabra clave. Gemini puede proporcionar una asistencia inteligente asombrosa, mejorando enormemente la eficiencia y creatividad del trabajo humano. Este documento describe principalmente el proceso de uso de la API de finalización de chat de Gemini, que nos permite utilizar fácilmente la función de conversación oficial de Gemini.

Proceso de solicitud

Para usar la API de finalización de chat de Gemini, primero dirígete a la consola de Ace Data Cloud para obtener tu token de API, que debes guardar como respaldo. Si aún no has iniciado sesión o registrado, serás redirigido automáticamente a la página de inicio de sesión que te invita a registrarte e iniciar sesión; una vez completado, volverás automáticamente a la página actual. Un token de API es suficiente para acceder a todos los servicios de la plataforma, sin necesidad de solicitar uno por cada servicio. La primera solicitud te otorgará un crédito gratuito para que puedas probarlo; si el crédito es insuficiente, puedes recargar el saldo general en la consola.
📘 Documentación completa: API de finalización de chat de Gemini →

Uso básico

A continuación, puedes completar el contenido correspondiente en la interfaz, como se muestra en la imagen:

Al usar esta interfaz por primera vez, necesitamos completar al menos tres campos: uno es authorization, que puedes seleccionar directamente en la lista desplegable. El otro parámetro es model, que es la categoría del modelo de Gemini que elegimos usar; aquí tenemos principalmente 6 tipos de modelos, los detalles se pueden ver en los modelos que proporcionamos. El último parámetro es messages, que es un array de nuestras preguntas; es un array que permite subir múltiples preguntas a la vez, cada pregunta contiene role y content, donde role indica el rol del preguntador, y ofrecemos tres identidades: user, assistant, system. El otro content es el contenido específico de nuestra pregunta. También puedes notar que a la derecha hay un código de llamada correspondiente que se genera; puedes copiar el código y ejecutarlo directamente, o simplemente hacer clic en el botón “Try” para realizar pruebas.

Consejo: La serie gemini-3.x flash es un modelo de pensamiento que consumirá primero tokens de razonamiento; asegúrate de establecer max_tokens en 512 o más, de lo contrario, puede que solo devuelva contenido vacío. gemini-3.6-flash es el modelo Flash recomendado actualmente, que admite hasta 1 millón de tokens de contexto, entrada de imágenes, llamadas a herramientas y respuestas en streaming; actualmente se llama a través de la interfaz de finalización de chat.
Después de la llamada, encontramos que el resultado devuelto es el siguiente:
El resultado devuelto tiene varios campos, que se describen a continuación:
  • id, el ID de la tarea de conversación generada, utilizado para identificar de manera única esta tarea de conversación.
  • model, el modelo de Gemini seleccionado.
  • choices, la información de respuesta que Gemini proporciona para la palabra clave.
  • usage: estadísticas sobre el uso de tokens para esta pregunta y respuesta.
Dentro de choices se incluye la información de respuesta de Gemini, donde choices contiene la información específica de la respuesta de Gemini, como se puede ver en la imagen.

Se puede ver que el campo content dentro de choices contiene el contenido específico de la respuesta de Gemini.

Comprensión de imágenes (entrada multimodal)

Gemini es un modelo multimodal nativo que puede “ver imágenes” directamente. Para enviar una imagen, simplemente cambia el content de un mensaje de cadena a un array de bloques de contenido, donde se incluyen bloques de text y image_url simultáneamente; esto es completamente compatible con el formato de OpenAI y el formato oficial de Gemini. image_url.url admite dos formas de escritura:
  • base64 data: URI (recomendado, más estable): el formato es data:<tipo de medio>;base64,<datos>, por ejemplo, data:image/jpeg;base64,/9j/4AAQ.... El tipo de medio (MIME) ya está escrito en el prefijo data:, por lo que no es necesario, ni existe un campo media_type separado.
  • URL de imagen accesible públicamente: por ejemplo, https://cdn.acedata.cloud/4hfydw.jpg.
Tipos de imagen admitidos: png, jpeg, webp, heic, heif. Código de ejemplo de llamada en Python (base64 data URI):
También se puede pasar directamente una URL de imagen accesible públicamente:
💡 image_url solo acepta el campo url (el valor puede ser una URL de imagen o un URI de datos base64 data:), así como un campo opcional detail. No envíes media_type — eso es un campo de imagen de Anthropic Claude, que no pertenece al formato image_url de OpenAI / Gemini.

Respuesta en flujo

Esta interfaz también admite respuestas en flujo, lo cual es muy útil para la integración en páginas web, permitiendo mostrar el contenido palabra por palabra. Si deseas que la respuesta se devuelva en flujo, puedes cambiar el parámetro stream en los encabezados de la solicitud a true. Modifica como se muestra en la imagen, pero el código de llamada necesita tener los cambios correspondientes para soportar la respuesta en flujo.

Después de cambiar stream a true, la API devolverá los datos JSON correspondientes línea por línea, y a nivel de código necesitamos hacer las modificaciones necesarias para obtener los resultados línea por línea. Ejemplo de código de llamada en Python:
El resultado de salida es el siguiente:
Como se puede ver, la respuesta contiene muchos data, y los choices dentro de data son el contenido de la respuesta más reciente, que coincide con el contenido presentado anteriormente. choices son los nuevos contenidos de respuesta, que puedes integrar en tu sistema según los resultados. Al mismo tiempo, el final de la respuesta en flujo se determina según el contenido de data, si el contenido es [DONE], significa que la respuesta en flujo ha terminado por completo. Los resultados devueltos de data tienen varios campos, que se describen a continuación:
  • id,generar el ID de la tarea de conversación actual, utilizado para identificar de manera única esta tarea de conversación.
  • model , el modelo seleccionado de la página oficial de Gemini.
  • choices, la información de respuesta proporcionada por Gemini para la pregunta.
JavaScript también es compatible, por ejemplo, el código de llamada en flujo de Node.js es el siguiente:
Ejemplo de código en Java:
Otros lenguajes pueden ser reescritos de manera similar, el principio es el mismo.

Diálogo en múltiples turnos

Si desea integrar la función de diálogo en múltiples turnos, necesita cargar múltiples preguntas en el campo messages, ejemplos específicos de múltiples preguntas se muestran en la imagen a continuación:

Ejemplo de código de llamada en Python:
Al cargar múltiples preguntas, se puede lograr fácilmente un diálogo en múltiples turnos, obteniendo respuestas como la siguiente:
Como se puede ver, la información contenida en choices es consistente con el contenido de uso básico, que incluye la respuesta específica de Gemini a múltiples diálogos, permitiendo así responder a las preguntas correspondientes basadas en múltiples contenidos de diálogo.

Modelo multimodal Gemini-3.0

Ejemplo de solicitud:
Ejemplo de resultado:
Por supuesto, también puedes enviar un enlace de video, el contenido específico es el siguiente:
Ejemplo de resultado:
De lo anterior se puede ver que el modelo Gemini 3.0 puede soportar la comprensión multimodal.

Modelo multimodal Gemini-3.1

gemini-3.1-pro-preview es el ID oficial del modelo Gemini 3.1 Pro actual, que admite entradas multimodales como texto, imágenes y videos, adecuado para tareas complejas de razonamiento, codificación y comprensión. Ejemplo de solicitud:
Gemini 3.1 Pro también admite la comprensión de videos:
El formato de respuesta es consistente con el de Gemini 3.0 Pro, consulte la descripción en el capítulo anterior sobre el modelo multimodal Gemini-3.0.

Manejo de errores

Al llamar a la API, si se encuentra con un error, la API devolverá el código de error correspondiente y la información. Por ejemplo:
  • 400 token_mismatched: Solicitud incorrecta, posiblemente debido a parámetros faltantes o inválidos.
  • 400 api_not_implemented: Solicitud incorrecta, posiblemente debido a parámetros faltantes o inválidos.
  • 401 invalid_token: No autorizado, token de autorización inválido o faltante.
  • 429 too_many_requests: Demasiadas solicitudes, ha superado el límite de tasa.
  • 500 api_error: Error interno del servidor, algo salió mal en el servidor.

Ejemplo de respuesta de error

Conclusión

A través de este documento, usted ha aprendido cómo utilizar la API de Gemini Chat Completion para implementar fácilmente la funcionalidad de conversación de Gemini oficial. Esperamos que este documento le ayude a integrar y utilizar mejor esta API. Si tiene alguna pregunta, no dude en ponerse en contacto con nuestro equipo de soporte técnico.