dall-e-3, la capacidad de renderizado de texto más potente gpt-image-1, la última generación gpt-image-2, así como la serie de modelos nano-banana / nano-banana-2-lite / nano-banana-2 / nano-banana-pro que se conectan a través de la misma interfaz. Todos ellos pueden generar imágenes de alta calidad a partir de descripciones de texto.
Este documento presenta principalmente el flujo de uso de la API de Generación de Imágenes de OpenAI, que nos permite utilizar fácilmente las funciones de generación de imágenes de la serie OpenAI.
Proceso de Solicitud
Para utilizar la API de Generación de Imágenes de OpenAI, primero dirígete a la consola de Ace Data Cloud para obtener tu Token de API, que debes guardar como respaldo.
Si aún no has iniciado sesión o registrado, serás redirigido automáticamente a la página de inicio de sesión que te invitará a registrarte e iniciar sesión; una vez completado, regresarás automáticamente a la página actual.
Un Token de API es suficiente para acceder a todos los servicios de la plataforma, sin necesidad de solicitar uno por cada servicio. La primera solicitud te otorgará un crédito gratuito para que lo pruebes; si el crédito es insuficiente, puedes recargar el saldo general en la consola.
📘 Documentación completa: API de Generación de Imágenes de OpenAI →
Modelo GPT-Image-2
gpt-image-2 es el nuevo modelo de generación de imágenes lanzado por OpenAI, que presenta mejoras significativas en comparación con dall-e-3 y gpt-image-1 en los siguientes aspectos:
- Mayor capacidad de seguimiento de instrucciones: puede entender con precisión instrucciones estructuradas complejas sobre composición, conteo, relaciones de posición, etc.
- Renderizado de texto más claro: en escenarios como carteles, menús, infografías, logotipos, el inglés y los números casi no presentan confusiones.
- Mayor variedad de estilos: soporta de forma nativa múltiples estilos como retratos cinematográficos, carteles retro, ilustraciones infantiles, fotografía de productos, infografías, entre otros.
- Soporte nativo para múltiples proporciones + alta resolución: cubre 5 proporciones (1:1, 4:3, 3:4, 16:9, 9:16) con 3 niveles de resolución (1K / 2K / 4K).
model como gpt-image-2. La url en el resultado devuelto es un enlace a una imagen alojada permanentemente en platform.cdn.acedata.cloud, que se puede abrir directamente en el navegador o incrustar en una página web.
Ruta oficial / variante inversa (:official / :reverse)
gpt-image-2 utiliza por defecto la ruta inversa. A través del sufijo del nombre del modelo, puedes seleccionar explícitamente la ruta:
gpt-image-2:official: ruta oficial de intermediación. Soportan > 1(devuelve múltiples imágenes a la vez) y resoluciones reales de 2K / 4K, cobrando por cada imagen, con un precio que es el doble del precio por defecto degpt-image-2. Actualmente, solo está disponible a través del canal openai-hk; si la ruta no está disponible, devolverá un error directamente y no se degradará a la ruta inversa.gpt-image-2:reverse: completamente equivalente algpt-image-2por defecto (ruta inversa), utilizado para declarar explícitamente que se utiliza la ruta inversa, sin cambios en el precio.
Las restricciones sobre el parámetro “n” que se mencionan a continuación solo se aplican a la ruta por defecto / inversa;gpt-image-2:officialsoportan > 1y cobra por imagen.
Valores soportados para size
gpt-image-2 solo verifica el formato de size, siempre que no sea auto o una cadena vacía, debe coincidir con WIDTHxHEIGHT (por ejemplo, 1024x1024, 2048x1152, 800x600); cualquier otra forma devolverá 400. Todos los tamaños (1K / 2K / 4K / personalizado) se cobran de manera uniforme por imagen, sin recargo por tamaño.
Restricciones estrictas de la parte superior para tamaños personalizados: tanto el ancho como la altura deben ser múltiplos de 16, el lado más largo ≤ 3840, el número total de píxeles ≤ 8,294,400. Si se excede el rango, será rechazado por la parte superior y devolverá un 4xx.
También puedes pasarsize: "auto"o omitir el camposize, en cuyo caso el modelo elegirá el tamaño predeterminado. En la categoría de 1K, la salida de la parte superior no garantiza un alineamiento de píxeles estricto: si pasas1024x1024, podrías recibir1254x1254, manteniendo la proporción. Si lo vuelves a pasar comosize, el cobro no cambia. Las llamadas de 4K generalmente requieren de 4 a 8 minutos, se recomienda usarlo junto con elcallback_urlpara callbacks asíncronos.
Sobre el parámetroA continuación, se presentan algunos ejemplos reales desde diferentes ángulos para experimentar visualmente la capacidad dengpt-image-2actualmente no soportan > 1: este parámetro será ignorado silenciosamente, ya sea que pasesn=1on=10, una sola solicitud solo devolverá 1 imagen y se cobrará solo por 1 imagen. Si necesitas obtener múltiples imágenes candidatas a la vez, por favor inicia múltiples solicitudes en paralelo (se recomienda pasar diferentesprompto diferentesseed, de lo contrario, las imágenes obtenidas pueden ser muy similares). Esta limitación también se aplica agpt-image-1/gpt-image-1.5, así como a la serienano-banana/nano-banana-2-lite/nano-banana-2/nano-banana-pro.dall-e-2es actualmente el único modelo que soporta de forma nativan > 1;dall-e-3solo soportan = 1.
gpt-image-2.
Escenario 1: Retrato cinematográfico
En las palabras clave se pueden utilizar términos cinematográficos (película de 35 mm, profundidad de campo reducida, luz de neón, etc.) para controlar con precisión la atmósfera y la textura. Código de ejemplo de llamada en Python:
Escena dos: Póster de viaje retro (con renderizado de texto)
gpt-image-2 muestra un rendimiento estable en tipografía y renderizado de fuentes, siendo muy adecuado para generar diseños con texto como carteles, menús, tarjetas de felicitación, etc.
url en el resultado devuelto es la siguiente:

AMALFI y ITALIA 1958 se ha renderizado de manera clara y correcta.
Escena tres: Composición compleja y conteo
La siguiente frase se utiliza para probar la capacidad del modelo para seguir instrucciones estructuradas sobre “cantidad” y “posición”.
dall-e-3.
Escena cuatro: Estilo de ilustración (horizontal)
Al especificar el medio artístico y palabras clave de emoción, se puede guiar al modelo para producir ilustraciones estilizadas.
Asincronía y devolución de llamada
gpt-image-2 generalmente requiere de 60 a 90 segundos por llamada, si no se desea mantener una conexión larga, se puede utilizar el mecanismo de devolución de llamada asíncrona callback_url que se describe más adelante en este artículo, el flujo de llamada es completamente consistente con otros modelos.
Serie de modelos Nano Banana
La serienano-banana es un modelo de generación de imágenes basado en Gemini, que se ha integrado a través de la misma interfaz /openai/images/generations, sin necesidad de cambiar el endpoint, solo hay que cambiar el model a cualquiera de los que se enumeran a continuación.
Importante: Rango de soporte de parámetros Nano Banana se integra al protocolo de OpenAI a través de una capa de adaptación, en comparación congpt-image-*solo admite los siguientes parámetros:model,prompt,size.
sizese mapeará aaspect_ratiointerno según la siguiente tabla, las dimensiones no listadas se degradarán a1:1:
1024x1024/512x512/256x256→1:11792x1024→16:91024x1792→9:16- No se admiten parámetros como
n,quality,style,response_format,background,output_format, etc.; si se ingresan, serán ignorados.- La estructura de retorno sigue el formato de OpenAI (
data[].url), perocreatedes fijo en0, y no se devolveráb64_json,revised_promptsiempre será igual alpromptoriginal.
Llamada básica
url devuelto:

Actualizar al modelo insignia nano-banana-pro
Solo necesita cambiar model a nano-banana-pro, los demás parámetros son completamente iguales:

Callback asíncrono
El mecanismo de callback asíncronocallback_url también es efectivo para nano-banana, el flujo de llamada es completamente igual que con otros modelos, consulte la sección Callback asíncrono a continuación.
Uso básico
A continuación, puede completar el contenido correspondiente en la interfaz, como se muestra en la imagen:
authorization, que se puede seleccionar directamente en la lista desplegable. Otro parámetro es model, model es la categoría del modelo que elegimos usar del sitio oficial de OpenAI DALL-E, aquí tenemos principalmente 1 tipo de modelo, los detalles se pueden ver en los modelos que proporcionamos. El último parámetro es prompt, prompt es la palabra clave que ingresamos para generar la imagen.
Al mismo tiempo, puede notar que a la derecha hay un código de llamada correspondiente generado, puede copiar el código y ejecutarlo directamente, o puede hacer clic en el botón “Try” para realizar pruebas.

created, ID de la generación de esta imagen, utilizado para identificar de manera única esta tarea.data, que contiene la información del resultado de la generación de la imagen.
data incluye la información específica de la imagen generada por el modelo, su url es el enlace detallado de la imagen generada, como se puede ver en la imagen.

Parámetro de calidad de imagen quality
A continuación, se presentará cómo configurar algunos parámetros detallados del resultado de la generación de imágenes, donde el parámetro de calidad de imagen quality incluye dos tipos, el primero standard indica que se genera una imagen estándar, el otro hd indica que la imagen creada tiene detalles más finos y mayor consistencia.
A continuación, se establece el parámetro de calidad de imagen en standard, la configuración específica se muestra en la imagen a continuación:


standard es como se muestra en la imagen a continuación:

url 的生成图片如下图所示:

b64_json ,可以得到如下图所示的图片:
可以看到 url 和 b64_json 生成的图片链接格式明显不同,具体使用方式请参考我们官网文档。
url de la imagen generada es Imagen URL esto se puede acceder directamente, el contenido de la imagen se muestra a continuación:

b64_json, se puede obtener el enlace de la imagen codificado en Base64, el resultado específico se muestra a continuación:
Callback asíncrono
Dado que el tiempo de generación de imágenes de la API de OpenAI puede ser relativamente largo, si la API no responde durante mucho tiempo, la solicitud HTTP mantendrá la conexión, lo que provocará un consumo adicional de recursos del sistema, por lo que esta API también ofrece soporte para callbacks asíncronos. El flujo general es: cuando el cliente inicia la solicitud, se especifica un campo adicionalcallback_url, después de que el cliente inicia la solicitud de API, la API devolverá inmediatamente un resultado que contiene un campo de información task_id, que representa el ID de la tarea actual. Cuando la tarea se completa, el resultado de la imagen generada se enviará a la callback_url especificada por el cliente en formato JSON POST, que también incluye el campo task_id, de esta manera el resultado de la tarea se puede asociar a través del ID.
A continuación, veamos un ejemplo para entender cómo operar específicamente.
Primero, el callback de Webhook es un servicio que puede recibir solicitudes HTTP, los desarrolladores deben reemplazarlo con la URL de su propio servidor HTTP. Aquí, para facilitar la demostración, se utiliza un sitio web de muestra de Webhook público https://webhook.site/, al abrir este sitio se puede obtener una URL de Webhook, como se muestra en la imagen:
Copie esta URL y podrá usarla como Webhook, el ejemplo aquí es https://webhook.site/3d32690d-6780-4187-a65c-870061e8c8ab.
A continuación, podemos establecer el campo callback_url a la URL de Webhook anterior, al mismo tiempo que llenamos los parámetros correspondientes, como se muestra en el siguiente código:
task_id, el campo data contiene el mismo resultado de generación de imágenes que la llamada sincrónica, a través del campo task_id se puede lograr la asociación de la tarea.
Manejo de errores
Al llamar a la API, si se encuentra con un error, la API devolverá el código de error correspondiente y la información. Por ejemplo:400 token_mismatched:Solicitud incorrecta, posiblemente debido a parámetros faltantes o inválidos.400 api_not_implemented:Solicitud incorrecta, posiblemente debido a parámetros faltantes o inválidos.401 invalid_token:No autorizado, token de autorización inválido o faltante.429 too_many_requests:Demasiadas solicitudes, ha superado el límite de tasa.500 api_error:Error interno del servidor, algo salió mal en el servidor.

