dall-e-3, das textbasierte Rendering mit stärkeren Fähigkeiten gpt-image-1, die neueste Generation gpt-image-2 sowie die über dieselbe Schnittstelle zugänglichen Modelle der nano-banana / nano-banana-2-lite / nano-banana-2 / nano-banana-pro Serie. Sie können alle qualitativ hochwertige Bilder basierend auf Textbeschreibungen generieren.
Dieses Dokument beschreibt hauptsächlich den Ablauf der Nutzung der OpenAI Images Generations API, mit der wir die Bildgenerierungsfunktionen der OpenAI-Serie einfach nutzen können.
Antragsprozess
Um die OpenAI Images Generations API zu nutzen, müssen Sie zunächst im Ace Data Cloud Dashboard Ihr API-Token abrufen und für zukünftige Verwendung aufbewahren.
Wenn Sie noch nicht angemeldet oder registriert sind, werden Sie automatisch zur Anmeldeseite weitergeleitet, um sich zu registrieren und anzumelden. Nach Abschluss werden Sie automatisch zur aktuellen Seite zurückgeleitet.
Ein API-Token reicht aus, um auf alle Dienste der Plattform zuzugreifen, es ist nicht erforderlich, für jeden Dienst separat einen Antrag zu stellen. Bei der ersten Beantragung erhalten Sie ein kostenloses Kontingent zur kostenlosen Nutzung; wenn das Kontingent erschöpft ist, können Sie im Dashboard Ihr Guthaben aufladen.
📘 Vollständige Dokumentation: OpenAI Images Generations API →
GPT-Image-2 Modell
gpt-image-2 ist das neueste Bildgenerierungsmodell von OpenAI, das im Vergleich zu dall-e-3 und gpt-image-1 in folgenden Aspekten deutliche Verbesserungen aufweist:
- Stärkere Befolgung von Anweisungen: Es kann komplexe Anweisungen zu Komposition, Zählung, räumlichen Beziehungen usw. genau verstehen.
- Klareres Text-Rendering: In Szenarien wie Plakaten, Menüs, Infografiken, Logos usw. treten kaum Verwirrungen bei Englisch und Zahlen auf.
- Reichhaltigere Stilvariationen: Unterstützt nativ verschiedene Stile wie filmische Porträts, Vintage-Poster, Kinderillustrationen, Produktfotografie, Infografiken usw.
- Nativ Unterstützung für mehrere Formate + hohe Auflösung: Deckt 5 Formate (1:1, 4:3, 3:4, 16:9, 9:16) mit insgesamt 3 Auflösungen (1K / 2K / 4K) ab.
model auf gpt-image-2 setzen. Die url im Rückgabeergebnis ist ein dauerhaft auf platform.cdn.acedata.cloud gehosteter Bildlink, der direkt im Browser geöffnet oder in eine Webseite eingebettet werden kann.
Offizielle Umleitung / Umgekehrte Variante (:official / :reverse)
gpt-image-2 verwendet standardmäßig die umgekehrte Route. Durch den Suffix des Modellnamens können Sie die Route explizit auswählen:
gpt-image-2:official: Offizielle Umleitungsroute. Unterstütztn > 1(gibt mehrere Bilder auf einmal zurück) und echte 2K / 4K Auflösung, die Abrechnung erfolgt pro Bild, der Preis beträgt das Doppelte des Standardpreises vongpt-image-2. Derzeit wird dies nur über den Kanal openai-hk bereitgestellt, wenn die Route nicht verfügbar ist, wird ein Fehler zurückgegeben, es erfolgt kein Downgrade auf die umgekehrte Route.gpt-image-2:reverse: Vollständig äquivalent zum Standardgpt-image-2(umgekehrte Route), um explizit die umgekehrte Route zu deklarieren, der Preis bleibt unverändert.
Die nachfolgende Einschränkung „Über dennParameter“ gilt nur für die Standard- / umgekehrte Route;gpt-image-2:officialunterstütztn > 1und wird pro Bild abgerechnet.
Unterstützte size Werte
gpt-image-2 überprüft nur das Format von size, solange es nicht auto oder eine leere Zeichenkette ist, muss es WIDTHxHEIGHT entsprechen (z. B. 1024x1024, 2048x1152, 800x600); jede andere Form führt zu einem 400 Fehler. Alle Größen (1K / 2K / 4K / benutzerdefiniert) werden einheitlich pro Bild abgerechnet, es gibt keine Preisaufschläge für die Größe.
Oben gibt es strenge Einschränkungen für benutzerdefinierte Größen: Breite und Höhe müssen Vielfache von 16 sein, die längere Seite ≤ 3840, die Gesamtpixelzahl ≤ 8.294.400. Überschreitungen werden von der Quelle abgelehnt und mit 4xx zurückgegeben.
Sie können auchsize: "auto"übergeben oder dassizeFeld weglassen, in diesem Fall wählt das Modell die Standardgröße selbst aus. Bei der 1K-Stufe garantiert die Quelle keine strikte Pixelanpassung – wenn Sie1024x1024übergeben, erhalten Sie möglicherweise1254x1254, das Verhältnis bleibt gleich. Wenn Sie es erneut alssizeübergeben, bleibt die Abrechnung unverändert. Ein 4K-Einzelaufruf benötigt normalerweise 4–8 Minuten, es wird empfohlen, dies zusammen mit demcallback_urlfür asynchrone Rückrufe zu verwenden.
Über denIm Folgenden werden einige verschiedene reale Beispiele gezeigt, um die Fähigkeiten vonnParametergpt-image-2unterstützt derzeit nichtn > 1: Dieser Parameter wird stillschweigend ignoriert, unabhängig davon, ob Sien=1odern=10übergeben, eine einzelne Anfrage gibt nur 1 Bild zurück und wird nur für 1 Bild abgerechnet. Wenn Sie mehrere Kandidatenbilder auf einmal erhalten möchten, müssen Sie selbst mehrere Anfragen parallel stellen (es wird empfohlen, gleichzeitig unterschiedlichepromptoder unterschiedlicheseedzu übergeben, da sonst die erhaltenen Bilder sehr ähnlich sein könnten). Diese Einschränkung gilt auch fürgpt-image-1/gpt-image-1.5sowie die Seriennano-banana/nano-banana-2-lite/nano-banana-2/nano-banana-pro.dall-e-2ist derzeit das einzige Modell, das nativn > 1unterstützt;dall-e-3unterstützt nurn = 1.
gpt-image-2 anschaulich zu erleben.
Szenario 1: Filmisches Porträt
In den Eingabeaufforderungen können filmische Begriffe (35mm Film, geringe Tiefenschärfe, Neonlicht usw.) verwendet werden, um Atmosphäre und Textur präzise zu steuern. Python Beispielaufrufcode:
Szenario zwei: Vintage-Reiseplakat (mit Textdarstellung)
gpt-image-2 zeigt eine stabile Leistung in der Typografie und Textdarstellung und eignet sich hervorragend zur Erstellung von Plakaten, Menüs, Grußkarten und anderen Designs mit Text.
url-Feld des Rückgabeergebnisses sieht wie folgt aus:

AMALFI und ITALIA 1958 klar und korrekt dargestellt wurden.
Szenario drei: Komplexe Komposition und Zählung
Der folgende Hinweis dient dazu, die Fähigkeit des Modells zu testen, strukturierte Anweisungen zu „Menge“ und „Position“ zu befolgen.
dall-e-3 schwer stabil zu erreichen war.
Szenario vier: Illustrationsstil (Querformat)
Durch die Angabe von Kunstmedien und emotionalen Schlüsselwörtern kann das Modell dazu angeregt werden, stilisierte Illustrationen zu erzeugen.
Asynchron und Rückruf
gpt-image-2 benötigt in der Regel 60 bis 90 Sekunden für einen einzelnen Aufruf. Wenn Sie keine dauerhafte Verbindung wünschen, können Sie den in diesem Artikel später beschriebenen callback_url-Asynchron-Rückrufmechanismus verwenden. Der Aufrufprozess ist identisch mit dem anderer Modelle.
Nano Banana Modellreihe
Dienano-banana-Reihe ist ein auf Gemini basierendes Bildgenerierungsmodell, das über dasselbe /openai/images/generations-Interface integriert ist. Es ist kein Wechsel des Endpunkts erforderlich, ändern Sie einfach model in eines der untenstehenden Modelle.
Wichtig: Unterstützter Parameterbereich Nano Banana wird über eine Anpassungsschicht in das OpenAI-Protokoll integriert und unterstützt im Vergleich zugpt-image-*nur die folgenden Parameter:model,prompt,size.
sizewird gemäß der folgenden Tabelle in das interneaspect_ratioabgebildet. Nicht aufgeführte Größen werden auf1:1zurückgestuft:
1024x1024/512x512/256x256→1:11792x1024→16:91024x1792→9:16- Unterstützt keine Parameter wie
n,quality,style,response_format,background,output_formatusw.; diese werden ignoriert, wenn sie ausgefüllt sind.- Die Rückgabestruktur folgt dem OpenAI-Format (
data[].url), abercreatedist fest auf0gesetzt, undb64_jsonwird nicht zurückgegeben,revised_promptist immer gleich dem ursprünglichenprompt.
Grundlegender Aufruf
url Feld aufgerufen werden:

Upgrade auf das Flaggschiff-Modell nano-banana-pro
Ändern Sie einfach model in nano-banana-pro, die anderen Parameter bleiben unverändert:

Asynchrone Rückruf
Diecallback_url asynchrone Rückruffunktion ist auch für nano-banana wirksam, der Aufrufprozess ist identisch mit anderen Modellen, siehe den Abschnitt Asynchrone Rückrufe weiter unten.
Grundlegende Nutzung
Nun können Sie die entsprechenden Inhalte im Interface ausfüllen, wie im Bild gezeigt:
authorization, den Sie direkt aus der Dropdown-Liste auswählen können. Ein weiterer Parameter ist model, model ist die Modellkategorie, die wir von der OpenAI DALL-E-Website auswählen, hier haben wir hauptsächlich 1 Modell, Details finden Sie in den von uns bereitgestellten Modellen. Der letzte Parameter ist prompt, prompt ist das Stichwort, das wir eingeben, um das Bild zu generieren.
Gleichzeitig können Sie auf der rechten Seite den entsprechenden Aufrufcode sehen, den Sie kopieren und direkt ausführen oder einfach auf die Schaltfläche „Try“ klicken können, um einen Test durchzuführen.

created, die ID der Bildgenerierung, die zur eindeutigen Identifizierung dieser Aufgabe dient.data, die Informationen über das Ergebnis der Bildgenerierung enthält.
data die spezifischen Informationen über die vom Modell generierten Bilder, und der url darin ist der detaillierte Link zum generierten Bild, wie im Bild gezeigt.

Bildqualitätsparameter quality
Als nächstes wird erklärt, wie einige detaillierte Parameter für die Bildgenerierungsergebnisse festgelegt werden, wobei der Bildqualitätsparameter quality zwei Arten umfasst, die erste standard bedeutet, dass ein Standardbild generiert wird, die andere hd bedeutet, dass das erstellte Bild feinere Details und größere Konsistenz aufweist.
Hier wird der Bildqualitätsparameter auf standard gesetzt, die spezifische Einstellung ist im folgenden Bild dargestellt:


standard wie im folgenden Bild dargestellt ist:

hd ,可以得到如下图所示的图片:

hd 比 standard 生成的图片具有更精细的细节和更大的一致性。
图片大小尺寸参数 size
我们还可以设置生成图片的尺寸大小,我们可以进行下面的设置。
下面设置图片的尺寸大小为 1024 * 1024 ,具体设置如下图:


1024 * 1024 的生成图片如下图所示:

1792 * 1024 ,可以得到如下图所示的图片:
可以看到图片的尺寸大小很明显不一样,另外还可以设置更多尺寸大小,详情信息参考我们官网文档。
图片风格参数 style
图片风格参数 style 包含俩个参数,第一种 vivid 表示生成的图片是更加生动的,另一种 natural 表示生成的图片更加的自然一点。
下面设置图片风格参数为 vivid ,具体设置如下图:


vivid 的生成图片如下图所示:

natural ,可以得到如下图所示的图片:

vivid 比 natural 生成的图片具有更加生动逼真。
图片链接的格式参数 response_format
最后一个图片链接的格式参数 response_format 也有俩种,第一种 b64_json 是对图片链接进行 Base64 编码,另一种 url 就是普通的图片链接,可以直接查看图片。
下面设置图片链接的格式参数为 url ,具体设置如下图:


url der generierte Bildlink ist Bild-URL, der direkt zugänglich ist, der Bildinhalt ist wie im folgenden Bild dargestellt:

b64_json setzt, kann man das Ergebnis des Base64-codierten Bildlinks erhalten, das spezifische Ergebnis ist wie im folgenden Bild dargestellt:
Asynchrone Rückrufe
Da die OpenAI Images Generations API möglicherweise relativ lange benötigt, um Bilder zu generieren, bleibt die HTTP-Anfrage bei längerer Nichtreaktion verbunden, was zu einem zusätzlichen Verbrauch von Systemressourcen führt. Daher bietet diese API auch Unterstützung für asynchrone Rückrufe. Der gesamte Prozess ist: Wenn der Client die Anfrage startet, wird zusätzlich eincallback_url-Feld angegeben. Nachdem der Client die API-Anfrage gestartet hat, gibt die API sofort ein Ergebnis zurück, das ein task_id-Feld enthält, das die aktuelle Aufgaben-ID darstellt. Wenn die Aufgabe abgeschlossen ist, werden die Ergebnisse der generierten Bilder in Form von POST JSON an die vom Client angegebene callback_url gesendet, wobei auch das task_id-Feld enthalten ist, sodass die Aufgabenergebnisse über die ID miteinander verknüpft werden können.
Lassen Sie uns anhand eines Beispiels verstehen, wie dies konkret funktioniert.
Zunächst ist der Webhook-Rückruf ein Dienst, der HTTP-Anfragen empfangen kann. Entwickler sollten ihn durch die URL ihres eigenen HTTP-Servers ersetzen. Hier verwenden wir zur Demonstration eine öffentliche Webhook-Beispielwebsite https://webhook.site/, auf der Sie eine Webhook-URL erhalten können, wie im Bild gezeigt:
Kopieren Sie diese URL, um sie als Webhook zu verwenden. In diesem Beispiel lautet die URL https://webhook.site/3d32690d-6780-4187-a65c-870061e8c8ab.
Als Nächstes können wir das Feld callback_url auf die oben genannte Webhook-URL setzen und die entsprechenden Parameter wie im folgenden Code gezeigt ausfüllen:
task_id-Feld enthält, und das data-Feld die gleichen Bildgenerierungsergebnisse wie bei der synchronen Anfrage enthält. Durch das task_id-Feld kann die Aufgabe verknüpft werden.
Fehlerbehandlung
Bei der API-Anfrage, wenn ein Fehler auftritt, gibt die API die entsprechenden Fehlercodes und Informationen zurück. Beispielsweise:400 token_mismatched:Ungültige Anfrage, möglicherweise aufgrund fehlender oder ungültiger Parameter.400 api_not_implemented:Ungültige Anfrage, möglicherweise aufgrund fehlender oder ungültiger Parameter.401 invalid_token:Unbefugt, ungültiges oder fehlendes Autorisierungstoken.429 too_many_requests:Zu viele Anfragen, Sie haben das Rate-Limit überschritten.500 api_error:Interner Serverfehler, etwas ist auf dem Server schiefgegangen.

