dall-e-3, das textbasierte Rendering mit stärkeren Fähigkeiten gpt-image-1, die neueste Generation gpt-image-2 sowie die über dieselbe Schnittstelle zugänglichen Modelle der nano-banana / nano-banana-2-lite / nano-banana-2 / nano-banana-pro Serie. Sie können alle qualitativ hochwertige Bilder basierend auf Textbeschreibungen generieren.
Dieses Dokument beschreibt hauptsächlich den Ablauf der Nutzung der OpenAI Bilder Generations API, mit der wir die Bildgenerierungsfunktionen der OpenAI-Serie einfach nutzen können.
Antragsprozess
Um die OpenAI Bilder Generations API zu nutzen, müssen Sie zunächst im Ace Data Cloud Dashboard Ihr API-Token abrufen und für später aufbewahren.
Wenn Sie noch nicht angemeldet oder registriert sind, werden Sie automatisch zur Anmeldeseite weitergeleitet, um sich zu registrieren und anzumelden. Nach Abschluss werden Sie automatisch zur aktuellen Seite zurückgeleitet.
Ein API-Token reicht aus, um auf alle Dienste der Plattform zuzugreifen, es ist nicht erforderlich, für jeden Dienst separat einen Antrag zu stellen. Bei der ersten Beantragung erhalten Sie ein kostenloses Kontingent, um es kostenlos auszuprobieren; wenn das Kontingent erschöpft ist, können Sie im Dashboard Ihr Guthaben aufladen.
📘 Vollständige Dokumentation: OpenAI Bilder Generations API →
GPT-Image-2 Modell
gpt-image-2 ist das neueste Bildgenerierungsmodell von OpenAI, das im Vergleich zu dall-e-3 und gpt-image-1 in folgenden Aspekten deutliche Verbesserungen aufweist:
- Stärkere Befolgung von Anweisungen: Es kann komplexe Anweisungen zu Komposition, Zählung, räumlichen Beziehungen usw. genau verstehen.
- Klareres Text-Rendering: In Szenarien wie Plakaten, Menüs, Infografiken, Logos usw. treten kaum Verwirrungen bei Englisch und Zahlen auf.
- Reichhaltigere Stilvariationen: Unterstützt nativ verschiedene Stile wie filmische Porträts, Vintage-Poster, Kinderillustrationen, Produktfotografie, Infografiken usw.
- Nativ Unterstützung für mehrere Formate + hohe Auflösung: Deckt 5 Formate (1:1, 4:3, 3:4, 16:9, 9:16) mit insgesamt 3 Auflösungen (1K / 2K / 4K) ab.
model auf gpt-image-2 setzen. Die url im Rückgabeergebnis ist ein dauerhaft auf platform.cdn.acedata.cloud gehosteter Bildlink, der direkt im Browser geöffnet oder in eine Webseite eingebettet werden kann.
Linienvarianten (:official / :reverse)
gpt-image-2 verwendet standardmäßig die Standardlinie. Durch den Suffix des Modellnamens können Sie die Linie explizit auswählen:
gpt-image-2:official: Offizieller Kanal, stabil und konform. Unterstützt echte 2K / 4K Auflösungen, die Abrechnung erfolgt pro Bild, der Preis beträgt das Doppelte des Standardpreises vongpt-image-2. Wenn die Linie nicht verfügbar ist, wird direkt ein Fehler zurückgegeben, es erfolgt keine automatische Herabstufung.gpt-image-2:reverse: Vollständig äquivalent zum Standardgpt-image-2, kosteneffizienter, Preis bleibt gleich.
Unterstützte size Werte
gpt-image-2 überprüft nur das Format von size, solange es nicht auto oder eine leere Zeichenkette ist, muss es WIDTHxHEIGHT entsprechen (z. B. 1024x1024, 2048x1152, 800x600); jede andere Form führt zu einem 400 Fehler. Alle Größen (1K / 2K / 4K / benutzerdefiniert) werden einheitlich pro Bild abgerechnet, es gibt keine Preisaufschläge für die Größe.
Größenbeschränkungen: Benutzerdefinierte Größen müssen sicherstellen, dass sowohl Breite als auch Höhe Vielfache von 16 sind, die lange Seite ≤ 3840 und die Gesamtpixelzahl ≤ 8.294.400 beträgt; Überschreitungen werden mit 4xx zurückgegeben.
Wenn Siesize: "auto"explizit übergeben, plant die Plattform die Leinwand im kontinuierlichen Verhältnis und bewertet nach folgender Priorität: explizite Pixel oder Verhältnisse in den Eingabeaufforderungen, Benennungsstandards (Papier / Druckerzeugnisse / Plattformplatzierungen / Werbung / Geräte / Fotografie / Film), Mediengewohnheiten und schließlich Kompositionsinferenz. Daher können neben den gängigen1:1,4:5,9:16,21:9auch nicht vordefinierte Verhältnisse wie1.91:1,1.85:1,2.39:1, ISO-Papier1:√2beibehalten werden; die endgültige Größe wird automatisch auf die von den Diensten unterstützten Vielfachen von 16 und das Pixelbudget angepasst. Wenn die automatische Bestimmung nicht verfügbar ist, wird auf das Standardformat des Modells zurückgegriffen, was die Generierung nicht unterbricht. Wenn das Feldsizeweggelassen wird, wird das Standardformat des Modells verwendet; bei strengen Anforderungen an die Pixel wird dennoch empfohlen, direktWIDTHxHEIGHTzu übergeben. Bei Ausgaben unter 1K wird keine strikte Pixelanpassung garantiert – wenn Sie1024x1024übergeben, erhalten Sie möglicherweise1254x1254, das Verhältnis bleibt jedoch gleich. Wenn Sie es erneut alssizeübergeben, bleibt die Abrechnung unverändert. Ein 4K-Einzelaufruf benötigt normalerweise 4–8 Minuten, es wird empfohlen, dies zusammen mit dem späterencallback_urlfür asynchrone Rückrufe zu verwenden.
Über denIm Folgenden werden einige verschiedene reale Beispiele gezeigt, um die Fähigkeiten vonnParametergpt-image-2unterstütztn > 1(Werte 1–10): Mit einer Anfrage können Sie die entsprechende Anzahl an Bildern zurückgeben und pro Bild abrechnen. Um Unterschiede zwischen mehreren Ergebnissen zu erzielen, wird empfohlen, gleichzeitig unterschiedlichepromptoderseedzu übergeben. Dies gilt auch fürgpt-image-1/gpt-image-1.5sowie die Seriennano-banana/nano-banana-2-lite/nano-banana-2/nano-banana-pro;dall-e-3unterstützt nurn = 1. Beachten Sie, dassresponse_format=b64_jsonnur fürn=1unterstützt wird, verwenden Sie bein>1die Standard-URL-Rückgabe. Wenn einige Bilder nicht erfolgreich generiert werden, werden nur die erfolgreichen Teile zurückgegeben und abgerechnet.
gpt-image-2 anschaulich zu erleben.
Szene Eins: Filmisches Porträt
In den Stichwörtern können filmische Begriffe (35mm Film, geringe Tiefenschärfe, Neonlicht usw.) verwendet werden, um die Atmosphäre und Textur präzise zu steuern. Python Beispielaufrufcode:
Szene Zwei: Vintage-Reiseplakat (mit Textdarstellung)
gpt-image-2 zeigt eine stabile Leistung in der Typografie und Textdarstellung und eignet sich hervorragend zur Erstellung von Plakaten, Menüs, Grußkarten und anderen Designs mit Text.
url-Feld des Rückgabeergebnisses sieht wie folgt aus:

AMALFI und ITALIA 1958 klar und korrekt dargestellt wurden.
Szene Drei: Komplexe Komposition und Zählung
Das folgende Stichwort wird verwendet, um die Fähigkeit des Modells zu testen, strukturierte Anweisungen zu „Menge“ und „Position“ zu befolgen.
dall-e-3-Ära schwer stabil zu erreichen war.
Szene Vier: Illustrationsstil (Querformat)
Durch die Angabe von künstlerischen Medien und emotionalen Schlüsselwörtern kann das Modell dazu angeregt werden, stilisierte Illustrationen zu erzeugen.
Asynchron und Rückruf
gpt-image-2 benötigt in der Regel 60–90 Sekunden für einen einzelnen Aufruf. Wenn Sie keine dauerhafte Verbindung wünschen, können Sie den in diesem Artikel später beschriebenen callback_url-Asynchron-Rückrufmechanismus verwenden. Der Aufrufprozess ist identisch mit dem anderer Modelle.
Nano Banana Modellreihe
Dienano-banana-Reihe ist ein auf Gemini basierendes Bildgenerierungsmodell, das über denselben /openai/images/generations-Endpunkt integriert ist, ohne dass ein Wechsel des Endpunkts erforderlich ist. Sie müssen lediglich das model in eines der untenstehenden ändern.
Wichtig: Unterstützter Parameterbereich Nano Banana wird über eine Anpassungsschicht in das OpenAI-Protokoll integriert und unterstützt im Vergleich zugpt-image-*nur die folgenden Parameter:model,prompt,size,n.
sizewird gemäß der folgenden Tabelle in das interneaspect_ratioabgebildet. Nicht aufgeführte Größen werden auf1:1zurückgestuft:
1024x1024/512x512/256x256→1:11792x1024→16:91024x1792→9:16- Unterstützt keine Parameter wie
quality,style,response_format,background,output_formatusw.; diese werden ignoriert, wenn sie ausgefüllt sind.n > 1wird unterstützt (1–10) und gibt die entsprechende Anzahl an Bildern zurück und berechnet diese nach Anzahl.- Die Rückgabestruktur folgt dem OpenAI-Format (
data[].url), abercreatedist fest auf0gesetzt, und es wird keinb64_jsonzurückgegeben,revised_promptist immer gleich dem ursprünglichenprompt.
Grundlegender Aufruf
url Feld aufgerufen werden:

Upgrade auf das Flaggschiff-Modell nano-banana-pro
Ändern Sie einfach model in nano-banana-pro, die anderen Parameter bleiben unverändert:

Asynchrone Rückrufe
Diecallback_url asynchrone Rückrufmechanismus funktioniert ebenfalls für nano-banana, der Aufrufprozess ist identisch mit anderen Modellen, siehe den Abschnitt Asynchrone Rückrufe unten.
Grundlegende Nutzung
Jetzt können Sie die entsprechenden Inhalte im Interface ausfüllen, wie im Bild gezeigt:
authorization, den Sie direkt aus der Dropdown-Liste auswählen können. Ein weiterer Parameter ist model, model ist die Kategorie des OpenAI DALL-E Modells, die wir verwenden möchten, hier haben wir hauptsächlich 1 Modell, Details finden Sie in den bereitgestellten Modellen. Der letzte Parameter ist prompt, prompt ist das Stichwort, das wir eingeben, um das Bild zu generieren.
Gleichzeitig können Sie auf der rechten Seite den entsprechenden Aufrufcode sehen, den Sie kopieren und direkt ausführen können, oder Sie können einfach auf die Schaltfläche „Try“ klicken, um einen Test durchzuführen.

created, die ID der Bildgenerierung, die zur eindeutigen Identifizierung dieser Aufgabe dient.data, enthält die Ergebnisinformationen der Bildgenerierung.
data die spezifischen Informationen über das vom Modell generierte Bild, und der url darin ist der Detaillink zum generierten Bild, wie im Bild gezeigt.

Bildqualitätsparameter quality
Als nächstes wird erklärt, wie einige detaillierte Parameter für die Bildgenerierungsergebnisse festgelegt werden, wobei der Bildqualitätsparameter quality zwei Arten umfasst, die erste standard bedeutet, dass ein Standardbild generiert wird, die andere hd bedeutet, dass das erstellte Bild feinere Details und größere Konsistenz aufweist.
Hier wird der Bildqualitätsparameter auf standard gesetzt, die spezifische Einstellungen sind im folgenden Bild dargestellt:


standard 的生成图片如下图所示:

hd ,可以得到如下图所示的图片:

hd 比 standard 生成的图片具有更精细的细节和更大的一致性。
Bildgröße Parameter size
Wir können auch die Größe der generierten Bilder einstellen, wir können die folgenden Einstellungen vornehmen.
Unten wird die Bildgröße auf 1024 * 1024 eingestellt, die spezifische Einstellung ist wie im folgenden Bild dargestellt:


1024 * 1024 的生成图片如下图所示:

1792 * 1024 ,可以得到如下图所示的图片:
可以看到图片的尺寸大小很明显不一样,另外还可以设置更多尺寸大小,详情信息参考我们官网文档。
Bildstil Parameter style
Der Bildstil Parameter style enthält zwei Parameter, die erste vivid bedeutet, dass das generierte Bild lebendiger ist, die andere natural bedeutet, dass das generierte Bild natürlicher ist.
Unten wird der Bildstil Parameter auf vivid eingestellt, die spezifische Einstellung ist wie im folgenden Bild dargestellt:


vivid 的生成图片如下图所示:

natural ,可以得到如下图所示的图片:

vivid 比 natural 生成的图片具有更加生动逼真。
Bildlink Format Parameter response_format
Der letzte Bildlink Format Parameter response_format hat ebenfalls zwei Arten, die erste b64_json ist eine Base64-Codierung des Bildlinks, die andere url ist der normale Bildlink, den Sie direkt anzeigen können.
Unten wird der Bildlink Format Parameter auf url eingestellt, die spezifische Einstellung ist wie im folgenden Bild dargestellt:


url der generierte Bildlink ist Bild-URL dies ist direkt zugänglich, der Bildinhalt ist wie im folgenden Bild dargestellt:

b64_json angegeben wird, kann das Ergebnis des Base64-codierten Bildlinks erhalten werden, das spezifische Ergebnis ist wie im folgenden Bild dargestellt:
Asynchrone Rückrufe
Da die OpenAI Images Generations API möglicherweise längere Zeit benötigt, um Bilder zu generieren, bleibt die HTTP-Anfrage bei längerer Nichtreaktion verbunden, was zu einem zusätzlichen Verbrauch von Systemressourcen führt. Daher bietet diese API auch Unterstützung für asynchrone Rückrufe. Der gesamte Prozess ist: Der Client initiiert die Anfrage und gibt zusätzlich eincallback_url-Feld an. Nachdem der Client die API-Anfrage gestartet hat, gibt die API sofort ein Ergebnis zurück, das ein task_id-Feld enthält, das die aktuelle Aufgaben-ID darstellt. Wenn die Aufgabe abgeschlossen ist, wird das Ergebnis des generierten Bildes in Form von POST JSON an die vom Client angegebene callback_url gesendet, wobei auch das task_id-Feld enthalten ist, sodass das Aufgabenergebnis über die ID verknüpft werden kann.
Lassen Sie uns anhand eines Beispiels verstehen, wie dies konkret funktioniert.
Zunächst ist der Webhook-Rückruf ein Dienst, der HTTP-Anfragen empfangen kann. Entwickler sollten ihn durch die URL ihres eigenen eingerichteten HTTP-Servers ersetzen. Hier zur Vereinfachung verwenden wir eine öffentliche Webhook-Beispielwebsite https://webhook.site/, auf dieser Website kann man eine Webhook-URL erhalten, wie im Bild dargestellt:
Kopieren Sie diese URL, um sie als Webhook zu verwenden, das Beispiel hier lautet https://webhook.site/3d32690d-6780-4187-a65c-870061e8c8ab.
Als nächstes können wir das Feld callback_url auf die oben genannte Webhook-URL setzen und die entsprechenden Parameter wie im folgenden Code angegeben ausfüllen:
task_id-Feld vorhanden ist, das data-Feld enthält die gleichen Bildgenerierungsergebnisse wie bei der synchronen Anfrage, und durch das task_id-Feld kann die Aufgabe verknüpft werden.
Fehlerbehandlung
Bei der API-Anfrage, wenn ein Fehler auftritt, gibt die API den entsprechenden Fehlercode und die Informationen zurück. Beispielsweise:400 token_mismatched:Ungültige Anfrage, möglicherweise aufgrund fehlender oder ungültiger Parameter.400 api_not_implemented:Ungültige Anfrage, möglicherweise aufgrund fehlender oder ungültiger Parameter.401 invalid_token:Unbefugt, ungültiges oder fehlendes Autorisierungstoken.429 too_many_requests:Zu viele Anfragen, Sie haben das Rate-Limit überschritten.500 api_error:Interner Serverfehler, etwas ist auf dem Server schiefgelaufen.

