Skip to main content
Die OpenAI Bilder Generations API unterstützt derzeit verschiedene Modelle zur Bildgenerierung, darunter das klassische dall-e-3, das textbasierte Rendering mit stärkeren Fähigkeiten gpt-image-1, die neueste Generation gpt-image-2 sowie die über dieselbe Schnittstelle zugänglichen Modelle der nano-banana / nano-banana-2-lite / nano-banana-2 / nano-banana-pro Serie. Sie können alle qualitativ hochwertige Bilder basierend auf Textbeschreibungen generieren. Dieses Dokument beschreibt hauptsächlich den Ablauf der Nutzung der OpenAI Bilder Generations API, mit der wir die Bildgenerierungsfunktionen der OpenAI-Serie einfach nutzen können.

Antragsprozess

Um die OpenAI Bilder Generations API zu nutzen, müssen Sie zunächst im Ace Data Cloud Dashboard Ihr API-Token abrufen und für später aufbewahren. Wenn Sie noch nicht angemeldet oder registriert sind, werden Sie automatisch zur Anmeldeseite weitergeleitet, um sich zu registrieren und anzumelden. Nach Abschluss werden Sie automatisch zur aktuellen Seite zurückgeleitet. Ein API-Token reicht aus, um auf alle Dienste der Plattform zuzugreifen, es ist nicht erforderlich, für jeden Dienst separat einen Antrag zu stellen. Bei der ersten Beantragung erhalten Sie ein kostenloses Kontingent, um es kostenlos auszuprobieren; wenn das Kontingent erschöpft ist, können Sie im Dashboard Ihr Guthaben aufladen.
📘 Vollständige Dokumentation: OpenAI Bilder Generations API →

GPT-Image-2 Modell

gpt-image-2 ist das neueste Bildgenerierungsmodell von OpenAI, das im Vergleich zu dall-e-3 und gpt-image-1 in folgenden Aspekten deutliche Verbesserungen aufweist:
  • Stärkere Befolgung von Anweisungen: Es kann komplexe Anweisungen zu Komposition, Zählung, räumlichen Beziehungen usw. genau verstehen.
  • Klareres Text-Rendering: In Szenarien wie Plakaten, Menüs, Infografiken, Logos usw. treten kaum Verwirrungen bei Englisch und Zahlen auf.
  • Reichhaltigere Stilvariationen: Unterstützt nativ verschiedene Stile wie filmische Porträts, Vintage-Poster, Kinderillustrationen, Produktfotografie, Infografiken usw.
  • Nativ Unterstützung für mehrere Formate + hohe Auflösung: Deckt 5 Formate (1:1, 4:3, 3:4, 16:9, 9:16) mit insgesamt 3 Auflösungen (1K / 2K / 4K) ab.
Die Aufrufmethode ist identisch mit anderen Modellen, Sie müssen lediglich das Feld model auf gpt-image-2 setzen. Die url im Rückgabeergebnis ist ein dauerhaft auf platform.cdn.acedata.cloud gehosteter Bildlink, der direkt im Browser geöffnet oder in eine Webseite eingebettet werden kann.

Linienvarianten (:official / :reverse)

gpt-image-2 verwendet standardmäßig die Standardlinie. Durch den Suffix des Modellnamens können Sie die Linie explizit auswählen:
  • gpt-image-2:official: Offizieller Kanal, stabil und konform. Unterstützt echte 2K / 4K Auflösungen, die Abrechnung erfolgt pro Bild, der Preis beträgt das Doppelte des Standardpreises von gpt-image-2. Wenn die Linie nicht verfügbar ist, wird direkt ein Fehler zurückgegeben, es erfolgt keine automatische Herabstufung.
  • gpt-image-2:reverse: Vollständig äquivalent zum Standard gpt-image-2, kosteneffizienter, Preis bleibt gleich.

Unterstützte size Werte

gpt-image-2 überprüft nur das Format von size, solange es nicht auto oder eine leere Zeichenkette ist, muss es WIDTHxHEIGHT entsprechen (z. B. 1024x1024, 2048x1152, 800x600); jede andere Form führt zu einem 400 Fehler. Alle Größen (1K / 2K / 4K / benutzerdefiniert) werden einheitlich pro Bild abgerechnet, es gibt keine Preisaufschläge für die Größe. Größenbeschränkungen: Benutzerdefinierte Größen müssen sicherstellen, dass sowohl Breite als auch Höhe Vielfache von 16 sind, die lange Seite ≤ 3840 und die Gesamtpixelzahl ≤ 8.294.400 beträgt; Überschreitungen werden mit 4xx zurückgegeben.
Wenn Sie size: "auto" explizit übergeben, plant die Plattform die Leinwand im kontinuierlichen Verhältnis und bewertet nach folgender Priorität: explizite Pixel oder Verhältnisse in den Eingabeaufforderungen, Benennungsstandards (Papier / Druckerzeugnisse / Plattformplatzierungen / Werbung / Geräte / Fotografie / Film), Mediengewohnheiten und schließlich Kompositionsinferenz. Daher können neben den gängigen 1:1, 4:5, 9:16, 21:9 auch nicht vordefinierte Verhältnisse wie 1.91:1, 1.85:1, 2.39:1, ISO-Papier 1:√2 beibehalten werden; die endgültige Größe wird automatisch auf die von den Diensten unterstützten Vielfachen von 16 und das Pixelbudget angepasst. Wenn die automatische Bestimmung nicht verfügbar ist, wird auf das Standardformat des Modells zurückgegriffen, was die Generierung nicht unterbricht. Wenn das Feld size weggelassen wird, wird das Standardformat des Modells verwendet; bei strengen Anforderungen an die Pixel wird dennoch empfohlen, direkt WIDTHxHEIGHT zu übergeben. Bei Ausgaben unter 1K wird keine strikte Pixelanpassung garantiert – wenn Sie 1024x1024 übergeben, erhalten Sie möglicherweise 1254x1254, das Verhältnis bleibt jedoch gleich. Wenn Sie es erneut als size übergeben, bleibt die Abrechnung unverändert. Ein 4K-Einzelaufruf benötigt normalerweise 4–8 Minuten, es wird empfohlen, dies zusammen mit dem späteren callback_url für asynchrone Rückrufe zu verwenden.
Über den n Parameter gpt-image-2 unterstützt n > 1 (Werte 1–10): Mit einer Anfrage können Sie die entsprechende Anzahl an Bildern zurückgeben und pro Bild abrechnen. Um Unterschiede zwischen mehreren Ergebnissen zu erzielen, wird empfohlen, gleichzeitig unterschiedliche prompt oder seed zu übergeben. Dies gilt auch für gpt-image-1 / gpt-image-1.5 sowie die Serien nano-banana / nano-banana-2-lite / nano-banana-2 / nano-banana-pro; dall-e-3 unterstützt nur n = 1. Beachten Sie, dass response_format=b64_json nur für n=1 unterstützt wird, verwenden Sie bei n>1 die Standard-URL-Rückgabe. Wenn einige Bilder nicht erfolgreich generiert werden, werden nur die erfolgreichen Teile zurückgegeben und abgerechnet.
Im Folgenden werden einige verschiedene reale Beispiele gezeigt, um die Fähigkeiten von gpt-image-2 anschaulich zu erleben.

Szene Eins: Filmisches Porträt

In den Stichwörtern können filmische Begriffe (35mm Film, geringe Tiefenschärfe, Neonlicht usw.) verwendet werden, um die Atmosphäre und Textur präzise zu steuern. Python Beispielaufrufcode:
Das Rückgabeergebnis sieht wie folgt aus:
Das generierte Bild sieht wie folgt aus:

Szene Zwei: Vintage-Reiseplakat (mit Textdarstellung)

gpt-image-2 zeigt eine stabile Leistung in der Typografie und Textdarstellung und eignet sich hervorragend zur Erstellung von Plakaten, Menüs, Grußkarten und anderen Designs mit Text.
Das Bild im url-Feld des Rückgabeergebnisses sieht wie folgt aus:

Man kann sehen, dass das Modell nicht nur den visuellen Stil des Art-Déco-Plakats genau wiedergegeben hat, sondern auch die Titeltexte AMALFI und ITALIA 1958 klar und korrekt dargestellt wurden.

Szene Drei: Komplexe Komposition und Zählung

Das folgende Stichwort wird verwendet, um die Fähigkeit des Modells zu testen, strukturierte Anweisungen zu „Menge“ und „Position“ zu befolgen.
Das generierte Bild sieht wie folgt aus:

Man kann sehen, dass die Anzahl der Bücher auf den drei Regalen (1 / 3 / 7) vollständig mit dem Stichwort übereinstimmt, was in der dall-e-3-Ära schwer stabil zu erreichen war.

Szene Vier: Illustrationsstil (Querformat)

Durch die Angabe von künstlerischen Medien und emotionalen Schlüsselwörtern kann das Modell dazu angeregt werden, stilisierte Illustrationen zu erzeugen.
Die generierte Querformat-Illustration sieht wie folgt aus:

Asynchron und Rückruf

gpt-image-2 benötigt in der Regel 60–90 Sekunden für einen einzelnen Aufruf. Wenn Sie keine dauerhafte Verbindung wünschen, können Sie den in diesem Artikel später beschriebenen callback_url-Asynchron-Rückrufmechanismus verwenden. Der Aufrufprozess ist identisch mit dem anderer Modelle.

Nano Banana Modellreihe

Die nano-banana-Reihe ist ein auf Gemini basierendes Bildgenerierungsmodell, das über denselben /openai/images/generations-Endpunkt integriert ist, ohne dass ein Wechsel des Endpunkts erforderlich ist. Sie müssen lediglich das model in eines der untenstehenden ändern.
Wichtig: Unterstützter Parameterbereich Nano Banana wird über eine Anpassungsschicht in das OpenAI-Protokoll integriert und unterstützt im Vergleich zu gpt-image-* nur die folgenden Parameter: model, prompt, size, n.
  • size wird gemäß der folgenden Tabelle in das interne aspect_ratio abgebildet. Nicht aufgeführte Größen werden auf 1:1 zurückgestuft:
    • 1024x1024 / 512x512 / 256x2561:1
    • 1792x102416:9
    • 1024x17929:16
  • Unterstützt keine Parameter wie quality, style, response_format, background, output_format usw.; diese werden ignoriert, wenn sie ausgefüllt sind. n > 1 wird unterstützt (1–10) und gibt die entsprechende Anzahl an Bildern zurück und berechnet diese nach Anzahl.
  • Die Rückgabestruktur folgt dem OpenAI-Format (data[].url), aber created ist fest auf 0 gesetzt, und es wird kein b64_json zurückgegeben, revised_prompt ist immer gleich dem ursprünglichen prompt.

Grundlegender Aufruf

Das Rückgabeergebnis sieht wie folgt aus:
Die generierte Bild kann direkt über das zurückgegebene url Feld aufgerufen werden:

Upgrade auf das Flaggschiff-Modell nano-banana-pro

Ändern Sie einfach model in nano-banana-pro, die anderen Parameter bleiben unverändert:
Beispielantwort:

Asynchrone Rückrufe

Die callback_url asynchrone Rückrufmechanismus funktioniert ebenfalls für nano-banana, der Aufrufprozess ist identisch mit anderen Modellen, siehe den Abschnitt Asynchrone Rückrufe unten.

Grundlegende Nutzung

Jetzt können Sie die entsprechenden Inhalte im Interface ausfüllen, wie im Bild gezeigt:

Bei der ersten Nutzung dieser Schnittstelle müssen wir mindestens drei Inhalte ausfüllen, einer ist authorization, den Sie direkt aus der Dropdown-Liste auswählen können. Ein weiterer Parameter ist model, model ist die Kategorie des OpenAI DALL-E Modells, die wir verwenden möchten, hier haben wir hauptsächlich 1 Modell, Details finden Sie in den bereitgestellten Modellen. Der letzte Parameter ist prompt, prompt ist das Stichwort, das wir eingeben, um das Bild zu generieren. Gleichzeitig können Sie auf der rechten Seite den entsprechenden Aufrufcode sehen, den Sie kopieren und direkt ausführen können, oder Sie können einfach auf die Schaltfläche „Try“ klicken, um einen Test durchzuführen.

Python Beispielaufrufcode:
Nach dem Aufruf stellen wir fest, dass das Rückgabeergebnis wie folgt aussieht:
Das Rückgabeergebnis enthält mehrere Felder, die wie folgt beschrieben werden:
  • created , die ID der Bildgenerierung, die zur eindeutigen Identifizierung dieser Aufgabe dient.
  • data, enthält die Ergebnisinformationen der Bildgenerierung.
Dabei enthält data die spezifischen Informationen über das vom Modell generierte Bild, und der url darin ist der Detaillink zum generierten Bild, wie im Bild gezeigt.

Bildqualitätsparameter quality

Als nächstes wird erklärt, wie einige detaillierte Parameter für die Bildgenerierungsergebnisse festgelegt werden, wobei der Bildqualitätsparameter quality zwei Arten umfasst, die erste standard bedeutet, dass ein Standardbild generiert wird, die andere hd bedeutet, dass das erstellte Bild feinere Details und größere Konsistenz aufweist. Hier wird der Bildqualitätsparameter auf standard gesetzt, die spezifische Einstellungen sind im folgenden Bild dargestellt:

Gleichzeitig können Sie auf der rechten Seite den entsprechenden Aufrufcode sehen, den Sie kopieren und direkt ausführen können, oder Sie können einfach auf die Schaltfläche „Try“ klicken, um einen Test durchzuführen.

Python Beispielaufrufcode:
Nach dem Aufruf stellen wir fest, dass das Rückgabeergebnis wie folgt aussieht:
返回的结果与基本使用的内容一致,可以看到图片质量参数为 standard 的生成图片如下图所示:

与上述相同操作,仅需将图片质量参数设置为 hd ,可以得到如下图所示的图片:

可以看到 hdstandard 生成的图片具有更精细的细节和更大的一致性。

Bildgröße Parameter size

Wir können auch die Größe der generierten Bilder einstellen, wir können die folgenden Einstellungen vornehmen. Unten wird die Bildgröße auf 1024 * 1024 eingestellt, die spezifische Einstellung ist wie im folgenden Bild dargestellt:

Gleichzeitig können Sie beachten, dass auf der rechten Seite der entsprechende Aufrufcode generiert wird, den Sie kopieren und direkt ausführen oder einfach auf die Schaltfläche „Try“ klicken können, um einen Test durchzuführen.

Python Beispielaufrufcode:
Nach dem Aufruf stellen wir fest, dass das zurückgegebene Ergebnis wie folgt aussieht:
返回的结果与基本使用的内容一致,可以看到图片的尺寸大小为 1024 * 1024 的生成图片如下图所示:

与上述相同操作,仅需将图片的尺寸大小为 1792 * 1024 ,可以得到如下图所示的图片: 可以看到图片的尺寸大小很明显不一样,另外还可以设置更多尺寸大小,详情信息参考我们官网文档。

Bildstil Parameter style

Der Bildstil Parameter style enthält zwei Parameter, die erste vivid bedeutet, dass das generierte Bild lebendiger ist, die andere natural bedeutet, dass das generierte Bild natürlicher ist. Unten wird der Bildstil Parameter auf vivid eingestellt, die spezifische Einstellung ist wie im folgenden Bild dargestellt:

Gleichzeitig können Sie beachten, dass auf der rechten Seite der entsprechende Aufrufcode generiert wird, den Sie kopieren und direkt ausführen oder einfach auf die Schaltfläche „Try“ klicken können, um einen Test durchzuführen.

Python Beispielaufrufcode:
Nach dem Aufruf stellen wir fest, dass das zurückgegebene Ergebnis wie folgt aussieht:
返回的结果与基本使用的内容一致,可以看到图片风格参数为 vivid 的生成图片如下图所示:

与上述相同操作,仅需将图片风格参数为 natural ,可以得到如下图所示的图片:

可以看到 vividnatural 生成的图片具有更加生动逼真。 Der letzte Bildlink Format Parameter response_format hat ebenfalls zwei Arten, die erste b64_json ist eine Base64-Codierung des Bildlinks, die andere url ist der normale Bildlink, den Sie direkt anzeigen können. Unten wird der Bildlink Format Parameter auf url eingestellt, die spezifische Einstellung ist wie im folgenden Bild dargestellt:

Gleichzeitig können Sie beachten, dass auf der rechten Seite der entsprechende Aufrufcode generiert wird, den Sie kopieren und direkt ausführen oder einfach auf die Schaltfläche „Try“ klicken können, um einen Test durchzuführen.

Python Beispielaufrufcode:
Nach dem Aufruf haben wir festgestellt, dass das Rückgabeergebnis wie folgt aussieht:
Das zurückgegebene Ergebnis stimmt mit dem grundlegenden Inhalt überein, und man kann sehen, dass der Bildlink mit dem Formatparameter url der generierte Bildlink ist Bild-URL dies ist direkt zugänglich, der Bildinhalt ist wie im folgenden Bild dargestellt:

Durch denselben Vorgang, bei dem der Bildlink mit dem Formatparameter b64_json angegeben wird, kann das Ergebnis des Base64-codierten Bildlinks erhalten werden, das spezifische Ergebnis ist wie im folgenden Bild dargestellt:

Asynchrone Rückrufe

Da die OpenAI Images Generations API möglicherweise längere Zeit benötigt, um Bilder zu generieren, bleibt die HTTP-Anfrage bei längerer Nichtreaktion verbunden, was zu einem zusätzlichen Verbrauch von Systemressourcen führt. Daher bietet diese API auch Unterstützung für asynchrone Rückrufe. Der gesamte Prozess ist: Der Client initiiert die Anfrage und gibt zusätzlich ein callback_url-Feld an. Nachdem der Client die API-Anfrage gestartet hat, gibt die API sofort ein Ergebnis zurück, das ein task_id-Feld enthält, das die aktuelle Aufgaben-ID darstellt. Wenn die Aufgabe abgeschlossen ist, wird das Ergebnis des generierten Bildes in Form von POST JSON an die vom Client angegebene callback_url gesendet, wobei auch das task_id-Feld enthalten ist, sodass das Aufgabenergebnis über die ID verknüpft werden kann. Lassen Sie uns anhand eines Beispiels verstehen, wie dies konkret funktioniert. Zunächst ist der Webhook-Rückruf ein Dienst, der HTTP-Anfragen empfangen kann. Entwickler sollten ihn durch die URL ihres eigenen eingerichteten HTTP-Servers ersetzen. Hier zur Vereinfachung verwenden wir eine öffentliche Webhook-Beispielwebsite https://webhook.site/, auf dieser Website kann man eine Webhook-URL erhalten, wie im Bild dargestellt: Kopieren Sie diese URL, um sie als Webhook zu verwenden, das Beispiel hier lautet https://webhook.site/3d32690d-6780-4187-a65c-870061e8c8ab. Als nächstes können wir das Feld callback_url auf die oben genannte Webhook-URL setzen und die entsprechenden Parameter wie im folgenden Code angegeben ausfüllen:
Wenn Sie auf Ausführen klicken, können Sie sofort ein Ergebnis erhalten, wie folgt:
Nach einer kurzen Wartezeit können wir die Ergebnisse der generierten Bilder an der Webhook-URL beobachten, der Inhalt ist wie folgt:
Man kann sehen, dass im Ergebnis ein task_id-Feld vorhanden ist, das data-Feld enthält die gleichen Bildgenerierungsergebnisse wie bei der synchronen Anfrage, und durch das task_id-Feld kann die Aufgabe verknüpft werden.

Fehlerbehandlung

Bei der API-Anfrage, wenn ein Fehler auftritt, gibt die API den entsprechenden Fehlercode und die Informationen zurück. Beispielsweise:
  • 400 token_mismatched:Ungültige Anfrage, möglicherweise aufgrund fehlender oder ungültiger Parameter.
  • 400 api_not_implemented:Ungültige Anfrage, möglicherweise aufgrund fehlender oder ungültiger Parameter.
  • 401 invalid_token:Unbefugt, ungültiges oder fehlendes Autorisierungstoken.
  • 429 too_many_requests:Zu viele Anfragen, Sie haben das Rate-Limit überschritten.
  • 500 api_error:Interner Serverfehler, etwas ist auf dem Server schiefgelaufen.

Fehlerantwort Beispiel

Fazit

Durch dieses Dokument haben Sie gelernt, wie Sie die Bildgenerierungs-API von OpenAI Images Generations einfach nutzen können, um die Bildgenerierungsfunktionen von OpenAI DALL-E zu verwenden. Wir hoffen, dass dieses Dokument Ihnen hilft, die API besser zu integrieren und zu nutzen. Bei Fragen wenden Sie sich bitte jederzeit an unser technisches Support-Team.