dall-e-3, textrenderingskapaciteten hos gpt-image-1, den senaste generationen gpt-image-2, samt modellerna i serien nano-banana / nano-banana-2-lite / nano-banana-2 / nano-banana-pro som är anslutna via samma gränssnitt. De kan alla generera högkvalitativa bilder baserat på textbeskrivningar.
Detta dokument beskriver huvudsakligen användningsflödet för OpenAI Images Generations API, vilket gör att vi enkelt kan använda OpenAI:s bildgenereringsfunktioner.
Ansökningsprocess
För att använda OpenAI Images Generations API, börja med att gå till Ace Data Cloud-konsolen för att hämta din API-token, som du ska spara för framtida bruk.
Om du inte har loggat in eller registrerat dig kommer du automatiskt att omdirigeras till inloggningssidan där du blir inbjuden att registrera dig och logga in. När detta är klart kommer du automatiskt att återvända till den aktuella sidan.
En API-token kan användas för att anropa alla plattformens tjänster, utan att behöva ansöka separat för varje tjänst. Första ansökan ger en gratis kvot för att prova; när kvoten är slut kan du ladda på allmän balans i konsolen.
📘 Fullständig dokumentation: OpenAI Images Generations API →
GPT-Image-2 Modell
gpt-image-2 är OpenAI:s nya generation av bildgenereringsmodeller, som har tydliga förbättringar jämfört med dall-e-3 och gpt-image-1 i följande aspekter:
- Bättre följsamhet till instruktioner: Kan exakt förstå komplexa kompositioner, räkning, positionsrelationer och andra strukturerade instruktioner.
- Tydligare textrendering: Engelska och siffror i scenarier som affischer, menyer, informationsgrafik och logotyper kommer nästan aldrig att bli förvrängda.
- Rikare stiluttryck: Inbyggt stöd för olika stilar som filmiska porträtt, retroaffischer, barnillustrationer, produktfotografi, informationsgrafik och mer.
- Inbyggt stöd för flera proportioner + högupplösning: Täcker 5 proportioner (1:1, 4:3, 3:4, 16:9, 9:16) med totalt 3 upplösningar (1K / 2K / 4K).
model-fältet till gpt-image-2. url i returresultatet är en permanent länk till en bild som är värd på platform.cdn.acedata.cloud, som kan öppnas direkt i webbläsaren eller bäddas in på en webbsida.
Officiell omdirigering / Omvänd variant (:official / :reverse)
gpt-image-2 använder som standard den omvända linjen. Genom att använda suffixet på modellnamnet kan du uttryckligen välja linje:
gpt-image-2:official: Officiell omdirigeringslinje. Stödern > 1(returnera flera bilder på en gång) och verklig 2K / 4K upplösning, debiteras per bild, enhetspriset är 2 gånger det vanligagpt-image-2. För närvarande tillhandahålls den endast av openai-hk-kanalen, och om linjen inte är tillgänglig returneras ett fel direkt, utan att nedgraderas till den omvända linjen.gpt-image-2:reverse: Helt ekvivalent med standardgpt-image-2(omvänd linje), används för att uttryckligen deklarera att den omvända linjen används, priset förblir oförändrat.
Nedan gäller begränsningarna “omn-parametern” endast för standard / omvänd linje;gpt-image-2:officialstödern > 1och debiterar per bild.
Stödda size värden
gpt-image-2 kontrollerar endast formatet på size, så länge det inte är auto eller en tom sträng, måste det matcha WIDTHxHEIGHT (till exempel 1024x1024, 2048x1152, 800x600); alla andra former kommer att returnera 400. Alla storlekar (1K / 2K / 4K / anpassade) debiteras enhetligt per bild, utan prishöjning baserat på storlek.
Övre gränser för anpassade storlekar: både bredd och höjd måste vara multiplar av 16, långsidan ≤ 3840, totalt antal pixlar ≤ 8,294,400. Överskridande av dessa gränser kommer att avvisas av uppströms och returnera 4xx.
Du kan också skickasize: "auto"eller utelämnasize-fältet, så väljer modellen automatiskt standardstorlek. I 1K-kategorin garanterar inte uppströms utdata strikt pixeljustering - du kan skicka1024x1024men få1254x1254, proportionerna förblir desamma. Om du skickar det igen somsize, förblir debiteringen densamma. 4K-anrop tar vanligtvis 4–8 minuter, det rekommenderas att använda det tillsammans medcallback_urlför asynkron återkoppling.
OmNedan ges några olika verkliga exempel för att intuitivt upplevan-parameterngpt-image-2stöder för närvarande inten > 1: denna parameter kommer att tyst ignoreras, oavsett om du skickarn=1ellern=10, kommer en enda begäran alltid att returnera 1 bild och debiteras endast för 1 bild. Om du behöver få flera kandidatbilder på en gång, vänligen initiera flera begärningar parallellt (det rekommenderas att skicka olikaprompteller olikaseed, annars kan de bilder du får vara mycket lika). Denna begränsning gäller också förgpt-image-1/gpt-image-1.5, samt seriernanano-banana/nano-banana-2-lite/nano-banana-2/nano-banana-pro.dall-e-2är för närvarande den enda modellen som ursprungligen stödern > 1;dall-e-3stöder endastn = 1.
gpt-image-2 kapabiliteter.
Scenario 1: Filmiskt Porträtt
I prompten kan filmtermer (35mm film, grunt skärpedjup, neonskott etc.) användas för att exakt kontrollera atmosfären och texturen. Python exempel på anropskod:
Scen två: Retro reseaffisch (med textrendering)
gpt-image-2 presterar stabilt när det gäller typografi och textrendering, vilket gör det mycket lämpligt för att generera affischer, menyer, gratulationskort och andra designarbeten med text.
url-fältet är bilden nedan:

AMALFI och ITALIA 1958 blev tydligt och korrekt renderade.
Scen tre: Komplex komposition och antal
Nedanstående prompt används för att testa modellens förmåga att följa strukturerade instruktioner om “antal” och “position”.
dall-e-3-eran.
Scen fyra: Illustrationsstil (landskap)
Genom att specificera konstnärligt medium och känslomässiga nyckelord kan man styra modellen att producera stiliserade illustrationer.
Asynkron och callback
gpt-image-2 kräver vanligtvis 60–90 sekunder för en enda anrop. Om man inte vill upprätthålla en lång anslutning kan man använda den asynkrona callback-mekanismen som beskrivs senare i denna artikel, anropsflödet är helt i linje med andra modeller.
Nano Banana-serien av modeller
nano-banana-serien är baserad på Gemini och är en bildgenereringsmodell som har integrerats via samma /openai/images/generations-gränssnitt, utan att behöva byta endpoint, man behöver bara ändra model till någon av de modeller som anges i tabellen nedan.
Viktigt: Parameterstöd Nano Banana ansluter via en adapter till OpenAI-protokollet och stöder endast följande parametrar jämfört medgpt-image-*:model,prompt,size.
sizekommer att mappas till internaspect_ratioenligt tabellen nedan, icke-listade storlekar kommer att degraderas till1:1:
1024x1024/512x512/256x256→1:11792x1024→16:91024x1792→9:16- Stöder inte parametrar som
n,quality,style,response_format,background,output_formatetc.; om de anges kommer de att ignoreras.- Återvändande struktur följer OpenAI-formatet (
data[].url), mencreatedär alltid0, ochb64_jsonkommer inte att returneras,revised_promptär alltid lika med den ursprungligaprompt.
Grundläggande anrop
url-fältet:

Uppgradera till flaggskeppsmodellen nano-banana-pro
Ändra bara model till nano-banana-pro, övriga parametrar förblir helt oförändrade:

Asynkron callback
callback_url asynkron callback-mekanism fungerar också för nano-banana, anropsflödet är helt identiskt med andra modeller, se avsnittet Asynkron callback nedan.
Grundläggande användning
Nu kan du fylla i motsvarande innehåll i gränssnittet, som visas i bilden:
authorization, som du direkt väljer i rullgardinsmenyn. En annan parameter är model, model är den vi väljer att använda från OpenAI DALL-E officiella modellkategori, här har vi huvudsakligen 1 typ av modell, detaljer kan ses i de modeller vi tillhandahåller. Den sista parametern är prompt, prompt är den text vi anger för att generera bilden.
Samtidigt kan du notera att det finns motsvarande anropskod som genereras till höger, du kan kopiera koden och köra den direkt, eller klicka på “Try” knappen för att testa.

created, ID för den här bildgenereringen, används för att unikt identifiera denna uppgift.data, innehåller information om bildgenereringen.
data innehåller den specifika informationen om den bild som modellen har genererat, där url är länken till den genererade bilden, som kan ses i bilden nedan.

Bildkvalitetsparameter quality
Nu kommer vi att beskriva hur man ställer in några detaljerade parametrar för bildgenereringsresultatet, där bildkvalitetsparametern quality innehåller två typer, den första standard innebär att en standardbild genereras, den andra hd innebär att den skapade bilden har mer detaljer och större konsekvens.
Nedan ställer vi in bildkvalitetsparametern till standard, specifik inställning visas i bilden:


standard ser ut som bilden nedan:

url 的生成图片如下图所示:

b64_json ,可以得到如下图所示的图片:
可以看到 url 和 b64_json 生成的图片链接格式明显不同,具体使用方式请参考我们的官方文档。
url är den genererade bildens länk Bild URL som kan nås direkt, bildinnehållet visas nedan:

b64_json, så kan vi få resultatet av den Base64-kodade bildlänken, det specifika resultatet visas nedan:
Asynkron callback
Eftersom OpenAI Images Generations API:s bildgenerering kan ta relativt lång tid, om API:t inte svarar under en längre tid, kommer HTTP-förfrågan att hålla anslutningen öppen, vilket leder till extra systemresursförbrukning, så detta API erbjuder också stöd för asynkron callback. Den övergripande processen är: när klienten initierar en begäran, specificerar den dessutom ettcallback_url-fält, efter att klienten har initierat API-förfrågan kommer API:t omedelbart att returnera ett resultat som innehåller ett task_id-fält, vilket representerar det aktuella uppdragets ID. När uppdraget är slutfört kommer resultatet av den genererade bilden att skickas till klientens angivna callback_url i POST JSON-format, vilket också inkluderar task_id-fältet, så att uppdragets resultat kan kopplas ihop med ID.
Låt oss förstå hur man gör detta genom ett exempel.
Först är Webhook-callback en tjänst som kan ta emot HTTP-förfrågningar, utvecklaren bör ersätta med URL:en till sin egen byggda HTTP-server. Här för att underlätta demonstration använder vi en offentlig Webhook-exempelsida https://webhook.site/, öppna denna webbplats för att få en Webhook-URL, som visas nedan:
Kopiera denna URL så kan den användas som Webhook, exemplet här är https://webhook.site/3d32690d-6780-4187-a65c-870061e8c8ab.
Därefter kan vi ställa in fältet callback_url till ovanstående Webhook-URL, samtidigt som vi fyller i motsvarande parametrar, som i följande kod:
task_id-fält, data-fältet innehåller samma bildgenereringsresultat som vid synkron anrop, och genom task_id-fältet kan uppdraget kopplas ihop.
Felhantering
Vid anrop av API:t, om ett fel uppstår, kommer API:t att returnera motsvarande felkod och information. Till exempel:400 token_mismatched:Dålig begäran, möjligtvis på grund av saknade eller ogiltiga parametrar.400 api_not_implemented:Dålig begäran, möjligtvis på grund av saknade eller ogiltiga parametrar.401 invalid_token:Obehörig, ogiltig eller saknad auktoriseringstoken.429 too_many_requests:För många begärningar, du har överskridit hastighetsgränsen.500 api_error:Intern serverfel, något gick fel på servern.

