Skip to main content
OpenAI Images Generations API stöder för närvarande flera bildgenereringsmodeller, inklusive den klassiska dall-e-3, textrenderingskapaciteten hos gpt-image-1, den senaste generationen gpt-image-2, samt modellerna i serien nano-banana / nano-banana-2-lite / nano-banana-2 / nano-banana-pro som är anslutna via samma gränssnitt. De kan alla generera högkvalitativa bilder baserat på textbeskrivningar. Detta dokument beskriver huvudsakligen användningsflödet för OpenAI Images Generations API, vilket gör att vi enkelt kan använda OpenAI:s bildgenereringsfunktioner.

Ansökningsprocess

För att använda OpenAI Images Generations API, börja med att gå till Ace Data Cloud-konsolen för att hämta din API-token, som du ska spara för framtida bruk. Om du inte har loggat in eller registrerat dig kommer du automatiskt att omdirigeras till inloggningssidan där du blir inbjuden att registrera dig och logga in. När detta är klart kommer du automatiskt att återvända till den aktuella sidan. En API-token kan användas för att anropa alla plattformens tjänster, utan att behöva ansöka separat för varje tjänst. Första ansökan ger en gratis kvot för att prova; när kvoten är slut kan du ladda på allmän balans i konsolen.
📘 Fullständig dokumentation: OpenAI Images Generations API →

GPT-Image-2 Modell

gpt-image-2 är OpenAI:s nya generation av bildgenereringsmodeller, som har tydliga förbättringar jämfört med dall-e-3 och gpt-image-1 i följande aspekter:
  • Bättre följsamhet till instruktioner: Kan exakt förstå komplexa kompositioner, räkning, positionsrelationer och andra strukturerade instruktioner.
  • Tydligare textrendering: Engelska och siffror i scenarier som affischer, menyer, informationsgrafik och logotyper kommer nästan aldrig att bli förvrängda.
  • Rikare stiluttryck: Inbyggt stöd för olika stilar som filmiska porträtt, retroaffischer, barnillustrationer, produktfotografi, informationsgrafik och mer.
  • Inbyggt stöd för flera proportioner + högupplösning: Täcker 5 proportioner (1:1, 4:3, 3:4, 16:9, 9:16) med totalt 3 upplösningar (1K / 2K / 4K).
Anropsmetoden är helt identisk med andra modeller, du behöver bara ställa in model-fältet till gpt-image-2. url i returresultatet är en permanent länk till en bild som är värd på platform.cdn.acedata.cloud, som kan öppnas direkt i webbläsaren eller bäddas in på en webbsida.

Officiell omdirigering / Omvänd variant (:official / :reverse)

gpt-image-2 använder som standard den omvända linjen. Genom att använda suffixet på modellnamnet kan du uttryckligen välja linje:
  • gpt-image-2:official: Officiell omdirigeringslinje. Stöder n > 1 (returnera flera bilder på en gång) och verklig 2K / 4K upplösning, debiteras per bild, enhetspriset är 2 gånger det vanliga gpt-image-2. För närvarande tillhandahålls den endast av openai-hk-kanalen, och om linjen inte är tillgänglig returneras ett fel direkt, utan att nedgraderas till den omvända linjen.
  • gpt-image-2:reverse: Helt ekvivalent med standard gpt-image-2 (omvänd linje), används för att uttryckligen deklarera att den omvända linjen används, priset förblir oförändrat.
Nedan gäller begränsningarna “om n-parametern” endast för standard / omvänd linje; gpt-image-2:official stöder n > 1 och debiterar per bild.

Stödda size värden

gpt-image-2 kontrollerar endast formatet på size, så länge det inte är auto eller en tom sträng, måste det matcha WIDTHxHEIGHT (till exempel 1024x1024, 2048x1152, 800x600); alla andra former kommer att returnera 400. Alla storlekar (1K / 2K / 4K / anpassade) debiteras enhetligt per bild, utan prishöjning baserat på storlek. Övre gränser för anpassade storlekar: både bredd och höjd måste vara multiplar av 16, långsidan ≤ 3840, totalt antal pixlar ≤ 8,294,400. Överskridande av dessa gränser kommer att avvisas av uppströms och returnera 4xx.
Du kan också skicka size: "auto" eller utelämna size-fältet, så väljer modellen automatiskt standardstorlek. I 1K-kategorin garanterar inte uppströms utdata strikt pixeljustering - du kan skicka 1024x1024 men få 1254x1254, proportionerna förblir desamma. Om du skickar det igen som size, förblir debiteringen densamma. 4K-anrop tar vanligtvis 4–8 minuter, det rekommenderas att använda det tillsammans med callback_url för asynkron återkoppling.
Om n-parametern gpt-image-2 stöder för närvarande inte n > 1: denna parameter kommer att tyst ignoreras, oavsett om du skickar n=1 eller n=10, kommer en enda begäran alltid att returnera 1 bild och debiteras endast för 1 bild. Om du behöver få flera kandidatbilder på en gång, vänligen initiera flera begärningar parallellt (det rekommenderas att skicka olika prompt eller olika seed, annars kan de bilder du får vara mycket lika). Denna begränsning gäller också för gpt-image-1 / gpt-image-1.5, samt serierna nano-banana / nano-banana-2-lite / nano-banana-2 / nano-banana-pro. dall-e-2 är för närvarande den enda modellen som ursprungligen stöder n > 1; dall-e-3 stöder endast n = 1.
Nedan ges några olika verkliga exempel för att intuitivt uppleva gpt-image-2 kapabiliteter.

Scenario 1: Filmiskt Porträtt

I prompten kan filmtermer (35mm film, grunt skärpedjup, neonskott etc.) användas för att exakt kontrollera atmosfären och texturen. Python exempel på anropskod:
Resultatet är som följer:
Den genererade bilden är som följer:

Scen två: Retro reseaffisch (med textrendering)

gpt-image-2 presterar stabilt när det gäller typografi och textrendering, vilket gör det mycket lämpligt för att generera affischer, menyer, gratulationskort och andra designarbeten med text.
Resultatet i url-fältet är bilden nedan:

Man kan se att modellen inte bara exakt återgav den visuella stilen av Art Deco-affischen, utan även att titlarna AMALFI och ITALIA 1958 blev tydligt och korrekt renderade.

Scen tre: Komplex komposition och antal

Nedanstående prompt används för att testa modellens förmåga att följa strukturerade instruktioner om “antal” och “position”.
Den genererade bilden är som följer:

Man kan se att antalet böcker på de tre hyllorna (1 / 3 / 7) är helt i linje med prompten, vilket var svårt att uppnå stabilt under dall-e-3-eran.

Scen fyra: Illustrationsstil (landskap)

Genom att specificera konstnärligt medium och känslomässiga nyckelord kan man styra modellen att producera stiliserade illustrationer.
Den genererade landskapsillustrationen är som följer:

Asynkron och callback

gpt-image-2 kräver vanligtvis 60–90 sekunder för en enda anrop. Om man inte vill upprätthålla en lång anslutning kan man använda den asynkrona callback-mekanismen som beskrivs senare i denna artikel, anropsflödet är helt i linje med andra modeller.

Nano Banana-serien av modeller

nano-banana-serien är baserad på Gemini och är en bildgenereringsmodell som har integrerats via samma /openai/images/generations-gränssnitt, utan att behöva byta endpoint, man behöver bara ändra model till någon av de modeller som anges i tabellen nedan.
Viktigt: Parameterstöd Nano Banana ansluter via en adapter till OpenAI-protokollet och stöder endast följande parametrar jämfört med gpt-image-*: model, prompt, size.
  • size kommer att mappas till intern aspect_ratio enligt tabellen nedan, icke-listade storlekar kommer att degraderas till 1:1:
    • 1024x1024 / 512x512 / 256x2561:1
    • 1792x102416:9
    • 1024x17929:16
  • Stöder inte parametrar som n, quality, style, response_format, background, output_format etc.; om de anges kommer de att ignoreras.
  • Återvändande struktur följer OpenAI-formatet (data[].url), men created är alltid 0, och b64_json kommer inte att returneras, revised_prompt är alltid lika med den ursprungliga prompt.

Grundläggande anrop

Resultatet är som följer:
Genererade bilder kan direkt nås via det returnerade url-fältet:

Uppgradera till flaggskeppsmodellen nano-banana-pro

Ändra bara model till nano-banana-pro, övriga parametrar förblir helt oförändrade:
Exempel på svar:

Asynkron callback

callback_url asynkron callback-mekanism fungerar också för nano-banana, anropsflödet är helt identiskt med andra modeller, se avsnittet Asynkron callback nedan.

Grundläggande användning

Nu kan du fylla i motsvarande innehåll i gränssnittet, som visas i bilden:

Vid första användningen av detta API behöver vi fylla i minst tre fält, ett är authorization, som du direkt väljer i rullgardinsmenyn. En annan parameter är model, model är den vi väljer att använda från OpenAI DALL-E officiella modellkategori, här har vi huvudsakligen 1 typ av modell, detaljer kan ses i de modeller vi tillhandahåller. Den sista parametern är prompt, prompt är den text vi anger för att generera bilden. Samtidigt kan du notera att det finns motsvarande anropskod som genereras till höger, du kan kopiera koden och köra den direkt, eller klicka på “Try” knappen för att testa.

Exempel på anropskod i Python:
Efter anropet ser vi att det returnerade resultatet ser ut som följer:
Det returnerade resultatet har flera fält, som beskrivs nedan:
  • created , ID för den här bildgenereringen, används för att unikt identifiera denna uppgift.
  • data, innehåller information om bildgenereringen.
Där data innehåller den specifika informationen om den bild som modellen har genererat, där url är länken till den genererade bilden, som kan ses i bilden nedan.

Bildkvalitetsparameter quality

Nu kommer vi att beskriva hur man ställer in några detaljerade parametrar för bildgenereringsresultatet, där bildkvalitetsparametern quality innehåller två typer, den första standard innebär att en standardbild genereras, den andra hd innebär att den skapade bilden har mer detaljer och större konsekvens. Nedan ställer vi in bildkvalitetsparametern till standard, specifik inställning visas i bilden:

Samtidigt kan du notera att det finns motsvarande anropskod som genereras till höger, du kan kopiera koden och köra den direkt, eller klicka på “Try” knappen för att testa.

Exempel på anropskod i Python:
Efter anropet ser vi att det returnerade resultatet ser ut som följer:
Det returnerade resultatet är i linje med innehållet i grundläggande användning, och vi kan se att bilden med bildkvalitetsparametern standard ser ut som bilden nedan:

调用之后,我们发现返回结果如下:
返回的结果与基本使用的内容一致,可以看到图片链接的格式参数为 url 的生成图片如下图所示:

与上述相同操作,仅需将图片链接的格式参数为 b64_json ,可以得到如下图所示的图片: 可以看到 urlb64_json 生成的图片链接格式明显不同,具体使用方式请参考我们的官方文档。
Efter anropet upptäckte vi att resultatet var som följer:
Det returnerade resultatet överensstämmer med det grundläggande användningsinnehållet, och vi kan se att bildlänkens formatparameter för url är den genererade bildens länk Bild URL som kan nås direkt, bildinnehållet visas nedan:

Genom att utföra samma operation som ovan, behöver vi bara ställa in bildlänkens formatparameter till b64_json, så kan vi få resultatet av den Base64-kodade bildlänken, det specifika resultatet visas nedan:

Asynkron callback

Eftersom OpenAI Images Generations API:s bildgenerering kan ta relativt lång tid, om API:t inte svarar under en längre tid, kommer HTTP-förfrågan att hålla anslutningen öppen, vilket leder till extra systemresursförbrukning, så detta API erbjuder också stöd för asynkron callback. Den övergripande processen är: när klienten initierar en begäran, specificerar den dessutom ett callback_url-fält, efter att klienten har initierat API-förfrågan kommer API:t omedelbart att returnera ett resultat som innehåller ett task_id-fält, vilket representerar det aktuella uppdragets ID. När uppdraget är slutfört kommer resultatet av den genererade bilden att skickas till klientens angivna callback_url i POST JSON-format, vilket också inkluderar task_id-fältet, så att uppdragets resultat kan kopplas ihop med ID. Låt oss förstå hur man gör detta genom ett exempel. Först är Webhook-callback en tjänst som kan ta emot HTTP-förfrågningar, utvecklaren bör ersätta med URL:en till sin egen byggda HTTP-server. Här för att underlätta demonstration använder vi en offentlig Webhook-exempelsida https://webhook.site/, öppna denna webbplats för att få en Webhook-URL, som visas nedan: Kopiera denna URL så kan den användas som Webhook, exemplet här är https://webhook.site/3d32690d-6780-4187-a65c-870061e8c8ab. Därefter kan vi ställa in fältet callback_url till ovanstående Webhook-URL, samtidigt som vi fyller i motsvarande parametrar, som i följande kod:
När vi klickar på kör kan vi omedelbart få ett resultat som följer:
Vänta en stund, så kan vi observera resultatet av den genererade bilden på Webhook-URL:en, innehållet är som följer:
Vi kan se att resultatet innehåller ett task_id-fält, data-fältet innehåller samma bildgenereringsresultat som vid synkron anrop, och genom task_id-fältet kan uppdraget kopplas ihop.

Felhantering

Vid anrop av API:t, om ett fel uppstår, kommer API:t att returnera motsvarande felkod och information. Till exempel:
  • 400 token_mismatched:Dålig begäran, möjligtvis på grund av saknade eller ogiltiga parametrar.
  • 400 api_not_implemented:Dålig begäran, möjligtvis på grund av saknade eller ogiltiga parametrar.
  • 401 invalid_token:Obehörig, ogiltig eller saknad auktoriseringstoken.
  • 429 too_many_requests:För många begärningar, du har överskridit hastighetsgränsen.
  • 500 api_error:Intern serverfel, något gick fel på servern.

Felrespons exempel

Slutsats

Genom detta dokument har du fått en förståelse för hur du enkelt kan använda OpenAI Images Generations API för att använda den officiella OpenAI DALL-E:s bildgenereringsfunktion. Vi hoppas att detta dokument kan hjälpa dig att bättre integrera och använda API:t. Om du har några frågor, tveka inte att kontakta vårt tekniska supportteam.