dall-e-3、テキストレンダリング能力が強化された gpt-image-1、最新世代の gpt-image-2、および同一インターフェースで接続される nano-banana / nano-banana-2-lite / nano-banana-2 / nano-banana-pro シリーズモデルを含む多様な画像生成モデルをサポートしています。これらはすべて、テキストの説明に基づいて高品質な画像を生成することができます。
この文書は、OpenAI Images Generations API 操作の使用フローを主に紹介しており、これを利用することで OpenAI シリーズの画像生成機能を簡単に使用できます。
申請フロー
OpenAI Images Generations API を使用するには、まず Ace Data Cloud コントロールセンター で API トークンを取得し、バックアップとして保管してください。
まだログインまたは登録していない場合は、自動的にログインページにリダイレクトされ、登録とログインを促されます。完了後、現在のページに自動的に戻ります。
1つの API トークンでプラットフォームのすべてのサービスを呼び出すことができ、各サービスごとに個別に申請する必要はありません。 初回申請時には無料のクレジットが付与され、無料で体験できます。クレジットが不足した場合は、コントロールセンター で一般的な残高をチャージできます。
📘 完全な文書:OpenAI Images Generations API →
GPT-Image-2 モデル
gpt-image-2 は OpenAI が提供する新世代の画像生成モデルで、dall-e-3 や gpt-image-1 に比べて以下の点で明らかな向上があります:
- 指示遵守能力が向上:複雑な構図、カウント、位置関係などの構造化された指示を正確に理解できます。
- テキストレンダリングがより明確:ポスター、メニュー、インフォグラフィック、ロゴなどのシーンで英語と数字がほとんど乱れることがありません。
- スタイル表現が豊富:映画的なポートレート、レトロポスター、子供向けイラスト、製品写真、インフォグラフィックなど、さまざまなスタイルをネイティブにサポートしています。
- ネイティブな多比率 + 高解像度サポート:5つの比率(1:1、4:3、3:4、16:9、9:16)をカバーし、3つの解像度(1K / 2K / 4K)を提供します。
model フィールドを gpt-image-2 に設定するだけで済みます。返される結果の url は、platform.cdn.acedata.cloud に永続的にホスティングされている画像リンクであり、ブラウザで直接開くか、ウェブページに埋め込むことができます。
公式中継 / 逆向き変体(:official / :reverse)
gpt-image-2 はデフォルトで逆向きのルートを使用します。モデル名のサフィックスを通じて明示的にルートを選択できます:
gpt-image-2:official:公式中継ルート。n > 1(一度に複数の画像を返す)および実際の 2K / 4K 解像度をサポートし、各画像ごとに課金され、単価はデフォルトのgpt-image-2の 2 倍です。現在は openai-hk チャンネルのみが提供しており、ルートが利用できない場合は直接エラーを返し、逆向きのルートにはダウングレードされません。gpt-image-2:reverse:デフォルトのgpt-image-2と完全に同等(逆向きルート)で、逆向きルートを明示的に宣言するために使用され、価格は変わりません。
以下の「nパラメータに関する制限」はデフォルト / 逆向きルートにのみ適用されます;gpt-image-2:officialはn > 1をサポートし、画像ごとに課金されます。
サポートされている size の値
gpt-image-2 は size の形式のみをチェックし、auto または空文字列でない限り、WIDTHxHEIGHT(例:1024x1024、2048x1152、800x600)に一致する必要があります;他の形式は 400 を返します。すべてのサイズ(1K / 2K / 4K / カスタム)は単一の画像ごとに統一して課金され、サイズによる追加料金はありません。
上流のカスタムサイズに対する厳格な制約:幅と高さはともに 16 の倍数、長辺 ≤ 3840、総ピクセル数 ≤ 8,294,400。範囲を超えると上流に拒否され、4xx で返されます。
size: "auto"を渡すこともできますし、sizeフィールドを省略することもできます。この場合、モデルがデフォルトサイズを自動的に選択します。 1K の範囲では上流の出力が厳密なピクセル整列を保証しません——1024x1024を渡すと1254x1254を受け取る可能性があり、比率は一致します。再度それをsizeとして渡すと、課金は変わりません。 4K の単一呼び出しには通常 4–8 分かかるため、後述のcallback_url非同期コールバックと併用することをお勧めします。
以下に、nパラメータに関してgpt-image-2は現在**n > 1をサポートしていません**:このパラメータは静かに無視され、n=1またはn=10を渡しても、単一のリクエストでは 1 枚の画像のみが返され、1 枚分のみ課金されます。複数の候補画像を一度に取得する必要がある場合は、自分で並行して複数のリクエストを発起してください(異なるpromptまたは異なるseedを同時に渡すことをお勧めします。そうしないと、得られる数枚の画像が非常に似ている可能性があります)。この制限はgpt-image-1/gpt-image-1.5、およびnano-banana/nano-banana-2-lite/nano-banana-2/nano-banana-proシリーズにも適用されます。dall-e-2は現在唯一n > 1をネイティブにサポートするモデルであり、dall-e-3はn = 1のみをサポートしています。
gpt-image-2 の能力を直感的に感じるためのいくつかの異なる方向からの実際の例を示します。
シーン1:映画的なポートレート
プロンプトには映画用語(35mm フィルム、浅い被写界深度、ネオン光など)を使用して、雰囲気と質感を正確に制御できます。 Python サンプル呼び出しコード:
シーン2:レトロ旅行ポスター(テキストレンダリング付き)
gpt-image-2 は、レイアウトとフォントレンダリングにおいて安定したパフォーマンスを発揮し、ポスター、メニュー、グリーティングカードなどのテキストを含むデザインに非常に適しています。
url フィールドに対応する画像は以下の通りです:

AMALFI と ITALIA 1958 が明確かつ正確にレンダリングされていることがわかります。
シーン3:複雑な構図とカウント
以下のプロンプトは、モデルが「数量」と「位置」などの構造化された指示に従う能力をテストするためのものです。
dall-e-3 時代には安定して達成するのが難しいものでした。
シーン4:イラストスタイル(横向き)
アートメディアと感情のキーワードを指定することで、モデルにスタイライズされたイラストを生成させることができます。
非同期とコールバック
gpt-image-2 の単一呼び出しは通常60〜90秒かかります。長い接続を維持したくない場合は、本文の後半で紹介する callback_url 非同期コールバックメカニズムを使用できます。呼び出しの流れは他のモデルと完全に一致します。
Nano Banana シリーズモデル
nano-banana シリーズは、Geminiに基づく画像生成モデルで、同じ /openai/images/generations インターフェースを通じて接続されており、エンドポイントを切り替える必要はありません。model を以下の表のいずれかに変更するだけで使用できます。
重要:パラメータのサポート範囲 Nano Banana は適応層を通じて OpenAI プロトコルに接続されており、gpt-image-*と比較して以下のパラメータのみをサポートします:model、prompt、size。
sizeは以下の表に従って内部aspect_ratioにマッピングされ、リストにないサイズは1:1に退化します:
1024x1024/512x512/256x256→1:11792x1024→16:91024x1792→9:16n、quality、style、response_format、background、output_formatなどのパラメータはサポートされておらず、入力しても無視されます。- 返される構造は OpenAI フォーマット(
data[].url)に従いますが、createdは固定で0となり、b64_jsonは返されず、revised_promptは常に元のpromptと同じです。
基本的な呼び出し
url フィールドを通じて直接アクセスできます:

フラッグシップモデル nano-banana-pro へのアップグレード
model を nano-banana-pro に変更するだけで、他のパラメータは完全に一致します:

非同期コールバック
callback_url の非同期コールバックメカニズムは、nano-bananaにも同様に有効で、呼び出しフローは他のモデルと完全に一致します。詳細は以下の 非同期コールバック セクションを参照してください。
基本的な使用法
次に、インターフェース上で対応する内容を入力できます。以下の図のように:
authorization で、ドロップダウンリストから直接選択できます。もう一つのパラメータは model で、model はOpenAI DALL-Eの公式モデルカテゴリを選択することを意味します。ここでは主に1種類のモデルがあります。詳細は提供されたモデルを参照してください。最後のパラメータは prompt で、prompt は生成したい画像のヒントワードを入力します。
また、右側には対応する呼び出しコードが生成されていることに注意してください。コードをコピーして直接実行することも、直接「Try」ボタンをクリックしてテストすることもできます。

created、今回の画像生成のIDで、今回のタスクを一意に識別するために使用されます。data、画像生成の結果情報を含みます。
data はモデルが生成した画像の具体的な情報を含んでおり、その中の url は生成された画像の詳細リンクです。以下の図のように確認できます。

画像品質パラメータ quality
次に、画像生成結果の詳細なパラメータの設定方法を紹介します。その中で画像品質パラメータ quality には2種類があります。最初の standard は標準の画像を生成することを示し、もう一つの hd は生成された画像がより細かいディテールと大きな一貫性を持つことを示します。
以下に画像品質パラメータを standard に設定する方法を示します。具体的な設定は以下の図の通りです:


standard の生成画像は以下の図の通りです:

url の生成画像は以下の通りです:

url の生成画像のリンクは 画像 URL これは直接アクセス可能で、画像内容は以下の図の通りです:

b64_json に設定すると、Base64エンコードされた画像リンクの結果が得られます。具体的な結果は以下の図の通りです:
非同期コールバック
OpenAI Images Generations APIによる画像生成には時間がかかる場合があるため、APIが長時間応答しない場合、HTTPリクエストは接続を維持し、追加のシステムリソースを消費する可能性があります。そのため、本APIは非同期コールバックのサポートも提供しています。 全体の流れは、クライアントがリクエストを開始する際に、追加でcallback_url フィールドを指定し、クライアントがAPIリクエストを開始した後、APIはすぐに結果を返し、現在のタスクIDを示す task_id フィールド情報を含みます。タスクが完了すると、生成された画像の結果がPOST JSON形式でクライアントが指定した callback_url に送信され、その中にも task_id フィールドが含まれているため、タスクの結果をIDで関連付けることができます。
以下の例を通じて、具体的にどのように操作するかを理解しましょう。
まず、WebhookコールバックはHTTPリクエストを受信できるサービスであり、開発者は自分が構築したHTTPサーバーのURLに置き換える必要があります。ここではデモのために、公開のWebhookサンプルサイト https://webhook.site/ を使用します。このサイトを開くとWebhook URLが得られます。以下の図の通りです:
このURLをコピーすればWebhookとして使用できます。このサンプルは https://webhook.site/3d32690d-6780-4187-a65c-870061e8c8ab です。
次に、フィールド callback_url を上記のWebhook URLに設定し、対応するパラメータを入力します。以下のコードのように:
task_id フィールドが含まれており、data フィールドには同期呼び出しと同じ画像生成結果が含まれています。task_id フィールドを通じてタスクの関連付けが可能です。
エラーハンドリング
APIを呼び出す際にエラーが発生した場合、APIは対応するエラーコードと情報を返します。例えば:400 token_mismatched:不正なリクエスト、パラメータが不足しているか無効である可能性があります。400 api_not_implemented:不正なリクエスト、パラメータが不足しているか無効である可能性があります。401 invalid_token:未承認、無効または不足している認証トークン。429 too_many_requests:リクエストが多すぎます、レート制限を超えました。500 api_error:内部サーバーエラー、サーバーで何かがうまくいきませんでした。

