概要
gpt-image-2 は OpenAI の最新フラッグシップ画像生成モデルで、gpt-image-1.5 のアップグレード版です。主なアップグレード: 有効な任意の解像度に対応(2K / 3840×2160 4K を含む), 参考画像に対する自動ハイフィデリティ, 同じティアで 20-30% 安価。APIYI のゲートウェイは OpenAI Images API と完全互換です。公式 OpenAI SDK の base_url をここに向けるだけで、コード不要で直接接続できます。
テキストから画像 API
/v1/images/generations — テキストプロンプトから画像を生成し、サイズ / 品質 / output_format を制御できます。画像編集 API
/v1/images/edits — 参考画像を multipart でアップロード(最大16枚)し、編集/融合指示を指定できます。マスクのインペインティングにも対応しています。APIYI の GPT-image-2 公式リレーを選ぶ理由?
OpenAI の公式チャネルを基盤に、信頼性、コスト、統合のしやすさの面でエンタープライズ本番ワークロード向けに徹底最適化されています:公式チャネル · 公式と同等
同時実行数制限なし
同価格 + 最大15%オフ
グローバルな障壁ゼロアクセス
api.apiyi.com に直接接続でき、安定したレイテンシで、越境向けの再設計も不要です。フルモデルラインナップ
gpt-image-2-all($0.03/image の一律料金)や、コスト重視の Nano Banana Pro / 2 へシームレスに切り替え可能です — シナリオに応じて柔軟に使い分けられます。プロフェッショナルなエンタープライズサポート
主な機能
任意の解像度(4Kを含む)
自動高精細
input_fidelity は渡さないでください(エラーになります)。20-30% 安価
中国語 + テキストレンダリング
high 品質でぼやけることはほとんどありません。マルチ画像融合(最大16枚)
image[] 配列は最大16枚の参照画像を受け付けます。prompt で「image 1 / image 2 / image 3」を使うと、アップロード順で参照できます。マスクインペインティング
複数の出力フォーマット
output_compression を設定してファイルサイズを調整できます。OpenAI SDK 直接接続
base_url を https://api.apiyi.com/v1 に向けて、公式 OpenAI SDK で直接呼び出せます — コード不要で移行できます。料金
APIYIのgpt-image-2(デフォルトグループ)はOpenAIの公式のリスト価格と完全に一致します。割引は代わりにチャージ特典によるものです。$100 をチャージすると 10% のボーナス、最大 20% です。📖 チャージ特典について学ぶ。
トークンレート(OpenAI の価格表と同じ)
トークン課金制 — 1 回のリクエスト = 入力テキスト + 入力画像 + 出力画像 token:1枚あたりのコスト参照(公式表)
1K プリセットサイズにおける一般的な 1 枚あたりのコスト:- 単価は OpenAI の一覧と一致します。チャージ ボーナス($100 で 10%、最大 20%)を重ねると、実質コストは直接利用より低くなります
- 2K / 4K には固定の 1 枚あたり価格がなく、実際の input + output token に基づいて課金されます
- 編集リクエストは、高忠実度が強制されるため、テキストから画像生成より input token がかなり多くなります
- ストリーミング(
stream: true+partial_images: N)では、部分ごとに output image token がさらに 100 追加でかかります - 同じサイズと品質の
gpt-image-1.5と比べると、gpt-image-2は約 20-30% 安くなります
複数の入力画像が価格に与える影響(2026年7月検証済み)
よくあるお客様の質問: 「参照画像ごとに一律料金なのか、それとも大きい画像ほど消費する token が増えるのか?」答えは、どちらも影響し、画像枚数は厳密に線形で加算されます。gpt-image-2 はすべての入力画像を強制的な高忠実度(input_fidelity は調整できません。渡すと 400 が返ります)で処理し、各参照画像はその寸法とアスペクト比に基づいて画像 token に変換されます。実測値(edits エンドポイント、2026-07-15):
- 個数は厳密に線形です: N 枚の参照画像 ≈ N × 1枚分の token。1024² の参照画像 16 枚 ≈ 16384 tokens ≈ $0.13 — これは
highの出力 1 回分($0.211)と同じ桁なので、複数画像の融合ではもはや無視できません。 - サイズには下限と上限の両方があります: 1024² 以下の正方形画像はすべて 1024 tokens として課金されます(512 に縮小しても 何も節約できません)。2048² と 4096² はどちらも 1521 tokens です(大きすぎる画像は変換前に縮小されるため、上限がかかります)。参照画像 1 枚あたりは、アスペクト比込みでおおむね 800〜1600 token の範囲に収まります。
- token 数はファイルサイズではなくピクセル寸法で決まります: 1.5MB まで圧縮するとアップロードの安定性と速度は向上しますが、画像 token は減りません。逆に、50MB のオリジナルをアップロードしても請求額が跳ね上がることはありません(上限が適用されます)。
2K/4K のコスト見積もり(ピクセル比による外挿、⚠️ 公式の固定価格ではありません)
OpenAI は 1K サイズについてのみ、画像ごとの固定価格表を公開しています — 2K/4K のサイズ別価格については公式のものがありません。以下の表は、予算見積もり目的のみで、上の 1K の公式レートを基準にピクセル数でスケーリングした、APIYI 独自の外挿です。SaaS サブスクリプション / クレジットベース課金との違い
画像生成ツールのベンダーは、通常 2 つの方式のどちらかで課金します。- 月額サブスクリプションプラン: 「月間 N 枚」のクォータに対して定額の月額料金を支払う方式です。このクォータは 過剰販売前提 を織り込んだ価格設定になっており、ベンダーは大半のユーザーが付与上限を使い切らないことを前提にしています。そのため、広告される「1 枚あたりのコスト」は、単にプラン料金をクォータ上限で割ったものにすぎず、実際に各画像を生成するのにあなたにとって本当にいくらかかるかを示すものではありません。
- クレジット / ポイントベースの計測: 品質やサイズの異なるジョブを、正体の分かりにくい「クレジット」に変換します。これは実態としては従量課金であり、実際の token 消費を隠すクレジット単位の背後に再パッケージされているだけです。
各呼び出しの実際の token 数を確認する方法
/v1/images/generations と /v1/images/edits はどちらも usage フィールドを返し、image input tokens と text input tokens は別々のフィールドとして返ります — 見積もりは不要で、各呼び出しの正確なコストはそれらをそのまま読むだけで分かります。以下は、参照画像 1 枚を含む実際の edit リクエストから取得した完全な usage オブジェクトです(ライブ取得):
グループ設定
gpt-image-2 公式リレーチャネルでは2つのグループを提供しています。ダッシュボード → Token 設定 → グループ で切り替えてください:
image2Enterprise に切り替えてください。

Token settings: pick the image2Enterprise group (1.2x) — stable when default capacity is tight
技術仕様
エンドポイント
サイズ参照
プリセットサイズ
カスタムサイズの制約
gpt-image-2 は、以下をすべて満たす 任意の有効なサイズ を受け付けます:
- 最大辺 ≤ 3840px
- 両方の辺が 16 の倍数
- アスペクト比 ≤ 3:1
- 総ピクセル数 ∈ [655,360, 8,294,400](約0.65MP~約8.3MP)
1600x1200, 1792x1024, 2048x1536, 3200x1800
無効な例: 1000x1000(16 の倍数ではない), 4000x4000(最大値を超過), 3840x1000(比率 > 3:1)
品質リファレンス
利用可能なティア
quality で、size よりも大きいです。 出力画像の token 数は quality × size によって決まりますが、quality のほうがはるかに重要です。同じサイズでも、low から high に変えるだけで、1枚あたりのコストは 30×以上 変わる可能性があります(上の「1画像あたりのコスト」表を参照してください。1024×1024 は low $0.006 から high $0.211 までの範囲です)。まず quality でコストを見積もり、そのあとで size の影響を加味してください。ベストプラクティス
まずは低い設定から統合する
quality=low + プリセットサイズ から始めて、呼び出しチェーン全体(認証、パラメータ、タイムアウト、エラー処理)を検証してください。low は high より数倍高速なため、長い遅延に隠されることなく機能上の問題をすぐに表面化できます。プリセットサイズを優先する
品質をシナリオに合わせる
low; 日常 / 最終 → medium; 文字、細かいテクスチャ、印刷 → high。low ↔ high は見た目の忠実度だけの違いではなく、推論の複雑さが段階的に変わることにも注意してください。そのため、レイテンシもそれに応じて変わります。JPEG 出力を選ぶ
output_format=jpeg + output_compression=85 は PNG より高速で、サイズもおおむね半分です。文字シナリオでは高に固定する
quality=high に固定してください。参照画像を準備する
クライアントのタイムアウトをグレード別に設定する(高 → 600s のセーフティネット)
quality と size で、特に quality が重要です。クライアントのタイムアウトはグレードごとに設定してください:high モードでは、キュー待ち、ロングテールのばらつき、上流のジッターを吸収するために 600 秒をセーフティネットのタイムアウトとして設定してください。UI で進捗を表示し、サーバー側にタスクキューを設けることも検討してください。移行時の注意
gpt-image-1.5 からの移行: input_fidelity は削除してください(強制的に高忠実度になり、渡すとエラーになります)。background: transparent は使用しないでください(サポートされていません)。従来の DALL·E 2/3 コードから移行する場合は、response_format を削除してください(GPT Image モデルはこれを 400 Unknown parameter: 'response_format' で拒否し、出力は常に b64_json です)。エラーと再試行
qualityごとにリクエストのタイムアウトを段階設定してください:low≥ 120秒 /medium≥ 240秒 /high≥ 600秒(安全策です — 3〜5分が観測されています。120秒/360秒前後で設定すると、多くの誤ったタイムアウトが発生します)- まず
quality=lowと統合し、その後、実際の品質要件に応じてmedium/highに上げてください - 5xx とタイムアウトには指数バックオフを使用してください(再試行は2回推奨)
- サポートのために
x-request-idヘッダーをログに記録してください
FAQ
400 Unknown parameter: 'response_format' はどう修正すればよいですか?
400 Unknown parameter: 'response_format' はどう修正すればよいですか?
response_format パラメータを削除してください。これが現時点で最も一般的な 400 エラーです。 gpt-image-2(および GPT Image シリーズ全体)は response_format を受け付けません: 出力形式は b64_json に固定されており、変更できません。これを渡すと、次のようになります。url / b64_json が提供されていました)で、古いサンプルコードや一部のサードパーティライブラリには今でもデフォルトで含まれていることがよくあります。gpt-image-2 に移行する際は、このフィールドを削除し、data[0].b64_json を直接読み取ってください(raw base64 なので、デコードして画像ファイルを取得します)。このエラーは入力検証段階で返され、課金されません。ワークフロー上どうしても base64 ではなく 画像 URL が必要な場合は、次の方法があります。- 公式
gpt-image-2には URL 出力がありません。base64 をデコードして、ご自身のオブジェクトストレージにアップロードしてください - あるいは、リバースエンジニアリング版の
gpt-image-2-allに切り替えてください。こちらはresponse_format: "url"をサポートし、24時間有効な CDN リンクを返します
b64_json に data:image/png;base64, プレフィックスを付ける必要はありますか?
b64_json に data:image/png;base64, プレフィックスを付ける必要はありますか?
gpt-image-2 は 生の base64 文字列(プレフィックスなし)を返します。gpt-image-2-all とは異なります。クライアント側の実装パターンは 2 通りです。- ファイルに書き出す:
base64.b64decode(b64_str)→ ディスクに書き込む - ブラウザで表示する:
img.src = 'data:image/png;base64,' + b64_str(手動で先頭に付与する)
input_fidelity を渡すと 400 になるのはなぜですか?
input_fidelity を渡すと 400 になるのはなぜですか?
gpt-image-2 は参照画像の高精細処理を 強制 し、input_fidelity はもう受け付けません。1.5 から移行する場合は、このフィールドを削除するだけで大丈夫です。置き換えは不要です。透明な背景が必要な場合はどうすればよいですか?
透明な背景が必要な場合はどうすればよいですか?
gpt-image-2 は background: transparent を サポートしていません(エラーになります)。回避策は 2 つあります。backgroundをopaqueに設定する(または省略する)うえで、PIL / sharp / オンラインツールを使って自分で透過部分を抜く- どうしても透明度が必要なケースでは、一時的に
gpt-image-1.5にフォールバックする
1回の呼び出しで何枚の画像を生成できますか?
1回の呼び出しで何枚の画像を生成できますか?
n=1)です。N 枚必要な場合は、N 件の並列リクエストを送ってください。各リクエストは個別に token 課金されます。なぜ 2K/4K はこんなに遅いのですか?
なぜ 2K/4K はこんなに遅いのですか?
quality=high + 高解像度で 1枚あたり約 235 秒(約4分)かかるケースを確認しています。さらに、3840×2160 + high のロングテールでは 5分近くまで延びることがあります。おすすめは次のとおりです。- まずは
quality=lowで統合し、呼び出し経路を検証してから、実際の品質要件に応じて引き上げる - 品質ごとにクライアントのタイムアウトを段階設定する:
low≥ 120s /medium≥ 240s /high≥ 600s(安全策) - UI で「生成中」の進捗を表示する
- 4K が不要な場合は 1024×1024 / 1536×1024 の 1K プリセットを使う
キャッシュ済み input の料金の恩恵は本当にありますか?
キャッシュ済み input の料金の恩恵は本当にありますか?
なぜ edit リクエストの方が text-to-image より高いのですか?
なぜ edit リクエストの方が text-to-image より高いのですか?
gpt-image-2 は参照画像の高精細処理を自動で有効にするため、参照画像自体が Vision の料金ルールにより大量の input token に変換されます。edit の input token は text-to-image より明らかに多くなるので、予算もそれに合わせて見積もってください。サイズも参照画像も同じなのに、なぜ毎回の課金額が違うのですか?
サイズも参照画像も同じなのに、なぜ毎回の課金額が違うのですか?
quality が auto(または未設定)になっていたことです。 「サイズも解像度も参照画像も同じなのに、価格が上下する」という報告をお客様からいただいたことがあります。調査したところ、size と quality の両方が auto になっていました。犯人は quality: auto です: auto モードでは、モデルが リクエストを解釈し、生成ごとにその場で異なる品質 tier を選択します。tier が違えば出力画像 token 数も変わり、価格も変わります。以下は、input が完全に同じ(各 1061 input token) なのに、費用が何倍も異なる実際の課金履歴です。auto がより高い品質 tier に解決され、output tokens が 5146 まで跳ね上がり、価格は約 3.5 倍になりました。対策: quality を auto のままにしないで、low / medium / high を明示的に渡してください。 tier を固定すれば、input が同じときの output token 数と価格は安定し、予測可能になります。上の「品質リファレンス」セクションもご参照ください。edit エンドポイントの画像枚数とサイズ制限は?
edit エンドポイントの画像枚数とサイズ制限は?
gpt-image-2 の画像 edit エンドポイント(/v1/images/edits)は、参照画像を最大 16 枚までサポートします。- multipart/form-data のファイルアップロード: 各画像は 50MB 未満、形式は
png/jpg/webp - base64 data URL: フィールド長の上限は約 20MiB(schema
maxLength: 20971520— 文字列フィールドの上限であり、50MB の multipart 上限とは別物です)なので、元画像は 15MB 以内に収めてください - mask ファイル: 別途、PNG で 4MB 未満 に制限されます
edit エンドポイントで 400 'Invalid image file or mode for image 1' が返ります。どうすればよいですか?
edit エンドポイントで 400 'Invalid image file or mode for image 1' が返ります。どうすればよいですか?
code: invalid_image_file)は、N 枚目の参照画像が標準的な png / jpg / webp ファイルではないことを意味します(1始まりです。インデックスを使って問題の画像を特定してください)。最もよくある原因は、スマホカメラ由来の MPO 形式 です。.jpg の Huawei Mate シリーズ端末からそのまま出したファイルには HDR gain-map のサブフレームが埋め込まれており、実際にはマルチフレーム JPEG コンテナ(MPO)になっています。ヘッダーは同じ FFD8 で、拡張子も file コマンドの表示も JPEG なので、見た目では判別できません。2026年7月時点で確認済み: MPO ファイルは常に拒否され、同じ画像を標準 JPEG/PNG として再エンコードすると 元の解像度のまま 成功します(サイズ、image[] フィールド名、または quality/size パラメータとは無関係です)。このエラーは入力検証段階で返され、課金されません。対策: アップロード前に Pillow で再エンコードしてください(Image.open(f).format が "MPO" を返す場合は、変換が必要です)。mask ファイルはどう準備すればよいですか?
mask ファイルはどう準備すればよいですか?
- 元画像と同じサイズ、PNG 形式、4MB 未満
- alpha channel 必須: 透明(alpha=0)= inpaint 対象、不透明 = 保持
- 最初の画像にのみ適用されます
- mask は「ソフトなガイド」です — モデルはマスク領域の周囲を広げたり縮めたりすることがあります
gpt-image-2 と gpt-image-2-all はどちらを選べばよいですか?
gpt-image-2 と gpt-image-2-all はどちらを選べばよいですか?
公式 OpenAI SDK をそのまま使えますか?
公式 OpenAI SDK をそのまま使えますか?
base_url を https://api.apiyi.com/v1 に向け、api_key に APIYI token を設定するだけです。生成中の処理をキャンセルできますか?
生成中の処理をキャンセルできますか?
gpt-image-2 は OpenAI の公式同期エンドポイントを使っているため、リクエストを送信した時点で「キャンセル」信号なしに完了まで実行されます。クライアントが切断されても、サーバー側は生成を最後まで行い、通常どおり課金されます。クライアント側のタイムアウトは慎重に設定してください。「切断 = 課金なし」とは考えないでください。rate limit(RPM)はありますか?
rate limit(RPM)はありますか?
非同期呼び出しはサポートされていますか?
非同期呼び出しはサポートされていますか?
gpt-image-2 は OpenAI 公式 API を厳密にミラーしており、同期のみです。リクエストは結果が返るまでブロックされます(high + 4K なら現実的には 1〜2分)。非同期キューやコールバック機構が必要な場合は、次のいずれかをご利用ください。- 業務層でタスクキュー(Celery / BullMQ など)を使って自前でラップする
- あるいは
gpt-image-2-allを使う。30〜60秒で生成され、フロントエンドからポーリングしやすいです
失敗した生成にも課金されますか?
失敗した生成にも課金されますか?
400 エラーで拒否し、課金は発生しません。典型的な応答は次のとおりです。401(無効な token)、429(rate limit)。token 課金が発生するのは、リクエストが実際にモデル生成段階まで到達した後、つまり 200 + b64_json を受信した時点からです。関連ドキュメント
- ⚖️ 公式版とリバース版の比較 - 横並びの選定ガイド
- テキストから画像へのプレイグラウンド -
/v1/images/generationsのインタラクティブなテスト - 画像編集プレイグラウンド -
/v1/images/editsのマルチ画像融合 + マスク - 詳説: gpt-image-2 ローンチ - ニュース記事
- 完全版統合ドキュメント - 完全なAPIリファレンス
- GPT-Image-2-All(リバースエンジニアリング版) - より安く、より高速な代替手段
- コミュニティ: Luck GPT-Image 2 ComfyUI ノード - ComfyUIで
gpt-image-2を直接呼び出す(マスク / 5枚の参照画像 / カスタムサイズ) - コミュニティ: APIYI GPT-Image 2 スキル - Codex CLI / Cursor / Gemini CLI やその他のAIコーディングツールから、1文で呼び出せます
- API マニュアル - 一般的な使用ガイド
gpt-image-2 は OpenAI の公式フラッグシップで、token課金です。定額料金($0.03/画像)とより高速な生成(30–60秒)を重視する場合は、gpt-image-2-allをご覧ください。