概述
gpt-image-2 是 OpenAI 最新旗艦影像生成模型,是gpt-image-1.5 的升級版。核心升級:任意合法解析度(含 2K / 3840×2160 4K)、參考圖自動高保真、同檔降價 20-30%。API易 閘道完整相容 OpenAI Images API,OpenAI 官方 SDK 把 base_url 指過來即可零程式碼改動直連。
文生圖 API
/v1/images/generations,輸入文本提示詞生成圖片,支援 size / quality / output_format。圖片編輯 API
/v1/images/edits,multipart 上傳參考圖(最多 16 張)+ 編輯/融合指令,支援 mask 局部重繪。為什麼選 API易 的 GPT-image-2 官轉?
對標 OpenAI 官方通道,針對企業生產場景在 穩定性、成本、接入體驗 三方面做了深度最佳化:官方通道 · 與官方一致
不限併發 · 企業可放量
同價 + 充值最低 85 折
全球零門檻接入
api.apiyi.com,延遲穩定、免去出海改造。模型生態齊全
gpt-image-2-all($0.03/張統一價)可無縫切換,另有價效比標杆 Nano Banana Pro / 2,按場景自由組合。專業服務 · 企業陪跑
核心特性
任意解析度(含 4K)
參考圖自動高保真
input_fidelity。同檔降價 20-30%
中文 + 文字渲染
high 檔位下精細文字幾乎不糊。多圖融合(最多 16 張)
image[] 陣列最多接受 16 張參考圖,prompt 中可用「圖1/圖2/圖3」明確指代。mask 局部重繪
多種輸出格式
output_compression 控制體積。OpenAI SDK 直連
base_url 指向 https://api.apiyi.com/v1 即可用 OpenAI 官方 SDK 直接呼叫,零程式碼改動遷移。模型定價
API易gpt-image-2(Default 分組)單價與 OpenAI 官網完全一致,折扣體現在充值活動上——充值 100 美金即送 10%,最多可送 20%,📖 瞭解充值活動。
按 token 計費單價(與官網一致)
按 token 計費,一次請求 = 文本輸入 + 圖片輸入 + 圖片輸出三段 token 之和:每張成本速查(官方按量定價表)
1K 預設尺寸下,每張輸出圖的典型成本:- 單價與 OpenAI 官網一致,疊加 充值加贈(充 $100 送 10%,最高 20%)後實際成本低於官方直連
- 2K / 4K 無固定每張價,按輸入 + 輸出 token 實計
- 編輯場景因強制高保真,輸入 token 明顯高於純文生圖
- 流式出圖(
stream: true+partial_images: N)每張 partial 額外消耗 100 個輸出 image token - 對比
gpt-image-1.5,同檔同尺寸gpt-image-2成本低約 20-30%
多圖輸入的價格影響(2026-07 實測)
客戶常問:「參考圖是每張定量收費,還是圖片越大消耗越多?」答案是兩者都影響,且張數嚴格線性累加。gpt-image-2 對輸入圖固定高保真處理(input_fidelity 不可調,傳了直接 400),每張參考圖按尺寸/寬高比換算成 image token。以下為控制變數實測(編輯介面,2026-07-15):
- 張數嚴格線性:N 張參考圖 ≈ N × 單張 token。16 張 1024² 參考圖 ≈ 16384 tokens ≈ $0.13——已與一張
high輸出($0.211)同量級,多圖融合時不可忽略。 - 尺寸有下限也有封頂:小於等於 1024² 的方圖統一按 1024 tokens 計(把圖縮到 512 不省錢);2048² 與 4096² 同為 1521 tokens(超大圖先縮放再換算,封頂)。單張參考圖的 token 大致在 800-1600 區間浮動(含寬高比影響)。
- token 由畫素尺寸決定,與檔案體積無關:把圖壓到 1.5MB 是為了上傳穩定和速度,不會減少 image token;反過來,費用也不會因為你傳了 50MB 的原圖而爆炸(有封頂)。
2K/4K 成本預估(畫素比例外推,⚠️ 非官方固定價)
OpenAI 官方只公佈了 1K 尺寸的固定每張單價表,2K/4K 沒有官方逐尺寸定價。下表是 API易 按「畫素總數比例」從上方 1K 官方單價外推的預估值,僅供預算參考:與 SaaS 套餐 / 積分制計費方式的區別
影像生成類工具廠商常見兩種計費模式:- 包月套餐(訂閱制):固定月費換取”每月可生成 N 張”的額度。這個額度背後是運營商按平均用量預估的超賣定價——套餐設計時就假設不是所有人都會用滿,宣傳的”單張成本”只是套餐價除以額度上限的理論值,跟你真實一張圖的實際生成成本沒有必然關係。
- 積分包 / 動態點數計費:把不同畫質、尺寸的生成任務換算成不透明的”積分”消耗,本質上也是按量計費,只是用積分做了一層包裝,掩蓋了底層真實的 token 用量。
如何檢視每次呼叫的真實 token 數
/v1/images/generations 和 /v1/images/edits 的響應都帶 usage 欄位,圖片輸入 token 和文本輸入 token 是分開返回的,不用估算,直接讀欄位就能精確核算這一次呼叫的真實成本。下面是一次真實編輯請求(帶 1 張參考圖)返回的完整 usage(實測抓包):
分組介紹
gpt-image-2 官轉目前提供兩個分組,可在後臺「令牌設定 → 分組」中切換:
image2Enterprise 即可臨時過渡使用。

令牌設定:選擇 image2Enterprise 分組(1.2x),常規資源不足時仍穩定
技術規格
端點一覽
尺寸(size)詳解
預設尺寸
自定義尺寸約束
gpt-image-2 接受任意合法尺寸,只需同時滿足:
- 最大邊 ≤ 3840px
- 兩條邊都是 16 的倍數
- 長短邊比例 ≤ 3:1
- 總畫素數 ∈ [655,360, 8,294,400](下限約 0.65MP,上限約 8.3MP)
1600x1200、1792x1024、2048x1536、3200x1800
非法示例:1000x1000(非 16 倍數)、4000x4000(超上限)、3840x1000(比例超 3:1)
畫質(quality)詳解
可選檔位
quality 是影響價格最大的引數,比 size 更顯著。 輸出圖片 token 量由 quality × size 共同決定,但 quality 的權重明顯更高——同一尺寸下從 low 到 high,每張成本可相差 30 倍以上(參見上方「每張成本速查」表:1024×1024 從 low $0.006 到 high $0.211)。預算和選檔時應優先按 quality 評估成本,再疊加 size 的影響。最佳實踐
對接先跑 low 驗證鏈路
quality=low + 預設尺寸跑通整條鏈路(鑑權、引數、超時、錯誤處理)。low 速度比 high 快數倍,能快速暴露所有非畫質相關的問題,避免被長耗時干擾排查。尺寸優先選預設
畫質按場景分檔
low;預設 / 終稿 → medium;文字、精細紋理、印刷 → high。注意 low ↔ high 不僅是畫面精美度差異,還包含推理複雜度差異——耗時差距可達數倍。輸出格式選 JPEG
output_format=jpeg + output_compression=85 比 PNG 快且體積小一半以上。文字場景鎖 high
quality=high。編輯場景準備參考圖
超時分檔配置(high 兜底 600 秒)
quality 與 size,尤其是 quality。建議按檔位配置客戶端超時:high 模式務必配 600 秒兜底,覆蓋排隊 / 長尾 / 服務抖動等各種異常情況;前端務必給進度反饋;服務端建議用任務佇列解耦。遷移注意
gpt-image-1.5 遷移:刪掉 input_fidelity(強制高保真,傳了會報錯);避開 background: transparent(暫不支援)。錯誤碼與重試
- 請求超時按
quality分檔配置:low≥ 120 秒 /medium≥ 240 秒 /high≥ 600 秒(兜底;實測 3–5 分鐘,按 120/360 秒配會大量誤超時) - 新接入先用
quality=low跑通鏈路,再按需升到medium/high - 對 5xx 與超時做 指數退避重試(建議 2 次)
- 記錄響應頭
x-request-id方便排查
常見問題
返回的 b64_json 要不要自己加 data:image/png;base64, 字首?
返回的 b64_json 要不要自己加 data:image/png;base64, 字首?
gpt-image-2 返回的是純 base64 字串(無字首),與 gpt-image-2-all 不同。客戶端有兩種用法:- 寫檔案:
base64.b64decode(b64_str)後寫入磁碟 - 瀏覽器渲染:
img.src = 'data:image/png;base64,' + b64_str自行拼字首
為什麼傳 input_fidelity 會報 400?
為什麼傳 input_fidelity 會報 400?
gpt-image-2 強制啟用 high-fidelity 處理參考圖,不再接受 input_fidelity 引數。從 1.5 遷移時把這個欄位移除即可,無需替換。想要透明背景怎麼辦?
想要透明背景怎麼辦?
gpt-image-2 暫不支援 background: transparent(會報錯)。兩個變通方案:- 把
background改為opaque/ 或不傳,自行用 PIL / sharp / 線上工具摳透明 - 仍需透明背景的場景臨時回退到
gpt-image-1.5
單次能出幾張?
單次能出幾張?
n=1)。如需 N 張請客戶端並行 N 次呼叫。每次獨立按 token 計費。2K/4K 出圖為什麼很慢?
2K/4K 出圖為什麼很慢?
quality=high + 高解析度下耗時 ≈ 235 秒(約 4 分鐘)單張,3840×2160 + high 長尾可接近 5 分鐘。建議:- 新接入先用
quality=low跑通鏈路,確認正常後再按業務需求升檔 - 客戶端超時按檔位配:
low≥ 120 秒 /medium≥ 240 秒 /high≥ 600 秒(兜底) - 前端顯示”生成中”進度反饋
- 不需要 4K 時仍用 1024×1024 / 1536×1024 等 1K 預設
編輯請求為什麼比文生圖貴?
編輯請求為什麼比文生圖貴?
gpt-image-2 對參考圖自動啟用 high-fidelity 處理,參考圖本身會按 Vision 計費規則換算成大量輸入 token。帶圖編輯的輸入 token 明顯高於文生圖,預算時要留足。尺寸、參考圖都一樣,為什麼每次呼叫價格還不一樣?
尺寸、參考圖都一樣,為什麼每次呼叫價格還不一樣?
quality 傳了 auto(或沒傳)。 有客戶反饋「尺寸、解析度、參考圖完全一樣,價格卻忽高忽低」,定位後發現請求裡 size 和 quality 都用了 auto。問題出在 quality: auto:自動模式下,模型會自行理解需求、臨時選擇不同的品質檔位去創作。檔位不同 → 輸出的 image token 數量不同 → 價格自然不同。下面是三次「輸入完全一致(input 都是 1061 token)」卻價格相差數倍的真實賬單:auto 被模型判定為更高畫質,輸出 token 飆到 5146,價格也隨之漲到約 3.5 倍。解決辦法:不要讓 quality 用 auto,顯式傳 low / medium / high。 固定檔位後,相同輸入的輸出 token 量和價格才穩定可預期。詳見上方「畫質(quality)詳解」章節。快取計費(Cached Input)能享受到嗎?
快取計費(Cached Input)能享受到嗎?
圖片編輯介面的圖片數量和大小限制?
圖片編輯介面的圖片數量和大小限制?
gpt-image-2 圖片編輯介面(/v1/images/edits)最多支援上傳 16 張參考圖:- multipart/form-data 檔案上傳:每張圖片小於 50MB,支援
png/jpg/webp - base64 data URL 方式:欄位長度限制約 20MiB(schema
maxLength: 20971520,是字串欄位限制,不等同於 multipart 的 50MB 上限),實際原圖建議控制在 15MB 以內 - mask 檔案:單獨限制為 PNG 且小於 4MB
編輯介面報 400「Invalid image file or mode for image 1」怎麼辦?
編輯介面報 400「Invalid image file or mode for image 1」怎麼辦?
code: invalid_image_file)的含義是:第 N 張參考圖不是標準的 png / jpg / webp 格式(序號從 1 開始,按序號定位問題圖)。最常見的根因是手機原拍照片的 MPO 格式:華為 Mate 系列等機型直出的 .jpg 內嵌 HDR 增益圖副幀,實為多幀 JPEG 容器(MPO)。檔案頭同為 FFD8,副檔名和 file 命令都顯示 JPEG,肉眼無法分辨——2026-07 實測 MPO 圖必被拒,重編碼為標準 JPEG/PNG 後原解析度上傳即成功(與尺寸、image[] 欄位名、quality/size 引數均無關)。該錯誤在入口校驗階段返回,不計費。修復:上傳前用 Pillow 重編碼(Image.open(f).format 返回 "MPO" 即需轉換):mask 檔案怎麼準備?
mask 檔案怎麼準備?
- 與原圖相同尺寸,PNG 格式,單張小於 4MB
- 必須帶 alpha 通道:透明區域(alpha=0)= 要重繪的部分,不透明區域 = 保留
- 僅對第一張 image 生效
- mask 是”軟引導”非精確邊界,模型可能在蒙版周圍擴充套件 / 收斂
和 gpt-image-2-all 怎麼選?
和 gpt-image-2-all 怎麼選?
能用 OpenAI 的官方 SDK 直連嗎?
能用 OpenAI 的官方 SDK 直連嗎?
base_url 指向 https://api.apiyi.com/v1,api_key 設為 API易 令牌即可:支援主動中斷生成任務嗎?
支援主動中斷生成任務嗎?
gpt-image-2 走 OpenAI 官方同步端點,請求一旦提交就會跑到結束,無法發出”取消”指令。客戶端即使斷開連線,服務端仍會把這次生成完整跑完並照常計費。建議在客戶端做好超時控制,不要依賴”斷連就不收費”的假設。有請求速率限制(RPM)嗎?
有請求速率限制(RPM)嗎?
支援非同步呼叫嗎?
支援非同步呼叫嗎?
gpt-image-2 嚴格與 OpenAI 官方一致——只有同步呼叫,發起請求後阻塞等待結果(high 檔 + 4K 實測 1–2 分鐘)。如需非同步佇列、回撥通知等能力:- 在業務層用任務佇列(Celery / BullMQ 等)自行封裝非同步
- 或改用
gpt-image-2-all,出圖約 30–60 秒,更適合前端輪詢
生成失敗會扣費嗎?
生成失敗會扣費嗎?
400 錯誤並不計費。典型響應:401(令牌無效)、429(限流)。只有請求實際進入模型生成階段(即收到 200 + b64_json)才會按 token 計費。相關文件
- ⚖️ 官轉 vs 官逆 對比 - 選型對照表,幫你決定用哪個
- 文生圖 Playground -
/v1/images/generations線上除錯 - 圖片編輯 Playground -
/v1/images/edits多圖融合 + mask - 深度解讀:gpt-image-2 上線說明 - News 文章
- 完整接入文件(中文) - 完整 API 參考
- GPT-Image-2-All(官逆版本) - 更便宜、更快的備選方案
- 社群貢獻:Luck GPT-Image 2 ComfyUI 節點 - 在 ComfyUI 中一鍵呼叫
gpt-image-2(含 mask / 5 圖輸入 / 自定義尺寸) - 社群貢獻:APIYI GPT-Image 2 Skills - 在 Codex CLI / Cursor / Gemini CLI 等 AI 程式設計工具中一句話呼叫
- API 使用手冊 - 通用呼叫規範
gpt-image-2 是 OpenAI 官方旗艦,按 token 實計;如果你更看重統一定價($0.03/張)和出圖速度(30–60s),可參考 gpt-image-2-all。