Skip to main content
本頁提供一個開箱即用的 Agent 技能(Skill):一個指令碼同時覆蓋 gpt-image-2(官轉)gpt-image-2-allgpt-image-2-vip(官逆)三條通道——它們都走同一套 OpenAI Images API,只是 --model 不同。把它放進你正在用的編碼 Agent,一句話即可出圖,整套東西就兩個檔案。

這個技能能做什麼

一個合併技能,指令碼會根據是否傳入圖片自動判斷走「文生圖」還是「圖片編輯」:

文生圖

只給提示詞 → 生成全新圖片,文字渲染、寫實質感強。

多圖融合

傳入多張圖(最多 16 張)+ 一條指令 → 把圖1的人放進圖2的場景、保留圖3的風格等。

局部重繪

傳入一張圖 + --mask 掩碼 + 指令 → 只改掩碼覆蓋的區域(僅官轉 gpt-image-2 支援)。

三個模型怎麼選

三條通道呼叫方式完全一致,區別只在通道來源、價格/速度和支援的引數。指令碼已按 --model 自動處理這些差異:
簡單記:要快又便宜gpt-image-2-all要鎖尺寸/4K 又便宜gpt-image-2-vip要畫質檔位、掩碼局部重繪gpt-image-2(官轉)。

能用在哪些 Agent

一個 Skill 本質上就是一個資料夾:一份寫給 Agent 看的說明(SKILL.md)+ 一個幹活的指令碼。所以凡是能讀取本地檔案、執行命令列的編碼 Agent 都能用上——比如 Codex、OpenClaw、hermes-agent、Claude Code 等。唯一要求:跑 Agent 的那臺機器(你的電腦或伺服器)裝了 Python 3 並且能聯網(指令碼要直連 api.apiyi.com)。僅此而已,不挑具體哪家 Agent。

三步裝好

① 建目錄、貼檔案、裝依賴

新建一個技能資料夾,放入下面兩個檔案(完整內容見後兩節)。本技能用 OpenAI SDK 呼叫,需要先裝一個依賴:

② 同目錄寫 Key

gpt-image-2/.env 裡寫上你的 API易 API Key(在 api.apiyi.com 控制台建立):
指令碼會自動從這個 .env 讀取 Key,無需任何額外配置或環境變數
.env 裡是你的金鑰。如果這個技能要隨專案倉庫共享,務必把 .env 加進 .gitignore,不要提交到 git

③ 交給 Agent

  • 支援技能自動發現的 Agent(如 Claude Code):把整個 gpt-image-2/ 目錄放進它的技能目錄——個人級 ~/.claude/skills/,或專案級 .claude/skills/(隨倉庫共享)。
  • 其他 Agent:按它各自的技能/外掛約定放置;或者最簡單——直接讓 Agent「讀一下這個資料夾裡的 SKILL.md,並照著執行」 即可。
裝好後就能用了,跳到 怎麼用 看示例。

SKILL.md

新建 gpt-image-2/SKILL.md,完整內容如下(description 寫清「做什麼 + 何時用」,Agent 會據此自動觸發):
name 必須是小寫字母 + 連字元。在支援斜槓命令的 Agent 裡,目錄名就是命令名——叫 gpt-image-2/gpt-image-2${CLAUDE_SKILL_DIR} 是 Claude Code 提供的技能目錄變數;其他 Agent 直接用指令碼的實際路徑即可。

scripts/gpt_image.py

新建 gpt-image-2/scripts/gpt_image.py,使用 OpenAI SDK 指向 API易(base_url="https://api.apiyi.com/v1"):

怎麼切換模型

切換通道只需改 --model,三種值任選:
想改預設通道(不每次都加 --model),在 gpt-image-2/.env 里加一行:
指令碼已自動相容 base64 與 url 兩種返回(官逆模型的 b64_jsondata:image;base64, 字首,指令碼會自動剝除)。只有當你強依賴 URL 輸出時,才需要在 API易 控制台把令牌「分組」切到 image2_OSS——普通出圖無需關心。

為什麼一句話就能出圖

很多人好奇:我又沒敲命令,怎麼說句”畫只貓”它就出圖了? 原理是這樣:Agent 啟動時會先讀取每個技能 SKILL.md 裡的 description(一段很短的後設資料,說明「這個技能做什麼、什麼時候該用」)。當你說出的需求匹配上這段描述的場景(比如”畫/生成/渲染一張圖""把這幾張圖融合一下”),Agent 就自動決定呼叫這個技能,去讀完整的 SKILL.md 並執行指令碼——整個過程你不用記任何命令。 不想靠 Agent 猜、想要百分百可控時,用下面的顯性呼叫

怎麼用

自然語言(隱式觸發)

裝好後直接對 Agent 說話即可:

顯性呼叫(更可控)

  • 支援斜槓命令的 Agent(如 Claude Code):
  • 任意 Agent / 直接命令它跑指令碼(最通用):

生成的圖片在哪裡

  • -o 只傳檔名(如 -o cat.png)時,圖片統一存到專案根目錄下的 gpt-image-output/ 資料夾(指令碼自動建立),所以你在專案裡的這個資料夾就能直接找到。
  • 「專案根目錄」= 指令碼從自身位置向上找到的第一個含 .git.claude 的目錄——不管 Agent 在哪個目錄執行,圖都落在專案裡,不會跑進臨時目錄害你找不到。
  • 指令碼會為每張圖列印一行完整絕對路徑,例如 圖片已儲存至 /Users/you/project/gpt-image-output/cat.png
  • 預設只出 1 張-n 3 一次出 3 張(最多 5),檔名自動加 -1-2-3 字尾。
  • 帶目錄的路徑(如 -o images/cat.png 或絕對路徑)時,按你給的路徑存,不進 gpt-image-output/
  • 編輯 / 融合同理:輸出是新檔案,不會覆蓋你的原圖

相關文件