이 페이지는 바로 사용할 수 있는 Agent Skill을 제공합니다: 하나의 스크립트가 gpt-image-2 (공식), gpt-image-2-all, gpt-image-2-vip(역방향) 세 채널을 모두 지원합니다. 이들은 모두 동일한 OpenAI Images API를 사용하며, 차이는 오직
--model뿐입니다. 이미 사용 중인 코딩 Agent에 넣고 하나의 prompt로 이미지를 생성하세요 — 파일은 두 개뿐입니다.이 스킬의 기능
하나로 결합된 스킬입니다. 스크립트가 입력 이미지를 전달했는지 여부를 자동 감지하여 텍스트-이미지와 이미지 편집 중 무엇을 사용할지 결정합니다:텍스트를 이미지로
프롬프트만 제공하면 → 강력한 텍스트 렌더링과 사실적인 품질을 갖춘 완전히 새로운 이미지가 생성됩니다.
다중 이미지 융합
여러 이미지(최대 16장) + 하나의 지시문 → 이미지 1의 사람을 이미지 2의 장면에 넣고, 이미지 3의 스타일을 유지하는 식으로 처리합니다.
인페인팅
이미지 1장 +
--mask + 지시문 → 마스크된 영역만 변경합니다(gpt-image-2 공식만 지원합니다).어떤 모델을 선택할지
세 채널은 모두 동일하게 호출되며; 차이는 소스 채널, 가격/속도, 그리고 어떤 파라미터가 반영되는지만 다릅니다. 스크립트는--model로 이러한 차이를 자동으로 처리합니다:
어떤 Agent가 사용할 수 있습니까
Skill은 본질적으로 폴더일 뿐입니다: Agent가 읽을 수 있도록 한 지침(
SKILL.md) + 작업을 수행하는 스크립트의 집합입니다. 따라서 로컬 파일을 읽고 셸 명령을 실행할 수 있는 모든 코딩 Agent가 이를 사용할 수 있습니다 — 예를 들어 Codex, OpenClaw, hermes-agent, Claude Code 등이 있습니다.유일한 요구 사항은 Agent를 실행하는 머신(사용자 컴퓨터 또는 서버)에 Python 3가 설치되어 있고 네트워크 액세스가 있어야 한다는 것입니다(스크립트가 api.apiyi.com를 직접 호출합니다). 그뿐입니다 — 특정 Agent에 종속되지 않습니다.3단계로 설정하기
① 폴더를 만들고, 파일을 붙여넣고, 종속성을 설치합니다
전체 내용은 다음 두 섹션에 있는 두 파일로 구성된 스킬 폴더를 만듭니다. 이 스킬은 OpenAI SDK를 통해 호출하므로, 먼저 종속성 하나를 설치합니다:② 같은 폴더에 키를 넣습니다
api.apiyi.com 콘솔에서 하나를 생성한 APIYI API Key를 gpt-image-2/.env에 기록합니다:
.env에서 키를 자동으로 읽습니다 — 추가 설정이나 환경 변수는 필요하지 않습니다.
③ Agent에 전달합니다
- 스킬을 자동으로 검색하는 에이전트(예: Claude Code): 전체
gpt-image-2/폴더를 해당 스킬 디렉터리에 넣으십시오 — 개인용~/.claude/skills/또는 프로젝트 수준.claude/skills/(리포지토리로 공유됨)입니다. - 다른 에이전트: 각자의 스킬/플러그인 규칙에 따라 배치하거나, 가장 간단하게는 **“이 폴더의 SKILL.md를 읽고 따르십시오”**라고 에이전트에게 지시하면 됩니다.
SKILL.md
아래의 전체 내용으로gpt-image-2/SKILL.md를 만드십시오(description에는 “무엇을 하는지 + 언제 사용하는지”가 들어 있으며, 이것이 Agent가 이를 자동 트리거하는 데 사용합니다):
scripts/gpt_image.py
APIYI(base_url="https://api.apiyi.com/v1")를 가리키도록 설정한 OpenAI SDK를 사용하여 gpt-image-2/scripts/gpt_image.py를 생성합니다:
모델 전환 방법
채널 전환은 **--model**일 뿐이며, 세 가지 값 중 하나입니다:
--model를 전달하지 않도록 하려면) gpt-image-2/.env에 한 줄을 추가합니다:
스크립트는 base64와 url 응답을 모두 자동으로 처리합니다(역방향 모델의
b64_json에는 data:image;base64, 접두사가 포함되어 있으며, 스크립트가 이를 제거합니다). URL 출력을 반드시 필요로 하는 경우에만 APIYI 콘솔에서 token의 과금 그룹을 image2_OSS로 변경하면 됩니다. 일반 생성에서는 필요하지 않습니다.왜 한 문장만으로 이미지가 생성됩니까
사람들은 종종 이렇게 궁금해합니다. 명령을 한 번도 입력하지 않았는데, 어떻게 “draw a cat”이 이미지로 만들어졌을까요? 작동 방식은 이렇습니다. 시작 시 에이전트는 먼저 각 스킬의SKILL.md에서 description를 읽습니다(이 스킬이 무엇을 하며 언제 사용해야 하는지를 아주 짧게 설명하는 메타데이터입니다). 요청이 이 시나리오와 일치하면(예: “draw / generate / render an image”, “fuse these images”), 에이전트는 자동으로 스킬을 호출하기로 결정하고, 전체 SKILL.md를 읽은 뒤 스크립트를 실행합니다. 이 모든 과정은 사용자가 어떤 명령도 기억할 필요 없이 이루어집니다.
에이전트가 추측하지 않게 하고 완전한 제어를 원하신다면, 아래의 명시적 호출을 사용하십시오.
사용 방법
자연어(암시적 트리거)
설치한 후에는 에이전트에게 말하기만 하면 됩니다:명시적 호출(더 많은 제어)
-
슬래시 명령을 지원하는 에이전트(예: Claude Code):
-
모든 에이전트 / 그냥 스크립트를 실행하라고 지시하는 경우(가장 범용적):
생성된 이미지가 저장되는 위치
-o가 파일명만 있는 경우(예:-o cat.png), 이미지들은 모두 프로젝트 루트의gpt-image-output/폴더에 저장됩니다(자동 생성됨). 따라서 프로젝트 안에서 바로 찾을 수 있습니다.- “프로젝트 루트” = 스크립트 자체 위치에서 상위로 올라가며 찾았을 때
.git또는.claude를 포함하는 첫 번째 디렉터리입니다. 즉, Agent가 어느 디렉터리에서 실행되든 이미지가 프로젝트 안에 저장되므로, 찾을 수 없는 임시 디렉터리에 들어가지 않습니다. - 스크립트는 이미지당 전체 절대 경로를 하나씩 출력합니다. 예:
Image saved to /Users/you/project/gpt-image-output/cat.png. - 기본적으로는 이미지 1장만 생성합니다.
-n 3는 한 번에 3장을 생성하며(최대 5장),-1,-2,-3접미사가 자동으로 추가됩니다. -o가 디렉터리가 포함된 경로(예:-o images/cat.png또는 절대 경로)인 경우, 해당 정확한 경로에 저장되며gpt-image-output/로 들어가지 않습니다.- 편집 / 퓨전도 같은 방식으로 동작합니다. 출력은 새 파일이며 원본을 덮어쓰지 않습니다.
관련 문서
- GPT-Image-2-All 에이전트 스킬 (역순, 가장 빠름)
- GPT-Image-2-VIP 에이전트 스킬 (역순, 4K 잠금)
- GPT-Image-2 이미지 생성 개요
- Nano Banana Pro 에이전트 스킬