Skip to main content
이 페이지에서는 바로 사용할 수 있는 에이전트 스킬을 제공합니다. 하나의 스크립트로 6개 모델(gpt-image-2.5-flare / gpt-image-2.5-sunburst / gpt-image-2 (공식)gpt-image-2.5-all / gpt-image-2-all / gpt-image-2-vip(리버스))을 지원합니다. 모두 동일한 OpenAI 이미지 API를 사용하며, --model만 다릅니다. 이미 사용 중인 코딩 에이전트에 추가하면 단일 prompt로 이미지를 생성할 수 있으며, 파일은 2개뿐입니다.

이 스킬의 기능

하나로 결합된 스킬입니다. 스크립트가 입력 이미지를 전달했는지 여부를 자동 감지하여 텍스트-이미지와 이미지 편집 중 무엇을 사용할지 결정합니다:

텍스트를 이미지로

프롬프트만 제공하면 → 강력한 텍스트 렌더링과 사실적인 품질을 갖춘 완전히 새로운 이미지가 생성됩니다.

다중 이미지 융합

여러 이미지(최대 16장) + 하나의 지시문 → 이미지 1의 사람을 이미지 2의 장면에 넣고, 이미지 3의 스타일을 유지하는 식으로 처리합니다.

인페인팅

이미지 1장 + --mask + 지시문 → 마스크된 영역만 변경합니다(gpt-image-2 공식만 지원합니다).

선택할 모델

6개 모델 모두 동일하게 호출되며, 차이점은 소스 채널, 가격/속도, 지원되는 매개변수뿐입니다. 3개의 공식 모델(2.5-flare / 2.5-sunburst / 2)은 가격과 매개변수가 동일하고, 3개의 리버스 모델도 서로 동일합니다. 스크립트는 --model를 통해 이러한 차이를 자동으로 처리합니다.
빠른 선택: 일상적인 텍스트-이미지gpt-image-2.5-flare; 편집 / 마스크 인페인팅gpt-image-2.5-sunburst; 빠르고 저렴한 처리gpt-image-2.5-all / gpt-image-2-all; 크기/4K 고정 및 저렴한 비용gpt-image-2-vip입니다.

어떤 Agent가 사용할 수 있습니까

Skill은 본질적으로 폴더일 뿐입니다: Agent가 읽을 수 있도록 한 지침(SKILL.md) + 작업을 수행하는 스크립트의 집합입니다. 따라서 로컬 파일을 읽고 셸 명령을 실행할 수 있는 모든 코딩 Agent가 이를 사용할 수 있습니다 — 예를 들어 Codex, OpenClaw, hermes-agent, Claude Code 등이 있습니다.유일한 요구 사항은 Agent를 실행하는 머신(사용자 컴퓨터 또는 서버)에 Python 3가 설치되어 있고 네트워크 액세스가 있어야 한다는 것입니다(스크립트가 api.apiyi.com를 직접 호출합니다). 그뿐입니다 — 특정 Agent에 종속되지 않습니다.

3단계로 설정하기

① 폴더를 만들고, 파일을 붙여넣고, 종속성을 설치합니다

전체 내용은 다음 두 섹션에 있는 두 파일로 구성된 스킬 폴더를 만듭니다. 이 스킬은 OpenAI SDK를 통해 호출하므로, 먼저 종속성 하나를 설치합니다:

② 같은 폴더에 키를 넣습니다

api.apiyi.com 콘솔에서 하나를 생성한 APIYI API Keygpt-image-2/.env에 기록합니다:
이 스크립트는 이 .env에서 키를 자동으로 읽습니다 — 추가 설정이나 환경 변수는 필요하지 않습니다.
.env에는 비밀 키가 들어 있습니다. 이 스킬을 프로젝트 리포지토리로 공유하는 경우, 반드시 .env.gitignore에 추가하고 git에 절대 커밋하지 마십시오.

③ Agent에 전달합니다

  • 스킬을 자동으로 검색하는 에이전트(예: Claude Code): 전체 gpt-image-2/ 폴더를 해당 스킬 디렉터리에 넣으십시오 — 개인용 ~/.claude/skills/ 또는 프로젝트 수준 .claude/skills/(리포지토리로 공유됨)입니다.
  • 다른 에이전트: 각자의 스킬/플러그인 규칙에 따라 배치하거나, 가장 간단하게는 **“이 폴더의 SKILL.md를 읽고 따르십시오”**라고 에이전트에게 지시하면 됩니다.
설치가 끝나면 바로 사용할 수 있습니다 — 예시는 사용 방법을 확인하십시오.

SKILL.md

gpt-image-2/SKILL.md에 아래 전체 콘텐츠를 사용하여 생성합니다(description에는 “기능 + 사용 시점”이 명시되며, 이는 Agent가 자동으로 트리거하는 데 사용됩니다).
name은 소문자와 하이픈만 사용해야 합니다. slash command를 지원하는 Agent에서는 디렉터리 이름이 명령어이며, gpt-image-2/gpt-image-2이 됩니다. ${CLAUDE_SKILL_DIR}은 Claude Code에서 제공하는 스킬 디렉터리 변수이며, 다른 Agent에서는 스크립트의 실제 경로를 사용하면 됩니다.

scripts/gpt_image.py

APIYI(base_url="https://api.apiyi.com/v1")를 가리키도록 설정된 OpenAI SDK를 사용하여 gpt-image-2/scripts/gpt_image.py를 생성합니다:

모델 전환 방법

모델 전환은 **--model**뿐이며, 다음 여섯 값 중 하나입니다:
기본 채널을 변경하려면(매번 --model을 전달하지 않도록), gpt-image-2/.env에 다음 줄을 추가합니다:
이 스크립트는 base64 및 URL 응답을 모두 자동으로 처리합니다(역방향 모델의 b64_json에는 data:image;base64, 접두사가 포함되며, 스크립트가 이를 제거합니다). URL 출력을 반드시 요구하는 경우에만 APIYI 콘솔에서 token의 과금 그룹을 image2_OSS로 전환하면 됩니다. 일반 생성에는 필요하지 않습니다.

왜 한 문장만으로 이미지가 생성됩니까

사람들은 종종 이렇게 궁금해합니다. 명령을 한 번도 입력하지 않았는데, 어떻게 “draw a cat”이 이미지로 만들어졌을까요? 작동 방식은 이렇습니다. 시작 시 에이전트는 먼저 각 스킬의 SKILL.md에서 description를 읽습니다(이 스킬이 무엇을 하며 언제 사용해야 하는지를 아주 짧게 설명하는 메타데이터입니다). 요청이 이 시나리오와 일치하면(예: “draw / generate / render an image”, “fuse these images”), 에이전트는 자동으로 스킬을 호출하기로 결정하고, 전체 SKILL.md를 읽은 뒤 스크립트를 실행합니다. 이 모든 과정은 사용자가 어떤 명령도 기억할 필요 없이 이루어집니다. 에이전트가 추측하지 않게 하고 완전한 제어를 원하신다면, 아래의 명시적 호출을 사용하십시오.

사용 방법

자연어(암시적 트리거)

설치가 완료되면 에이전트와 대화하기만 하면 됩니다.

명시적 호출(더 세밀한 제어)

  • 슬래시 명령을 지원하는 에이전트(예: Claude Code):
  • 모든 에이전트 / 스크립트를 실행하라고 지시하기만 하면 됩니다(가장 범용적):

생성된 이미지가 저장되는 위치

  • -o파일명만 있는 경우(예: -o cat.png), 이미지들은 모두 프로젝트 루트의 gpt-image-output/ 폴더에 저장됩니다(자동 생성됨). 따라서 프로젝트 안에서 바로 찾을 수 있습니다.
  • “프로젝트 루트” = 스크립트 자체 위치에서 상위로 올라가며 찾았을 때 .git 또는 .claude를 포함하는 첫 번째 디렉터리입니다. 즉, Agent가 어느 디렉터리에서 실행되든 이미지가 프로젝트 안에 저장되므로, 찾을 수 없는 임시 디렉터리에 들어가지 않습니다.
  • 스크립트는 이미지당 전체 절대 경로를 하나씩 출력합니다. 예: Image saved to /Users/you/project/gpt-image-output/cat.png.
  • 기본적으로는 이미지 1장만 생성합니다. -n 3는 한 번에 3장을 생성하며(최대 5장), -1, -2, -3 접미사가 자동으로 추가됩니다.
  • -o디렉터리가 포함된 경로(예: -o images/cat.png 또는 절대 경로)인 경우, 해당 정확한 경로에 저장되며 gpt-image-output/로 들어가지 않습니다.
  • 편집 / 퓨전도 같은 방식으로 동작합니다. 출력은 새 파일이며 원본을 덮어쓰지 않습니다.

관련 문서