Skip to main content
이 페이지는 바로 사용할 수 있는 Agent Skill을 제공합니다. 이미 사용 중인 코딩 Agent에 그대로 넣고, 자연어(또는 명시적인 명령)로 APIYI 플랫폼의 Nano Banana Pro(gemini-3-pro-image)를 호출하여 이미지 생성과 편집을 수행할 수 있습니다. 전체는 단 두 개의 파일로 구성되어 있으므로 복사해서 바로 사용하시면 됩니다.

스킬이 하는 일

하나로 결합된 단일 스킬입니다. 이 스크립트는 입력 이미지를 전달하는지 여부를 자동 감지하여 텍스트를 이미지로와 이미지 편집 중에서 결정합니다:

텍스트를 이미지로

프롬프트만 입력하면 → 10가지 종횡비와 1K/2K/4K 해상도를 지원하는 완전히 새로운 이미지를 생성합니다.

이미지 편집

이미지 1장 + 지시문 → 로컬 편집, 스타일 변경, 배경 교체 등.

다중 이미지 합성

여러 이미지 + 하나의 지시문 → 합성, 비교, 의상 교체 등.

어느 에이전트가 사용할 수 있습니까

스킬은 본질적으로 하나의 폴더에 불과합니다. 에이전트가 읽을 수 있는 지침 묶음(SKILL.md)과 작업을 수행하는 스크립트로 이루어집니다. 따라서 로컬 파일을 읽고 셸 명령을 실행할 수 있는 모든 코딩 에이전트는 사용할 수 있습니다 — 예를 들어 Codex, OpenClaw, hermes-agent, Claude Code 등이 있습니다.유일한 요구사항은 에이전트를 실행하는 머신(사용자 컴퓨터 또는 서버)에 Python 3가 설치되어 있고 네트워크 액세스가 있어야 한다는 점입니다(스크립트가 api.apiyi.com를 직접 호출합니다). 이것이 전부입니다 — 특정 에이전트에 종속되지 않습니다.

3단계로 설정하기

① 폴더를 만들고 파일을 붙여넣기

다음 두 파일이 들어 있는 스킬 폴더를 만드십시오(전체 내용은 다음 두 섹션에 있습니다):

② 같은 폴더에 키를 넣기

api.apiyi.com 콘솔에서 생성한 APIYI API Keynano-banana-pro/.env에 기록하십시오:
스크립트는 이 .env에서 키를 자동으로 읽어옵니다. — 추가 설정이나 환경 변수는 필요하지 않습니다.
.env에는 비밀 키가 들어 있습니다. 프로젝트 리포지토리를 통해 이 스킬을 공유하는 경우, .env.gitignore에 반드시 추가하고 git에 절대 커밋하지 마십시오.

③ 에이전트에 전달하기

  • 스킬을 자동 감지하는 에이전트(예: Claude Code)의 경우: 전체 nano-banana-pro/ 폴더를 해당 스킬 디렉터리에 넣으십시오. 개인용 ~/.claude/skills/이거나, 프로젝트 수준의 .claude/skills/일 수 있습니다(리포지토리를 통해 공유됨).
  • 다른 에이전트의 경우: 해당 에이전트의 자체 스킬/플러그인 규칙에 맞게 배치하십시오. 아니면 가장 간단하게는 — 에이전트에게 “이 폴더의 SKILL.md를 읽고 따라오세요”라고 지시하십시오.
설치가 끝나면 준비 완료입니다 — 예제는 사용 방법을 확인하십시오.

SKILL.md

nano-banana-pro/SKILL.md을(를) 다음의 전체 내용으로 생성하십시오. (description은 “무엇을 하는지 + 언제 사용하는지”를 뜻하며, Agent가 이를 기준으로 자동 트리거합니다):
name는 소문자와 하이픈만 사용할 수 있으며 claude / anthropic 같은 예약어를 포함하면 안 됩니다. 슬래시 명령을 지원하는 에이전트에서는 디렉터리 이름이 곧 명령입니다 — nano-banana-pro/nano-banana-pro가 됩니다. ${CLAUDE_SKILL_DIR}는 Claude Code가 제공하는 스킬 디렉터리 변수입니다. 다른 에이전트에서는 스크립트의 실제 경로를 사용하십시오.

scripts/nano_banana.py

nano-banana-pro/scripts/nano_banana.py를 Gemini 네이티브 형식으로 생성하십시오(검증된, 작동하는 APIYI 텍스트-투-이미지 / 이미지 편집 참조 페이지의 코드와 동일합니다). 순수 Python 표준 라이브러리만 사용하며 pip install는 필요하지 않습니다:
기본 모델 이름은 gemini-3-pro-image(안정된 이름)입니다. 기존 gemini-3-pro-image-preview를 사용하려면 APIYI_IMAGE_MODEL=gemini-3-pro-image-preview를 설정하십시오 — 둘은 같은 가격이며 기능적으로 동일합니다.

왜 한 문장만으로 이미지가 생성되는가

많은 분들이 이렇게 궁금해합니다. 명령을 한 번도 입력하지 않았는데, 어떻게 “draw a cat”이 이미지를 생성했을까요? 작동 방식은 이렇습니다. 시작할 때 에이전트는 각 스킬의 SKILL.md에서 description을 먼저 읽습니다(즉, 이 스킬이 무엇을 하고 언제 사용해야 하는지를 설명하는 아주 짧은 메타데이터입니다). 사용자의 요청이 해당 상황과 일치하면(예: “draw / generate / render an image”, “edit this image to…”), 에이전트는 자동으로 해당 스킬을 호출하기로 결정하고, 전체 SKILL.md를 읽은 뒤 스크립트를 실행합니다. 이 모든 과정은 사용자가 어떤 명령도 기억하지 않아도 자동으로 이루어집니다. 따라서:
  • 잘 작성된 description = 더 정확한 자동 트리거링입니다. 이 스킬의 설명에는 이미 “generate / draw / edit / composite an image” 같은 표현이 포함되어 있습니다.
  • 에이전트가 추측하지 않도록 하고 완전한 제어를 원하신다면, 아래의 명시적 호출을 사용하십시오.

사용 방법

자연어(암시적 트리거)

설치한 뒤에는 Agent와 대화하기만 하면 됩니다:

명시적 호출(더 많은 제어)

Agent가 스스로 판단하지 않게 하고 싶을 때는, 두 가지 명시적 방법이 있습니다:
  • 슬래시 명령을 지원하는 에이전트(예: Claude Code):
  • 모든 에이전트 / 스크립트를 실행하라고만 지시하는 방식(가장 범용적임):
종횡비와 선명도를 제어하는 방법: 종횡비에는 --aspect를 사용하고(예: --aspect 16:9, 10가지 옵션), 해상도에는 --size를 사용합니다(1K / 2K / 4K). “세로 9:16으로 해줘”, “정사각형 이미지로 해줘”, 또는 “4K로 렌더링해줘”라고만 말하면 에이전트가 이러한 플래그를 자동으로 추가합니다.

생성된 이미지가 저장되는 위치

  • -o일반 파일명인 경우(예: -o dog.png), 이미지들은 모두 프로젝트 루트의 nano-banana-output/ 폴더에 저장됩니다(자동으로 생성됩니다). 따라서 프로젝트 안에서 바로 찾을 수 있습니다.
  • “Project root”는 스크립트의 자체 위치에서 상위로 올라가면서 발견되는 .git 또는 .claude를 포함하는 첫 번째 디렉터리입니다. 즉, 에이전트가 어느 디렉터리에서 실행되든 이미지가 프로젝트 내부에 저장되며, 찾을 수 없는 임시 디렉터리에 저장되지 않습니다.
  • 스크립트는 이미지마다 전체 절대 경로를 하나씩 출력합니다. 예: Image saved to /Users/you/project/nano-banana-output/dog.png.
  • 기본값은 이미지 1장 생성입니다. -n 3를 사용하면 한 번에 3장을 생성하며(최대 5장, 그보다 많으면 5장으로 제한됨), -1, -2, -3 접미사가 자동으로 추가됩니다.
  • -o가 디렉터리가 포함된 경로인 경우(예: -o images/dog.png 또는 절대 경로), 해당 정확한 경로에 저장되며(상대 경로는 현재 작업 디렉터리를 기준으로 합니다) nano-banana-output/로 들어가지 않습니다.
  • 이미지 편집도 같은 방식으로 동작합니다. 출력은 새 파일이며 원본을 덮어쓰지 않습니다.
Nano Banana Pro에는 엄격한 콘텐츠 안전 제어가 적용됩니다. 스크립트가 finishReason을(를) STOP과(와) 다르게 보고하거나 거부 텍스트를 반환하면, 그에 맞게 콘텐츠를 조정하고 동일한 위반 prompt를 반복해서 다시 시도하지 마십시오. 생성 레퍼런스의 오류 처리 가이드를 참고하십시오.

관련 문서