Skip to main content
이 페이지는 즉시 적용 가능한 Agent Skill을 제공합니다. 생성하기 전에 프롬프트를 점검하고, 누락된 요소를 채우며, 품질을 떨어뜨리는 모호한 표현을 제거한 뒤, 다시 작성한 버전으로 생성합니다. 전체는 타사 종속성 0개인 두 개의 파일로 구성됩니다.
이미지가 기대에 못 미칠 때, 문제는 대개 모델이 아니라 프롬프트입니다. 이 스킬은 고급 이미지 생성의 “재작성 레이어”를 어떤 코딩 에이전트에든 바로 넣어 사용할 수 있는 형태로 바꿉니다.

이 스킬이 하는 일

생성 전 진단

주제, 환경, 조명, 렌즈, 그레이딩, 구도를 하나씩 점수화하고, 0~100점 평점을 부여하며, 위험 요소를 나열한 뒤, 복사할 수 있도록 다시 작성된 prompt를 반환합니다.

생성 후 검토

실제 이미지를 원본 prompt와 함께 전달하면 모델이 이를 다시 읽어 보고, prompt의 어떤 문장이 실행되지 않았는지와 모델이 임의로 추가한 내용을 짚어낸 뒤, 그에 맞게 다시 작성합니다.

대상 모델 조언

-t를 사용하면 해당 계열에 특화된 메모를 덧붙입니다: 참조 이미지 제한, 마스크 지원, 그리고 해상도 파라미터의 명칭입니다.

주제 인지 검사

인물 사진은 피부와 조명 검사를 받고, 제품 사진은 배경과 텍스트 금지 검사를 받으며, 일러스트는 포토리얼리즘 체크리스트의 가중치를 자동으로 낮춥니다.

전체 진단, 시작부터 끝까지

입력은 사용자가 실제로 입력했을 내용과, 그로 인해 생성된 이미지입니다:
대충 작성한 prompt에서 생성된 커피 이미지: 나무 테이블, 그라인더, 삼베 자루 및 기타 소품, 컵에는 지어낸 브랜드명이 인쇄되어 있음

The actual result produced by that casual prompt

진단 출력(실제 실행 결과의 일부):
그렇게 다시 작성한 prompt를 같은 모델(gemini-3-pro-image)에 변경 없이 다시 입력하면:
다시 작성한 prompt에서 생성된 커피 이미지: 따뜻한 흰색 세라믹 라테 컵이 중립적인 연한 회색 배경 위에 놓여 있으며, 명확한 조명 방향이 있고, 그림자는 오른쪽 뒤로 떨어지며, 어디에도 텍스트가 없고, 넉넉한 여백이 있습니다

Regenerated from the rewritten prompt: a clean, usable e-commerce hero shot

모든 소품이 사라지고, 배경은 제어 가능한 중립 회색이며, 그림자에는 방향이 있고, 브랜드명도 지어내지 않았으며, 문구를 넣을 공간도 있습니다. 모델은 바뀌지 않았습니다. 바뀐 것은 prompt뿐입니다.

진단을 실행할 시점

모든 생성에 검토가 필요한 것은 아닙니다. 요청이 이미 얼마나 구체적인지에 따라 판단합니다:
이 스킬은 prompt만 다시 작성합니다. 이미지를 생성하지는 않습니다. 완전한 검토-후-생성 흐름을 위해 Nano Banana Pro 스킬 또는 GPT-Image-2 시리즈 스킬과 함께 사용하십시오.

어떤 에이전트에서 작동하는지

스킬은 사실상 하나의 폴더입니다: 에이전트에게 그것이 무엇인지 알려 주는 파일 하나(SKILL.md)와 작업을 수행하는 스크립트로 이루어집니다. 따라서 로컬 파일을 읽고 명령을 실행할 수 있는 모든 코딩 에이전트가 이를 사용할 수 있습니다 — Codex, OpenClaw, hermes-agent, Claude Code 등입니다.유일한 요구 사항은 에이전트를 실행하는 머신에 Python 3네트워크 접근 권한이 있어야 한다는 점입니다(스크립트가 api.apiyi.com와 직접 통신합니다). 이 스킬은 Python 표준 라이브러리만 사용하며 — pip로 설치할 것은 아무것도 없습니다.

세 단계로 설치합니다

1. 폴더를 만들고 파일을 붙여넣습니다

다음 두 파일이 들어 있는 스킬 폴더를 만드십시오(전체 내용은 아래 두 섹션에 있습니다):
pip install는 필요하지 않습니다.

2. 그 옆에 키를 추가합니다

api.apiyi.com 콘솔에서 생성한 APIYI API 키image-prompt-doctor/.env에 넣으십시오:
스크립트는 이 .env에서 키를 자동으로 읽습니다 — 다른 설정이나 환경 변수는 필요하지 않습니다.
.env에는 비밀이 들어 있습니다. 이 스킬이 프로젝트 리포지토리를 통해 공유되는 경우, .env.gitignore에 추가하고 절대 커밋하지 마십시오.

3. 에이전트에 전달합니다

  • 스킬 자동 탐지 기능이 있는 에이전트(예: Claude Code): 전체 image-prompt-doctor/ 폴더를 해당 에이전트의 스킬 디렉터리에 넣으십시오 — 사용자 수준은 ~/.claude/skills/, 프로젝트 수준은 .claude/skills/(repo를 통해 공유됨)입니다.
  • 그 밖의 에이전트: 해당 에이전트의 자체 스킬/플러그인 규약에 따라 배치하십시오. 아니면 가장 간단하게는 — 에이전트에게 “이 폴더의 SKILL.md를 읽고 따르십시오”라고 말씀하시면 됩니다.
이것이 설치의 전부입니다. 예제를 보려면 사용 방법으로 이동하십시오.

SKILL.md

image-prompt-doctor/SKILL.md를 아래의 전체 내용으로 생성하십시오(description에는 “무엇을 하는지 + 언제 사용하는지”가 표시되며, 에이전트가 이를 사용해 자동으로 트리거합니다):

scripts/prompt_doctor.py

다음 전체 내용으로 image-prompt-doctor/scripts/prompt_doctor.py를 생성합니다(Python 표준 라이브러리만 사용하며, 설치할 것은 없습니다):

진단 모델 전환

기본값은 gpt-5.6-luna입니다 — 저렴하며($0.2 입력 / $1.2 출력, 백만 tokens당) 이미지 입력을 지원하므로 검토 모드에 필요합니다. 변경하는 방법은 두 가지입니다:
전환할 때 주의할 두 가지가 있습니다: 검토 모드는 이미지 입력을 지원하는 모델이 필요합니다(텍스트 전용 모델은 첨부된 이미지를 받으면 오류가 발생합니다) — 목록은 비전 이해를 참조하십시오. 그리고 스크립트는 response_format: {"type": "json_object"}를 보내므로, JSON 모드를 지원하지 않는 모델은 대신 펜스 코드 블록 형태의 텍스트를 반환할 수 있습니다(스크립트는 방어적으로 펜스를 제거하지만, JSON 모드를 지원하는 모델을 사용하는 것이 좋습니다).

한 문장이 진단을 유발하는 이유

흔히 드는 질문이 있습니다. 저는 명령을 한 번도 입력하지 않았는데, 왜 “draw me an image”라고 말했을 뿐인데 먼저 prompt를 검토했습니까? 작동 방식은 이렇습니다. 시작 시 에이전트는 각 스킬의 SKILL.md에 있는 description을 읽습니다. 이는 해당 스킬이 무엇을 하며 언제 적용되는지를 알려 주는 짧은 메타데이터입니다. 사용자가 말한 내용이 그 설명과 일치하면(“draw me a …”, “why did this image come out wrong”, “improve this prompt”), 에이전트는 스스로 스킬을 호출하기로 결정하고 SKILL.md 전체를 읽은 뒤 스크립트를 실행합니다. 사용자가 명령을 외울 필요는 없습니다. SKILL.md에도 이미 구체적인 요청은 해당 처리가 필요 없다고 명시되어 있으므로, 모든 prompt에 개입하지는 않습니다. 완전한 제어가 필요할 때는 아래의 명시적 호출을 사용하십시오.

사용 방법

자연어(암묵적 트리거)

설치한 뒤에는 에이전트에게 그냥 말하면 됩니다:

명시적 호출(더 많은 제어)

  • 슬래시 명령이 있는 에이전트(예: Claude Code):
  • 모든 에이전트 / 그냥 스크립트를 실행하라고 지시하면 됨(가장 범용적):

진단 결과가 표시되는 위치

  • 이 스킬은 파일을 전혀 쓰지 않습니다. 결과는 터미널에 출력되고 에이전트가 이를 사용자에게 전달합니다 — 점수, 여섯 요소 표시, 위험, 다시 작성한 prompt, 변경된 내용, 매개변수 제안이 포함됩니다.
  • 결과를 자신의 프로그램으로 전달하려면 --json를 추가하십시오. 출력은 파일로 리다이렉트할 수 있는 구조화된 객체(score / elements / risks / optimized_prompt / changes / suggested_params)입니다:
  • 사용하기 전에 다시 작성한 prompt를 확인하십시오: 다시 쓰면 의도가 달라질 수 있습니다(예: “coffee”가 “a latte”로 바뀌는 경우). 또한 SKILL.md에는 에이전트가 먼저 묻도록 이미 안내되어 있습니다.
  • 검토 모드로 전달된 이미지는 절대로 수정되거나 덮어쓰이지 않습니다 — 읽기 전용 입력입니다.

비용

진단 한 번에는 몇 천 개의 token이 소모됩니다. gpt-5.6-luna의 정가 기준으로는 그 비용이 1센트의 일부에 불과한 반면, 단일 high 품질 생성은 수십 배 더 많은 비용이 듭니다. 생성하기 전에 진단하면, 재시도로 인한 낭비를 줄여 드는 효과가 비용보다 더 큽니다. 검토 모드는 이미지를 업로드하며, 이는 input tokens로 과금됩니다 — 약간 더 들지만, 여전히 한 번의 생성보다 훨씬 저렴합니다.

관련 문서