Skip to main content
원하는 이미지를 얻는 방법은 “이 한 번의 시도는 실패했습니다. 어떻게 복구하나요”에 대한 답변입니다. 이 페이지는 다음 질문에 답합니다: 매번 시도가 성공하도록 하려면 어떻게 해야 하나요. 늘 나오는 질문이 있습니다. freepik.comhiggsfield.ai 같은 소비자용 이미지 제품은 여러분이 사용하는 것과 같은 기반 모델, 즉 같은 Nano Banana, GPT-이미지, FLUX 계열 위에서 동작합니다. 그런데도 출력은 더 완성도 있어 보입니다. 차이는 모델 가중치에 있지 않습니다. 그것은 모델을 감싸고 있는 레이어입니다. 그리고 그 레이어는 직접 구축할 수 있습니다. 이 페이지에서 그 방법을 보여드립니다.

1. 소비자용 이미지 제품이 모델 주위를 감싸는 방식

이들 제품 중 하나를 분해해 보면 모델 바깥에 대략 8개의 계층이 있습니다. 그 모든 계층은 API에서 재현할 수 있습니다:
경쟁사 기능 목록을 그대로 복사하기 전에 정리해야 할 플랫폼 경계 두 가지:
  1. APIYI에는 업스케일링, 배경 제거, 얼굴 복원 엔드포인트가 없습니다. 큰 이미지가 필요하다면, 나중에 키우는 계획보다는 생성 시점에 고해상도 티어를 선택하십시오(gpt-image-2는 4K, Nano Banana Pro는 4K). 투명 배경이 필요하다면, 오직 seedream-5-0seedream-5-0-pro만 알파 채널이 있는 PNG로 반환하도록 요청할 수 있습니다.
  2. APIYI는 LoRA나 아이덴티티 학습을 제공하지 않습니다. Soul ID 뒤에 있는 “한 번 학습하면 얼굴을 영원히 고정” 기능은 참조 이미지로만 근사할 수 있습니다. 같은 캐릭터라도 장면과 조명 변화에 따라 여전히 흔들리며, 새 샷이 정면에 가까운 구도와 원래 조명에 가까울수록 가장 잘 유지됩니다. 엄격한 일관성이 필요한 상업용 캐릭터라면 사람 검수 단계를 예산에 반영하십시오.

2. 첫 번째 계층만으로도 결과가 이미 분리됩니다: 일반 입력을 구조화로 바꾸기

이것은 가장 효과가 큰 계층이며, 가장 자주 건너뛰는 계층이기도 합니다.

나란히 비교한 테스트: 하나의 모델, 하나의 브리프, 두 개의 prompt

브리프는 “커피용 이커머스 상품 사진”입니다. 왼쪽은 사용자가 실제로 입력한 내용이고, 오른쪽은 빠진 결정을 채워 넣은 같은 브리프입니다. 두 경우 모두 gemini-3-pro-image (Nano Banana Pro)에서 2K, 1:1에 한 번씩 실행되었습니다:
일반 prompt에서 나온 커피 이미지: 나무 테이블, 그라인더, 삼베 자루 및 요청하지 않은 다른 소품들, 따뜻한 향수성 그레이딩, 그리고 컵에 인쇄된 만들어낸 브랜드명

Casual prompt: 'Make me a coffee product shot, make it look nice, make it feel premium'

구조화된 prompt에서 나온 커피 이미지: 연한 회색 마이크로시멘트 표면 위의 무광 블랙 세라믹 컵, 깔끔하게 흐릿한 배경, 분명한 광원 방향, 넉넉한 여백

Structured prompt: subject, environment, light position, lens, grading, imperfections and composition all specified

왼쪽 이미지는 보기 흉하지는 않지만, 사용할 수는 없습니다. 모델은 아무도 승인하지 않은 결정을 잔뜩 내렸습니다. 그라인더와 삼베 자루를 추가하고, 향수 어린 따뜻한 그레이딩으로 정하고, 컵에는 만들어낸 브랜드명을 인쇄했습니다. 그런 자동 생성 텍스트는 상업적으로 그 프레임을 쓸모없게 만듭니다. 오른쪽 이미지는 바로 상품 페이지에 올릴 수 있습니다. 중립적인 배경, 말로 설명할 수 있는 조명 구성, 그리고 카피를 넣을 여유가 있기 때문입니다. “보기 좋다”와 “실제로 사용할 수 있다”는 서로 다른 목표입니다. 일반적인 prompt로는 첫 번째만 도달할 수 있습니다.

재작성 계층이 제공해야 하는 여섯 가지 요소

재작성은 prompt를 더 길게 만드는 것을 의미하지 않습니다. 빠진 결정을 채워 넣는 것을 의미합니다. 이미지 prompt에는 여섯 가지 핵심 요소가 있습니다:
해상도는 일곱 번째 요소가 아닙니다. 출력 해상도는 size / imageSize 같은 매개변수에서만 결정됩니다. prompt에 “4K”나 “8K”를 적어도 픽셀 하나도 늘어나지 않습니다. 이미지 압축 및 출력 해상도를 보십시오.

코드로 본 재작성 계층

여기서는 저렴하고 빠른 텍스트 모델만으로 충분합니다. 생성에 비하면 비용은 미미합니다:
“8K, ultra HD, masterpiece, perfect”를 금지하는 규칙에 유의하십시오 — 4절에서 그 이유를 설명합니다.

3. 실제로 배포할 수 있는 파이프라인

남은 네 개 레이어를 재작성 레이어에 이어 붙이면 전체가 완성됩니다:
1

재작성: 자유 입력을 구조화된 prompt로

2절을 참조하십시오. 이 단계는 진행되는 동안 사용자 입력의 민감한 내용도 중화하므로, 후단에서 요청이 차단되는 빈도를 눈에 띄게 줄입니다.
2

앵커: 레퍼런스 이미지와 스타일 상수

스타일은 두 가지로 고정됩니다: 모든 prompt에 덧붙는 스타일 상수(사용자 설정값)와 고정된 레퍼런스 이미지 집합입니다.레퍼런스 한도는 모델 계열별로 크게 다르므로, 파이프라인을 설계하기 전에 사용 중인 계열을 확인하십시오:지켜야 할 두 가지 규칙이 있습니다: prompt의 “이미지 1 / 이미지 2”는 배열 순서에 엄격히 대응합니다. 따라서 어느 것이 어느 것인지 명시하십시오. 또한 Grok은 /v1/images/edits에서만 레퍼런스 이미지를 인정합니다 — 이를 /v1/images/generations에 넘기면 조용히 버려지지만 여전히 과금됩니다.
3

샘플: N개를 병렬로 생성하고 n에 의존하지 마십시오

소비자용 제품이 「첫 시도에 바로 맞췄다」는 느낌은 사실 제품이 대신 여러 장의 카드를 뽑아 보는 것과 같습니다.하지만 서버 측 n 매개변수는 대부분의 이미지 모델에 영향을 주지 않습니다(Seedream은 아예 무시합니다). 여러 후보를 얻으려면 클라이언트에서 여러 요청을 동시에 보내십시오 — 이 사이트의 스킬 페이지는 한 번에 5개로 제한합니다. 채널별로 동시 실행 수를 조정하십시오. 일부는 2개부터 429를 반환하기 시작하므로 지수 백오프를 추가하십시오.
4

선택: 비전 모델을 판정자로 사용하십시오

N개의 후보를 확보한 뒤에는 자동으로 선택해야 합니다. 그렇지 않으면 선택을 사용자에게 떠넘긴 것에 불과합니다.후보들을 표준 /v1/chat/completions 이미지 입력으로 비전 모델에 다시 보내 채점하십시오. 지원 가능한 모델은 비전 이해를 참조하십시오. 평가 기준은 다섯 가지 차원으로 고정하고 JSON 반환을 요구하십시오: 지시 준수, 구조와 해부학, 텍스트 정확성, 텍스처 사실성, 구도.
이 용도로는 /v1/rerank를 사용하지 마십시오. bge-reranker-v2-m3텍스트 전용 재정렬 모델이며 이미지를 받지 않습니다. 이미지 채점에는 비전 이해 모델이 필요합니다.
5

보정하고 마무리하십시오

구도가 확정된 뒤에는 로컬에서 조정하십시오 — 하나의 복합 지시문보다 성공률이 훨씬 높습니다:
  • 픽셀 단위 로컬 재페인트: **공식 릴레이 gpt-image-2**만 마스크를 지원합니다. 마스크 인페인팅 가이드를 참조하십시오.
  • 멀티턴 누적 편집: Nano Banana 모델의 네이티브 Gemini 엔드포인트에서 지원됩니다(이전 이미지를 role: "model"로 다시 입력합니다). 리버스 엔지니어링한 경로는 이를 지원하지 않습니다.
  • 즉시 재호스팅: 반환되는 URL은 모두 임시입니다(FLUX는 약 10분이며 CORS가 없고, Seedream과 R2는 약 24시간입니다). 따라서 확보하는 즉시 자신의 오브젝트 스토리지로 다운로드하십시오.

최소 엔드 투 엔드 구현

4. AI 느낌 제거하기

“AI 느낌”은 미스터리가 아닙니다. 그것은 하나씩 제거할 수 있는 구체적인 특성들의 집합입니다.

나란히 비교 테스트

동일한 모델(gemini-3-pro-image), 동일한 피사체, 두 가지 prompt 스타일, 각각 두 장의 이미지, 각 배치에서 첫 번째 이미지를 보여줍니다:
기본 prompt에서의 인물 사진: 피사체가 정중앙에 있고 카메라를 바라보며, 빛의 방향이 드러나지 않는 균일한 조명, 깔끔한 배경, 전형적인 스톡 사진 같은 느낌

Bare prompt: 'A photorealistic half-body portrait of a young woman by a cafe window, smiling at the camera, 8K, ultra HD, ultra detailed, flawless skin, beautiful, perfect lighting, masterpiece'

제어된 prompt에서의 인물 사진: 단일한 방향성의 창문광, 얼굴의 절반은 그림자 속에 있고, 모공과 솜털이 보이며, 볼에 작은 점이 있고, 머리카락이 몇 가닥 흩어져 있으며, 필름 그레이딩이 적용되고, 피사체가 중앙보다 오른쪽에 배치됨

The same subject after adding four blocks of control language: light position, lens, medium, imperfections

왼쪽 이미지는 나쁘지 않습니다 — 기본 모델이 충분히 강해서 아무 장식 없는 prompt만으로도 보기 좋은 이미지를 만들어냅니다. 하지만 그 안에는 특징 세트가 고스란히 들어 있습니다. 피사체가 정중앙에 고정되어 있고, 빛은 어디서 오는지 알 수 없을 정도로 고르며, 모든 요소가 무난합니다. 그리고 이것은 우연도 아닙니다. 그 배치의 두 이미지 모두 본질적으로 같은 구도와 조명 패턴을 공유했습니다. 오른쪽 이미지는 접근 방식을 바꿨습니다. 빛에는 방향이 생겼고, 얼굴의 절반은 그림자에 잠기도록 두었으며, 피부에는 유분과 모공이 드러나고, 볼에는 점이 있으며, 삐져나온 머리카락은 빗질되지 않았고, 피사체는 중앙보다 오른쪽에 있습니다. 이것은 “카페에서 미소 짓는 여성의 스톡 이미지”가 아니라 특정한 순간에 촬영된 특정 인물로 읽힙니다.
파이프라인의 진짜 가치는 바로 여기서도 드러납니다. 그것은 못난 출력을 예쁜 출력으로 바꾸는 것이 아니라, “운 좋게 잘 나온 것”을 “여러분이 지정했고, 설명할 수 있고, 재현할 수 있는 좋은 결과”로 바꿉니다. 이해관계자는 오른쪽 이미지를 더 선호하지 않을 수도 있지만, 왼쪽 이미지로는 왜 그런 모습인지 설명할 수 없고, 다음 이미지에 그것을 맞추라고 요청할 수도 없습니다.

AI스러운 모습의 증상, 수정안, 그리고 쓰지 말아야 할 것

8K, ultra HD, ultra detailed, masterpieceperfect와 같은 모호한 품질 표현은 순효과가 마이너스입니다. 이것들은 아무 해상도도 더하지 못하며(해상도를 더하는 것은 오직 파라미터뿐입니다), 모델을 과도하게 선명하고 과채도인 렌더 쪽으로 밀어붙입니다. 바로 이것이 AI스러운 모습의 핵심입니다. 위의 왼쪽 prompt는 그런 표현들로 가득 차 있었고, 그 결과가 그것을 보여줍니다. 품질을 원하시면, 대신 구체적인 조명, 렌즈, 매체를 작성하십시오.

복사-붙여넣기용 제어 언어 네 블록

필요에 따라 프롬프트에 섞어 넣으십시오. 각 블록에서 한두 줄이면 보통 충분합니다:

조명

왼쪽에서 들어오는 창광만이 프레임 안의 유일한 광원입니다 / 오후 3시의 강한 후면광 / 역광, 머리카락에 림라이트 / 프레임 안의 실제 광원으로 놓인 책상 램프 / 뚜렷한 그림자 없는 흐린 날의 확산광

렌즈

35mm f/2.0, 자연스러운, 눈높이 / 85mm f/2.8, 가까운 눈에 초점 / 낮은 카메라 위치의 24mm, 약간의 가장자리 왜곡 / 공간을 압축하는 망원 렌즈, 평평해진 배경 레이어 / 모서리에 약한 비네팅

매체

Kodak Portra 400의 특성, 고운 입자감 / 따뜻한 하이라이트, 차가운 그림자 / Polaroid 즉석 필름, 낮은 대비, 부드러운 가장자리 / 초기 CCD 디지털 카메라의 노이즈와 색조 편차 / 전반적으로 낮은 채도, 선명화 없음

불완전성

자연스러운 피부 질감, 보이는 모공과 잔털 / 몇 가닥 풀린 머리카락, 빗질되지 않음 / 보풀이 인 스웨터, 닳은 소맷단 / 테이블 위의 물자국, 지문과 부스러기 / 중심에서 벗어난 구도, 피사체 일부가 가장자리에서 잘림

세 가지 완전한 예시

자연스러운 반신 인물 사진: 카페 창가에 선 20대 중반의 여성이 옆으로 몸을 돌린 채 바깥을 바라보고 있으며, 입가의 미소를 간신히 참는 듯합니다. 왼쪽에서 들어오는 창문빛만이 프레임의 유일한 광원이며, 얼굴 오른쪽 절반은 그림자에 잠기고 코 다리 아래에는 작고 선명한 그림자가 있습니다. 85mm 렌즈, f/2.8, 눈높이, 가까운 쪽 눈에 초점. Kodak Portra 400의 특성과 같은 미세하고 눈에 보이는 그레인, 따뜻한 하이라이트와 차가운 그림자, 전반적으로 낮은 채도. 자연스러운 피부: 보이는 모공과 솜털, 코 옆면의 약간의 윤기, 왼쪽 볼의 작은 점, 몇 가닥 삐져나온 눈썹 털, 이마에 정리되지 않은 느슨한 머리카락. 피부 보정 없음, 미용 리터칭 없음, 샤프닝 없음. 피사체는 중앙 오른쪽에 배치하고, 왼쪽에는 여백을 둡니다.
이커머스 히어로 샷: 매트한 검은색 세라믹 푸어오버 컵에 블랙 커피가 80% 채워져 있고, 표면에는 얇은 크레마 고리가 떠 있습니다. 컵은 연한 회색 마이크로시멘트 표면 위에 놓여 있으며, 같은 톤의 벽이 뒤에서 흐릿하게 보입니다. 왼쪽 위 45도 방향의 소프트박스에서 들어오는 키라이트, 오른쪽의 흰색 바운스 카드가 컵 오른쪽 가장자리를 따라 좁은 하이라이트를 남기고, 부드러운 캐스트 섀도우가 뒤쪽 오른편으로 떨어집니다. 85mm 매크로 렌즈, f/5.6, 앞면을 15도 아래로 기울인 시점, 컵 전체가 선명합니다. 차갑고 중립적인 화이트 밸런스, 전반적으로 낮은 채도. 유약에는 약간의 수공예적 불균일함과 아주 작은 가마 자국이 있으며, 가장자리에는 매우 희미한 사용 흔적이 보입니다. 넉넉한 여백, 컵은 프레임의 왼쪽 1/3에 배치합니다. 이미지 어디에도 브랜드명이나 텍스트는 없습니다.
비가 막 그친 오후 6시의 좁은 구시가지 거리로, 양쪽 가게의 라이트박스가 물웅덩이에 비치고 있습니다. 유일한 키라이트는 거리 끝의 따뜻한 가로등이며, 가게 창문빛이 필라이트 역할을 하고, 하늘에는 아직 차가운 황혼의 기운이 남아 있어 따뜻함과 차가움의 대비를 만듭니다. 28mm 렌즈, f/4, 카메라는 눈높이, 약간 위로 기울임. 전반적으로 낮은 채도, 그림자에는 노이즈를 유지하고, 그림자 들어올리기는 하지 않습니다. 벽에는 물때 자국, 찢어진 낡은 포스터, 에어컨 실외기가 있고, 전선이 프레임 상단을 가로지릅니다. 아무도 카메라를 정면으로 바라보지 않으며, 지나가는 사람들은 뒤에서 보이고 약간 모션 블러가 있습니다.

5. 파이프라인 설계를 바꿀 사실

이 사실들을 미리 알고 있으면 재작업을 한 번 줄일 수 있습니다.

6. 파이프라인이 가치가 있는 경우의 비용 계산

파이프라인은 성공률을 위해 비용을 치르는 방식입니다. 비용은 이미지 생성 비용에서 출력이 대부분을 차지합니다(gpt-image-2는 출력에 토큰 100만 개당 $30를 청구합니다). 반면 재작성과 채점에 사용되는 텍스트 및 비전 모델 비용은 거의 무시해도 될 수준입니다. 따라서 비용은 본질적으로 “몇 개의 후보를 생성했는가”에 달려 있습니다. 모든 항목에 하나의 설정을 쓰기보다, 세 가지 등급을 사용하세요. 테스트는 간단합니다. 이 이미지를 팀 밖의 누군가가 보게 됩니까? 그렇다면 표준 이상은 충분히 값을 합니다. 내부 검토용이라면 초안이면 충분합니다. 그 사이에 게이트를 하나 더 넣을 수도 있습니다. 즉, 최고 점수가 임계값 아래로 떨어질 때만 더 많은 후보를 생성하면 대부분의 요청이 2개에서 수렴하게 만들 수 있습니다.

간단 요약

  • 격차는 모델 가중치에 있는 것이 아니라 모델 주변의 8개 레이어에 있습니다: rewrite, presets, anchoring, sampling, selection, 단계별 편집, 후처리, rehosting.
  • rewrite 레이어의 반환 효과가 가장 큽니다: 주제, 환경, 조명, 렌즈, 그레이딩, 구도를 채워 넣으면 “보기 좋다”가 “실제로 사용할 수 있다”가 됩니다.
  • 여러 후보 생성과 vision-model 점수화가 소비자 제품의 높은 체감 성공률이 실제로 나오는 지점입니다. n는 작동하지 않으므로 클라이언트 측에서 fan out해야 하며, /v1/rerank은 이미지를 점수화할 수 없습니다.
  • AI 같은 느낌을 없애려면 형용사가 아니라 구체성을 추가해야 합니다: 광원 하나를 지정하고, 초점거리와 조리개를 제시하고, 매체와 그레인을 명시하고, 의도적으로 결함을 추가하고, 피사체를 중앙에서 벗어나게 배치하십시오.
  • 8K / masterpiece / perfect lighting는 순손실입니다 — 추가 해상도는 없고, 프레임을 렌더링한 듯한 느낌으로 밀어갑니다.
  • 재현을 위해 seed에 의존하지 마십시오. 대신 전체 요청을 보관하십시오. 이미지 API는 동기식이며 연결이 끊겨도 과금되므로, 파이프라인에는 큐가 필요합니다.
  • APIYI에는 업스케일링, 배경 제거, 아이덴티티 학습 엔드포인트가 없습니다. 처음부터 그 레이어들을 고려해 설계하십시오.

관련 문서

원하는 이미지를 얻는 방법

실패한 단일 호출 복구: prompt를 다시 작성하고, 재시도하고, 모델을 전환하고, 테스트 도구로 격리합니다

이미지 API 필수 사항

동기 호출, 타임아웃 단계, 과금, base64 처리, 입력 이미지 전처리

마스크 인페인팅 가이드

픽셀 수준의 국소 편집, 공식 릴레이의 gpt-image-2 전용

다중 이미지 융합 테스트

참조 제한을 어떻게 측정했는지, 그리고 14장 이미지 융합 결과

비전 이해

후보 이미지를 평가하는 데 사용할 수 있는 비전 모델과 호출 방법

자체 비동기 큐 구축

다중 후보 파이프라인을 지원하도록 동기 생성을 작업 큐로 래핑하기