Skip to main content
POST
Image editing: edit a reference image or fuse several
🔒 기본적으로 열려 있지 않음: Grok Imagine 2는 Default 그룹에 속하지 않습니다. 자체 Grok_imagine 그룹에 속하며, 호출하기 전에 액세스를 요청해야 합니다(이 페이지의 플레이그라운드 포함). 액세스 권한이 없으면 모든 호출이 503을 반환합니다.이 제품군의 콘텐츠 안전 정책은 플랫폼의 다른 모델과 크게 다르며 일부 카테고리는 필터링되지 않으므로, 컴플라이언스 위험을 제한하기 위해 선택적으로 액세스 권한을 부여합니다. 누적 지출이 $1,000 이상인 기존 고객은 지원팀에 사용 사례를 설명하여 활성화할 수 있으며, 그 외 사용자는 사용 사례와 적용 중인 콘텐츠 조정 제어 방안을 설명하여 WeCom 지원을 통해 신청합니다. 전체 절차: Grok Imagine 2 개요 - 그룹 설정.
오른쪽의 대화형 플레이그라운드는 로컬 파일 업로드를 지원합니다. Authorization에 API Key를 입력하고(형식: Bearer sk-xxx), image 파일을 선택한 다음 prompt 및 model을 입력하고 전송합니다.
🔴 이 엔드포인트는 multipart/form-data 파일 업로드가 필요합니다/v1/images/edits에 JSON을 전송하면 항상 400을 반환합니다:
특히 xAI 또는 업스트림 공급업체의 문서에서 통합하는 경우 중요합니다: 해당 문서는 공개 이미지 URL({"image": {"type": "image_url", "url": "..."}})을 포함한 JSON 본문을 설명하지만, 그 형식은 APIYI 게이트웨이를 통해서는 작동하지 않습니다. 대신 이 페이지를 따르십시오.장점은 파일 업로드를 사용하면 이미지 호스팅이 필요 없다는 것입니다. 로컬 파일을 바로 전송하면 되므로 공개 URL을 준비하는 것보다 간단합니다.파일 필드 이름은 image 또는 **image[]**이어야 합니다. images / image_file은 415를 반환합니다. prompt은 필수이며, 생략하면 400을 반환합니다.
이 페이지를 사용하는 경우: 참조 이미지 하나를 편집하거나 여러 개를 융합할 때입니다. prompt만으로 생성하려면 텍스트-이미지 엔드포인트를 사용하십시오.
⚠️ 출력 크기는 첫 번째 참조 이미지를 따르며 변경할 수 없습니다resolution 및 aspect_ratio은 여기서 오류 없이 허용되지만 효과가 없습니다. 편집된 출력은 항상 첫 번째 참조 이미지의 크기와 일치합니다(1280x720 입력 시 1280x720 출력, 1024x1024 입력 시 1024x1024 출력).융합에도 동일하게 적용됩니다. 참조 이미지 4개의 순서를 뒤집으면 출력이 1280x720에서 1024x1024으로 바뀌며, 새로운 첫 번째 이미지를 따릅니다.출력 크기를 변경하려면 업로드 전에 첫 번째 참조 이미지를 자르거나 크기를 조정하십시오.
융합 순서는 중요합니다: image[]은 1-4개의 참조 이미지를 허용하며(측정된 상한은 4개이고, 다섯 번째 이미지는 400을 반환함), 업로드 순서가 prompt에서 말하는 ‘이미지 1 / 이미지 2 / 이미지 3’을 의미합니다. 예를 들어 ‘이미지 1의 피사체를 이미지 2의 장면에 배치하고, 이미지 2의 아트 스타일을 유지’와 같이 명시적으로 지정하십시오.2 / 3 / 4개의 참조 이미지로 측정한 결과, 추가되는 각 이미지는 출력에 해당 피사체를 추가하며 각 이미지의 고유한 특성이 유지됩니다. 즉, 융합은 실제로 작동합니다.

코드 예시

Python (OpenAI SDK, 단일 이미지)

Python (원시 requests, 단일 이미지)

Python (멀티 이미지 융합, 파일 1-4개)

cURL

Node.js (네이티브 fetch + FormData)

브라우저 JavaScript

파라미터 레퍼런스

이 계열은 마스크 인페인팅을 지원하지 않습니다. 변경 범위를 제한하려면 prompt에 이를 정확히 설명하십시오 — 예를 들어 “스카프만 빨간색으로 바꾸고, 나머지는 모두 정확히 그대로 유지합니다”라고 적으십시오. 모델은 이러한 제약을 매우 엄격하게 따릅니다.

편집 동작 및 prompt 스타일

편집 엔드포인트는 입력 이미지의 아트 스타일, 구도, 팔레트 및 주체 정체성을 유지하고, prompt가 지정한 내용만 변경합니다. 안정적인 결과를 얻으려면:
“나머지는 모두 그대로 유지하십시오”라고 명시적으로 말하는 것이 이 모델에서 가장 효과적인 기법입니다. 융합의 경우에는 항상 image[] 업로드 순서에 맞춰 “image 1 / image 2”를 지칭하십시오.또한 가장 중요한 주체를 먼저 배치하십시오: 첫 번째 이미지는 출력 크기만 설정하는 것이 아니라, 테스트에서는 순서를 반대로 하면 보조 주체의 정체성이 다른 대상과 섞이는 문제가 발생했습니다.

응답 형식

응답 필드 주의사항
  • 각 data[] 항목에는 response_format에 따라 url 또는 b64_json 중 하나만 포함됩니다 — 둘 다는 아닙니다.
  • revised_prompt은 반환되지 않습니다 — 존재한다고 가정하지 마십시오.
  • b64_json은 data:image/...;base64, 접두사가 없는 원시 base64입니다 — 바로 디코드하십시오.
  • created는 항상 0이며 타임스탬프로 사용할 수 없습니다.
  • 출력 차원은 입력 이미지에 의해 결정되므로 요청 파라미터로 너비/높이를 예측하지 마십시오.
usage은 정산에 사용할 수 없습니다: prompt_tokens는 항상 1000 x n인 플레이스홀더입니다. 편집 비용은 이미지당 정액 요율로 텍스트-투-이미지와 동일하며, 실제 과금은 APIYI 콘솔 과금 기록을 사용하십시오.

인증

Authorization
string
header
필수

API Key created in the APIYI Console

본문

multipart/form-data
model
enum<string>
기본값:grok-imagine-image
필수

Model ID

사용 가능한 옵션:
grok-imagine-image,
grok-imagine-image-quality
prompt
string
필수

Editing instruction. State what to change and explicitly ask for everything else to stay put, e.g. Change the scarf color to bright RED. Keep everything else exactly the same.

예시:

"Change the scarf color to bright RED. Keep everything else exactly the same."

image
file
필수

Reference image file. For multi-image fusion repeat the image[] field (1-4 files); upload order is what "image 1 / image 2 / image 3" refers to in the prompt, and the first file also determines output dimensions. Each added image contributes a subject in testing. Accepted formats: png / jpg / webp.

n
integer
기본값:1

Number of output images, 1-10. Independent of the number of reference images

필수 범위: 1 <= x <= 10
예시:

1

response_format
enum<string>
기본값:url

Response format. url returns a direct link; b64_json returns raw base64 (no data: prefix)

사용 가능한 옵션:
url,
b64_json
예시:

"url"

응답

Image generated successfully

created
integer

Creation timestamp. Always 0 for this model — do not use it for timing

예시:

0

data
object[]

Array of image results, length equals the requested n

usage
object

Placeholder values — do not use for billing reconciliation. prompt_tokens is always 1000 x n