Skip to main content

개요

MAI-Image 2.6은 Microsoft AI의 자체 이미지 생성 모델로, 2026-09-04에 출시되어 Microsoft Foundry에서 퍼블릭 프리뷰로 제공됩니다. 출시 당시 Arena의 텍스트 투 이미지(text-to-image) 및 이미지 편집 부문 모두에서 2위, Artificial Analysis의 이미지 편집 부문에서 1위를 기록했습니다(Microsoft 발표 기준, 2026-09-04 일자). APIYI는 Microsoft 공식 채널을 통해 두 가지 변형 모델을 제공합니다. 두 모델 모두 동일한 엔드포인트와 파라미터를 공유합니다:
  • MAI-Image-2.6: 품질과 정밀도에 최적화된 플래그십 모델입니다
  • MAI-Image-2.6-Flash: 고속 변형 모델입니다. Microsoft에 따르면 GPT-Image-2-Medium보다 2.8배 빠르게 생성되며 높은 처리량이 요구되는 프로덕션 워크로드에 적합합니다
주요 특징: 탁월한 중국어 텍스트 렌더링(간판, 대련, 손글씨가 글자 단위로 정확하게 표현됨), 고정밀 편집(요청한 부분만 변경되고 나머지는 픽셀 단위로 동일하게 유지됨), width + height을 통한 자유로운 캔버스 크기 지정(최대 1536×1536 영역), 크기에 관계없이 이미지당 균일한 가격 책정. 1024×1024 이미지는 Flash에서 약 17초, 2.6에서 약 30초가 소요됩니다.
📌 시작하기 전에 알아두어야 할 세 가지
  1. 두 개의 엔드포인트만 지원됩니다: /v1/images/generations(텍스트 투 이미지, JSON) 및 /v1/images/edits(편집, multipart/form-data). /v1/chat/completions 및 /v1/responses는 지원되지 않으며 404를 반환합니다.
  2. response_format, seed 또는 negative_prompt를 전송하지 마십시오. 세 항목 모두 즉시 400을 반환합니다. 응답은 항상 data[0].b64_json(PNG)입니다.
  3. size가 아닌 width + height로 크기를 설정하십시오. 텍스트 투 이미지 엔드포인트에서는 size이 별도의 오류 없이 무시되며 항상 1024×1024 크기로 생성됩니다.
모든 이미지 API는 동기식입니다. 비동기 작업 ID가 제공되지 않습니다. 클라이언트 연결이 끊어지면 결과가 손실되지만 요청에 대해서는 여전히 과금됩니다. 이 모델에는 넉넉한 타임아웃을 설정하십시오. 이미지 API 핵심 및 모범 사례를 참고하십시오.

텍스트 투 이미지 API

텍스트 prompt로부터 이미지를 생성하며 대화형 Playground를 제공합니다.

이미지 편집 API

참조 이미지와 지시 사항을 업로드하며, 두 이미지의 융합을 지원합니다. Playground가 포함되어 있습니다.

AI 에이전트에게 연동 맡기기

Codex / Claude Code / Cursor 환경에서 개발 중이라면 아래 prompt를 복사하여 입력하십시오. 에이전트가 먼저 이 페이지의 일반 텍스트 버전을 가져온 후(모든 문서 URL 끝에 .md 추가), 사용자의 기술 스택에 맞는 코드를 작성합니다. 여기에는 타임아웃, 400을 반환하는 세 가지 파라미터, size 대신 width/height 사용, 파일 업로드 전용 편집 등 자주 발생하는 함정들이 명시되어 있습니다.

코딩 에이전트를 통해 MAI-Image 2.6 텍스트 투 이미지 및 이미지 편집 기능을 연동하거나 디버깅합니다. Codex, Claude Code, Cursor 등에 복사하여 붙여넣으십시오.

APIYI에서 MAI-Image 2.6을 사용해야 하는 이유

Microsoft 공식 채널

Microsoft 공식 채널을 통해 제공됩니다. Microsoft Foundry의 동일한 모델과 같으며, 표준 /v1/images/generations 및 /v1/images/edits 엔드포인트를 지원하고 OpenAI Images API와 동일한 형태의 응답을 반환합니다.

이미지당 정액 과금

제공업체는 tokens 단위로 과금하므로 이미지가 클수록 비용이 더 많이 발생합니다. APIYI는 크기에 관계없이 이미지당 동일한 가격을 청구합니다. 768×768과 1536×1536의 가격이 동일하므로 이미지 단위로 예산을 산정할 수 있습니다.

어디서나 접근 가능

Azure 계정이나 해외 서버가 필요하지 않습니다. 데이터 센터, 홈 네트워크, 해외 노드 어디에서나 api.apiyi.com에 직접 연결할 수 있으며, 하나의 키로 모든 모델을 사용할 수 있습니다.

다양한 모델 라인업

GPT-Image-2, Nano Banana 2, Seedream, FLUX와 결합하여 다양한 사용 사례에 맞게 활용할 수 있습니다.

주요 기능

중국어 텍스트 렌더링

중국어 상점 간판, 대련, 칠판 손글씨가 글자 단위로 정확하게 표현됩니다. 포스터, 제품 이미지, 굿즈 제작에 적합합니다.

고정밀 편집

“주전자를 코발트 블루로 변경해 줘”라고 하면 주전자만 변경되며, 치수 라벨 및 기타 개체는 픽셀 단위로 동일하게 유지됩니다.

사용자 지정 캔버스

긴 변 기준 최대 3072(예: 3072×768 배너) 및 1536×1536 면적 제한 내에서 어떤 width + height 조합이든 지원합니다.

두 가지 속도 등급

1024×1024 크기 기준 Flash에서는 약 17초, 2.6에서는 약 30초가 소요되며, 10개의 동시 요청에서도 지연 시간이 안정적으로 유지됩니다.

샘플 결과

중국어 텍스트 렌더링(MAI-Image-2.6-Flash, APIYI 방문을 환영하는 중국어 간판을 요청한 prompt): 간판, 등불, 대련, 칠판 모두 가독성 높은 중국어를 보여줍니다.
MAI-Image-2.6-Flash 중국어 텍스트 렌더링: 중국어 환영 간판이 있는 전통 찻집
참조 이미지 편집(MAI-Image-2.6-Flash, “주전자를 짙은 코발트 블루 유약 색상으로 변경하고 나머지는 모두 동일하게 유지해 줘”라는 지시): 왼쪽이 원본, 오른쪽이 결과입니다. 주전자의 색상만 변경되며 치수 라벨 및 기타 개체는 그대로 유지됩니다.
MAI-Image-2.6-Flash 편집 예시: 크림색에서 코발트 블루로 색상이 변경된 주전자, 그 외 모든 것은 변경 없음

요금

모델 가격은 변동될 수 있으며 위 표는 참고용입니다. 상단 네비게이션의 모델 요금 탭의 내용이 기준이 됩니다: 모델 요금.
과금 유의사항
  • 크기와 상관없이 이미지당 과금: 768×768과 1536×1536의 비용은 동일하며, prompt 길이는 가격에 영향을 미치지 않습니다.
  • 편집 비용은 텍스트-이미지 생성과 동일: 단일 이미지 편집 및 2장 이미지 합성은 각각 이미지 1장으로 과금되며, 편집 엔드포인트의 n=2는 이미지 2장으로 과금됩니다.
  • 400 오류로 실패한 요청(검열 또는 잘못된 매개변수)은 이미지를 생성하지 않습니다.
  • 응답 내 usage 필드로 정산 대조를 하지 마십시오: prompt_tokens는 항상 이미지 수 × 1000으로 설정되는 플레이스홀더 값입니다. 콘솔의 과금 내역이 기준이 됩니다.
  • 충전 보너스 프로모션과 중복 적용됩니다.

그룹 및 Tokens

이 시리즈는 Default 그룹에 속해 있습니다. 새로 생성된 모든 token으로 호출할 수 있으며, 별도의 신청은 필요하지 않습니다.
Token 과금 모드: 이 시리즈에는 Pay-as-you-go Priority 및 Per-request가 모두 지원됩니다. 동일한 token으로 플랫폼의 token 과금 모델도 함께 사용할 수 있도록 Pay-as-you-go Priority를 권장합니다.요청 속도: 단일 키는 50 RPM 이하로 유지해 주십시오. 대규모 배치 작업의 경우 사전에 지원팀에 문의해 주시기 바랍니다.

기술 사양

엔드포인트

❌ Chat 엔드포인트는 지원되지 않습니다이 시리즈에서 /v1/chat/completions 및 /v1/responses은 **404 Requested path is not found**을 반환합니다. Cherry Studio 및 LobeChat과 같은 Chat 클라이언트는 목록에 있는 모든 모델에 chat 요청을 보내므로, 해당 클라이언트에서는 MAI-Image를 선택하지 마십시오. Images API를 지원하는 도구를 사용하거나 자체 코드에서 직접 호출하십시오.
✅ 편집 엔드포인트는 multipart 파일 업로드만 지원합니다/v1/images/edits에 JSON(URL, data URI 또는 원시 base64 형태의 image 포함)을 전송하면 400이 반환됩니다:
-F "[email protected]"을(를) 사용하여 로컬 파일을 직접 업로드하십시오. 이미지 호스팅은 필요하지 않습니다. 전체 예제는 이미지 편집 API를 참조하십시오.
기본 도메인은 https://api.apiyi.com이며, 백업 도메인은 https://b.apiyi.com입니다.

주요 파라미터

width 및 height (출력 크기)

일반적인 캔버스 크기(모두 면적 상한 이내):
size은(는) 두 엔드포인트에서 다르게 작동합니다: 텍스트-이미지 생성에서는 경고 없이 무시되며(항상 1024×1024), 편집 엔드포인트에서는 정상 적용됩니다. 혼란을 피하려면 두 엔드포인트 모두에서 width + height을(를) 사용하십시오.

n (이미지 수)

  • 텍스트-이미지 생성: n은(는) 적용되지 않습니다. 2, 4 또는 10을 전송해도 1개의 이미지만 반환됩니다(과금도 1건). 더 많은 이미지가 필요한 경우 병렬 요청을 전송하십시오.
  • 편집: n이(가) 정상 작동합니다. n=2은(는) 2개의 이미지를 반환하며, 2건으로 과금됩니다.

모범 사례

1

사용 사례별 모델 변형 선택

일괄 생성이나 지연 시간에 민감한 작업 → MAI-Image-2.6-Flash. 메인 포스터, 복잡한 구도 또는 높은 품질 기준이 필요한 작업 → MAI-Image-2.6. 매개변수가 동일하므로 모델 이름만 변경하여 전환할 수 있습니다.
2

렌더링할 텍스트에 따옴표 사용

이미지에 표시되어야 하는 텍스트는 따옴표로 묶고 표시될 위치를 명시하십시오(예: “Grand Opening”이라고 적힌 표지판). 모델은 따옴표로 묶인 텍스트를 매우 충실하게 재현합니다.
3

편집 시 ‘다른 모든 것은 그대로 유지’ 명시

원본을 가능한 한 유지하려면 “Make the teapot cobalt blue, keep everything else exactly the same(찻주전자를 코발트 블루로 변경하고, 다른 모든 것은 완전히 동일하게 유지해 줘)”과 같이 지시사항을 작성하십시오.
4

캔버스 변경 시 이미지 재구성

원본과 가로세로 비율이 다른 width / height을 전달하면 모델은 자르거나 패딩하는 대신 장면을 재배치합니다. 로컬 편집의 경우 크기를 생략하면 출력이 16의 배수로 맞춰진 원본 비율을 따릅니다(예: 1344×756 입력 → 1360×768 출력).
5

여러 장의 이미지가 필요한 경우 병렬 요청 전송

Text-to-image는 호출당 하나의 이미지를 반환하므로, 4장의 이미지가 필요하다면 병렬 요청 4개를 전송하십시오. 자체 테스트 결과, 동시 실행 수 10개에서도 지연 시간은 단일 요청과 동일했습니다.

오류 코드 및 재시도

클라이언트 권고사항: 위의 4xx / 500 오류는 확정적으로 발생하므로 재시도하는 것은 무의미하며, 대신 알림을 설정하십시오. 네트워크 타임아웃과 429의 경우에만 지수 백오프를 적용하여 최대 3회까지 재시도할 가치가 있습니다. 클라이언트 타임아웃으로 중단된 요청에도 여전히 과금된다는 점에 유의하시고, 먼저 타임아웃 시간을 늘리십시오.

자주 묻는 질문 (FAQ)

이 시리즈는 b64_json만 반환하며 response_format 파라미터를 허용하지 않습니다. "b64_json"을 전달해도 400 Invalid parameters: response_format이 반환됩니다.gpt-image / DALL·E에서 마이그레이션한 코드에서는 이를 명시적으로 설정하는 경우가 많습니다. 해당 파라미터를 제거하십시오. 이미지는 그대로 data[0].b64_json에 포함되어 반환됩니다. seed 및 negative_prompt도 마찬가지입니다.
텍스트 투 이미지 엔드포인트는 size을 읽지 않습니다. 이를 무시하고 기본값인 1024×1024로 렌더링합니다. 대신 "width": 1536, "height": 1024을 사용하십시오.편집 엔드포인트에서는 size이 작동하지만, 일관성을 위해 두 엔드포인트 모두에서 width + height을 사용하는 것이 좋습니다.
불가능합니다. 편집 엔드포인트는 multipart/form-data 파일 업로드만 허용합니다. image에 URL, data URI 또는 base64 문자열을 전달하면 400 오류가 반환됩니다.URL만 있는 경우, 먼저 서버에서 이미지를 다운로드한 후 업로드하십시오:
두 번째 이미지의 필드명을 **image2**로 지정하십시오:
OpenAI SDK의 client.images.edit(image=[f1, f2])은 두 파일을 모두 image[]로 전송합니다. 이 시리즈는 중복된 파일 필드를 허용하지 않아 400 오류를 반환합니다. SDK를 통한 단일 이미지 편집은 정상적으로 작동합니다.
지원되지 않습니다. mask 필드를 전달하면 400 오류가 반환됩니다. 특정 영역을 수정하려면 prompt에 해당 영역을 설명하십시오(예: “Only make the teapot blue, keep everything else exactly the same”). 테스트 결과 모델은 이러한 제약 조건을 매우 잘 따릅니다.
권장하지 않습니다. 해당 채팅 클라이언트는 /v1/chat/completions을 사용하므로 이 시리즈에서는 404 오류가 반환됩니다. OpenAI Images API를 지원하는 도구를 사용하거나, 본 문서의 코드 예제를 통해 직접 호출하십시오.
텍스트 투 이미지는 항상 1장만 반환합니다. 어떤 n을 전달하든 1장의 이미지만 수신되며 1장에 대해서만 비용이 청구됩니다. 더 많은 이미지가 필요한 경우 병렬 요청을 전송하십시오.편집 엔드포인트에서는 n가 작동합니다. n=2은 2장의 이미지를 반환하며 2장으로 과금됩니다.
불가능합니다. usage.prompt_tokens은 항상 1000 × 이미지 수이고 output_tokens는 항상 0이며, 이는 임시 플레이스홀더 값입니다. 이 시리즈는 이미지당 과금되며, APIYI 콘솔의 청구 내역이 기준이 됩니다.
이 시리즈는 Microsoft의 공식 콘텐츠 안전 정책을 사용하며, 이는 비교적 엄격합니다. 실제 유명인, 유혈/잔혹한 표현(gore), 유명 IP 캐릭터(예: Disney), 누드 등은 차단됩니다.차단 시 400 content_safety_violation이 반환되며 메시지에 구체적인 사유가 포함됩니다. prompt 수준의 차단은 일반적으로 5~8초 이내에 반환되며, 생성 후 적용되는 일부 차단은 일반적인 이미지 생성과 거의 동일한 시간이 소요됩니다. 동일한 prompt로 재시도해도 해결되지 않으므로 prompt를 다시 작성하십시오.
지원되지 않습니다. 일반적인 동기식 요청으로 호출하고 전체 응답을 기다리십시오.
가장 흔한 원인은 모델 이름의 대소문자 오류입니다. 모델 이름은 정확히 MAI-Image-2.6 또는 MAI-Image-2.6-Flash이어야 하며, mai-image-2.6-flash은 503을 반환합니다.

관련 문서