Skip to main content

Обзор

MAI-Image 2.6 — это собственная модель генерации изображений от Microsoft AI, выпущенная 2026-09-04 и доступная в режиме public preview на платформе Microsoft Foundry. На момент запуска она занимала 2-е место как по генерации изображений по тексту (text-to-image), так и по редактированию изображений на Arena, а также 1-е место по редактированию изображений на Artificial Analysis (по состоянию на 2026-09-04, согласно анонсу Microsoft). APIYI предоставляет две версии через официальный канал Microsoft. Обе используют одинаковые эндпоинты и параметры:
  • MAI-Image-2.6: флагманская модель, оптимизированная для высокого качества и точности
  • MAI-Image-2.6-Flash: быстрая версия. По заявлению Microsoft, она генерирует изображения в 2,8 раза быстрее, чем GPT-Image-2-Medium, и подходит для высоконагруженных рабочих процессов в продакшене
Особенности: великолепный рендеринг китайского текста (вывески магазинов, вертикальные парные надписи и рукописный текст отображаются с точностью до иероглифа), высокоточное редактирование (изменяется только запрошенная область; остальная часть сохраняется пиксель-в-пиксель), произвольный холст с помощью width + height (разрешением до 1536×1536) и фиксированная цена за изображение независимо от размера. Генерация изображения 1024×1024 занимает около 17 с на Flash и около 30 с на 2.6.
📌 Три вещи, которые нужно знать перед началом работы
  1. Поддерживаются только два эндпоинта: /v1/images/generations (text-to-image, JSON) и /v1/images/edits (редактирование, multipart/form-data). /v1/chat/completions и /v1/responses не поддерживаются и возвращают ошибку 404.
  2. Не передавайте response_format, seed или negative_prompt. Все три параметра сразу вызовут ошибку 400. Ответ всегда возвращается в формате data[0].b64_json (PNG).
  3. Задавайте размер с помощью width + height, а не size. На эндпоинте text-to-image параметр size игнорируется без предупреждения, и вы всегда получаете 1024×1024.
Все API для работы с изображениями являются синхронными: асинхронный ID задачи отсутствует. При разрыве соединения клиентом результат будет потерян, но запрос всё равно тарифицируется. Установите для этой модели достаточно большой таймаут. См. Основы работы с Image API и рекомендации.

API генерации изображений по тексту

Генерация изображений по текстовому prompt с интерактивным Playground.

API редактирования изображений

Загрузка эталонного изображения с инструкцией; поддерживается объединение двух изображений. Включает Playground.

Доверьте интеграцию ИИ-агенту

Если вы ведете разработку с помощью Codex / Claude Code / Cursor, скопируйте приведенный ниже prompt в агент. Сначала агент загрузит текстовую версию этой страницы (добавьте .md к любому URL документации), а затем напишет код под ваш стек технологий. В нем подробно описаны типичные ошибки: таймауты, три параметра, возвращающие ошибку 400, width/height вместо size, а также редактирование только через загрузку файлов.

Поручите ИИ-агенту для написания кода выполнить интеграцию или отладку генерации текста в изображение и редактирования изображений с помощью MAI-Image 2.6. Скопируйте и вставьте это в Codex, Claude Code, Cursor и т. д.

Почему стоит использовать MAI-Image 2.6 на APIYI

Официальный канал Microsoft

Предоставляется через официальный канал Microsoft. Модель полностью аналогична одноименной модели в Microsoft Foundry. Стандартные эндпоинты /v1/images/generations и /v1/images/edits с форматом ответов, как у OpenAI Images API.

Тарификация за изображение

Провайдер тарифицирует по tokens, поэтому изображения большего размера стоят дороже. APIYI предлагает фиксированную цену за изображение независимо от размера: 768×768 и 1536×1536 стоят одинаково, что позволяет планировать бюджет в расчете на изображение.

Доступ откуда угодно

Не требуется аккаунт Azure или зарубежный сервер. Подключайтесь к api.apiyi.com напрямую из дата-центров, домашних сетей или зарубежных узлов, используя единый ключ для всех моделей.

Полная линейка моделей

Комбинируйте с GPT-Image-2, Nano Banana 2, Seedream и FLUX под различные сценарии использования.

Ключевые возможности

Отрисовка китайского текста

Китайские вывески магазинов, вертикальные парные надписи и рукописный текст на меловой доске получаются точными до иероглифа. Отлично подходит для постеров, изображений товаров и мерча

Высокоточное редактирование

«Сделай чайник кобальтово-синим» меняет только чайник; размерные метки и другие объекты остаются попиксельно идентичными

Пользовательский холст

Любая комбинация width + height с длинной стороной до 3072 (например, баннер 3072×768) и ограничением площади до 1536×1536

Два уровня скорости

Генерация 1024×1024 занимает около 17 с на Flash и около 30 с на 2.6; задержка остается стабильной при 10 параллельных запросах

Примеры результатов

Отрисовка китайского текста (MAI-Image-2.6-Flash, prompt запрашивал китайскую вывеску, приветствующую посетителей APIYI): вывеска, фонари, вертикальные парные надписи и меловая доска содержат четкий и разборчивый китайский текст.
Отрисовка китайского текста в MAI-Image-2.6-Flash: традиционная чайная с приветственной вывеской на китайском языке
Редактирование по изображению-референсу (MAI-Image-2.6-Flash, инструкция «Замени глазурь чайника на глубокий кобальтово-синий, всё остальное оставь без изменений»): оригинал слева, результат справа. Цвет меняет только чайник; размерные метки и остальные объекты остаются нетронутыми.
Пример редактирования в MAI-Image-2.6-Flash: цвет чайника изменен с кремового на кобальтово-синий, всё остальное без изменений

Тарифы

Цены на модели могут меняться; таблица выше носит исключительно справочный характер, а актуальные данные всегда указаны на вкладке Цены на модели в верхней навигации: Цены на модели.
Примечания по тарификации
  • За изображение, независимо от размера: 768×768 и 1536×1536 стоят одинаково, а длина prompt не влияет на цену.
  • Редактирование стоит столько же, сколько генерация по тексту: редактирование одного изображения и совмещение двух изображений тарифицируются как одно изображение каждое; n=2 на эндпоинте редактирования тарифицируется как 2 изображения.
  • Запросы, завершившиеся ошибкой 400 (модерация или неверные параметры), не создают изображение.
  • Не сверяйте с полем usage в ответе: prompt_tokens всегда равно 1000 × количество изображений и является плейсхолдером. Окончательными данными считаются начисления в консоли.
  • Суммируется с акцией бонусных начислений при пополнении.

Группы и tokens

Эта серия входит в группу Default. Её может вызывать любой вновь созданный token; подавать заявку не требуется.
Режим тарификации token: для этой серии подходят как Pay-as-you-go Priority, так и Per-request. Мы рекомендуем Pay-as-you-go Priority, чтобы один и тот же token работал и с моделями платформы, тарифицируемыми по tokens.Частота запросов: держите нагрузку на один ключ в пределах 50 RPM. При больших пакетных нагрузках заранее обратитесь в службу поддержки.

Технические характеристики

Эндпоинты

❌ Чат-эндпоинты не поддерживаются/v1/chat/completions и /v1/responses возвращают 404 Requested path is not found для этой серии. Чат-клиенты, такие как Cherry Studio и LobeChat, отправляют чат-запросы ко всем моделям из списка, поэтому не выбирайте MAI-Image в этих клиентах. Используйте инструмент с поддержкой Images API или вызывайте его из собственного кода.
✅ Эндпоинт редактирования принимает только загрузку файлов через multipartОтправка JSON (с image в виде URL, data URI или необработанного base64) на /v1/images/edits возвращает 400:
Загружайте локальный файл напрямую с помощью -F "[email protected]". Хостинг изображений не требуется. Полные примеры см. в разделе API редактирования изображений.
Основной домен — https://api.apiyi.com, резервный домен — https://b.apiyi.com.

Ключевые параметры

width и height (размер вывода)

Распространенные размеры холста (все в пределах ограничения площади):
size ведет себя по-разному на двух эндпоинтах: в text-to-image он молча игнорируется (всегда 1024×1024), тогда как на эндпоинте редактирования он применяется. Чтобы избежать путаницы, используйте width + height на обоих эндпоинтах.

n (количество изображений)

  • Text-to-image: n не действует. Передача 2, 4 или 10 по-прежнему возвращает 1 изображение (и тарифицируется как 1). Для получения большего количества отправляйте параллельные запросы.
  • Редактирование: n работает. n=2 возвращает 2 изображения, которые тарифицируются как 2.

Рекомендации

1

Выбирайте вариант под конкретную задачу

Пакетная генерация или чувствительные к задержке задачи → MAI-Image-2.6-Flash. Главные постеры, сложные композиции или строгие требования к качеству → MAI-Image-2.6. Параметры идентичны, поэтому переключение требует лишь изменения имени модели.
2

Заключайте в кавычки текст, который нужно отобразить

Поместите любой текст, который должен появиться на изображении, в кавычки и укажите, где он должен располагаться, например вывеска с надписью «Grand Opening». Модель очень точно воспроизводит текст в кавычках.
3

Указывайте «оставьте всё остальное без изменений» при редактировании

Формулируйте инструкции наподобие «Сделай чайник кобальтово-синим, всё остальное оставь точно таким же», чтобы сохранить как можно больше деталей оригинала.
4

Изменение холста меняет композицию изображения

Если вы передадите width / height с соотношением сторон, отличным от оригинала, модель перестраивает композицию сцены, а не обрезает её и не добавляет поля. Для точечного редактирования не указывайте размер: тогда соотношение сторон результата будет соответствовать оригиналу с округлением до кратных 16 (например, входное изображение 1344×756 → результат 1360×768).
5

Нужно несколько изображений? Отправляйте параллельные запросы

Генерация «текст в изображение» возвращает одно изображение за вызов, поэтому для 4 изображений отправьте 4 параллельных запроса. В наших тестах при 10 параллельных запросах задержка соответствовала одиночным запросам.

Коды ошибок и повторные попытки

Рекомендации для клиента: приведенные выше ошибки 4xx / 500 детерминированы, поэтому повторять запросы бессмысленно; вместо этого настройте оповещения об их возникновении. Повторные запросы имеют смысл только при сетевых таймаутах и 429 — с экспоненциальной задержкой и не более чем 3 попытками. Имейте в виду, что запросы, сброшенные по таймауту на стороне клиента, все равно тарифицируются, поэтому сначала увеличьте значение таймаута.

Часто задаваемые вопросы

Эта серия возвращает только b64_json и не принимает параметр response_format. Даже "b64_json" возвращает 400 Invalid parameters: response_format.В коде, перенесённом с gpt-image / DALL·E, он часто задаётся явно. Удалите его; изображение по-прежнему будет в data[0].b64_json. То же самое относится к seed и negative_prompt.
Эндпоинт генерации изображений по тексту (text-to-image) не считывает size. Он просто игнорирует его и генерирует размер по умолчанию 1024×1024. Используйте вместо этого "width": 1536, "height": 1024.На эндпоинте редактирования size работает, но для единообразия рекомендуется использовать width + height в обоих случаях.
Нет. Эндпоинт редактирования принимает только загрузку файлов через multipart/form-data. Передача URL, data URI или строки base64 в качестве image вернёт ошибку 400.Если у вас есть только URL, сначала скачайте файл на свой сервер, а затем загрузите его:
Назовите поле второго изображения image2:
Метод client.images.edit(image=[f1, f2]) из OpenAI SDK отправляет оба файла как image[]. Эта серия не принимает повторяющиеся поля файлов и возвращает ошибку 400. Редактирование одиночного изображения с помощью SDK работает корректно.
Нет. Поле mask вернёт ошибку 400. Для локальных правок опишите нужную область в prompt, например: «Только сделай чайник синим, всё остальное оставь точно таким же». По результатам наших тестов модель точно следует подобным ограничениям.
Не рекомендуется. Эти чат-клиенты используют /v1/chat/completions, который возвращает 404 для этой серии. Используйте инструмент с поддержкой OpenAI Images API или вызывайте его напрямую с помощью примеров кода из этой документации.
Генерация изображений по тексту всегда возвращает 1. Какое бы значение n вы ни передали, вы получите и оплатите 1 изображение. Для получения большего количества отправляйте параллельные запросы.На эндпоинте редактирования n работает: n=2 возвращает 2 изображения и тарифицируется как 2.
Нет. usage.prompt_tokens всегда равно 1000 × количество изображений, а output_tokens всегда равно 0; это плейсхолдеры. Эта серия тарифицируется поштучно за изображение, а данные в консоли APIYI являются определяющими.
В этой серии используется официальная политика безопасности контента Microsoft, которая достаточно строгая: реальные знаменитости, жестокость (gore), известные персонажи с авторскими правами (например, Disney) и нагота блокируются.При блокировке возвращается 400 content_safety_violation с указанием конкретной причины в сообщении. Блокировки на уровне prompt обычно возвращаются в течение 5–8 с; некоторые применяются уже после генерации и занимают примерно столько же времени, сколько создание обычного изображения. Повторный запрос с тем же prompt не поможет — перефразируйте его.
Нет. Вызывайте его как обычный синхронный запрос и ожидайте полного ответа.
Наиболее частая причина — неправильный регистр имени модели. Имя должно быть строго MAI-Image-2.6 или MAI-Image-2.6-Flash; mai-image-2.6-flash возвращает 503.

Связанные документы