Обзор
gpt-image-2 — новейшая флагманская модель генерации изображений OpenAI — пришедшая на сменуgpt-image-1.5. Ключевые улучшения: любое допустимое разрешение (включая 2K / 3840×2160 4K), автоматический high-fidelity при работе с референсными изображениями, на 20-30% дешевле при том же уровне. Шлюз APIYI полностью совместим с OpenAI Images API — укажите сюда base_url официального OpenAI SDK для прямого подключения без кода.
API генерации изображений по тексту
/v1/images/generations — генерируйте изображения из text prompt с контролем размера / качества / output_format.API редактирования изображений
/v1/images/edits — загрузка референсных изображений в формате multipart (до 16) + инструкции по редактированию/смешиванию, с поддержкой mask inpainting.Почему стоит выбрать официальный релей APIYI для GPT-image-2?
Построен на официальном канале OpenAI и глубоко оптимизирован для корпоративных production-нагрузок по направлениям надежности, стоимости и опыта интеграции:Официальный канал · Как у официального
Без ограничений на параллельные запросы
Та же цена + скидка до 15%
Глобальный доступ без барьеров
api.apiyi.com из отечественных дата-центров, домашнего широкополосного интернета или зарубежных узлов — стабильная задержка, без трансграничной перестройки архитектуры.Полная линейка моделей
gpt-image-2-all ($0.03 за изображение, фиксированная цена), или на самый выгодный по стоимости Nano Banana Pro / 2 — комбинируйте варианты под каждый сценарий.Профессиональная корпоративная поддержка
Основные возможности
Любое разрешение (вкл. 4K)
Автоматическая высокая точность
input_fidelity (иначе будет ошибка).На 20-30% дешевле
Китайский + рендеринг текста
high.Слияние нескольких изображений (до 16)
image[] массив принимает до 16 референсных изображений. Используйте «image 1 / image 2 / image 3» в prompt, чтобы сослаться на них по порядку загрузки.Маскирование inpainting
Несколько форматов вывода
output_compression для jpeg/webp, чтобы управлять размером файла.Прямой доступ через OpenAI SDK
base_url на https://api.apiyi.com/v1 и вызывайте напрямую с официальным OpenAI SDK — миграция без кода.Тарифы
APIYI’sgpt-image-2 (группа по умолчанию) полностью совпадает с официальной ценой OpenAI из прайс-листа — скидка вместо этого формируется за счет бонуса за пополнение: пополните $100 и получите бонус 10%, до 20%. 📖 Узнайте о промоакциях за пополнение.
Тарификация по количеству token (как в прайс-листе OpenAI)
Token-metered — один запрос = токены входного текста + входного изображения + выходного изображения:Справка по стоимости за изображение (официальная таблица)
Типичная стоимость за изображение при предустановленных размерах 1K:- Базовые цены совпадают с прайс-листом OpenAI; добавьте бонус за пополнение (10% при $100, до 20%), и ваша эффективная стоимость окажется ниже, чем при прямом обращении
- Для 2K / 4K нет фиксированной цены за изображение — тарификация идет по фактическим input + output tokens
- Запросы на редактирование требуют заметно больше input tokens, чем text-to-image, из-за принудительного high-fidelity
- Потоковая передача (
stream: true+partial_images: N) добавляет по 100 output image tokens за каждый partial - По сравнению с
gpt-image-1.5того же размера и качества,gpt-image-2примерно на 20-30% дешевле
Как несколько входных изображений влияют на цену (проверено в июле 2026)
Частый вопрос от клиентов: «Каждое референсное изображение стоит фиксированную сумму, или большие изображения расходуют больше tokens?» Ответ: важны оба фактора, и количество изображений суммируется строго линейно.gpt-image-2 обрабатывает каждое входное изображение в принудительном режиме высокой детализации (input_fidelity не настраивается — при его передаче возвращается 400), и каждое референсное изображение преобразуется в image tokens в зависимости от его размеров и aspect ratio. Контролируемые измерения (эндпоинт edits, 2026-07-15):
- Количество строго линейно: N референсных изображений ≈ N × tokens одного изображения. 16 референсных изображений при 1024² ≈ 16384 tokens ≈ $0.13 — тот же порядок величины, что и один вывод
high($0.211), так что в случае слияния нескольких изображений этим уже нельзя пренебрегать. - Размер имеет и нижний предел, и потолок: квадратные изображения размером 1024² и меньше тарифицируются как 1024 tokens (уменьшение до 512 ничего не экономит); 2048² и 4096² оба стоят 1521 tokens (слишком большие изображения перед преобразованием уменьшаются — потолок действует). Одно референсное изображение обычно попадает примерно в диапазон 800-1600 tokens с учетом соотношения сторон.
- Tokens определяются размерами в пикселях, а не размером файла: сжатие до 1.5MB помогает со стабильностью и скоростью загрузки, но не уменьшает image tokens; наоборот, загрузка исходника на 50MB тоже не раздует ваш счет (действует потолок).
Оценка стоимости 2K/4K (экстраполяция по соотношению пикселей, ⚠️ не официальная фиксированная цена)
OpenAI публикует только фиксированную таблицу цены за изображение для размеров 1K — для 2K/4K нет официальной помодельной цены по размеру. Приведенная ниже таблица — это собственная экстраполяция APIYI на основе официальных ставок 1K выше, масштабированная по числу пикселей, и она предназначена только для планирования бюджета:Чем это отличается от SaaS-подписки / тарификации на основе credit
Вендоры инструментов генерации изображений обычно тарифицируют по одной из двух схем:- Ежемесячные планы подписки: фиксированная ежемесячная плата за квоту «N изображений в месяц». Эта квота рассчитывается исходя из предположения о сверхпродаже — вендор закладывает ожидание, что большинство пользователей не израсходует весь лимит, поэтому рекламируемая «стоимость за изображение» — это просто цена плана, деленная на верхний предел квоты, а не то, сколько на самом деле стоит сгенерировать для вас одно изображение.
- Учёт на основе credit / point: задачи разного качества и размера переводятся в неочевидные «credits». По сути это тарификация по фактическому использованию, просто переупакованная в единицу credit, которая скрывает реальное потребление token.
Как проверить фактическое количество token для каждого вызова
И/v1/images/generations, и /v1/images/edits возвращают поле usage, а token входного изображения и token входного текста возвращаются как отдельные поля — ничего оценивать не нужно, просто считайте их, чтобы получить точную стоимость каждого вызова. Вот полный объект usage из реального запроса на редактирование с одним референсным изображением (зафиксировано в реальном времени):
Настройка групп
Канал официального релеяgpt-image-2 предлагает две группы. Переключите в панели управления → Настройки token → Группа:
image2Enterprise, чтобы переждать всплеск нагрузки.

Token settings: pick the image2Enterprise group (1.2x) — stable when default capacity is tight
Технические характеристики
Эндпоинты
Справка по размерам
Предустановленные размеры
Ограничения пользовательского размера
gpt-image-2 принимает любой допустимый размер, который соответствует всем условиям:
- Макс. сторона ≤ 3840px
- Обе стороны кратны 16
- Соотношение сторон ≤ 3:1
- Общее число пикселей ∈ [655,360, 8,294,400] (~0.65MP до ~8.3MP)
1600x1200, 1792x1024, 2048x1536, 3200x1800
Недопустимые примеры: 1000x1000 (не кратно 16), 4000x4000 (выше максимума), 3840x1000 (соотношение > 3:1)
Справка по качеству
Доступные уровни
quality сильнее всего влияет на цену — больше, чем size. Количество output image token определяется quality × size, но quality имеет гораздо больший вес: при одном и том же размере переход от low к high может изменить стоимость за изображение более чем в 30× (см. таблицу «стоимость за изображение» выше: для 1024×1024 диапазон от low $0.006 до high $0.211). Сначала оценивайте стоимость по quality, а затем учитывайте влияние size.Лучшие практики
Сначала интегрируйтесь с низким качеством
quality=low + фиксированного размера, чтобы проверить полный цепочку вызовов (auth, params, timeouts, обработка ошибок). low работает в несколько раз быстрее, чем high, поэтому функциональные проблемы быстро проявляются, не маскируясь большой задержкой.Используйте фиксированные размеры
Соотносите качество со сценарием
low; ежедневное / финальное → medium; текст, тонкие текстуры, печать → high. Обратите внимание, что low ↔ high — это не только визуальная точность, но и скачок сложности inference, поэтому задержка растет соответственно.Выбирайте вывод JPEG
output_format=jpeg + output_compression=85 работает быстрее, чем PNG, и занимает примерно вдвое меньше места.Зафиксируйте высокий уровень для текстовых сценариев
quality=high для сценариев с вывесками и постерами.Подготовьте reference images
Разделите тайм-аут клиента по уровням (high → 600s страховочный запас)
quality и size — особенно quality. Настраивайте тайм-ауты клиента по уровням:high установите 600s как страховочный тайм-аут — это позволит учесть очереди, вариативность длинного хвоста и джиттер upstream. Показывайте прогресс в UI; на стороне сервера стоит рассмотреть очередь задач.Примечания по миграции
gpt-image-1.5: уберите input_fidelity (принудительное высокое качество, при передаче вызовет ошибку); не используйте background: transparent (не поддерживается).Ошибки и повторные попытки
- Устанавливайте таймаут запроса по
quality:low≥ 120 seconds /medium≥ 240 seconds /high≥ 600 seconds (страховочная мера — наблюдается 3–5 минут; настройка около 120s/360s приводит к множеству ложных таймаутов) - Сначала интегрируйтесь с
quality=low, затем переходите кmedium/highпо мере реальной необходимости в качестве - Экспоненциальная задержка между повторами для 5xx и таймаутов (рекомендуется 2 повторные попытки)
- Логируйте заголовок
x-request-idдля поддержки
Частые вопросы
Нужно ли добавлять префикс data:image/png;base64, к b64_json?
Нужно ли добавлять префикс data:image/png;base64, к b64_json?
gpt-image-2 возвращает сырую base64-строку (без префикса), в отличие от gpt-image-2-all. Два варианта на стороне клиента:- Запись в файл:
base64.b64decode(b64_str)→ записать на диск - Отображение в браузере:
img.src = 'data:image/png;base64,' + b64_str(добавить префикс вручную)
Почему при передаче input_fidelity возвращается 400?
Почему при передаче input_fidelity возвращается 400?
gpt-image-2 принудительно включает высокоточное обработку референсных изображений и больше не принимает input_fidelity. При миграции с 1.5 просто удалите это поле — замена не нужна.Что делать, если мне нужен прозрачный фон?
Что делать, если мне нужен прозрачный фон?
gpt-image-2 не поддерживает background: transparent (будет ошибка). Два обходных варианта:- Установите
backgroundвopaque(или не указывайте) и выделите прозрачность самостоятельно с помощью PIL / sharp / онлайн-инструментов - Временно вернитесь к
gpt-image-1.5для сценариев, где прозрачность действительно нужна
Сколько изображений можно отправить за один вызов?
Сколько изображений можно отправить за один вызов?
n=1). Для N изображений отправляйте N параллельных запросов. Каждый тарифицируется отдельно по token.Почему 2K/4K такие медленные?
Почему 2K/4K такие медленные?
quality=high + высокое разрешение занимает примерно 235 секунд (~4 минуты) на изображение, а у 3840×2160 + high длинный хвост может растягиваться почти до 5 минут. Рекомендации:- Сначала интегрируйтесь с
quality=low, чтобы проверить цепочку вызова, а затем повышайте уровень по мере реальной необходимости в качестве - Настраивайте тайм-аут клиента по качеству:
low≥ 120s /medium≥ 240s /high≥ 600s (страховочный запас) - Показывайте в UI прогресс «генерация»
- Используйте пресеты 1K 1024×1024 / 1536×1024, когда 4K не нужен
Действительно ли мне даст выгоду тарификация с кэшированием input?
Действительно ли мне даст выгоду тарификация с кэшированием input?
Почему запросы на редактирование дороже, чем text-to-image?
Почему запросы на редактирование дороже, чем text-to-image?
gpt-image-2 автоматически включает высокоточное обработку референсных изображений, а сами референсы по правилам тарификации Vision превращаются в большой объем input tokens. В редактировании input tokens заметно выше, чем в text-to-image, — закладывайте это в бюджет.Одинаковый размер и reference images — почему каждый вызов все равно стоит по-разному?
Одинаковый размер и reference images — почему каждый вызов все равно стоит по-разному?
quality был установлен в auto (или не указан). Нам сообщали о случаях, когда «размер, разрешение и reference images одинаковые, а цена то растет, то падает». При проверке выяснялось, что и size, и quality были установлены в auto.Виновник — quality: auto: в auto mode модель интерпретирует запрос и на лету выбирает другой уровень качества для каждой генерации. Разный уровень означает разное количество output image tokens, а значит и разную цену. Ниже три реальные записи тарификации с одинаковым input (по 1061 input tokens), но стоимостью, отличающейся в несколько раз:auto определился более высокий уровень качества, output tokens выросли до 5146, а цена поднялась примерно в 3.5 раза.Исправление: не оставляйте quality в режиме auto — явно передавайте low / medium / high. При фиксированном уровне число output tokens и цена для одинакового input становятся стабильными и предсказуемыми. См. раздел «Quality Reference» выше.Каковы ограничения по количеству и размеру изображений для edit endpoint?
Каковы ограничения по количеству и размеру изображений для edit endpoint?
gpt-image-2 image edit endpoint (/v1/images/edits) поддерживает до 16 reference images:- multipart/form-data file upload: каждое изображение должно быть меньше 50MB, форматы
png/jpg/webp - base64 data URL: ограничение длины поля составляет примерно 20MiB (schema
maxLength: 20971520— ограничение поля-строки, не то же самое, что предел multipart в 50MB), поэтому держите исходные изображения в пределах 15MB - mask file: отдельно ограничен PNG менее 4MB
Эндпоинт редактирования возвращает 400 'Invalid image file or mode for image 1' — что делать?
Эндпоинт редактирования возвращает 400 'Invalid image file or mode for image 1' — что делать?
code: invalid_image_file) означает: N-е референсное изображение не является стандартным файлом png / jpg / webp (нумерация с 1 — используйте индекс, чтобы найти проблемное изображение).Самая частая причина — формат MPO у фото с телефонов: .jpg, полученные напрямую с телефонов серии Huawei Mate, содержат подкадр HDR gain-map и фактически являются многокадровыми JPEG-контейнерами (MPO). Заголовок тот же FFD8, и расширение, и команда file показывают JPEG — на глаз это невозможно заметить. Проверено в июле 2026: файлы MPO всегда отклоняются, а те же изображения, перекодированные в стандартный JPEG/PNG, успешно проходят на полном исходном разрешении (это не связано с размерами, названием поля image[] или параметрами quality/size). Ошибка возвращается на этапе проверки input и не тарифицируется.Исправление: перекодируйте через Pillow перед загрузкой (если Image.open(f).format возвращает "MPO", требуется преобразование):Как подготовить файл маски?
Как подготовить файл маски?
- Того же размера, что и оригинал, формат PNG, менее 4MB
- Должен иметь alpha channel: прозрачные участки (alpha=0) = область inpaint, непрозрачные = сохранить
- Применяется только к первому изображению
- Маска — это «мягкая подсказка»: модель может расширять или сужать область вокруг замаскированного региона
gpt-image-2 vs gpt-image-2-all: что выбрать?
gpt-image-2 vs gpt-image-2-all: что выбрать?
Могу ли я напрямую использовать официальный OpenAI SDK?
Могу ли я напрямую использовать официальный OpenAI SDK?
base_url на https://api.apiyi.com/v1 и укажите api_key в качестве вашего APIYI token:Можно ли отменить идущую генерацию?
Можно ли отменить идущую генерацию?
gpt-image-2 использует официальный синхронный endpoint OpenAI — после отправки запроса он выполняется до завершения, без сигнала «cancel». Даже если клиент отключится, сервер все равно завершит генерацию и спишет средства обычным образом. Тщательно настраивайте client-side timeouts — не считайте, что «отключение = нет списания».Есть ли лимит запросов (RPM)?
Есть ли лимит запросов (RPM)?
Поддерживается ли асинхронный вызов?
Поддерживается ли асинхронный вызов?
gpt-image-2 строго повторяет официальный API OpenAI — только синхронный режим. Запрос блокируется, пока не будет получен результат (high + 4K в реальности занимает 1–2 минуты). Если вам нужна асинхронная очередь или механизм callback:- Оберните это сами через очередь задач (Celery / BullMQ и т. д.) на уровне бизнес-логики
- Или используйте
gpt-image-2-all— генерирует за 30–60s, удобнее опрашивать с фронтенда
Тарифицируются ли неудачные генерации?
Тарифицируются ли неудачные генерации?
400, и списание не происходит. Типичный ответ:401 (invalid token), 429 (rate limit). Тарификация token начинается только после того, как запрос действительно достигает этапа генерации модели (то есть получены 200 + b64_json).Связанные документы
- ⚖️ Сравнение официального и обратного вариантов - Руководство по выбору бок о бок
- Площадка Text-to-Image -
/v1/images/generationsинтерактивное тестирование - Площадка редактирования изображений -
/v1/images/editsслияние нескольких изображений + mask - Подробный разбор: запуск gpt-image-2 - Новостная статья
- Полная документация по интеграции - Полная справка по API
- GPT-Image-2-All (Reverse-Engineered) - Более дешевая и быстрая альтернатива
- Сообщество: узлы Luck GPT-Image 2 для ComfyUI - Вызывайте
gpt-image-2напрямую в ComfyUI (mask / 5 reference images / custom sizes) - Сообщество: навыки APIYI GPT-Image 2 - Запускайте из Codex CLI / Cursor / Gemini CLI и других ИИ-инструментов для программирования одной фразой
- Руководство по API - Общее руководство по использованию
gpt-image-2 — это официальный флагман OpenAI, тарифицируемый по token. Если для вас важнее фиксированная тарификация ($0.03/image) и более быстрая генерация (30–60s), см. gpt-image-2-all.