Skip to main content
На этой странице вы получаете готовый к использованию Agent Skill: выполните проверку prompt до генерации, заполните недостающие элементы, уберите расплывчатые слова, которые снижают качество, и сгенерируйте результат по переписанной версии. Всё это — два файла с нулевой зависимостью от сторонних пакетов.
Когда изображение разочаровывает, проблема обычно в prompt — не в модели и не в канале. Этот skill превращает «слой переписывания» из Продвинутой генерации изображений в нечто, что можно встроить в любой coding agent.

Что делает навык

Диагностика перед генерацией

По отдельности оценивает объект, окружение, свет, объектив, грейдинг и композицию, выставляет рейтинг от 0 до 100, перечисляет риски и возвращает переписанный prompt, готовый к копированию.

Проверка после генерации

Передайте фактическое изображение вместе с исходным prompt, и модель прочитает его обратно, указывая, какое предложение prompt не было выполнено, а также что модель добавила от себя, после чего перепишет текст соответствующим образом.

Советы по целевой модели

С -t оно добавляет примечания, специфичные для этого семейства: ограничения на референсные изображения, поддержку mask и то, как называется параметр разрешения.

Проверки с учётом объекта

Портреты получают проверки кожи и освещения, снимки товаров — проверки фона и запрета на текст, а иллюстрация автоматически снижает вес чек-листа фотореализма.

Полная диагностика от начала до конца

Входные данные — это то, что пользователь действительно ввёл бы, плюс изображение, которое получилось:
Изображение кофе по обычному prompt: деревянный стол, кофемолка, мешок из мешковины и другие реквизиты, с вымышленным названием бренда, напечатанным на чашке

The actual result produced by that casual prompt

Результат диагностики (фрагмент реального запуска):
Если подать этот переписанный prompt обратно в ту же модель (gemini-3-pro-image) без изменений:
Изображение кофе по переписанному prompt: тёпло-белая керамическая чашка для латте на нейтральном светло-сером фоне, чёткое направление света, тень падает назад вправо, нигде нет текста, много свободного пространства

Regenerated from the rewritten prompt: a clean, usable e-commerce hero shot

Все реквизиты исчезли, фон стал управляемым нейтральным серым, у тени появилось направление, вымышленное название бренда не возникло, и осталось место для текста. Модель не изменилась. Изменился только prompt.

Когда запускать диагностику

Не каждый запрос требует проверки. Решайте по тому, насколько конкретно уже сформулирован запрос:
Этот навык только переписывает prompt; он не генерирует изображения. Используйте его вместе с Навыком Nano Banana Pro или Навыком серии GPT-Image-2, чтобы получить полный процесс проверки и последующей генерации.

В каких агентах он работает

По сути, Skill — это просто папка: один файл сообщает агенту, что это такое (SKILL.md), плюс скрипт, который выполняет работу. Поэтому любой coding agent, который умеет читать локальные файлы и выполнять команды, может использовать его — Codex, OpenClaw, hermes-agent, Claude Code и другие.Единственное требование: на машине, где запущен agent, должны быть Python 3 и доступ к сети (скрипт обращается к api.apiyi.com напрямую). Этот skill использует только стандартную библиотеку Python — ничего не нужно устанавливать через pip.

Установка в три шага

1. Создайте папку и поместите файлы

Создайте папку навыка с этими двумя файлами (полное содержимое в двух разделах ниже):
Никакой pip install не требуется.

2. Добавьте свой ключ рядом с ней

Поместите ваш APIYI API-ключ (созданный в консоли api.apiyi.com) в image-prompt-doctor/.env:
Скрипт автоматически считывает ключ из этого .envникакой другой настройки или переменной окружения не требуется.
.env хранит ваш секрет. Если этот навык распространяется через репозиторий проекта, добавьте .env в .gitignore и никогда не включайте его в коммит.

3. Передайте это агенту

  • Агенты с автоматическим обнаружением навыков (например, Claude Code): поместите всю папку image-prompt-doctor/ в их каталог навыков — на уровне пользователя в ~/.claude/skills/ или на уровне проекта в .claude/skills/ (доступно через репозиторий).
  • Любой другой агент: разместите его в соответствии с собственной схемой для навыков/плагинов этого агента; или, проще всего, — просто скажите агенту: «прочитайте SKILL.md в этой папке и следуйте ему.»
Вот и вся установка. Перейдите к как использовать его за примерами.

SKILL.md

Создайте image-prompt-doctor/SKILL.md с полным содержимым ниже (description содержит «что он делает + когда его использовать», и именно это агент использует для автоматического срабатывания):

scripts/prompt_doctor.py

Создайте image-prompt-doctor/scripts/prompt_doctor.py со следующим полным содержимым (только стандартная библиотека Python, ничего устанавливать не нужно):

Переключение модели диагностики

По умолчанию — gpt-5.6-luna: недорогая ($0.2 на вход / $1.2 на выход за миллион tokens) и принимает изображения, что необходимо для режима проверки. Есть два способа сменить её:
На что обратить внимание при переключении: режиму проверки требуется модель, которая принимает изображения (текстовая модель выдаст ошибку при прикрепленном изображении) — см. Понимание изображений со списком. И скрипт отправляет response_format: {"type": "json_object"}, поэтому модель без режима JSON может вместо этого вернуть текст в блоке кода (скрипт на всякий случай удаляет обрамление блока кода, но лучше использовать модель, которая поддерживает режим JSON).

Почему одна фраза запускает диагностику

Распространённый вопрос: я никогда не вводил команду, так почему фраза «draw me an image» заставила сначала проверить prompt? Вот как это работает: при запуске агент читает description в каждом SKILL.md навыка — короткий фрагмент метаданных, который говорит, что делает этот навык и когда он применяется. Когда то, что вы говорите, совпадает с этим описанием («draw me a …», «why did this image come out wrong», «improve this prompt»), агент самостоятельно решает вызвать навык, читает полный SKILL.md и запускает скрипт. Вам не нужно запоминать команду. В SKILL.md также указано, что запрос, который уже достаточно конкретный, не требует такой обработки, поэтому он не будет вмешиваться в каждый prompt. Когда вам нужен полный контроль, используйте явный вызов ниже.

Как использовать

Естественный язык (неявный триггер)

После установки просто обращайтесь к агенту:

Явный вызов (больше контроля)

  • Агенты с slash-командами (например, Claude Code):
  • Любой агент / просто скажите ему запустить скрипт (наиболее универсальный):

Куда попадает диагностика

  • Этот навык не записывает файлы. Результат выводится в терминал, а агент пересылает его вам — оценка, оценки по шести элементам, риски, переписанный prompt, что изменилось и рекомендации по параметрам.
  • Чтобы передать результат в вашу собственную программу, добавьте --json; output — это структурированный объект (score / elements / risks / optimized_prompt / changes / suggested_params), который можно перенаправить в файл:
  • Подтвердите переписанный prompt перед использованием: переписывание может изменить намерение (превратив «кофе» в «латте»), а SKILL.md уже говорит агенту сначала спросить.
  • Изображения, переданные в режим review, никогда не изменяются и не перезаписываются — это входные данные только для чтения.

Стоимость

Одна диагностика стоит несколько тысяч token. По прайс-листу gpt-5.6-luna это доли цента, тогда как одна генерация качества high стоит в десятки раз дороже. Диагностика перед генерацией позволяет сэкономить больше на избежанных повторных попытках, чем она стоит. В режиме Review загружается изображение, и это тарифицируется как input tokens — немного дороже, но всё ещё намного ниже одной генерации.

Связанная документация