Skip to main content
あなたが望む画像を手に入れる方法 は、「この1回の試行は失敗した、どうやって立て直す?」に答えます。このページは次の問いに答えます: どうすれば毎回うまく決められるのか よくある疑問があります。freepik.comhiggsfield.ai のようなコンシューマー向け画像製品は、あなたが使っているのと同じ基盤モデル、つまり同じ Nano Banana、GPT-Image、FLUX 系列で動いています。それでも、出力はより完成度が高く見えます。その差はモデルの重みにあるのではありません。モデルの周りに重ねられたレイヤーにあります。そして、そのレイヤーは自分で構築できます。このページでその方法を示します。

1. モデルの周辺を取り巻く消費者向け画像プロダクト

こうしたプロダクトを1つ分解すると、モデルの外側におよそ8層あります。そのどれもが API で再現可能です。
競合の機能一覧をそのまま写す前に、整理しておくべきプラットフォーム上の2つの制約:
  1. APIYI にはアップスケーリング、背景削除、顔復元のエンドポイントがありません。 大きな画像が必要なら、後から拡大する前提ではなく、生成時点で高解像度ティアを選んでください(gpt-image-2 は 4K、Nano Banana Pro は 4K)。透過背景が必要な場合、PNG をアルファチャンネル付きで返すようプロンプトできるのは seedream-5-0seedream-5-0-pro だけです。
  2. APIYI は LoRA やアイデンティティ学習を提供していません。 Soul ID の背後にある「一度学習したら顔を永久に固定する」機能は、参照画像で近似するしかありません。つまり、同じキャラクターでもシーンや照明の変化でずれ続けますし、新しいショットが正面寄りで元の照明に近いほど最も安定します。厳密な一貫性が求められる商用キャラクターでは、人手レビューの工程を予算に組み込んでください。

2. カジュアルな入力を構造に変えれば、最初のレイヤーだけで結果が分かれます

これは最もレバレッジの高いレイヤーであり、最も見落とされがちなレイヤーです。

並べて比較するテスト: 1つのモデル、1つのブリーフ、2つのプロンプト

ブリーフは「コーヒーの e コマース商品写真」です。左はユーザーが実際に入力する内容、右は不足していた決定を埋め込んだ同じブリーフです。どちらも gemini-3-pro-image(Nano Banana Pro)で 2K1:1 に 1 回ずつ実行しました:
カジュアルなプロンプトから生成されたコーヒー画像: 木製テーブル、グラインダー、麻袋、その他の要求していない小物、温かみのあるノスタルジックなグレーディング、そしてカップに印字された架空のブランド名

Casual prompt: 'Make me a coffee product shot, make it look nice, make it feel premium'

構造化されたプロンプトから生成されたコーヒー画像: 明るいグレーのマイクロセメント面に置かれたマットブラックのセラミックカップ、すっきりとぼけた背景、明確な光の方向、十分なネガティブスペース

Structured prompt: subject, environment, light position, lens, grading, imperfections and composition all specified

左の画像は悪くはありませんが、使えません。モデルは、誰も指示していない決定を山ほど勝手に行いました。グラインダーと麻袋を追加し、ノスタルジックで温かいグレーディングにし、カップに架空のブランド名を印字しました。こうした自動生成テキストは、商用ではフレームを無価値にします。右の画像は、そのまま商品ページに載せられます。ニュートラルな背景、口頭で説明できるレベルのライティング、そしてコピーを載せる余白があります。 「見栄えがよい」と「使える」は別の目標です。 カジュアルなプロンプトで到達できるのは前者だけです。

リライト層が補うべき6つの要素

リライトは、プロンプトを長くすることではありません。不足している決定を埋めることです。画像プロンプトには、6つの土台となる要素があります。
解像度は7つ目の要素ではありません。 出力解像度は size / imageSize のようなパラメータからのみ決まり、プロンプトに「4K」や「8K」と書いても 1 ピクセルも増えません。画像圧縮と出力解像度 を参照してください。

コードにおけるリライト層

ここでは、安価で高速なテキストモデルで十分です。コストは生成に比べれば無視できるほどです:
「8K, ultra HD, masterpiece, perfect」を禁止するルールに注目してください。理由はセクション 4 で説明します。

3. 実際にリリースできるパイプライン

残りの4層を書き換え層につなげれば、全体がそろいます:
1

書き換え: カジュアルな入力を構造化された prompt に

2節を参照してください。このステップでは、途中でユーザー入力の機微な内容も無害化するため、下流でリクエストがブロックされる頻度が実際に下がります。
2

アンカー: 参照画像とスタイル定数

スタイルは2つの要素で固定されます: すべての prompt に追加されるスタイル定数(あなたのプリセット)と、固定された参照画像セットです。参照画像の上限はファミリーごとに大きく異なります — パイプラインを設計する前に、自分のものを確認してください:守るべきルールは2つあります: prompt 内の 「image 1 / image 2」 は配列順に厳密に対応する ため、どちらがどれかを明示してください。また、Grok が参照画像を認識するのは /v1/images/edits のみ です — それを /v1/images/generations に渡すと黙って破棄され、それでも課金されます。
3

サンプル: N を並列生成し、n に頼らない

消費者向け製品の「最初の一発で当たった」感じは、実際には製品があなたの代わりに複数のカードを引いているだけです。しかし、サーバー側の n パラメータは大半の画像モデルでは効果がありません(Seedream はこれを完全に無視します)。複数の候補を得るには、クライアントから複数のリクエストを並行して送ってください — このサイトの skill ページでは同時に5件までに制限されています。チャネルごとに同時実行数を調整してください。中には2件で 429 を返し始めるものもあるので、指数バックオフを追加してください。
4

選択: ジャッジとしてビジョンモデルを使う

N 個の候補ができたら、自動で選択しなければなりません。さもないと、単に選択をユーザーに押し付けただけになります。候補を標準の /v1/chat/completions 画像入力でビジョンモデルに戻して採点させます。対象モデルについては ビジョン理解 を参照してください。評価基準は5項目に固定し、JSON で返すように求めます: 指示への準拠、構造と人体構造、テキストの正確さ、テクスチャのリアリティ、構図。
これに /v1/rerank は使わないでください。bge-reranker-v2-m3テキスト専用 の再ランキングモデルで、画像は受け付けません。画像の採点にはビジョン理解モデルが必要です。
5

レタッチして仕上げる

構図が固まってから局所的に調整します — 1つの複合指示にまとめるより、成功率がはるかに高いです:
  • ピクセル単位の局所リペイント: マスクに対応しているのは 公式リレーの gpt-image-2 のみです。マスク補完ガイド を参照してください。
  • 複数ターンの累積編集: Nano Banana モデルの ネイティブ Gemini エンドポイント でサポートされています(前の画像を role: "model" として再投入します);逆アセンブルしたルートではサポートされません。
  • すぐに再ホストする: 返される URL はすべて一時的です(FLUX は約10分で CORS なし、Seedream と R2 は約24時間)ので、取得したらすぐに自分のオブジェクトストレージへダウンロードしてください。

最小限のエンドツーエンド実装

4. AIっぽさを取り除く

「AIっぽさ」は謎ではありません。それは1つずつ取り除ける具体的な特徴の集合です。

並べて比較するテスト

同じモデル(gemini-3-pro-image)、同じ被写体、2つのpromptスタイル、各2枚の画像、各バッチの最初の1枚:
素のpromptからのポートレート: 被写体は中央に配置されカメラを正面に向いており、光の方向が判別できない均一な照明、整った背景、ありふれたストック写真のような見た目

Bare prompt: 'A photorealistic half-body portrait of a young woman by a cafe window, smiling at the camera, 8K, ultra HD, ultra detailed, flawless skin, beautiful, perfect lighting, masterpiece'

制御されたpromptからのポートレート: 1方向からの窓光、顔の半分は影になり、毛穴と産毛が見え、頬に小さなほくろがあり、髪の毛が少し乱れ、フィルム調のグレーディング、被写体は中央より右に配置

The same subject after adding four blocks of control language: light position, lens, medium, imperfections

左の画像は悪くありません。ベースモデルが十分強力なので、素のpromptでも見栄えの良い画像が出てきます。しかし、そこには特徴がすべて揃っています。被写体はど真ん中に固定され、光はどこから来ているのか分からないほど均一で、すべての要素が無難です。そして、これは偶然ではありません。そのバッチの2枚は、実質的に同じ構図と照明パターンを共有していました。 右の画像はアプローチを変えています。光に方向があり、顔の半分は影に落ち、肌には脂っぽさと毛穴が見え、頬にはほくろがあり、飛び出した髪はとかされておらず、被写体は中央より右に置かれています。これは「カフェでほほえむ女性のストック画像」ではなく、特定の人物を特定の瞬間に撮影したものとして読めます。
ここでも、パイプラインの本当の価値が見えてきます。見栄えの悪い出力をきれいな出力に変えるのではなく、「たまたま良かった」を「指定し、説明し、再現できる良さ」に変えるのです。ステークホルダーは右の画像を好まないかもしれませんが、左の画像については、なぜそのように見えるのかを説明できず、次の画像にそれを合わせるよう依頼することもできません。

AIっぽさの症状、修正、そして書くべきでないもの

8Kultra HDultra detailedmasterpieceperfectのような曖昧な品質語は、逆効果です。 それらは解像度を上げず(それを担うのはパラメータだけです)、モデルを過度にシャープ化された、彩度過多のレンダーへと誘導します。まさにそれがAIっぽさの核心です。上の左側のpromptはそれらで埋め尽くされており、その結果がそれを示しています。品質が欲しいなら、その代わりに具体的な光、レンズ、媒体を書いてください。

コピペ用制御語句の4つのブロック

必要に応じて prompt に組み込んでください。各ブロックから 1、2 行ずつ使うだけで、通常は十分です:

ライト

左からの窓光だけがフレーム内の唯一の光源 / 午後3時の強い背面側光 / 逆光で、髪にリムライト / フレーム内の実用光としてのデスクランプ / 明確な影のない曇天の拡散光

レンズ

35mm f/2.0、自然なスナップ、目線の高さ / 85mm f/2.8、近い方の目にピント / 低いカメラ位置からの24mm、わずかな周辺歪み / 空間を圧縮する望遠レンズ、平坦化された背景レイヤー / 角に軽いビネット

メディア

Kodak Portra 400 らしい質感、きめ細かな粒状感 / 温かいハイライト、冷たいシャドウ / Polaroid のインスタントフィルム、低コントラスト、柔らかなエッジ / 初期のCCDデジタルカメラのノイズと色かぶり / 全体的に低彩度、シャープ化なし

不完全さ

自然な肌の質感、見える毛穴と産毛 / 少し乱れた髪の毛束、とかしていない / 毛玉のあるセーター、擦り切れた袖口 / テーブルの水跡、指紋、パンくず / 中央から外れた構図、被写体の一部が端で切れている

3つの完全な例

自然な上半身ポートレート: カフェの窓際にいる20代半ばの女性が横を向いて外を見ており、思わずこぼれそうな笑みを浮かべています。左からの窓光だけがフレーム内の唯一の光源で、顔の右半分は影に落ち、鼻筋の下には輪郭のはっきりした小さな影があります。85mmレンズ、f/2.8、目線の高さ、手前の目にピント。細かな粒状感が見える Kodak Portra 400 らしい質感で、ハイライトは暖かく、シャドウは冷たく、全体として低彩度です。自然な肌: 毛穴と産毛が見え、鼻の側面に少しツヤがあり、左頬に小さなほくろ、眉毛に数本のはみ出した毛、額にはとかれていない髪の毛束があります。肌のスムージングなし、美肌レタッチなし、シャープ化なし。被写体は画面中央やや右、左側にネガティブスペース。
Eコマース向けのヒーローショット: マットブラックのセラミック製ポアオーバーカップにブラックコーヒーが80%まで注がれており、表面には細いクレマの輪があります。薄いグレーのマイクロセメント面の上に置かれ、背後には同じトーンの壁がぼけています。左上45度のソフトボックスからのキーライト、右側の白いレフ板がカップ右端に細いハイライトを残し、柔らかな落ち影が右後方に落ちます。85mmマクロレンズ、f/5.6、正面から15度下向きに傾けた構図で、カップ全体にピントが合っています。クールなニュートラルホワイトバランスで、全体的に低彩度です。釉薬には手作りらしいわずかなムラと、ごく小さな窯跡があり、縁にはかすかな使用感があります。たっぷりとしたネガティブスペースを取り、カップはフレーム左1/3に配置します。画像内のどこにもブランド名や文字は入れません。
夕方6時の旧市街の細い通りで、雨上がり直後、両側の店のライトボックスを映す水たまりがあります。唯一のキーライトは通りの先にある暖かな街灯で、店先のショーウィンドウが補助光になり、空にはまだ冷たい夕暮れの気配が残っていて、暖色と寒色のコントラストを作ります。28mmレンズ、f/4、カメラは目線の高さで、やや上向きに傾けます。全体的に低彩度で、影にはノイズを残し、シャドーの持ち上げはしません。壁には水染み、破れた古いポスター、エアコンユニットがあり、画面上部を電線が横切ります。誰もカメラの方を向いていません。通行人は背中越しに見え、わずかにモーションブラーがかかっています。

5. パイプライン設計を変える事実

これらを事前に把握しておくと、やり直しを減らせます。

6. パイプラインが価値を持つのはいつか:コスト計算

パイプラインは、成功率のためにお金を使う仕組みです。コストの大半は output が占めます(gpt-image-2 は output を 100万 token あたり $30 で課金します)。一方、書き換えやスコアリングに使うテキストおよびビジョンモデルのコストは、ほぼ誤差の範囲です。つまり、コストは実質的に「何件の候補を生成したか」で決まります。 すべてを同じ設定にするのではなく、3 段階を使い分けてください。 判定はシンプルです。この画像をチーム外の誰かが見るか? もしそうなら、Standard 以上で十分に元が取れます。社内でざっと見るだけなら、Draft で十分です。さらに中間のゲートを追加することもできます。つまり、トップスコアがしきい値を下回った場合にだけ候補を増やすようにすれば、ほとんどのリクエストは 2 件で収束します。

要点まとめ

  • ギャップはモデルの重みにはなく、モデルの周辺にある8層、つまりリライト、プリセット、アンカリング、サンプリング、選択、ステップごとの編集、後処理、リホスティングにあります。
  • リライト層のリターンが最も高いです。被写体、環境、光、レンズ、グレーディング、構図を埋めると、「見栄えがよい」が「使える」に変わります。
  • 複数候補+ビジョンモデルによるスコアリングこそが、消費者向け製品の見かけ上の高い成功率の正体です。n は動作しないため、クライアント側でファンアウトしてください。/v1/rerank は画像をスコアリングできません。
  • AIっぽさを消すには、形容詞ではなく具体性を足します。光源を1つ指定し、焦点距離と絞りを与え、媒体と粒状感を明記し、意図的に不完全さを加え、被写体をオフセンターにずらします。
  • 8K / masterpiece / perfect lighting は純粋なマイナスです。追加の解像度はなく、フレームをレンダリングされた見た目へと寄せてしまいます。
  • 再現のために seed に頼らないでください。代わりに完全なリクエストを保存します。画像 API は同期型で、切断時も課金されるため、パイプラインにはキューが必要です。
  • APIYI にはアップスケーリング、背景除去、アイデンティティ学習のエンドポイントはありません。最初からそれらの層を前提に設計してください。

関連ドキュメント

思いどおりの画像を手に入れる方法

1件の失敗した呼び出しを立て直す方法: prompt を書き直す、再試行する、モデルを切り替える、テストツールで切り分ける

画像 API の基本

同期呼び出し、タイムアウト階層、課金、base64 の取り扱い、入力画像の前処理

マスクインペインティングガイド

ピクセル単位のローカル編集、公式リレーの gpt-image-2 専用

マルチ画像融合テスト

参照制限をどのように測定したか、加えて 14枚の画像を融合した結果

ビジョン理解

候補画像のスコア付けに使える Vision モデルと、その呼び出し方

独自の非同期キューを構築する

同期生成をタスクキューでラップし、複数候補パイプラインを支える