🔍 インテリジェントなビジュアル分析
オブジェクト認識、シーン理解、テキスト抽出、感情分析など、さまざまなビジュアルタスクをサポートし、AI が画像を真に「理解」できるようにします。
🌟 コア機能
- 🎯 マルチモデル対応: Gemini 3、GPT-5、Claude 4 シリーズなどのトップクラスのマルチモーダルモデルに対応
- 📸 柔軟な入力: URL リンクと Base64 エンコードされた画像をサポート
- 🌏 中国語最適化: 中国語のシーン理解とテキスト認識に完全対応
- ⚡ 高速応答: 秒単位で結果を返す高性能推論
- 💰 コスト管理: さまざまな予算要件に対応できる複数のモデル विकल्प
📋 対応するVisionモデル
以下は、現在の主要なマルチモーダル推奨モデルです。モデルIDは新しいリリースで変更される場合があります — 常にコンソールを優先してください。現在、多くのチャットモデルがマルチモーダルの画像入力をサポートしています: 上の表は一般的な推奨モデルを示しているもので、全一覧ではありません。GPT-5、Gemini 3、Claude 4シリーズ、Grok 4、Qwen、GLM、Kimi などの主要モデルは、ほとんどが画像入力に対応しています。
- 📚 完全なモデル一覧と機能比較: 人気モデル(随時更新)
- 🔗 ライブのモデル一覧と料金: APIYI コンソール料金ページ(Vision対応はコンソールでご確認ください)
🚀 クイックスタート
1. 基本例 - 画像URL
2. ローカル画像の例 - Base64エンコード
3. 上級例 - 複数画像比較
4. cURL の例(コマンドライン)
画像URL方式:5. よくあるエラー: 画像 URL ダウンロードのタイムアウト
画像 URL 方式を使用すると、次のようなエラーが発生することがあります:- 画像ホスト / オリジンサーバーの応答が遅い、または特定のネットワーク地域に対して相性が悪い
- 画像が大きすぎて、ダウンロードが制限時間を超えてしまう
- URL にホットリンク保護がある、ログインが必要、または公開された直接リンクではない
- ✅ Base64(data URI)アップロードに切り替える(推奨、上の例 2 を参照)- 画像データをリクエスト本文に直接送信するため、ダウンロード処理を完全に回避でき、最も安定した方法です
- より高速で、公開アクセス可能な画像の直接リンクを使用する
- 画像を圧縮して再試行する
6. よくあるエラー: invalid base64 data(Base64 フィールドに URL を誤って入れている)
次のような 400 エラーを受け取った場合(ここでは Claudeシリーズ の文言を示しています。ほかのモデル系列では少し表現が異なりますが、重要な特徴はinvalid base64 data です):
data:image/...;base64, プレフィックスの後ろに続く内容は、画像リンクではなく、その画像ファイル自体を Base64 エンコードした内容でなければなりません。URL 方式と Base64 方式は、画像を渡すための相互に排他的な 2 つの方法であり、混在させることはできません。よくある原因は、クライアントコードが常に data URI の連結経路を通るため、リモートの画像 URL まで連結してしまうことです。
正しい使い方を並べて比較すると:
7. 宣言されたメディアタイプが実際の画像形式と一致しないときのよくあるエラー
次のような 400 エラーを受け取った場合(重要なシグネチャはThe image was specified using the image/png media type, but the image appears to be a image/jpeg image です):
Bedrock Runtime: InvokeModel, ValidationException は、リクエストが Claude 系の上流チャネルに到達し、パラメータ検証の段階で拒否されたことを示しています)。メッセージはかなり文字どおりの意味です:
- data URI が画像を PNG として 宣言している(
data:image/png;base64,...) - しかし Base64 をデコードした後、上流はファイルヘッダー(マジックバイト)を確認し、実際の内容は JPEG だと判断した
- 宣言と内容が不一致 → 400。Base64 エンコード自体は問題ありません。間違っているのはプレフィックス内のメディアタイプです
- ファイル拡張子から MIME タイプを推測したが、その拡張子が嘘だった — ファイル名は
xxx.pngでも、実際は拡張子だけを付け替えた JPEG です(ダウンロードツール、チャットアプリ、スクリーンショットツールはどれもこれを行います) - クライアントコードで
image/png(またはimage/jpeg)をハードコード しており、すべての画像に形式に関係なく同じプレフィックスを付けている - 画像が処理パイプラインを通る間に形式が変わったのに、ファイル名はそのままだった
🎯 よくあるユースケース
1. 製品認識と分析
2. 文書OCR認識
3. 医療画像支援
4. セキュリティ監視分析
💡 ベストプラクティス
画像前処理の推奨事項
- 形式のサポート: JPEG、PNG、GIF、WebP などの一般的な形式
- サイズ上限: 1枚あたり20MB未満を推奨
- 解像度: 高解像度の画像ほど認識精度が向上します
- 圧縮: 転送速度を改善するために適度に圧縮します
プロンプト最適化
エラーハンドリング
🔧 高度な機能
1. ストリーミング出力
長時間かかる分析では、ストリーミング出力のほうがユーザー体験が向上します:2. マルチターン会話
詳細な分析でもコンテキストを維持します:3. Function Calling と組み合わせる
📊 パフォーマンス比較
🚨 重要な注意事項
- プライバシー保護: 機密情報を含む画像はアップロードしないでください
- コンプライアンスに準拠した利用: 関連法規を遵守し、違法な目的には使用しないでください
- 結果の検証: AI の分析結果は参考情報にすぎません。重要な判断には手動での確認が必要です
- コスト管理: 不要な費用を避けるため、モデルは適切に選択してください
🔗 関連リソース
💡 ヒント: まずは Gemini 3.5 Flash や Gemini 2.5 Flash のようなコスト効率の高いモデルでテストし、その後、品質を確認できたら本番環境では Gemini 3.1 Pro や GPT-5.5 のような高度なモデルに切り替えてください。利用可能なモデルの詳細は、人気モデルまたはコンソールのモデル一覧をご覧ください。