> ## Documentation Index
> Fetch the complete documentation index at: https://docs.apiyi.com/llms.txt
> Use this file to discover all available pages before exploring further.

# 2026 LLM ヘッド・トゥ・ヘッド比較

> Model Info の概要の実データに基づき、このページでは Claude、GPT、Gemini、DeepSeek、Qwen、GLM、Kimi、Grok、MiniMax といった主要なテキストLLMを、コーディング、推論、長文コンテキスト、価格、コンテキストウィンドウの観点から比較し、最適なモデルをすばやく選べるようにします。

<Note>
  **データの鮮度**: 2026-07 時点で、すべてのモデル推奨とベンチマーク数値は [Model Info 概要（APIYI 公式）](/ja/api-capabilities/model-info) に基づいています。
  この文書は、**ベンダーが新しいモデルをリリースするたびに継続的に更新されています**。最新のモデル一覧とリアルタイム価格については、[APIYI コンソールの料金ページ](https://www.apiyi.com/account/pricing) をご参照ください。
</Note>

<Info>
  **このページの見方**:

  * 本ページでは **8つのタスクシナリオ**（コーディング、ライティング、高速応答、長文コンテキスト、推論、エージェント、ウェブ検索、コスト管理）に焦点を当て、model-info から推奨の組み合わせを示します
</Info>

## 📌 8つのシナリオ向けおすすめ組み合わせ（コピペで使えます）

> [Model Infoの概要 → 使用推奨](/ja/api-capabilities/model-info)から直接抜粋しています

### シナリオ 1: コーディング

| ティア         | 推奨モデル                                                      | 出典メモ（model-infoの原文）                                                                             |
| ----------- | ---------------------------------------------------------- | ----------------------------------------------------------------------------------------------- |
| 🏆 **最高性能** | Claude Opus 4.7 · GPT-5.5 · Claude Sonnet 4.6              | "コーディングベンチマークは4.6（Opus）比で+13%、SWE-bench 88.7%（GPT-5.5）、Opus 4.5（Sonnet 4.6）と同等"                 |
| 💰 **最もお得** | Gemini 3.5 Flash · GLM-5.1 · Kimi K2.6 · DeepSeek V4 Flash | "Gemini 3.5 Flashは3.1 Proを完全に上回り / GLM-5.1はSWE-Bench Pro 58.4 / Kimi K2.6はGPT-5.4とOpus 4.6を上回る" |
| 🧰 **代替候補** | DeepSeek V4 Pro · Qwen3.7-Max · MiniMax M2.7 · o4-mini     | —                                                                                               |

### シナリオ 2: ライティング

| ティア         | 推奨モデル                                                                            |
| ----------- | -------------------------------------------------------------------------------- |
| ⭐ **第一候補**  | GPT-5.5 · GPT-5.4 · Gemini 3.1 Pro Preview · Claude Opus 4.7 · Claude Sonnet 4.6 |
| 🔁 **代替候補** | chat-latest · Claude Sonnet 4.5 · GPT-4.1 · GPT-4o · Claude Haiku 4.5 · GLM-4.6  |

### シナリオ 3: 高速応答

| ティア         | 推奨モデル                                                                      | 出典メモ            |
| ----------- | -------------------------------------------------------------------------- | --------------- |
| ⭐ **第一候補**  | Gemini 3.5 Flash (\~4x speed) · Claude Haiku 4.5 (2x faster) · GPT-4o Mini | model-infoに記載あり |
| 🔁 **代替候補** | Gemini 3.1 Flash Lite · Gemini 2.5 Flash · Grok 4 Fast · GPT-4.1 Mini      | —               |

### シナリオ 4: 長文コンテキスト

| カテゴリ                    | 推奨モデル                                           | コンテキスト（model-infoデータ） |
| ----------------------- | ----------------------------------------------- | --------------------- |
| 🌍 **超長文コンテキスト**        | Gemini 2.5 Pro · Grok 4 Fast · Grok Code Fast 1 | **2M / 200K / 256K**  |
| 💻 **コーディング向け長文コンテキスト** | GLM-4.6 · Claude 4シリーズ · Kimi K2                | 200K                  |

<Warning>
  **長文コンテキストの注意点**: 上記の数値は、model-infoで示されている **コンテキストウィンドウ** です。実際の「有効ウィンドウ」（検索結果の精度が維持される最長長さ）は、通常は表記値より短くなります。金融や医療のような高精度が求められる分野では、RAGチャンク分割と組み合わせてください。
</Warning>

### シナリオ 5: 複雑な推論

| モデル                          | ベンチマーク（model-infoに記載）                         | 備考                                           |
| ---------------------------- | --------------------------------------------- | -------------------------------------------- |
| **GPT-5.5 Pro**              | Terminal-Bench 2.0 **82.7%**                  | **`/v1/responses` endpoint + SVIPグループ限定**、割高 |
| **Claude Opus 4.7 Thinking** | 適応型chain-of-thought、強化された深い推論                 | 1M（ベータ）                                      |
| **GPT-5.5**                  | SWE-bench Verified 88.7%、新しい **`xhigh`推論ティア** | 最もコスパの良い選択                                   |
| **o3**                       | 推論モデル、価格が大幅に引き下げられています                        | 200Kコンテキスト、性能とコストのバランスが取れています                |
| **o4-mini**                  | 軽量推論モデル                                       | 200K                                         |

<Tip>
  **推論ティアを有効にする方法**:

  * GPT-5.5 / GPT-5.5 Pro はデフォルトで`medium`です。`xhigh`を使うには、リクエストで`reasoning_effort: xhigh`を渡してください
  * GPT-5.5 Pro は`/v1/responses`でのみ動作し、`/v1/chat/completions`では動作しません
  * GPT Proシリーズを日常的なタスクに使わないでください — 1回の呼び出しで数ドルかかることがあります
</Tip>

### シナリオ 6: エージェント

| モデル                 | 主な機能（model-infoの原文）                                           |
| ------------------- | ------------------------------------------------------------- |
| **Kimi K2.5**       | ネイティブにマルチモーダル、**100の協調エージェントを持つAgent Swarm**                  |
| **Qwen3.7-Max**     | **35時間にわたる自律的な長期エージェントタスク**、AA Intelligence Index 56.6、世界トップ5 |
| **Claude Opus 4.7** | 本番タスク3倍、ツールエラーを1/3に削減                                         |
| **GPT-5.3 Codex**   | SWE-Bench ProでSOTA、複雑なコーディングとエージェントタスク                        |
| **GPT-5.4**         | ネイティブなコンピューター利用、GDPval 83%                                    |
| **MiniMax M2.7**    | 自己進化型、10Bパラメータの最小Tier-1、オープンソース                               |

### シナリオ 7: Web検索

| モデル                             | 備考                                                       |
| ------------------------------- | -------------------------------------------------------- |
| **Grok 4 All** · **Grok 3 All** | **ネイティブなWebアクセス**（tool呼び出しは不要）；リアルタイム情報、ニュース、市場分析に適しています |

### シナリオ 8: コスト管理

| モデル                        | 価格データ（model-infoに記載）                                    |
| -------------------------- | ------------------------------------------------------- |
| **MiniMax M2.7 standard**  | **\$0.3 / 100万 input tokens**                           |
| **MiniMax M2.7 highspeed** | **\$0.6 / 100万 input tokens**（`MiniMax-M2.7-highspeed`） |

<Info>
  **その他のモデルの価格**: model-infoでは、すべてのモデルについて入力/出力価格が明示されているわけではありません。すべての価格は [APIYIコンソールの料金ページ](https://www.apiyi.com/account/pricing) に従います。
  「ソース転送ルート + 固定1:7交換レート + チャージボーナス」を組み合わせると、実効価格は通常、ベンダーに直接申し込む場合よりも低くなります — 正確な金額はコンソールをご確認ください。
</Info>

## 🧮 コーディングベンチマーク参考表

> model-info に明示的な数値があるモデルのみを掲載しています。疑問符があるものや数値のない項目は、model-info の完全な説明をご覧ください。

| モデル                 | ベンチマーク                                          | コンテキスト    | カテゴリ      |
| ------------------- | ----------------------------------------------- | --------- | --------- |
| **GPT-5.5 Pro**     | Terminal-Bench 2.0 **82.7%**                    | 1M        | 推論        |
| **GPT-5.5**         | SWE-bench Verified **88.7%**                    | 1M        | コーディング    |
| **GPT-5.5**         | ハルシネーション率 **60%低下**、5.4 比                       | 1M        | 品質        |
| **GPT-5.4**         | GDPval **83%**                                  | 1M        | エージェント    |
| **GPT-5.3 Codex**   | SWE-Bench Pro **SOTA**                          | 128K      | コーディング    |
| **GPT-5.2**         | GDPval **70.9%**（プロを上回る）                        | 400K      | コーディングと計画 |
| **GPT-5.1**         | SWE-bench **76.3%**                             | 128K      | コーディング    |
| **Claude Opus 4.7** | コーディングベンチマーク **+13%**、4.6 比                     | 1M (Beta) | コーディング    |
| **Claude Opus 4.7** | **3x** の本番タスク、ツールエラーを 1/3 に削減                   | 1M (Beta) | エージェント    |
| **Kimi K2.6**       | SWE-Bench Pro **58.6**（GPT-5.4 と Opus 4.6 を上回る） | 256K      | コーディング    |
| **GLM-5.1**         | SWE-Bench Pro **58.4**                          | —         | コーディング    |
| **MiniMax M2.7**    | SWE-bench Pro **56.22%**（10B パラメータで最小の Tier-1）  | standard  | コーディング    |
| **MiniMax M2.5**    | SWE-bench **80.2%**                             | standard  | コーディング    |
| **Qwen3.7-Max**     | AA Intelligence Index **56.6**（世界トップ5、中国では1位）   | 1M        | エージェント    |

## 📚 コンテキストウィンドウ参照表

| モデル                                                                                                                                                                  | コンテキストウィンドウ | 出典                |
| -------------------------------------------------------------------------------------------------------------------------------------------------------------------- | ----------- | ----------------- |
| **Gemini 2.5 Pro**                                                                                                                                                   | **2M**      | 長文コンテキスト向け推奨      |
| **GPT-5.5 Pro** · **GPT-5.5** · **GPT-5.4** · **Claude Opus 4.7** · **Claude Opus 4.7 Thinking** · **Qwen3.7-Max**                                                   | **1M**      | model-infoに記載     |
| **GPT-5.2** · **chat-latest**                                                                                                                                        | 400K        | model-infoに記載     |
| **Kimi K2.6**                                                                                                                                                        | 256K        | model-infoに記載     |
| **GPT-5.1** · **GPT-5.3 Codex** · **GPT-5** · **GPT-5 Mini** · **GPT-5 Nano** · **GPT-4.1** · **GPT-4.1 Mini** · **GPT-4o** · **GPT-4o Mini** · **o3** · **o4-mini** | 128K / 200K | model-infoに記載     |
| **Grok 4 Fast / Grok Code Fast 1**                                                                                                                                   | 200K / 256K | 長文コンテキスト向け推奨      |
| **GLM-4.6 / Claude 4 シリーズ / Kimi K2**                                                                                                                                | 200K        | コーディング向けの長文コンテキスト |
| **Qwen Max / Qwen Plus / Qwen Turbo**                                                                                                                                | 32K         | model-infoに記載     |

<Note>
  **注意**: コンテキストウィンドウの数値 = **ベンダーが公表する最大値**。
  実際の検索精度（「干し草の山から針を探す」）は極端に長い場合に大きく低下します。長文コンテキストは RAG の代替ではありません。
</Note>

## 💡 model-info からの4つのコスト最適化のヒント（原文どおり）

1. **使用量を階層化する**: 単純なタスクには低コストのモデルを、複雑なタスクにはプレミアムモデルを使います
2. **まず試してから拡大する**: 小さなモデルでプロトタイプを作り、要件が明確になったら大きいものに切り替えます
3. **バッチ処理**: 類似したタスクを大量に処理する場合は Nano または Mini のバリアントを選びます
4. **キャッシュして再利用する**: 繰り返しのクエリには結果をキャッシュします

## ❓ model-info からの GPT-5 シリーズに関する注意点 3 つ（原文のまま）

<Warning>
  **GPT-5 シリーズの利用上の注意**:

  1. `temperature` パラメータは 1 に設定する必要があります（サポートされるのは 1 のみです）
  2. `max_tokens` の代わりに `max_completion_tokens` を使用してください
  3. `top_p` パラメータは渡さないでください
</Warning>

## 🔗 関連リソース

* [Model Info の概要 (model-info)](/ja/api-capabilities/model-info) — このページのすべてのデータの唯一の情報源
* [APIYI コンソール価格ページ](https://www.apiyi.com/account/pricing) — リアルタイム価格
* [画像・動画生成モデル](/ja/api-capabilities/image-video-models) — マルチモーダルモデルのリファレンス
* [APIマニュアル](/ja/api-manual) · [はじめに](/ja/getting-started) · [OpenAI互換の呼び出し](/ja/api-capabilities/openai/compatible)

<Tip>
  **まだどれを選ぶべきか迷っていますか？** [APIYI サポートにお問い合わせ](https://work.weixin.qq.com/kfid/kfc9adfd5810ece25ec) いただき、次の内容をお知らせください:

  * ご利用用途（chat / RAG / agents / writing / ...）
  * 1日あたりの呼び出し回数
  * パフォーマンス要件（最初のtokenまでのレイテンシ、出力品質）
  * 予算範囲

  この4つのデータポイントをもとに、**用途に合わせたモデルの組み合わせ**をご提案します。
</Tip>

<Note>
  **免責事項**:
  このページのすべてのデータは docs/api-capabilities/model-info.mdx に由来します（2026-07時点で確認）。
  model-info はベンダーがモデルを公開するたびに継続的に更新されます。最新の推奨内容については、model-info を直接参照するか、[APIYI コンソール価格ページ](https://www.apiyi.com/account/pricing) をご確認ください。
</Note>
