簡潔な回答
同じ model です。違いは、web app の中に包まれているエンジニアリング層全体にあります。たとえるなら、web app は家具付きのアパートで、API はむき出しのスケルトンです。
- 家具付き(claude.ai / chatgpt.com): system prompt、web 検索、コード実行、ファイル解析、会話メモリ、コンテキスト管理がすべて事前に組み込まれており、あとは入居するだけです。
- むき出しのスケルトン(API): 中核の model 機能だけが提供されます(耐力壁、配管、配線)。Search、tools、memory、context は自分で設定します。
Web アプリは実際に何を追加するのですか?
公式プロダクトは、モデルの上に大量の見えないエンジニアリングを重ねています。そのどれもモデルの重みには含まれておらず、API には初期状態では一切含まれていません。System prompt
Web アプリは、各ターンごとに非表示の prompt を注入します。多くの場合、数千 tokens にもなります。内容は、アイデンティティ、トーン、回答の長さ、書式設定の好み、拒否の境界、Markdown ルールなどです。これが、Web アプリが「より人間らしく聞こえ、書式がより整い、自分が何者かを知っている」ように見える最大の理由です。
組み込みツール
Web 検索、ページ取得、コードサンドボックス(計算機として使用)、ファイルと画像の解析、グラフ描画、Artifacts / Canvas などです。今日のニュースについて尋ねたり、何かを計算させたりすると、Web アプリは自動的にツールを呼び出します。ツールを設定していない場合、API は推測するしかありません。
メモリと履歴
Web アプリは、会話履歴、セッション横断のメモリ、プロジェクトのナレッジベースを保存します。API は 完全にステートレス です。以前のターンを
messages に入れなければ、モデルは何も覚えていません。コンテキスト管理
長い会話では、Web アプリが自動的に要約、切り詰め、過去の断片の取得を行い、制限内に収めます。API では、切り詰め、要約、または RAG を自分で実装します。
デフォルトパラメータと thinking budget
Web アプリは、temperature、max_tokens、reasoning effort を自動で選びます。製品によっては、質問を別のモデルや thinking tier に 自動ルーティング するものもあります。API はデフォルト値を使いますが、それは多くの場合 Web アプリの設定とは異なります。
後処理とレンダリング
引用バッジ、シンタックスハイライト、表のレンダリング、折りたたみ式の reasoning は、すべてフロントエンド側の作業です。API はプレーンテキストまたは JSON を返すため、見た目は当然ながらより素っ気なくなります。
一目でわかる違い
各具体的な違いの原因は何ですか?
API は最近のニュースや出来事を把握していません
API は最近のニュースや出来事を把握していません
モデルの知識は学習カットオフで止まっています。ウェブアプリは 内蔵ウェブ検索 でその差分を埋めています。API はデフォルトではブラウズしません。修正方法: 対応する検索ツール(
web_search、google_search)を呼び出すか、独自の検索 API を接続して結果をコンテキストに入れてください。API の計算や単語数カウントが間違っています
API の計算や単語数カウントが間違っています
ウェブアプリは計算のために、サンドボックス内でコードを書いて実行しています。素のモデルは頭の中で計算しているだけなので、誤りが出るのは想定内です。修正方法: 電卓ツールまたはコード実行ツールを接続するか、モデルにプロンプトで手順を示すよう依頼してください。
API の応答がかなり短く、洗練されていません
API の応答がかなり短く、洗練されていません
ウェブアプリのシステムプロンプトには、構成、長さ、Markdown 書式に関する詳細なルールが含まれています。修正方法: 欲しいスタイルを自分のシステムプロンプトに入れてください — 「セクション見出しを使う」「結論を先に、詳細は後に」「コードには必ずコメントを付ける」。
API 上ではモデルが自分を認識していないか、誤ったバージョンを名乗ります
API 上ではモデルが自分を認識していないか、誤ったバージョンを名乗ります
「自分は誰か」はモデルの重みに保存されていません。ウェブアプリはシステムプロンプトでアイデンティティを固定しています。参照: LLM はなぜ自分のバージョン番号を知らないのですか? と Claude はなぜ自分を Qwen や DeepSeek と呼ぶのですか?
API が前に言ったことを忘れます
API が前に言ったことを忘れます
API はステートレスです — 各リクエストはまったく新しい会話です。ウェブアプリは履歴を自動で付けてくれます。修正方法: それ以前のやり取りをすべて
messages 配列に含めてください。これで入力 tokens が増えるため、コストを抑えるには プロンプトキャッシュ と組み合わせてください。同じ質問でも毎回違う答えになります
同じ質問でも毎回違う答えになります
それは不具合ではなく、サンプリングのランダム性です。ウェブアプリも同じように動きますが、同じ質問を二度投げることはあまりありません。修正方法:
temperature を下げる(例: 0.2)か、プロンプトで出力形式を明示的に制約してください。API の reasoning が浅く感じます
API の reasoning が浅く感じます
多くのウェブアプリはデフォルトで高い thinking budget で動作しますが、API のデフォルトは通常それより低いか、無効です。修正方法:
reasoning_effort / thinking を明示的に高く設定し、最大出力長を増やしてください。max_tokens を参照してください。APIでWebアプリの体験を再現する方法
1
手順1: 独自のシステムプロンプトを書く
これが最も効果の高い施策です。アイデンティティ、トーン、出力形式、回答の長さ、境界条件を定義します。
2
手順2: 会話履歴を自分で保持する
各ユーザーメッセージとモデルの返信をすべて
messagesに追加して、Webアプリのメモリを再現します。4
手順4: パラメータを揃える
デフォルトに頼らず、
temperature、max_tokens、および推論ティアを明示的に設定します。Webアプリと同じ深さに合わせるには、通常は推論強度を上げる必要があります。5
手順5: 長いコンテキストを扱う
会話が長くなったら、要約するか、最後の N ターンと重要な事実だけを残して、コンテキストウィンドウ内に収めます。キャッシュを有効にすると、繰り返しのプレフィックスにかかるコストを大幅に削減できます。
知っておくべき境界
APIYIがどこに当てはまるか: APIYIは純粋なAPIゲートウェイです。リクエストはそのまま通過し、プロンプト注入も書き換えもありません。 APIYI経由の挙動は、公式APIへ直接呼び出した場合と一致します。むき出しの殻はむき出しの殻のままであり、私たちはそれを補ったり、裏で壁を壊したりはしません。
関連する質問
LLMはなぜ自分自身のバージョン番号を知らないのですか?
モデルのアイデンティティに関する基本原理
Claudeはなぜ自分をQwenやDeepSeekだと言うのですか?
アイデンティティの混同についての詳しい解説
適切なモデルはどう選べばよいですか?
各モデルの強みとユースケース
Base URLはどのように設定しますか?
さまざまなクライアントでAPIYIを接続する方法
お問い合わせ
WeComサポート
メール
サポート: [email protected]ビジネス: [email protected]
