Kimi K2.5 は APIYI で利用可能です: Alibaba Cloud 公式転送チャネル、OpenAI 互換エンドポイント、モデル ID
kimi-k2.5。Kimi の公式サイトとは異なり、Thinking モードはリクエストボディ内で enable_thinking: true を使って明示的に有効化する必要があります。デフォルトではモデルは Instant モードで動作します。主な特長
256K コンテキスト
256K tokens で追加料金なし — 中規模のコードベース全体や長文書を 1 回の呼び出しで収められます。
推論モード
enable_thinking: true で深い推論を有効化できます — 複雑な計画立案、根本原因分析、エージェント向けに最適です。ネイティブなマルチモーダル + ビジュアルコーディング
画像とコードをネイティブに理解します — UI モックアップ、スクリーンショット、図を実行可能なコードに変換するのが得意です。
安定した Alibaba Cloud 転送
Alibaba Cloud の公式リレー経由でルーティングされます — 高い同時実行数でもエンタープライズ級 SLA を提供します。
モデル情報
料金
料金メモ: APIYI では、グループの基本レートとして 0.88× のレート倍率(公式定価の 88%)を採用しています。新規登録 / 大口チャージボーナス(例: $100 チャージで $10 無料など)を重ねると、実質コストは公式の 80% 未満になります。詳細は チャージ特典 をご覧ください。
Thinkingモードを有効にする方法
Kimiの公式サイトとの最大の違いは、APIYIではデフォルトがInstantモードである点です。リクエストボディでenable_thinking を使って Thinking を明示的に有効化する必要があります:
cURL の例(Thinkingを有効化)
呼び出し方法
エンドポイント
基本的な使い方(即時モード)
詳細な使い方(推論モード)
ストリーミング
リクエストパラメータ
レスポンス形式
ベストプラクティス
- タスクごとにモードを切り替える: 日常のチャットや短い生成では Instant mode を有効のままにし、複雑な推論、コードレビュー、エージェントの計画には
enable_thinking: trueを設定します。 - 256K のコンテキストを活用する: 中規模のリポジトリ、製品ドキュメント一式、長い会議の文字起こしを 1 回の呼び出しに収められます — 追加料金はありません。
- マルチモーダルなビジュアルコーディング: UI のスクリーンショットやデザインモックアップを送れば、K2.5 が 1 回で「読み取り → 計画 → コーディング」まで行います。
- 節約効果を最大化する: $100 以上の入金ボーナスを 0.88× のグループレートと組み合わせると、実質コストは公式の 80% 未満に下がります。
- web_search の注意点に留意する: Moonshot の組み込み
$web_searchツールが必要な場合は、enable_thinkingを無効にしてください。
よくある質問
なぜ私のリクエストは推論モードを使っていないのですか?
なぜ私のリクエストは推論モードを使っていないのですか?
推論モードはデフォルトではオフです。リクエストボディに
"enable_thinking": true が含まれていることを確認してください。OpenAI Python SDK では extra_body の中に渡し、Node.js SDK ではトップレベルのフィールドとして渡せます。APIYI の Kimi K2.5 は Moonshot のものと同じモデルですか?
APIYI の Kimi K2.5 は Moonshot のものと同じモデルですか?
はい — 同じ上流モデルで、Alibaba Cloud の公式リレーチャネル経由でルーティングされています。違いは、推論モードがデフォルトではオフで、
enable_thinking で有効化する必要があることだけです。0.88×のグループレートはどのように動作しますか?
0.88×のグループレートはどのように動作しますか?
APIYI コンソールで API token を作成する際、Kimi K2.5 を含むグループに割り当ててください。課金では自動的に 0.88× のレート倍率が適用されます。チャージ特典を併用すると、総コストはさらに下がります。チャージ特典 をご覧ください。
関数呼び出し / tool の使用をサポートしていますか?
関数呼び出し / tool の使用をサポートしていますか?
はい。標準的な OpenAI スタイルの
tools 定義を渡してください。公式の $web_search 内蔵 tool は推論モードと排他的である点に注意してください。別々の呼び出しで使用してください。推論モードは追加料金がかかりますか?
推論モードは追加料金がかかりますか?
推論トレースは出力 token としてカウントされ、通常どおり課金されます。複雑なタスクでは出力 token が大幅に増える場合があるため、より深い推論が必要なときだけ有効にしてください。
関連リソース
API マニュアル
APIの完全な利用ガイド
入金プロモーション
ボーナスを積み重ねて、価格をさらに下げます
モデル情報
利用可能なすべてのモデルとグループを閲覧できます
ユースケース
クライアント統合のウォークスルー