Skip to main content
Qwen3.6 は Alibaba Tongyi Qianwen の次世代モデルファミリーで、2026 年 Q2 に 3 つのクローズドソース本番ティア — Max(フラッグシップ)、Plus(バランス型)、Flash(速度重視)— に加えて、2 つのオープンウェイト版 27B35B-A3B としてリリースされました。APIYI は 5 つのモデルすべてを Aliyun official relay / APIYI hosted relay 経由でルーティングし、OpenAI Chat Completions 互換です。クローズドソースティアは公式ポータルの認証とレート制限ポリシーに一致しており、オープンウェイトティアは APIYI の公式リレーでホストされるため、顧客は GPU をレンタルしたりローカル推論環境を立ち上げたりする必要がありません
🚀 ハイライト: Max-Preview は SWE-bench Pro と Terminal-Bench 2.0 を含む 6 つのコーディングベンチマークで #1 を主張し、Flash はネイティブ 256K(1M まで拡張可能)のマルチモーダルコンテキストを備えた 35B-A3B MoE、Plus は 1M のコンテキストウィンドウを持つ 72B/18B-active の主力モデルです。オープンウェイトの qwen3.6-27b(27B dense)と qwen3.6-35b-a3b(35B MoE / 3B active)は APIYI の公式リレーでホストされており、GPU レンタルは不要で、課金は token ごとです。コーディングエージェント、長文コンテキスト RAG、マルチモーダルディスパッチ、監査可能な重みを必要とするコンプライアンス重視のワークロード向けに設計されています

クローズドソース本番ティア(Aliyun official relay)

qwen3.6-max-preview

コーディングのフラッグシップ6 つのコーディングベンチマークで #1。AIME 2025 で 93%、GPQA で 86%、LiveCodeBench で 79%。

qwen3.6-flash

速度重視のマルチモーダル35B-A3B MoE、テキスト / 画像 / 動画入力をネイティブサポート、256K のベースコンテキストは 1M まで拡張可能。

qwen3.6-plus

バランス型の主力モデル総パラメータ 72B / アクティブ 18B、1M コンテキスト、Terminal-Bench 61.6 で Claude Opus 4.5 を上回ります。

オープンウェイトティア(APIYI ホスト・GPU レンタル不要)

qwen3.6-27b

27B dense · コーディングの高性能モデルQwen チームのオープンウェイト版リリース(Hugging Face Qwen/Qwen3.6-27B)。コーディング能力は 397B 級モデルに匹敵します。APIYI の公式リレーでホストされているため、ローカル GPU は不要です。

qwen3.6-35b-a3b

35B-A3B オープンウェイト MoEQwen チームのオープンウェイト版リリース(Hugging Face Qwen/Qwen3.6-35B-A3B)。クローズドソース版 Flash と同系統ですが、配布ティアは異なります。アクティブパラメータは 3B のみで、計算コストは極めて低いです。

なぜ APIYI の Qwen3.6 を Aliyun 公式リレー経由で使うのか?

Alibaba Cloud Bailian の公式チャネルを基準にし、安定性コスト統合のしやすさ の面でエンタープライズ本番環境向けに深く最適化しています:

Aliyun 公式リレー

Alibaba Cloud Bailian の公式チャネル経由でルーティングされます。認証とレート制限ポリシーは公式ポータルと一致し、国内での低レイテンシとエンタープライズグレードのSLAを実現します。

同時実行数の上限なし · 自由にスケール

厳格な RPM / TPM の上限はありません(上流の供給状況に依存します)。エンタープライズ顧客は需要に応じてスケールでき、高同時実行の調整にはチケットと専用チャネルを利用できます。

定価一致 + チャージで約15%オフ

表示価格は Alibaba Cloud の公式レートと一致します。チャージ特典と組み合わせると、実効単価は 定価の約85% になります。

グローバルな手間のないアクセス

海外サーバーやプロキシは不要 です。国内データセンター、家庭向けブロードバンド、海外ノードのいずれからも api.apiyi.com に直接接続でき、海外への移行は不要です。

OpenAI互換のフルエコシステム

OpenAI Chat Completions 互換です。APIYI の統一モデルカタログを通じて、GPT / Claude / DeepSeek / GLM などをシームレスに切り替えられます。

プロフェッショナルサービス · エンタープライズサポート

モデル選定とAgentワークフローに深い知見があり、エンタープライズ顧客向けにPoC → カナリア → 本番まで一貫してサポートします。

5つのモデルの選び方

Max-Preview · コーディングと複雑な推論

Scenarios: コーディングエージェントのドライバー、実世界のソフトウェアエンジニアリングタスク(SWE-Verified クラス)、Cursor / Claude Code ワークフローの主力モデル。Benchmarks: SWE-bench Pro 58.4(GLM-5.1 の 56.6 を上回る)、AIME 2025 93%、GPQA 86%、LiveCodeBench 79%、Terminal-Bench 2.0 第1位。Note: Preview 表示のため、重みはまだ調整中です。本番トラフィックへ切り替える前に、小規模なカナリア運用を実施してください。

Flash · 大規模マルチモーダル長文コンテキスト

Scenarios: 画像 / 動画の理解、長文ドキュメントの要約、大量翻訳、RAG 後の全文統合生成。Architecture: 合計35B / アクティブ3B の MoE(35B-A3B)、ネイティブ256Kコンテキスト、1M tokens まで拡張可能。Multimodal: ネイティブのテキスト / 画像 / 動画入力。単価は Max の約1/8です。

Plus · バランスの取れた主力モデル

Scenarios: 日常対話、カスタマーサポート、コンテンツ生成、企業ナレッジベースの Q&A、中程度の複雑さの推論。Architecture: 合計72B / アクティブ18B の MoE — 推論速度は Claude Opus 4.6 の約3倍です。Benchmarks: Terminal-Bench 2.0 の 61.6 は Claude Opus 4.5(59.3)を上回ります。SWE-bench Verified 78.8。

qwen3.6-27b · オープンウェイトのコーディング向け主力モデル

Scenarios: コスト重視のコーディング支援、ローカルデプロイに踏み切る前の API 検証段階、監査可能なオープンソースライセンスを要件とする顧客。Notes: 27B のデンス構成、オープンウェイトで、コーディング能力は 397B クラスのモデルに匹敵します。APIYI でホストされるため、ローカル GPU は不要です。

qwen3.6-35b-a3b · オープンウェイトの高速 MoE

Scenarios: 高頻度・低コストのワークフロー、セルフホスト推論に移行する前の移行段階、コンプライアンスのためにダウンロード可能な重みを必要とするプロジェクト。Notes: クローズドソースの Flash と同じ系統(合計35B / アクティブ3B)です。オープンウェイト版は APIYI でホストされるため、GPU のレンタル、デプロイ、運用を省けます。

推奨ルーティング

Strategy: 既定は Flash、エスカレーション時は Plus、上限は Max-Preview。コストが最優先のワークロードでは、オープンウェイトの 27b / 35b-a3b に切り替えます。日常対話とマルチモーダルバッチは Flash に振り分け、より強い推論が必要なら Plus にエスカレーションし、コーディングエージェント、複雑な推論、複数ステップの計画には Max-Preview を確保し、コストが最も重要な場合や監査可能な重みが必要な場合はオープンウェイト階層に落とします。

料金

5つのモデルはいずれも 従量課金 - チャット で課金されます。クローズドソースのティア(Max-Preview / Flash / Plus)は、1回のリクエストにおける入力 token の合計数を基準にした 段階課金 を採用します。オープンウェイトのティア(27b / 35b-a3b)は 単一の定額レート — ティアなし で課金されます。定価は Alibaba Cloud の公式レートと同じで、APIYI のチャージ特典により実効単価はおおむね 定価の85% になります。

qwen3.6-max-preview

qwen3.6-flash

qwen3.6-plus

qwen3.6-27b (オープンウェイト · APIYI ホスト)

qwen3.6-35b-a3b (オープンウェイト · APIYI ホスト)

料金に関する注意:
  • クローズドソースのティア(段階課金): ティアは 1回のリクエストにおける入力 token の合計数 によって決まります。そのリクエスト内のすべての token(入力 + 出力)は、そのティアのレートで課金されます。ティアをまたいだ按分はありません — たとえば、300K の入力 token を含む Flash のリクエストは 256K – 1000K に該当し、リクエスト全体が $0.68 / $4.08 で課金されます。これは「最初の 256K は安価で、残りの 44K は上位ティア」という分割にはなりません。
  • オープンウェイトのティア(定額課金): qwen3.6-27bqwen3.6-35b-a3b は APIYI の公式リレーでホストされています。ティアはありません。ユーザーは GPU を借りたり、ローカルで推論を実行したりする必要はなく、実際の token 消費量に応じて直接精算できます。
  • 定価は Alibaba Cloud Bailian と一致します。チャージ特典 を利用すると、実効単価はおおむね 定価の85% になります。
  • キャッシュヒット時の課金は現時点では個別に開示されておらず、ベースティアにフォールバックします。

仕様

クローズドソースの本番ティア

オープンウェイトのティア(APIYI がホスト)

ホストされたオープンウェイトの理由: オープンウェイトのチェックポイントは公開ダウンロード可能ですが、実行には GPU、VRAM、運用が必要です。APIYI はこれらのオープンウェイトを公式リレーでホストしているため、API を直接呼び出せます — 「監査可能な重み、制御可能なライセンス」という利点を保ちながら、レンタル、デプロイ、運用コストを省けます。

エンドポイント

ドメイン: api.apiyi.com が主要なゲートウェイです。b.apiyi.com / vip.apiyi.com のような代替ゲートウェイでも、同一のレスポンスが返ります。OpenAI / OpenAI-compatible SDK を直接使用するには、base_urlhttps://api.apiyi.com/v1 に設定してください。

コード例

Python(OpenAI SDK 互換)

Node.js

cURL

ベストプラクティス

1

タスクごとに適切なティアを選ぶ

日常的な対話 / 分類 / マルチモーダルのバッチ処理には Flash を既定にします。中程度の複雑さの推論や企業向けナレッジベースのQ&Aには Plus を使います。コーディングエージェント、複雑な計画、または競技レベルの数理推論にだけ Max-Preview へ上げてください。可能なときは一段下げてください。
2

ティア境界を見積もる

起動前に P95 の input token 数を把握してください。Max-Preview で 128K を超える場合、または Flash / Plus で 256K を超える場合、価格が急上昇します。超長文のコンテキストは要約 / 分割して、P95 を下位ティア内に収めてください。
3

マルチモーダルのバッチ処理

Flash は 1M のコンテキストと動画入力に対応していますが、単一の超長リクエストだと上位ティアに移行します。長い動画をセグメントに分割し、1回あたりのコストを抑えるために 256K 以内のチャンクで入力してください。
4

プレビューのカナリア運用

qwen3.6-max-preview は Preview ビルドで、重みはまだ調整中です。重要な経路では、本番トラフィックを切り替える前に、A/B 比較付きの小規模カナリアを実施してください。
5

ツールとストリーミング

3つのモデルはいずれも OpenAI 形式の toolsstream: true をサポートします。既存の OpenAI 互換の Agent フレームワーク(OpenClaw、LangChain、LlamaIndex など)に、そのまま組み込めます。ツール呼び出しロジックを書き換える必要はありません。
6

チャージ特典を活用する

表示価格はすでに Alibaba の公式レートと一致しています。チャージ特典と合わせると、実質の単価は**定価の約85%**になります。1,000ドル以上の大きめのチャージほど特典率が高くなります — 最適なマージンを確保するには、回数を減らして大きくチャージしてください。

エラーとリトライ

クライアントへの推奨事項:
  • リクエストのタイムアウトを ≥ 120秒 に設定してください(Max-Preview の推論と Plus の長文コンテキスト CoT は時間がかかります)
  • 5xx とタイムアウトには 指数バックオフのリトライ を適用してください(2回の試行を推奨します)
  • トラブルシューティングのために x-request-id レスポンスヘッダーをログに記録してください

FAQ

はい。5つすべてが /v1/chat/completions(OpenAI Chat Completions 互換)を共有します。異なるのは model フィールドだけです(qwen3.6-max-preview / qwen3.6-flash / qwen3.6-plus / qwen3.6-27b / qwen3.6-35b-a3b)— 必要に応じて同じコードベース内で切り替えてください。
主な違いは3つあります。(1) ダウンロード可能な weights — オープンウェイトのチェックポイントは Hugging Face にあり、社内監査、コンプライアンス申請、または将来的なローカル推論への移行に使えます。(2) ホスト型コンピュート — APIYI は公式リレー上でオープンウェイトをホストしているため、API を呼ぶだけでよく、GPU のレンタル / デプロイ / 運用は不要です。(3) よりシンプルな課金 — オープンウェイトのティアは定額で、ティア分けがなく、予算を立てやすいです。性能面では、35B-A3B はクローズドソースの Flash と系譜を共有しています(分配ティアが異なるだけです)。27B は独立した dense モデルで、コーディング能力ははるかに多いパラメータ数のモデルに匹敵します。
オープンな大規模モデルを自前運用するには、少なくとも次が必要です。高性能 GPU(27B には少なくとも 1 台の A100 40G が必要、35B-A3B にはさらに多くの VRAM が必要です)、推論フレームワーク(vLLM / TensorRT-LLM)、監視、フェイルオーバー、そしてアップグレードのパイプラインです。APIYI のホスト型公式リレーはそのすべてを処理します — token 単位で課金され、必要に応じてスケールし、クローズドソースのティアと同じ OpenAI 互換 SDK を共有します。まずは API で構築し、後から自前ホスティングへ切り替えるかどうかを決めてください。移行はスムーズです。
ティアは、1回のリクエストに含まれる input tokens の総数 で決まります。そのリクエスト内のすべての tokens(input + output)は、対応するティアのレートで課金されます。例: 300K input tokens の Flash リクエストは 256K – 1000K に入り、リクエスト全体が $0.68 / $4.08 で課金されます — 「最初の 256K は安く、残りの 44K は高い」という分割にはなりません。
はい、ただしまずはカナリアで試してください。Qwen チームは、今後の改訂でも weights を継続的に洗練させると述べています。重要な経路では、ベンチマークタスクに対して A/B テストを行い、安定版が出てから本番トラフィックを切り替えてください。
OpenAI の Vision 互換フォーマットを使います。messages では、content を配列として送り、各要素は {type: "text", text: ...} または {type: "image_url", image_url: {url: ...}} にします。動画については、公式ドキュメントの video_url / フレームサンプリングのフィールドに従ってください。
表示価格は公式レートと一致します。違いは、APIYI が recharge bonuses を積み上げることで、実効単価が 表示価格の約 85% になる点と、OpenAI 互換エコシステム全体(GPT / Claude / Gemini / DeepSeek / GLM など)をサポートする統一アカウントがある点です。複数のベンダーアカウントを維持する必要はありません。
はい。3つのモデルはいずれも OpenAI 標準の tools / tool_choice を受け付けます。既存の Agent フレームワークの tool-calling ロジックをそのまま再利用できます。Max-Preview は、複数段階の tool 呼び出しと長期的な計画で特に強みを発揮します。
Max-Preview は reasoning タスクで CoT を自動的に有効化します。Plus は CoT が常時オンです。Flash は速度優先で、デフォルトでは CoT を出力しません。フィールド名は Alibaba Cloud のレスポンス形式(reasoning_content など)に従います。
Flash と Plus は 1M tokens、Max-Preview は 262K で上限となります。上限を超えると 400 が返ります。送信前に要約 / チャンク分割 / RAG 検索を適用してください — すべてを 1 回の呼び出しに詰め込もうとしないでください。
はい。base_urlhttps://api.apiyi.com/v1 に設定し、上記のいずれかの model ID を model として渡してください — コード変更なしで移行できます。
クライアント側の 4xx エラー(param error / auth failure / content-moderation block)は課金されません。推論に到達しないサーバー側の 5xx エラーも課金されません。tokens を正常に返したリクエストは、クライアントがストリーミング中にキャンセルしても、実際の token 数に応じて課金されます。

関連ドキュメント

まとめ: Qwen3.6シリーズは、重いコーディングエージェントから大量のマルチモーダル配信まで、需要曲線全体をカバーします。Max-Preview は国内コーディングを新たな高みに押し上げ、Flash はマルチモーダルの長文コンテキストワークロードの単価を大幅に下げ、Plus は信頼できるバランス型の主力モデルです。APIYI の公式リレーでホストされるオープンウェイトの 27B と 35B-A3B のバリアントは、「GPU を借りずに制御可能なオープンウェイト」という課題を埋めます。5つすべてが OpenAI Chat 互換のエンドポイントを共有し、公式レートに合わせた定価設定で、チャージ特典を組み合わせると定価の約85%まで下がります。現時点で Aliyun の公式リレーチャンネルで利用できる中では、最も優れた価格性能比です。