🚀 核心亮點:Max-Preview 在 SWE-bench Pro / Terminal-Bench 2.0 等 6 項程式設計基準登頂,Flash 是 35B-A3B MoE、原生 256K 可擴 1M 多模態上下文,Plus 是 72B/18B 啟用的均衡主力(1M 上下文)。開源
qwen3.6-27b(27B 稠密)與 qwen3.6-35b-a3b(35B MoE / 3B 啟用)由 API易 官轉託管,按量付費、不用自己租卡。適合程式設計 Agent、長上下文 RAG、多模態批次分發,以及需要可控權重 / 合規審計 的生產場景。閉源生產版(阿里雲官轉)
qwen3.6-max-preview
程式設計旗艦國產程式設計登頂:6 項 Coding 基準 #1,AIME 2025 93%,GPQA 86%,LiveCodeBench 79%。
qwen3.6-flash
極速多模態35B-A3B MoE,文本 / 影像 / 影片原生輸入,256K 基礎可擴 1M 上下文。
qwen3.6-plus
均衡主力72B 總參 / 18B 啟用,1M 上下文,Terminal-Bench 61.6 超越 Claude Opus 4.5。
開源權重版(API易官轉託管 · 免租卡)
qwen3.6-27b
27B 稠密 · 程式設計小鋼炮Qwen 團隊開源權重(Hugging Face
Qwen/Qwen3.6-27B),27B 程式設計能力對標 397B 量級模型。API易 官轉託管,無需本地 GPU。qwen3.6-35b-a3b
35B-A3B 開源 MoEQwen 團隊開源權重(Hugging Face
Qwen/Qwen3.6-35B-A3B),與閉源 Flash 同源不同檔位,3B 啟用極低算力成本。為什麼選 API易 的 Qwen3.6 阿里雲官轉?
對標阿里雲百鍊官方通道,針對企業生產場景在 穩定性、成本、接入體驗 三方面做了深度最佳化:阿里雲官轉直連
通過阿里雲百鍊官方通道接入,鑑權與限流策略與官網一致,國內機房與家寬網路延遲穩定,企業級 SLA。
不限併發 · 企業可放量
無 RPM / TPM 上限封頂(受底層供給限制),企業客戶可按需放量;支援工單與專屬群協助高併發排程。
同價 + 充值加贈 ≈ 8.5 折
掛牌單價與阿里雲官網一致,疊加 充值加贈活動,長期使用成本約 官網 8.5 折。
全球零門檻接入
無需海外伺服器或代理,國內機房、家寬網路、海外節點均可直連
api.apiyi.com,免去出海改造。OpenAI 相容生態齊全
OpenAI Chat Completions 相容格式,配合 GPT / Claude / DeepSeek / GLM 等 全模型生態 可無縫切換。
專業服務 · 企業陪跑
團隊深耕大模型選型與 Agent 工作流,可為企業客戶提供從 PoC、灰度到生產上線的完整技術支援。
五款模型怎麼選
Max-Preview · 程式設計與複雜推理
場景:Coding Agent 主力、SWE-Verified 類真實軟工任務、Cursor / Claude Code 工作流主驅動模型。基準:SWE-bench Pro 58.4(反超 GLM-5.1 56.6)、AIME 2025 93%、GPQA 86%、LiveCodeBench 79%、Terminal-Bench 2.0 #1。注意:標記為 Preview,權重仍在迭代,關鍵鏈路建議先小流量灰度。
Flash · 高頻多模態長上下文
場景:影像 / 影片理解、長文件總結、批次翻譯、RAG 後整篇綜合歸納。結構:35B 總參 / 3B 啟用的 MoE(35B-A3B),原生 256K 可擴充套件至 1M tokens。多模態:原生支援文本 / 影像 / 影片輸入,單價僅 Max 的約 1/8。
Plus · 主力均衡
場景:日常對話、客服、內容生成、企業知識庫問答、中等複雜度推理。結構:72B 總參 / 18B 啟用的 MoE,推理速度約 Claude Opus 4.6 的 3 倍。基準:Terminal-Bench 2.0 達 61.6 超越 Claude Opus 4.5(59.3),SWE-bench Verified 78.8。
qwen3.6-27b · 開源程式設計小鋼炮
場景:成本敏感的程式設計輔助、私有化部署評估前的 API 驗證、對開源協議 / 可審計權重有合規要求的客戶。特點:27B 稠密結構,開源權重,程式設計能力對標 397B 級別。API易 官轉託管,按量計費,無需本地 GPU。
qwen3.6-35b-a3b · 開源極速 MoE
場景:高頻低成本場景、希望未來切換為本地推理的過渡期、合規要求權重可下載的專案。特點:與閉源 Flash 同源(35B 總參 / 3B 啟用),開源版本由 API易 託管,省去租卡 / 部署 / 運維。
混合路由建議
推薦策略:Flash 預設 + Plus 升級 + Max-Preview 兜頂;成本敏感場景再下沉到開源 27b / 35b-a3b。常規對話與多模態批次交給 Flash;需要更強推理時升級到 Plus;程式設計 Agent / 複雜推理 / 多步規劃升級到 Max-Preview;對成本極敏感或需可審計權重的場景下沉到開源版。
模型定價
全系採用 按量付費 - Chat 計費模式:閉源生產版(Max-Preview / Flash / Plus)按 單次請求輸入 token 數 決定整請求單價檔位(階梯計費);開源版(27b / 35b-a3b)為單一檔位平價計費,不分檔。掛牌價持平阿里雲官網,疊加 API易 充值加贈後實際單價約 官網 8.5 折。qwen3.6-max-preview
qwen3.6-flash
qwen3.6-plus
qwen3.6-27b(開源版 · API易官轉託管)
qwen3.6-35b-a3b(開源版 · API易官轉託管)
計費說明:
- 閉源生產版(階梯計費):單價檔位由單次請求的總輸入 tokens 決定,整次請求的所有 tokens(輸入 + 輸出)按對應檔位的單價計費。跨檔不分攤——例如 Flash 單次輸入 300K tokens 落入
256K – 1000K檔,整請求按 $0.68 / $4.08 計價;不會出現”前 256K 按低價、後 44K 按高價”的拆分。 - 開源版(平價計費):
qwen3.6-27b與qwen3.6-35b-a3b由 API易 官轉託管,單價不分檔;客戶無需自行租 GPU 或部署本地推理,按實際消耗 token 數直接結算。 - 掛牌價持平阿里雲百鍊官網,疊加 充值加贈 實際單價約 8.5 折。
- 快取命中價當前未單獨披露,按基礎檔計價。
技術規格
閉源生產版
開源權重版(API易官轉託管)
端點一覽
呼叫示例
Python(OpenAI SDK 相容)
Node.js
cURL
最佳實踐
1
按任務選模型檔
Flash 預設處理常規對話 / 分類 / 多模態批次;Plus 處理中等複雜推理與企業知識庫問答;只在程式設計 Agent / 複雜規劃 / 數學競賽級推理時升級到 Max-Preview。能省一檔成本就降一檔。
2
階梯檔位測算
上線前先估算 P95 輸入 token 數:Max-Preview 跨過 128K、Flash / Plus 跨過 256K 後單價顯著上升。建議把超長上下文先做摘要 / 分段,控制 P95 在低檔區間內。
3
多模態分批
Flash 支援 1M 上下文與影片輸入,但單次過長會觸發高檔單價。建議把超長影片先切片再喂入,按 256K 分批控制單次成本。
4
Preview 灰度
qwen3.6-max-preview 標記為 Preview,權重仍在迭代。關鍵鏈路建議先小流量灰度 + AB 比對,待版本穩定後再切主流量。5
工具呼叫與流式
三款模型均支援 OpenAI 風格的
tools 欄位與 stream: true,可直接複用現有 OpenAI Agent 框架(OpenClaw / LangChain / LlamaIndex 等)的工具呼叫邏輯。6
充值加贈疊加
掛牌價已與官網持平,疊加 充值加贈活動 後實際單價約 8.5 折。大額充值($1000+)檔位贈送比例更高,長期使用建議一次性充值到位。
錯誤碼與重試
建議客戶端:
- 請求超時 120 秒 起步(Max-Preview 推理 / Plus 思維鏈長上下文請求耗時較長)
- 對 5xx 與超時做 指數退避重試(建議 2 次)
- 記錄響應頭
x-request-id方便排查
常見問題
五款模型用的是同一個 API 端點嗎?
五款模型用的是同一個 API 端點嗎?
是。5 款模型共用
/v1/chat/completions 端點,OpenAI Chat Completions 相容格式,僅 model 欄位不同(qwen3.6-max-preview / qwen3.6-flash / qwen3.6-plus / qwen3.6-27b / qwen3.6-35b-a3b),可在同一份程式碼裡按需切換。開源版(27b / 35b-a3b)和閉源版有什麼區別?
開源版(27b / 35b-a3b)和閉源版有什麼區別?
主要差別有三:(1) 權重可下載——開源版本可在 Hugging Face 拉取權重,便於內部審計、合規備案或後續切換為本地推理;(2) 算力託管——API易 把開源權重託管到官轉通道,客戶調 API 即可,省去租卡、部署與運維成本;(3) 計費簡單——開源版按量平價計費,不分檔,預算可控。能力上 35B-A3B 與閉源 Flash 同源不同檔位,27B 是獨立的稠密模型,程式設計能力對標更大引數量級模型。
既然權重開源,為什麼還要走 API易 的官轉 API?
既然權重開源,為什麼還要走 API易 的官轉 API?
本地跑開源大模型至少需要:合適的 GPU(27B 至少 A100 40G ×1,35B-A3B 視訊記憶體更高)、推理框架(vLLM / TensorRT-LLM)、監控告警、容災、版本升級流程。API易 官轉託管把這些全部托掉,按 token 計費,按需擴縮,且與閉源版共用同一份 OpenAI 相容 SDK——開發期用 API 跑通,生產期再決定要不要切自託管,路徑平滑。
階梯計費具體怎麼算?
階梯計費具體怎麼算?
單價檔位由單次請求的總輸入 token 數決定,整次請求的所有 token(輸入 + 輸出)按對應檔位的單價計費。例如 Flash 單次輸入 300K tokens 落入
256K – 1000K 檔,整請求按 $0.68 / $4.08 計價,不會拆分前 256K 與後 44K。Max-Preview 是 Preview,能用於生產嗎?
Max-Preview 是 Preview,能用於生產嗎?
可以,但建議先做小流量灰度。Qwen 團隊已明確表示後續版本仍會迭代權重,關鍵鏈路上線前建議跑 AB 比對,記錄基準任務表現,待版本穩定後再切主流量。
Flash 的多模態輸入怎麼呼叫?
Flash 的多模態輸入怎麼呼叫?
使用 OpenAI Vision 相容格式:
messages 中 content 欄位傳入陣列,每個元素為 {type: "text", text: ...} 或 {type: "image_url", image_url: {url: ...}}。影片輸入按官方文件使用 video_url / 幀取樣欄位。API易 與阿里雲百鍊官網價格一樣嗎?
API易 與阿里雲百鍊官網價格一樣嗎?
掛牌價完全持平阿里雲百鍊官網。區別在於 API易 上疊加 充值加贈活動 後,實際單價約官網 8.5 折;同時賬戶支援 OpenAI 全生態切換(GPT / Claude / Gemini / DeepSeek / GLM 等),無需重複開多個供應商賬號。
是否支援函式呼叫 / Tool Use?
是否支援函式呼叫 / Tool Use?
支援。三款模型均相容 OpenAI 標準的
tools / tool_choice 欄位,可直接複用現有 Agent 框架的工具呼叫邏輯。Max-Preview 在多步工具呼叫與長程規劃上表現最佳。是否支援思維鏈輸出?
是否支援思維鏈輸出?
Max-Preview 在推理任務上自動啟用思維鏈;Plus 始終開啟思維鏈;Flash 主打速度,預設不輸出思維鏈。具體欄位名以阿里雲官網響應格式為準(
reasoning_content 等)。超過 1M 上下文怎麼辦?
超過 1M 上下文怎麼辦?
Flash 與 Plus 的最大上下文為 1M tokens,Max-Preview 為 262K。超過上限會觸發
400 錯誤。建議先做摘要 / 分段 / RAG 檢索,避免一次性塞入超長內容。可以用 OpenAI 官方 SDK 直連嗎?
可以用 OpenAI 官方 SDK 直連嗎?
可以。把
base_url 設為 https://api.apiyi.com/v1,model 欄位填上述任一模型 ID 即可,零改動遷移。失敗的請求會扣費嗎?
失敗的請求會扣費嗎?
4xx 類客戶端錯誤(引數錯誤 / 鑑權失敗 / 內容稽核攔截)不計費;5xx 類服務端錯誤若請求未實際進入推理階段亦不計費。已成功返回 token 的請求按實際 token 數計費,即使響應被客戶端中斷。相關文件
- 深度解讀:Qwen3.6 雙模上線 Max-Preview + Flash
- 深度解讀:Qwen3.6-Plus 上線 阿里千問最強程式設計 Agent 模型
- 充值加贈活動 - 把單價壓到約 8.5 折
- 模型資訊總覽 - 檢視所有可用模型及分組
- API 使用手冊 - 通用呼叫規範
小結:Qwen3.6 系列覆蓋了從重型 Coding Agent 到高頻多模態分發的完整需求曲線——Max-Preview 把國產程式設計推到新高,Flash 用極低單價撐起多模態長上下文,Plus 是穩定的均衡主力;27B 與 35B-A3B 兩款開源版由 API易 官轉託管,把”開源權重可控 + 免租卡”這條路徑補齊。5 款模型共用 OpenAI Chat 相容端點,掛牌持平官網 + 充值加贈約 8.5 折,是當前阿里雲官轉通道里價效比最優的國產模型組合。