Skip to main content
Qwen3.8-Max(qwen3.8-max)是阿里通義千問 2026 年 8 月 3 日釋出的新一代旗艦,稀疏 MoE 架構、2.4 萬億總引數,支援 1M 上下文、131K 最大輸出,原生接受文本、圖片、影片三種輸入。API易在釋出當天上架,並完成了 586 次實測呼叫——本頁的能力矩陣、引數行為與計費提醒全部來自實測,不是轉述官方文件。
API易已接入 Qwen3.8-Max:模型名 qwen3.8-max預設開啟深度思考(預設 xhigh 檔,思考 tokens 計入輸出計費),日常對話建議顯式設 reasoning_effort="none",實測輸出可從約 158 tokens 降到 5 tokens。上一代見 Qwen3.6 系列(歷史版本)

核心優勢

比官網便宜 17.5%

輸入 $1.65、輸出 $4.95 每 1M tokens,阿里雲官網為 $2/$6。可疊加充值活動繼續下探。

1M 上下文實測可用

8K / 32K / 128K 三檔正文,中部與尾部各埋一枚標識,兩個端點 6/6 全部精確召回。128K 單次約 80 秒。

一個模型三種模態

文本、圖片、影片輸入全部實測通過,無需在「長文模型」和「視覺模型」之間切換。

Agent 能力大幅提升

FrontierSWE 由上代 40.7 升至 73.5,DeepSWE 21.6 → 56.6。工具呼叫鏈路完整,兩輪 round-trip 實測通過。

端點支援

模型定價

每 1M tokens,折扣前掛牌價: 可疊加充值活動,實際成本更低。

技術規格

官方基準:GPQA Diamond 92.6、PaperBench 93.0、OmniDocBench 1.5 92.1、Terminal-Bench 2.1 86.6、OSWorld-Verified 86.1、IFBench 82.8、FrontierSWE 73.5、SWE-bench Pro 67.7。

思考控制(最重要的一節)

Qwen3.8-Max 預設就在思考,檔位為 xhigh。思考 tokens 計入輸出計費,且佔比常達 90% 以上。

reasoning_effort 七個值,四個真實檔位

引數接受 7 個值,但實測只對應 4 個真實檔位 max 不會比 xhigh 想得更多。傳其他值會返回 400 並列出合法值。

關閉思考的寫法

extra_body 裡的 enable_thinking: falsechat_template_kwargs: {"enable_thinking": false} 同樣生效,效果等價。
max_tokens 不約束思考 tokens。 實測設 max_tokens=1,仍被計 1054 個輸出 token,其中 1045 個是思考。max_tokens 只截斷可見回答。想控制成本請用 reasoning_effort,不要指望 max_tokens

thinking_budget 不生效

傳 128 / 512 / 4096 任何數值,實測行為都等同於 low 檔,數值不起作用。請改用 reasoning_effort

呼叫示例

Python(OpenAI SDK 相容)

圖片輸入

遠端圖片 URL 在本端點同樣可用,直接把 url 填成 https://... 即可。

影片輸入

影片理解單次耗時實測 144–285 秒,請把客戶端超時設到 300 秒以上,並優先用流式或非同步任務佇列承接。
另有幀序列寫法 {"type": "video", "video": [幀1, 幀2, ...]},要求 4–8000 幀,少於 4 幀會返回 400。

cURL

工具呼叫

Chat Completions 端點的工具呼叫完整可用:單工具、並行多工具、兩輪 round-trip、20 個工具中選 1、流式增量拼接、parallel_tool_calls: false 全部實測通過。
強制工具呼叫需同時關閉思考。 tool_choice 設為 "required" 或指定具體函式時,必須同時設 reasoning_effort="none",否則返回 400(tool_choice does not support being set to required or object in thinking mode)或靜默不呼叫。tool_choice"auto" / "none" 不受此限制。同理,n > 1 也需要關閉思考。

結構化輸出

response_formatjson_schema 實測嚴格守約:巢狀物件、列舉、陣列、additionalProperties: false 全部生效,無多餘欄位、無 Markdown 程式碼塊包裹。
結構化場景請顯式關思考。 同一個 schema 實測對比:兩者守約程度完全一致,成本和延遲差一個數量級。

上下文快取

  • 命中門檻約 1024 tokens:818 tokens 的字首不命中,1070 tokens 起命中
  • 真實多輪對話吃得到快取:逐輪追加訊息的場景每輪都命中
  • 長文收益顯著:128K 上下文實測快取命中 98.6%,32K 命中 99.3%
快取命中在實測中不夠穩定,同樣的字首在不同輪次時有時無,TTL 無法從介面回顯可靠推斷。請把快取收益當作「有則賺到」,不要拿它做成本預算

Anthropic 端點用法

/v1/messages 可用於程式碼整合,但回傳歷史訊息前需要剝掉 thinking,否則返回 400(if content is list. item must be dict and key[type] should in dict)。
實測這樣處理後,3 輪跨輪記憶、工具呼叫兩輪 round-trip、工具結果進入後續記憶全部正常。
Claude Code 等現成客戶端暫不可用——這類客戶端預設原樣回顯歷史 content blocks,無法改變其行為,第二輪就會 400。請改用 /v1/chat/completions
該端點的其他差異:response_format 被靜默忽略(結構化輸出請改用工具強制)、tool_choice 只接受 OpenAI 格式、圖片只支援 base64(遠端 URL 返回 400)、reasoning_effort 不生效(關思考請用 thinking: {"type": "disabled"})。

引數相容性

最佳實踐

日常對話與高頻呼叫

顯式設 reasoning_effort="none"。實測耗時從約 5 秒降到 2 秒、輸出 tokens 降到 1/30。

長文件與程式碼庫分析

128K 召回實測精確,長文快取命中率高。把大文件放在訊息前部,追問放在尾部。

資料抽取

json_schema 約束結構,同時關思考。守約程度不受影響。

Agent 與工具編排

/v1/chat/completions。需要強制呼叫時記得關思考。

常見問題

max_tokens 只約束可見回答,不約束思考部分。實測 max_tokens=1 仍被計 1054 個輸出 token。控制成本請用 reasoning_effort="none"
思考模式下不支援 tool_choice 強制呼叫。請同時傳 reasoning_effort="none"
該端點對本模型暫未接入,30 次測試全部失敗(錯誤碼在 404 與 400 之間跳變)。已反饋渠道方,接通後會在即時動態公告。請改用 /v1/chat/completions
暫時不能。/v1/messages 端點拒絕含 thinking 塊的歷史訊息,而 Claude Code 預設原樣回顯。自己寫程式碼呼叫時剝掉該塊即可正常使用。
該模型背後有多條上游線路,其中一條不回顯 reasoning_tokenscached_tokens,實測約佔 chat 請求的三分之一。已反饋渠道方統一口徑。需要精確核算思考成本時請留意這一點。
影片理解單次實測 144–285 秒,屬於模型本身的處理耗時。請把超時設到 300 秒以上,並考慮用非同步佇列承接。

相關文件

本頁實測資料來自 2026-08-03 的 586 次呼叫(12:50–14:35 UTC+8)。計費相關結論基於介面返回的 usage 欄位,未與賬單逐筆交叉驗證。模型與閘道行為可能隨渠道調整而變化,以實際呼叫為準。