qwen3.8-max)是阿里通义千问 2026 年 8 月 3 日发布的新一代旗舰,稀疏 MoE 架构、2.4 万亿总参数,支持 1M 上下文、131K 最大输出,原生接受文本、图片、视频三种输入。API易在发布当天上架,并完成了 586 次实测调用——本页的能力矩阵、参数行为与计费提醒全部来自实测,不是转述官方文档。
API易已接入 Qwen3.8-Max:模型名
qwen3.8-max。默认开启深度思考(默认 xhigh 档,思考 tokens 计入输出计费),日常对话建议显式设 reasoning_effort="none",实测输出可从约 158 tokens 降到 5 tokens。上一代见 Qwen3.6 系列(历史版本)。核心优势
比官网便宜 17.5%
输入 $1.65、输出 $4.95 每 1M tokens,阿里云官网为 $2/$6。可叠加充值活动继续下探。
1M 上下文实测可用
8K / 32K / 128K 三档正文,中部与尾部各埋一枚标识,两个端点 6/6 全部精确召回。128K 单次约 80 秒。
一个模型三种模态
文本、图片、视频输入全部实测通过,无需在「长文模型」和「视觉模型」之间切换。
Agent 能力大幅提升
FrontierSWE 由上代 40.7 升至 73.5,DeepSWE 21.6 → 56.6。工具调用链路完整,两轮 round-trip 实测通过。
端点支持
模型定价
每 1M tokens,折扣前挂牌价:
可叠加充值活动,实际成本更低。
技术规格
官方基准:GPQA Diamond 92.6、PaperBench 93.0、OmniDocBench 1.5 92.1、Terminal-Bench 2.1 86.6、OSWorld-Verified 86.1、IFBench 82.8、FrontierSWE 73.5、SWE-bench Pro 67.7。
思考控制(最重要的一节)
Qwen3.8-Max 默认就在思考,档位为xhigh。思考 tokens 计入输出计费,且占比常达 90% 以上。
reasoning_effort 七个值,四个真实档位
参数接受 7 个值,但实测只对应 4 个真实档位:
传
max 不会比 xhigh 想得更多。传其他值会返回 400 并列出合法值。
关闭思考的写法
extra_body 里的 enable_thinking: false 与 chat_template_kwargs: {"enable_thinking": false} 同样生效,效果等价。
thinking_budget 不生效
传 128 / 512 / 4096 任何数值,实测行为都等同于 low 档,数值不起作用。请改用 reasoning_effort。
调用示例
Python(OpenAI SDK 兼容)
图片输入
url 填成 https://... 即可。
视频输入
{"type": "video", "video": [帧1, 帧2, ...]},要求 4–8000 帧,少于 4 帧会返回 400。
cURL
工具调用
Chat Completions 端点的工具调用完整可用:单工具、并行多工具、两轮 round-trip、20 个工具中选 1、流式增量拼接、parallel_tool_calls: false 全部实测通过。
结构化输出
response_format 的 json_schema 实测严格守约:嵌套对象、枚举、数组、additionalProperties: false 全部生效,无多余字段、无 Markdown 代码块包裹。
上下文缓存
- 命中门槛约 1024 tokens:818 tokens 的前缀不命中,1070 tokens 起命中
- 真实多轮对话吃得到缓存:逐轮追加消息的场景每轮都命中
- 长文收益显著:128K 上下文实测缓存命中 98.6%,32K 命中 99.3%
Anthropic 端点用法
/v1/messages 可用于代码集成,但回传历史消息前需要剥掉 thinking 块,否则返回 400(if content is list. item must be dict and key[type] should in dict)。
response_format 被静默忽略(结构化输出请改用工具强制)、tool_choice 只接受 OpenAI 格式、图片只支持 base64(远程 URL 返回 400)、reasoning_effort 不生效(关思考请用 thinking: {"type": "disabled"})。
参数兼容性
最佳实践
日常对话与高频调用
显式设
reasoning_effort="none"。实测耗时从约 5 秒降到 2 秒、输出 tokens 降到 1/30。长文档与代码库分析
128K 召回实测精确,长文缓存命中率高。把大文档放在消息前部,追问放在尾部。
数据抽取
用
json_schema 约束结构,同时关思考。守约程度不受影响。Agent 与工具编排
走
/v1/chat/completions。需要强制调用时记得关思考。常见问题
为什么我设了 max_tokens 还是被扣了很多 token?
为什么我设了 max_tokens 还是被扣了很多 token?
max_tokens 只约束可见回答,不约束思考部分。实测 max_tokens=1 仍被计 1054 个输出 token。控制成本请用 reasoning_effort="none"。为什么 tool_choice 指定了函数却报 400?
为什么 tool_choice 指定了函数却报 400?
思考模式下不支持
tool_choice 强制调用。请同时传 reasoning_effort="none"。为什么 /v1/responses 调不通?
为什么 /v1/responses 调不通?
该端点对本模型暂未接入,30 次测试全部失败(错误码在 404 与 400 之间跳变)。已反馈渠道方,接通后会在实时动态公告。请改用
/v1/chat/completions。Claude Code 能用这个模型吗?
Claude Code 能用这个模型吗?
暂时不能。
/v1/messages 端点拒绝含 thinking 块的历史消息,而 Claude Code 默认原样回显。自己写代码调用时剥掉该块即可正常使用。usage 里为什么有时没有 reasoning_tokens?
usage 里为什么有时没有 reasoning_tokens?
该模型背后有多条上游线路,其中一条不回显
reasoning_tokens 与 cached_tokens,实测约占 chat 请求的三分之一。已反馈渠道方统一口径。需要精确核算思考成本时请留意这一点。视频调用为什么很慢?
视频调用为什么很慢?
视频理解单次实测 144–285 秒,属于模型本身的处理耗时。请把超时设到 300 秒以上,并考虑用异步队列承接。
相关文档
- Qwen3.8-Max 在线调试 — Playground 直接发请求
- Qwen3.6 系列(历史版本) — 上一代五款模型
- Qwen3.8-Max 上线说明 — 基准数据与完整解读
- 模型价格 — 全站模型单价、缓存价格与可用端点
- 充值优惠活动 — 叠加折扣
本页实测数据来自 2026-08-03 的 586 次调用(12:50–14:35 UTC+8)。计费相关结论基于接口返回的 usage 字段,未与账单逐笔交叉验证。模型与网关行为可能随渠道调整而变化,以实际调用为准。