核心要点
- 发布当天上架:阿里通义千问 2026 年 8 月 3 日发布 Qwen3.8-Max,API易同日挂牌
- 2.4T 参数稀疏 MoE:1M 上下文窗口、131K 最大输出、262K 最大思考预算
- 基准表现:GPQA Diamond 92.6、PaperBench 93.0、Terminal-Bench 2.1 86.6、SWE-bench Pro 67.7;FrontierSWE 从上代 40.7 跃升至 73.5
- 价格比官网低 17.5%:挂牌 $1.65/$4.95 每 1M tokens,官网为 $2.00/$6.00,且可叠加充值活动继续下探
- 原生多模态:实测图片与视频输入均可用,不只是文本模型
- 我们跑了 586 次调用:能力边界、计费陷阱、参数坑位全部实测过一遍,结论写在下文
数据来源:阿里通义官方发布(
qwen.ai/blog?id=qwen3.8)、QwenCloud 模型卡(qwencloud.com/models/qwen3.8-max),基准数据为官方 2026-08-03 公布口径。API易侧结论来自 2026-08-03 12:50–14:35 (UTC+8) 的 586 次实测调用。背景介绍
Qwen3.8-Max 是通义千问 Max 系列的新一代旗舰,架构上延续稀疏 MoE 路线,总参数量 2.4 万亿。 与上一代 Qwen3.7-Max 相比,官方把改进重点放在了 Agent 能力和多模态上,而不是纯推理分数的堆高。最能说明问题的是 FrontierSWE 从 40.7 直接拉到 73.5,DeepSWE 从 21.6 到 56.6 —— 这类基准考的是模型能不能在真实代码库里连续干活,而不是做单点难题。 对国内开发者更实际的一点是:这一代把 1M 上下文和多模态输入都做进了同一个模型,不需要在”长文模型”和”视觉模型”之间来回切换。详细解析
官方基准
技术规格
API易实测:端点支持情况
我们对三个端点各自跑了完整用例,结论如下:Chat Completions
/v1/chat/completions完整可用,推荐主用。工具调用、结构化输出、多模态、流式全部正常。Anthropic Messages
/v1/messages代码集成可用,需在回传历史时剥掉 thinking 块。Claude Code 等现成客户端暂不可用。Responses
/v1/responses暂不支持。30 次测试全部失败,已反馈渠道方。实测通过的能力
- 128K 长上下文召回:在 8K / 32K / 128K 三档正文的中部与尾部各埋一枚唯一标识,两个端点 6/6 全部精确召回。128K 单次约 80 秒
- 结构化输出严格守约:
json_schema在嵌套对象、枚举、数组、additionalProperties: false全部生效,无多余字段、无 Markdown 代码块包裹 - 图片输入:形状识别、颜色识别、点阵图 OCR、多图区分全部正确
- 视频输入:能准确描述视频内容(实测一段 3D 动画场景被完整还原),单次耗时 144–285 秒
- 工具调用:单工具、并行多工具、两轮完整 round-trip、20 个工具中选 1、流式增量拼接全部正常
- 稳定性:12 并发 12/12 成功;长流式完整终止,无尾部扣留;输出速率约 19–22 tokens/s,Chat 非流式 P50 约 3.4 秒
实际应用
代码示例
关键提醒 1:思考默认开启,控成本要用 reasoning_effort
Qwen3.8-Max 的思考模式默认就是开的,默认档位 xhigh。日常对话场景想省钱省时间,显式关掉即可:
reasoning_effort 从默认降到 none,输出从约 158 tokens 降到 5 tokens,耗时从约 5 秒降到 2 秒。
reasoning_effort 一共接受 7 个值,但实测只对应 4 个真实档位:
关键提醒 2:max_tokens 管不住思考 token
关键提醒 3:强制工具调用需同时关思考
需要tool_choice 强制调用("required" 或指定具体函数),或需要 n > 1 时,必须同时设 reasoning_effort="none",否则会返回 400 或静默不调用:
tool_choice 用 "auto" 或 "none" 则不受此限制。
关键提醒 4:结构化输出建议显式关思考
结构化输出会让思考量大幅上涨。实测同一个 schema:
两者的 JSON 结构守约程度完全一致。结构化场景请显式关思考,成本和延迟都能降一个数量级。
关键提醒 5:Anthropic 端点的使用方式
用/v1/messages 做代码集成时,回传历史消息前需要剥掉 thinking 块:
/v1/chat/completions。
上下文缓存
实测缓存命中门槛约为 1024 tokens,真实多轮追加对话吃得到缓存,128K 长文场景命中率可达 98.6%。目前不支持的能力
/v1/responses端点- 内置联网搜索(两种调用写法均无效)
thinking_budget参数(传任何数值都等价于low档)- Anthropic 端点的远程图片 URL(请改用 base64)
- Anthropic 端点的
response_format(结构化输出请改用工具强制)
价格与可用性
定价(每 1M tokens)
以上为折扣前挂牌价。
叠加网站充值活动
充值活动可在挂牌价基础上继续下探,详见充值优惠活动。调用方式
总结与建议
适合用 Qwen3.8-Max 的场景- 长文档分析、代码库理解 —— 128K 实测召回精确,长文缓存命中率高
- 需要严格 JSON 结构的数据抽取 ——
json_schema守约程度好,记得关思考 - 图文/视频混合理解 —— 一个模型覆盖三种模态,省去切换成本
- Agent 与工具编排 —— 工具调用链路完整,FrontierSWE 和 Terminal-Bench 的提升在这类任务上能体现出来
- 思考默认开着,日常对话加
reasoning_effort="none" max_tokens不是成本护栏,reasoning_effort才是- 主用
/v1/chat/completions;/v1/responses暂不支持
本文的 API易侧数据来自 2026-08-03 的 586 次实测调用(12:50–14:35 UTC+8)。计费相关结论基于接口返回的 usage 字段,未与账单逐笔交叉验证。模型与网关行为可能随渠道调整而变化,以实际调用为准。