/v1/chat/completions:完整可用,工具调用、结构化输出、多模态、流式均已验证/v1/messages:代码集成可用,回传历史消息前需剥掉thinking块;Claude Code 等现成客户端因无法改变其回显行为,暂不可用/v1/responses:暂不支持,已反馈渠道方
xhigh 档),日常对话建议显式设 reasoning_effort="none",实测输出可从约 158 tokens 降到 5 tokens。其二,max_tokens 不约束思考 token——实测设 max_tokens=1 仍被计 1054 个输出 token,控成本请用 reasoning_effort。其三,需要 tool_choice 强制调用或 n > 1 时,必须同时设 reasoning_effort="none",否则报 400 或静默失效。
完整的能力矩阵、基准数据与代码示例见 Qwen3.8-Max 上线说明。
← 返回实时动态 · 📚 按月归档