qwen3.8-max)는 2026년 8월 3일에 출시된 Alibaba Qwen의 새로운 플래그십입니다. 이는 총 2.4조 파라미터를 가진 희소 MoE 모델로, 100만 컨텍스트 윈도우, 최대 출력 131K, 그리고 텍스트, 이미지, 동영상 입력에 대한 기본 지원을 제공합니다. APIYI는 출시 당일 이를 등록했고 이에 대해 586회의 실시간 테스트 호출을 수행했습니다. 이 페이지의 기능 매트릭스, 파라미터 동작, 과금 참고 사항은 모두 공식 문서를 그대로 옮긴 것이 아니라 이러한 테스트에서 나온 것입니다.
Qwen3.8-Max는 APIYI에서 사용 가능합니다: 모델 이름은
qwen3.8-max입니다. 추론은 기본적으로 켜져 있으며(xhigh 티어에서 적용되고, 추론 token은 출력으로 과금됨), 일상적인 채팅에서는 reasoning_effort="none"를 명시적으로 설정하십시오. 테스트에서는 이 설정으로 출력이 대략 158 token에서 5 token으로 줄었습니다. 이전 세대는 Qwen3.6 시리즈(레거시)를 참조하십시오.이 모델을 선택하는 이유
공식 대비 17.5% 저렴
1M token당 입력 $1.65, 출력 $4.95로 Alibaba Cloud의 $2/$6보다 저렴합니다. 충전 프로모션이 추가로 적용됩니다.
1M 컨텍스트, 검증됨
마커가 문서 중간과 끝에 숨겨진 8K / 32K / 128K 본문 전반에서 두 엔드포인트 모두 6/6 전부를 정확히 회수했습니다. 128K 호출은 약 80초가 걸립니다.
세 가지 모달리티, 하나의 모델
텍스트, 이미지, 동영상 입력 모두 정상 작동이 검증되었습니다 — “긴 컨텍스트 모델”과 “비전 모델”을 오갈 필요가 없습니다.
훨씬 더 강력한 에이전틱 작업
FrontierSWE는 이전 세대의 40.7에서 73.5로, DeepSWE는 21.6에서 56.6으로 상승했습니다. 도구 호출 체인은 완성되었으며, 2회 왕복이 검증되었습니다.
엔드포인트 지원
가격
1M tokens당, 할인 전 정가:
충전 프로모션은 추가로 적용되어 더 낮은 실효 비용을 제공합니다.
사양
공식 벤치마크: GPQA Diamond 92.6, PaperBench 93.0, OmniDocBench 1.5 92.1, Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1, IFBench 82.8, FrontierSWE 73.5, SWE-bench Pro 67.7.
추론 제어(가장 중요한 섹션)
Qwen3.8-Max는 기본적으로xhigh 티어에서 추론합니다. 추론 token은 출력으로 과금되며, 대개 그 90% 이상을 차지합니다.
7개 값, 4개의 실제 티어
이 매개변수는 7개 값을 받지만 실제로는 4개의 실제 티어에만 매핑됩니다:max을 전달해도 xhigh보다 더 많이 추론하지는 않습니다. 그 외의 값은 허용된 집합을 나열한 400을 반환합니다.
추론을 끄는 방법
enable_thinking: false는 extra_body 및 chat_template_kwargs: {"enable_thinking": false}와 동등하며, 역시 작동합니다.
thinking_budget는 영향을 주지 않습니다
128 / 512 / 4096을 전달해도 모두 low 티어와 동일하게 동작합니다. 숫자 자체는 무시됩니다. 대신 reasoning_effort을 사용하십시오.
코드 예시
Python (OpenAI SDK 호환)
이미지 입력
url를 https://... 주소로 설정하기만 하면 됩니다.
동영상 입력
{"type": "video", "video": [frame1, frame2, ...]}도 있으며, 4–8000프레임이 필요합니다. 4보다 적으면 400이 반환됩니다.
cURL
도구 호출
Chat Completions 엔드포인트의 도구 호출은 완전히 작동합니다: 단일 도구, 병렬 도구, 2라운드 왕복, 20개 도구 중 1개 선택, 스트리밍 델타, 그리고parallel_tool_calls: false 모두 검증되었습니다.
구조화된 출력
response_format를 테스트에서 json_schema가 엄격하게 유지된 상태로 사용하면: 중첩 객체, 열거형, 배열, 그리고 additionalProperties: false가 모두 적용되었으며, 추가 필드나 Markdown 코드 펜스는 없었습니다.
컨텍스트 캐싱
- 약 1,024 token 부근에서 적중 임계값: 818-token 접두사는 미적중이었고, 1,070 tokens 이상은 적중했습니다
- 실제 다중 턴 대화는 적중합니다: 메시지를 턴마다 추가하면 매 라운드마다 적중했습니다
- 긴 문서에서 가장 큰 효과가 있습니다: 128K에서 입력의 98.6%가 캐시되었고, 32K에서 99.3%가 캐시되었습니다
Anthropic 엔드포인트 사용
/v1/messages는 코드 통합에는 유용하지만, 기록을 재생하기 전에 thinking 블록을 반드시 제거해야 합니다. 그렇지 않으면 400(if content is list. item must be dict and key[type] should in dict)이 발생합니다.
response_format은 조용히 무시됩니다(구조화된 출력을 위해 도구 호출을 강제하십시오), tool_choice은 OpenAI 형식만 허용합니다, 이미지는 base64여야 하며(원격 URL은 400을 반환합니다), 그리고 reasoning_effort은 아무 영향도 없습니다(추론을 끄려면 thinking: {"type": "disabled"}를 사용하십시오).
파라미터 호환성
모범 사례
일상 대화 및 대량 호출
reasoning_effort="none"을 명시적으로 설정하십시오. 측정된 지연 시간은 약 5초에서 2초로 줄었고, output tokens는 대략 1/30로 감소했습니다.긴 문서 및 코드베이스
128K recall은 테스트에서 정확했으며, 긴 문서의 캐시 적중률이 높습니다. 큰 문서는 메시지 목록 앞쪽에 두고 질문은 끝에 두십시오.
데이터 추출
json_schema로 제약을 걸고 thinking을 비활성화하십시오. 준수도는 영향을 받지 않습니다.에이전트 및 도구 오케스트레이션
/v1/chat/completions를 사용하십시오. 도구 호출을 강제할 때는 thinking을 비활성화하는 것을 잊지 마십시오.자주 묻는 질문
max_tokens를 설정한 뒤에도 왜 여전히 많은 token이 청구됩니까?
max_tokens를 설정한 뒤에도 왜 여전히 많은 token이 청구됩니까?
max_tokens는 보이는 응답만 제한하며, 추론 부분은 제한하지 않습니다. 저희는 max_tokens=1에서 청구된 출력 token 1,054개를 측정했습니다. 비용을 제어하려면 reasoning_effort="none"를 사용하십시오.이름이 지정된 함수가 있는 tool_choice는 왜 400을 반환합니까?
이름이 지정된 함수가 있는 tool_choice는 왜 400을 반환합니까?
추론이 켜져 있는 동안에는 강제 tool choice를 지원하지 않습니다.
reasoning_effort="none"를 함께 전달하십시오.왜 /v1/responses에 도달할 수 없습니까?
왜 /v1/responses에 도달할 수 없습니까?
이 엔드포인트는 아직 이 모델에 연결되지 않았습니다. 30번의 테스트 호출이 모두 실패했으며, 오류 코드는 404와 400 사이를 번갈아 가며 나타났습니다. 상위 쪽에 보고되었으며, 사용 가능해지면 Live Updates에서 공지하겠습니다. 대신
/v1/chat/completions를 사용하십시오.이 모델을 Claude Code에서 사용할 수 있습니까?
이 모델을 Claude Code에서 사용할 수 있습니까?
아직은 불가능합니다.
/v1/messages 엔드포인트는 thinking 블록을 포함한 기록 메시지를 거부하며, Claude Code는 이를 그대로 재생합니다. 직접 작성한 코드에서 호출할 때는 해당 블록을 제거하면 엔드포인트가 정상적으로 동작합니다.왜 usage에서 reasoning_tokens가 때때로 누락됩니까?
왜 usage에서 reasoning_tokens가 때때로 누락됩니까?
이 모델은 여러 upstream 경로를 통해 제공되며, 그중 하나는
reasoning_tokens 또는 cached_tokens를 보고하지 않습니다. 이는 전체 chat 요청의 약 3분의 1에서 측정되었습니다. 정합성을 위해 상위 쪽에 보고되었습니다. 정확한 추론 비용 집계가 필요하다면 염두에 두십시오.왜 동영상 호출은 이렇게 느립니까?
왜 동영상 호출은 이렇게 느립니까?
동영상 이해는 호출당 144~285초가 측정되었으며, 이는 모델 자체의 처리 시간입니다. timeout을 300초 이상으로 설정하고 비동기 큐를 고려하십시오.
관련
- Qwen3.8-Max 플레이그라운드 — 요청을 직접 전송합니다
- Qwen3.6 시리즈(레거시) — 이전 다섯 개 모델입니다
- Qwen3.8-Max 출시 노트 — 벤치마크와 전체 설명입니다
- 모델 요금 — 모델별 요율, 캐시 요금, 사용 가능한 엔드포인트입니다
- 충전 프로모션 — 중복 적용 가능한 할인입니다
이 페이지의 측정값은 2026-08-03(12:50–14:35 UTC+8)에 수행한 586회의 실시간 호출에서 가져왔습니다. 과금 관련 결론은 API가 반환한 usage 필드를 기준으로 하며, 송장과 한 줄씩 대조하지는 않았습니다. 채널 조정에 따라 모델 및 게이트웨이 동작은 변경될 수 있으므로, 실시간 호출을 기준 소스로 보아야 합니다.