APIYI의 Alibaba Qwen3.6 패밀리: Max-Preview 코딩 플래그십 + Flash 속도 우선 멀티모달 + Plus 균형형 워크호스 + 27B / 35B-A3B 오픈 웨이트 변형(APIYI 호스팅 — GPU 대여 불필요). 모두 Aliyun의 공식 릴레이를 통해 라우팅되며, OpenAI Chat 호환입니다. 정가는 Alibaba의 공식 요율과 동일하며, APIYI의 충전 보너스로 실질 단가는 정가의 약 85% 수준입니다.
이 페이지는 레거시 아카이브입니다. Alibaba Qwen의 현재 주력은 Qwen3.8-Max로, 2026년 8월에 공개되었습니다 — 2.4T 파라미터, 1M 컨텍스트, 기본 이미지 및 비디오 입력, Alibaba의 공식 가격보다 17.5% 낮게 책정되었습니다. 아래의 다섯 Qwen3.6 모델은 동일한 가격과 통합 방식으로 계속 호출할 수 있지만, 새 프로젝트는 Qwen3.8-Max로 시작해야 합니다.
Qwen3.6은 Alibaba Tongyi Qianwen의 차세대 모델 패밀리로, 2026년 2분기에 세 가지 폐쇄형 생산 티어 — Max (주력), Plus (균형형), Flash (속도 우선) — 와 두 가지 오픈 가중치 변형인 27B 및 35B-A3B로 공개되었습니다. APIYI는 다섯 모델 모두를 Aliyun official relay / APIYI hosted relay를 통해 라우팅하며, OpenAI Chat Completions와 호환됩니다. 폐쇄형 티어는 공식 포털의 인증 및 요청 제한 정책을 따르며, 오픈 가중치 티어는 APIYI의 공식 릴레이에서 호스팅되므로 고객이 GPU를 임대하거나 로컬 추론을 직접 구축할 필요가 없습니다.
🚀 하이라이트: Max-Preview는 SWE-bench Pro와 Terminal-Bench 2.0을 포함한 6개 코딩 벤치마크에서 #1을 차지한다고 주장합니다; Flash는 기본 256K(1M까지 확장 가능) 멀티모달 컨텍스트를 갖춘 35B-A3B MoE입니다; Plus는 1M 컨텍스트 윈도우를 갖춘 72B/18B 활성 작업용 모델입니다. 오픈 가중치 qwen3.6-27b(27B dense)와 qwen3.6-35b-a3b(35B MoE / 3B active)는 APIYI의 공식 릴레이에서 호스팅되므로 GPU 임대가 필요 없으며, 토큰당 과금됩니다. 코딩 에이전트, 장문 컨텍스트 RAG, 멀티모달 디스패치, 그리고 감사 가능한 가중치가 필요한 규정 준수 민감 워크로드를 위해 설계되었습니다.
적용 시나리오: Coding Agent 드라이버, 실제 소프트웨어 엔지니어링 작업(SWE-Verified 급), Cursor / Claude Code 워크플로의 기본 모델입니다.벤치마크: SWE-bench Pro 58.4로 GLM-5.1의 56.6을 앞섭니다, AIME 2025 93%, GPQA 86%, LiveCodeBench 79%, Terminal-Bench 2.0 #1입니다.참고: Preview로 표시되어 있으며, 가중치가 아직 계속 조정 중입니다. 본 트래픽으로 전환하기 전에 소규모 카나리를 먼저 실행하십시오.
Flash · 대규모 멀티모달 장문 컨텍스트
적용 시나리오: 이미지 / 동영상 이해, 긴 문서 요약, 대량 번역, RAG 이후 전체 문서 종합입니다.아키텍처: 총 35B / 활성 3B MoE(35B-A3B), 기본 256K 컨텍스트이며 1M tokens까지 확장 가능합니다.멀티모달: 텍스트 / 이미지 / 동영상 입력을 기본으로 지원합니다. 단가가 Max의 약 1/8입니다.
Plus · 균형 잡힌 주력 모델
적용 시나리오: 일상 대화, 고객 지원, 콘텐츠 생성, 엔터프라이즈 지식베이스 Q&A, 중간 난도의 추론입니다.아키텍처: 총 72B / 활성 18B MoE — 추론 속도는 대략 Claude Opus 4.6의 3배입니다.벤치마크: Terminal-Bench 2.0에서 61.6으로 Claude Opus 4.5(59.3)를 앞섭니다. SWE-bench Verified 78.8입니다.
qwen3.6-27b · 오픈웨이트 코딩 강자
적용 시나리오: 비용에 민감한 코딩 지원, 로컬 배포를 커밋하기 전의 API 검증 단계, 감사 가능한 오픈소스 라이선스가 필요한 고객입니다.참고: 27B dense, 오픈 웨이트이며 코딩 능력은 397B급 모델에 필적합니다. APIYI에서 호스팅하므로 로컬 GPU가 필요 없습니다.
qwen3.6-35b-a3b · 오픈웨이트 고속 MoE
적용 시나리오: 고빈도 저비용 워크플로, 셀프 호스티드 추론으로 옮기기 전의 전환 단계, 규정 준수를 위해 다운로드 가능한 가중치가 필요한 프로젝트입니다.참고: 폐쇄형 Flash와 같은 계열입니다(총 35B / 활성 3B). 오픈웨이트 버전은 APIYI에서 호스팅하므로 GPU 대여, 배포, 운영을 건너뛸 수 있습니다.
권장 라우팅
전략: 기본은 Flash, 승격 시 Plus, 상한은 Max-Preview로 두며, 극도로 비용에 민감한 워크로드에는 오픈웨이트 27b / 35b-a3b로 낮추십시오.일상적인 대화와 멀티모달 배치는 Flash로 보내고, 더 강한 추론이 필요하면 Plus로 승격하며, 코딩 에이전트, 복잡한 추론, 다단계 계획에는 Max-Preview를 남겨 두십시오. 비용이 가장 중요하거나 감사 가능한 가중치가 필요할 때는 오픈웨이트 계층으로 전환하십시오.
다섯 모델 모두 종량제 - Chat 기준으로 과금됩니다. 비공개 소스 계층( Max-Preview / Flash / Plus )은 단일 요청의 총 입력 token 수를 기준으로 하는 계단식 과금을 사용합니다. 오픈 웨이트 계층(27b / 35b-a3b)은 단일 정액 요율 — 계층 없음으로 과금됩니다. 목록 가격은 Alibaba Cloud의 공식 요율과 일치하며, APIYI의 충전 보너스로 실효 단가는 대략 목록 가격의 85% 수준이 됩니다.
비공개 소스 계층(계단식 과금): 계층은 단일 요청의 총 입력 token 수로 정해집니다. 해당 요청의 모든 token(입력 + 출력)은 그 계층의 요율로 과금됩니다. 계층 간 일할 계산은 없습니다 — 예를 들어 입력 token이 300K인 Flash 요청은 256K – 1000K에 해당하며, 전체 요청이 $0.68 / $4.08 요율로 과금되고, “처음 256K는 저렴하고 나머지 44K는 더 높은 계층”으로 나뉘지 않습니다.
오픈 웨이트 계층(정액 과금): qwen3.6-27b 및 qwen3.6-35b-a3b는 APIYI의 공식 릴레이에서 호스팅됩니다 — 계층이 없습니다. 고객은 GPU를 임대하거나 로컬 추론을 실행할 필요가 없으며, 실제 token 사용량에 따라 직접 정산하면 됩니다.
목록 가격은 Alibaba Cloud Bailian과 일치합니다. 충전 보너스를 적용하면 실효 단가는 대략 목록 가격의 85% 수준입니다.
Qwen team 오픈 웨이트 (Hugging Face Qwen/Qwen3.6-35B-A3B)
컨텍스트
공식 weight 카드와 동일
공식 weight 카드와 동일
입력 모달리티
텍스트
텍스트
스트리밍
✅ 지원
✅ 지원
함수 호출 / 도구 사용
✅ 지원
✅ 지원
과금
사용량 기반 Chat (고정, 단계 없음)
사용량 기반 Chat (고정, 단계 없음)
채널
APIYI 호스팅 릴레이
APIYI 호스팅 릴레이
호스팅된 오픈 웨이트를 사용하는 이유: 오픈 웨이트 체크포인트는 공개적으로 다운로드할 수 있지만, 실행하려면 GPU, VRAM, 운영이 필요합니다. APIYI는 이러한 오픈 웨이트를 공식 릴레이에 호스팅합니다, 따라서 API를 직접 호출할 수 있습니다 — 임대, 배포, 운영 비용을 들이지 않으면서 “감사 가능한 가중치, 통제 가능한 라이선스”라는 장점을 유지합니다.
도메인: api.apiyi.com은 주요 게이트웨이입니다. b.apiyi.com / vip.apiyi.com 같은 대체 게이트웨이도 동일한 응답을 생성합니다. OpenAI / OpenAI 호환 SDK를 직접 사용하려면 base_url를 https://api.apiyi.com/v1로 설정합니다.
일상적인 대화 / 분류 / 멀티모달 배칭에는 Flash를 기본으로 사용합니다. 중간 수준의 추론과 기업용 지식 베이스 Q&A에는 Plus를 사용합니다. 코딩 에이전트, 복잡한 계획, 또는 경쟁 수준의 수학 추론에는 Max-Preview로만 올립니다. 가능할 때마다 더 낮은 티어를 사용합니다.
2
티어 경계를 추정합니다
출시 전에 P95 입력 token 수를 프로파일링합니다. Max-Preview는 128K를 넘기거나 Flash / Plus는 256K를 넘기면 가격이 급격히 올라갑니다. 매우 긴 컨텍스트는 요약 / 청크로 나누어 P95를 더 낮은 티어 안에 유지합니다.
3
멀티모달 배칭
Flash는 1M 컨텍스트와 비디오 입력을 지원하지만, 하나의 매우 긴 요청은 더 높은 티어를 유발합니다. 긴 비디오는 구간별로 나눈 뒤 256K 이내의 청크로 입력해 호출당 비용을 관리합니다.
4
Preview 카나리
qwen3.6-max-preview는 Preview 빌드입니다 — 가중치가 아직 반복 조정 중입니다. 중요한 경로에서는 메인 트래픽을 전환하기 전에 A/B 비교를 포함한 작은 카나리 테스트를 먼저 실행합니다.
5
도구 및 스트리밍
세 모델 모두 OpenAI 스타일의 tools와 stream: true를 지원합니다. 도구 호출 로직을 다시 작성하지 않고도 기존 OpenAI 호환 Agent 프레임워크(OpenClaw, LangChain, LlamaIndex 등)에 그대로 넣을 수 있습니다.
6
충전 보너스를 더해 활용합니다
정가는 이미 Alibaba의 공식 요율과 일치합니다. 충전 보너스를 더하면 실효 단가는 정가의 85% 정도입니다. 더 큰 충전($1,000+)일수록 더 높은 보너스 비율을 받으므로, 더 적고 큰 금액으로 충전하는 편이 마진에 가장 유리합니다.
네. 다섯 모델 모두 /v1/chat/completions를 공유합니다(OpenAI Chat Completions 호환). 차이는 model 필드만 다르며(qwen3.6-max-preview / qwen3.6-flash / qwen3.6-plus / qwen3.6-27b / qwen3.6-35b-a3b), 필요에 따라 같은 코드베이스에서 전환하시면 됩니다.
오픈 웨이트(27b / 35b-a3b)와 클로즈드 소스 계층의 차이는 무엇입니까?
주요 차이는 세 가지입니다: (1) 다운로드 가능한 가중치 — 오픈 웨이트 체크포인트는 내부 감사, 컴플라이언스 제출, 또는 향후 로컬 추론으로의 마이그레이션을 위해 Hugging Face에 있습니다; (2) 호스팅된 컴퓨트 — APIYI가 공식 릴레이에서 오픈 웨이트를 호스팅하므로 사용자는 API만 호출하면 되고, GPU 대여 / 배포 / 운영이 필요 없습니다; (3) 더 단순한 과금 — 오픈 웨이트 계층은 정액 요금제를 사용하며, 단계가 없어 예산 편성이 더 쉽습니다. 성능 측면에서는 35B-A3B가 클로즈드 소스 Flash와 계보를 공유하지만(배포 계층은 다름), 27B는 독립적인 dense 모델로 코딩 능력이 훨씬 더 높은 파라미터 수를 가진 모델들과 견줄 만합니다.
가중치가 공개되어 있는데 왜 APIYI의 호스팅된 API를 사용해야 합니까?
오픈 대형 모델을 자체 호스팅하려면 최소한 다음이 필요합니다: 성능이 충분한 GPU(27B는 최소 A100 40G 1개가 필요하며, 35B-A3B는 더 많은 VRAM이 필요함), 추론 프레임워크(vLLM / TensorRT-LLM), 모니터링, 장애 조치, 업그레이드 파이프라인. APIYI의 호스팅된 공식 릴레이가 이 모든 것을 처리합니다 — token 기준으로 과금되고, 필요에 따라 확장되며, 클로즈드 소스 계층과 동일한 OpenAI 호환 SDK를 공유합니다. API로 먼저 구축하고, 나중에 자체 호스팅으로 전환할지 결정하시면 됩니다. 전환 경로는 계속 매끄럽게 유지됩니다.
단계별 과금은 정확히 어떻게 작동합니까?
단계는 단일 요청의 총 입력 token 수로 결정됩니다. 해당 요청의 모든 token(입력 + 출력)은 해당 단계의 요율로 과금됩니다. 예시: 입력 token이 300K인 Flash 요청은 256K – 1000K에 해당하며, 요청 전체가 $0.68 / $4.08로 과금됩니다 — “처음 256K는 저렴하고, 나머지 44K는 더 비싸게”로 나뉘지 않습니다.
Max-Preview는 Preview입니다 — 프로덕션에 사용해도 됩니까?
네, 하지만 먼저 카나리로 운영하셔야 합니다. Qwen 팀은 이후 개정판에서 가중치를 계속 다듬을 것이라고 밝혔습니다. 중요한 경로에서는 벤치마크 작업으로 A/B 테스트를 수행하고, 안정적인 버전이 나올 때만 메인 트래픽을 전환하시면 됩니다.
Flash에 멀티모달 입력은 어떻게 보내야 합니까?
OpenAI의 Vision 호환 형식을 사용하십시오: messages에서 content를 각 요소가 {type: "text", text: ...} 또는 {type: "image_url", image_url: {url: ...}}인 배열로 보내십시오. 동영상의 경우 공식 문서의 video_url / 프레임 샘플링 필드를 따르십시오.
APIYI의 가격은 Alibaba Cloud Bailian의 공식 사이트와 같습니까?
목록 가격은 공식 요율과 같습니다. 차이점은 APIYI가 충전 보너스를 더해 실질 단가를 정가의 약 85% 수준으로 낮추며, OpenAI 호환 전체 생태계(GPT / Claude / Gemini / DeepSeek / GLM 등)를 지원하는 통합 계정을 제공한다는 점입니다 — 여러 공급업체 계정을 따로 유지할 필요가 없습니다.
function calling / tool use를 지원합니까?
네. 세 모델 모두 OpenAI 표준 tools / tool_choice를 수용합니다. 기존 Agent 프레임워크의 tool-calling 로직을 재사용할 수 있습니다. Max-Preview는 다단계 tool call과 장기 계획에서 강점을 보입니다.
chain-of-thought 출력을 지원합니까?
Max-Preview는 추론 작업에서 CoT를 자동으로 활성화하며, Plus는 CoT가 항상 켜져 있고, Flash는 속도 우선이라 기본적으로 CoT를 출력하지 않습니다. 필드 이름은 Alibaba Cloud의 응답 형식(reasoning_content 등)을 따릅니다.
요청이 1M 컨텍스트를 초과하면 어떻게 됩니까?
Flash와 Plus는 1M token까지, Max-Preview는 262K까지 지원합니다. 한도를 초과하면 400가 반환됩니다. 전송 전에 요약 / 청킹 / RAG 검색을 적용하십시오 — 모든 것을 한 번의 호출에 억지로 넣지 마십시오.
공식 OpenAI SDK를 직접 사용할 수 있습니까?
네. base_url를 https://api.apiyi.com/v1로 설정하고 위 모델 ID 중 하나를 model로 전달하시면 됩니다 — 코드 변경 없이 마이그레이션할 수 있습니다.
실패한 요청도 과금됩니까?
클라이언트 측 4xx 오류(파라미터 오류 / 인증 실패 / 콘텐츠 모더레이션 차단)는 과금되지 않습니다. 추론에 도달하지 못한 서버 측 5xx 오류도 과금되지 않습니다. token을 성공적으로 반환한 요청은 클라이언트가 스트리밍 중간에 취소하더라도 실제 token 수 기준으로 과금됩니다.
정리: Qwen3.6 시리즈는 고부하 코딩 에이전트부터 대량 멀티모달 처리까지의 전체 수요 곡선을 포괄합니다. Max-Preview는 국내 코딩을 새로운 수준으로 끌어올리고, Flash는 멀티모달 장문 컨텍스트 워크로드의 단가를 크게 낮추며, Plus는 믿을 수 있는 균형형 주력 모델입니다. APIYI의 공식 릴레이가 호스팅하는 오픈 웨이트 27B 및 35B-A3B 변형은 “GPU를 빌리지 않고도 제어 가능한 오픈 웨이트”의 고리를 완성합니다. 이들 다섯 모델은 모두 OpenAI Chat 호환 엔드포인트를 공유하며, 공식 요율과 맞춘 목록가에 제공되고, 충전 보너스와 함께하면 대략 목록가의 85% 수준까지 내려가므로, 현재 Aliyun 공식 릴레이 채널에서 이용할 수 있는 최고의 가격/성능 조합입니다.