APIYI의 Qwen3.6 패밀리: Max-Preview 코딩 플래그십 + Flash 속도 우선 멀티모달 + Plus 균형형 주력 + 27B / 35B-A3B 오픈 웨이트 변형( APIYI가 호스팅하므로 GPU 대여가 필요 없습니다). 모두 Aliyun의 공식 릴레이를 통해 라우팅되며 OpenAI Chat 호환입니다. 정가는 Alibaba의 공식 요율과 일치하며, APIYI의 충전 보너스로 실효 단가는 정가의 약 85% 수준입니다.
Qwen3.6은 Alibaba Tongyi Qianwen의 차세대 모델 패밀리로, 2026년 2분기에 세 가지 클로즈드 소스 프로덕션 티어 — Max (플래그십), Plus (균형형), Flash (속도 우선) — 와 두 개의 오픈 웨이트 변형인 27B 및 35B-A3B로 출시되었습니다. APIYI는 다섯 모델을 모두 Aliyun 공식 릴레이 / APIYI 호스팅 릴레이를 통해 라우팅하며, OpenAI Chat Completions와 호환됩니다. 클로즈드 소스 티어는 공식 포털의 인증 및 요청 제한 정책을 따르며; 오픈 웨이트 티어는 APIYI의 공식 릴레이에서 호스팅되므로 고객이 GPU를 임대하거나 로컬 추론을 직접 구축할 필요가 없습니다.
🚀 하이라이트: Max-Preview는 SWE-bench Pro와 Terminal-Bench 2.0을 포함한 6개 코딩 벤치마크에서 #1을 주장합니다; Flash는 기본 256K(1M까지 확장 가능) 멀티모달 컨텍스트를 갖춘 35B-A3B MoE입니다; Plus는 1M 컨텍스트 윈도우를 갖춘 72B/18B-active 작업용 모델입니다. 오픈 웨이트 qwen3.6-27b (27B dense)와 qwen3.6-35b-a3b (35B MoE / 3B active)는 APIYI의 공식 릴레이에서 호스팅되므로 GPU 임대가 필요 없고, token당 과금됩니다. 코딩 에이전트, 장문 컨텍스트 RAG, 멀티모달 디스패치, 감사 가능한 가중치가 필요한 컴플라이언스 민감 워크로드에 적합합니다.
적용 사례: Coding Agent 드라이버, 실제 소프트웨어 엔지니어링 작업(SWE-Verified 클래스), Cursor / Claude Code 워크플로의 기본 모델입니다.벤치마크: SWE-bench Pro 58.4로 GLM-5.1의 56.6을 앞섭니다. AIME 2025 93%, GPQA 86%, LiveCodeBench 79%, Terminal-Bench 2.0 1위입니다.참고: Preview로 표시되어 있으며, 가중치는 아직 반복 조정 중입니다. 메인 트래픽 전환 전에 작은 카나리 테스트를 먼저 실행해야 합니다.
Flash · 대규모 멀티모달 장문 컨텍스트
적용 사례: 이미지 / 동영상 이해, 장문 문서 요약, 대량 번역, RAG 이후 전체 문서 종합입니다.아키텍처: 총 35B / 활성 3B MoE(35B-A3B), 기본 256K 컨텍스트이며 1M token까지 확장 가능합니다.멀티모달: 텍스트 / 이미지 / 동영상 입력을 기본 지원합니다. 단가는 Max의 약 1/8입니다.
Plus · 균형 잡힌 주력 모델
적용 사례: 일상 대화, 고객 지원, 콘텐츠 생성, 기업 지식 베이스 Q&A, 중간 복잡도의 추론입니다.아키텍처: 총 72B / 활성 18B MoE — 추론 속도는 대략 Claude Opus 4.6의 3배입니다.벤치마크: Terminal-Bench 2.0의 61.6은 Claude Opus 4.5(59.3)를 앞섭니다. SWE-bench Verified는 78.8입니다.
qwen3.6-27b · 오픈 웨이트 코딩 강자
적용 사례: 비용에 민감한 코딩 지원, 로컬 배포로 전환하기 전의 API 검증 단계, 감사 가능한 오픈소스 라이선스에 대한 컴플라이언스 요구가 있는 고객입니다.참고: 27B dense, 오픈 웨이트이며 코딩 능력은 397B급 모델에 필적합니다. APIYI에서 호스팅되므로 로컬 GPU가 필요하지 않습니다.
qwen3.6-35b-a3b · 오픈 웨이트 고속 MoE
적용 사례: 고빈도 저비용 워크플로, 자체 호스팅 추론으로 옮기기 전의 전환 단계, 컴플라이언스 때문에 다운로드 가능한 가중치가 필요한 프로젝트입니다.참고: 폐쇄형 Flash와 같은 계열(총 35B / 활성 3B)입니다. 오픈 웨이트 버전은 APIYI에서 호스팅되므로 GPU 임대, 배포, 운영을 건너뛸 수 있습니다.
추천 라우팅
전략: 기본은 Flash + 상향 시 Plus + 상한은 Max-Preview이며, 초저비용 민감 워크로드는 오픈 웨이트 27b / 35b-a3b로 낮춥니다.일상 대화와 멀티모달 배치는 Flash로 라우팅하고; 더 강한 추론이 필요하면 Plus로 상향하며; 코딩 에이전트, 복잡한 추론, 다단계 계획에는 Max-Preview를 남겨 두고; 비용이 가장 중요하거나 감사 가능한 가중치가 필요할 때는 오픈 웨이트 티어로 내립니다.
모든 다섯 모델은 종량제 - Chat으로 과금됩니다. 폐쇄형 등급(Max-Preview / Flash / Plus)은 단일 요청의 총 입력 token 수를 기준으로 하는 단계형 과금을 사용합니다. 오픈 웨이트 등급(27b / 35b-a3b)은 단일 정액 요금 — 등급 없음으로 과금됩니다. 목록 가격은 Alibaba Cloud의 공식 요율과 일치하며, APIYI의 충전 보너스로 실제 단가는 대략 목록가의 85% 수준이 됩니다.
폐쇄형 등급(단계형 과금): 등급은 단일 요청의 총 입력 token 수로 정해집니다. 해당 요청의 모든 token(입력 + 출력)은 그 등급의 요율로 과금됩니다. 등급 간 안분 정산은 없습니다 — 예를 들어, 입력 token이 300K인 Flash 요청은 256K – 1000K에 해당하며 전체 요청이 $0.68 / $4.08 요율로 과금되고, “처음 256K는 저렴하게, 나머지 44K는 더 높은 등급으로” 나뉘어 계산되지 않습니다.
오픈 웨이트 등급(정액 과금): qwen3.6-27b와 qwen3.6-35b-a3b는 APIYI의 공식 릴레이에서 호스팅되며, 등급 구분이 없습니다. 고객은 GPU를 임대하거나 로컬 추론을 실행할 필요가 없으며, 실제 token 사용량에 따라 직접 정산됩니다.
목록 가격은 Alibaba Cloud Bailian과 일치합니다. 충전 보너스를 적용하면 실질 단가는 대략 목록가의 85% 수준입니다.
오픈 웨이트를 호스팅하는 이유: 오픈 웨이트 체크포인트는 공개적으로 다운로드할 수 있지만, 이를 실행하려면 GPU, VRAM, 운영이 필요합니다. APIYI는 이러한 오픈 웨이트를 공식 릴레이에서 호스팅하므로 API를 직접 호출할 수 있으며, 임대·배포·운영 비용은 줄이면서 “감사 가능한 가중치, 통제 가능한 라이선스”라는 이점을 유지합니다.
도메인: api.apiyi.com이 기본 게이트웨이입니다. b.apiyi.com / vip.apiyi.com 같은 대체 게이트웨이는 동일한 응답을 반환합니다. OpenAI / OpenAI 호환 SDK를 직접 사용하려면 base_url를 https://api.apiyi.com/v1로 설정합니다.
일상적인 대화 / 분류 / 멀티모달 배치 처리에는 Flash를 기본으로 사용합니다. 중간 복잡도의 추론과 엔터프라이즈 지식 베이스 Q&A에는 Plus를 사용합니다. 코딩 에이전트, 복잡한 계획 수립, 또는 대회급 수학 추론에는 Max-Preview로만 올립니다. 가능할 때마다 한 단계 낮추십시오.
2
티어 경계를 추정합니다
출시 전에 P95 입력 token 수를 프로파일링하십시오. Max-Preview가 128K를 넘거나, Flash / Plus가 256K를 넘으면 가격이 급격히 상승합니다. 매우 긴 컨텍스트는 요약 / 청크 처리하여 P95를 더 낮은 티어 안에 유지하십시오.
3
멀티모달 배치 처리
Flash는 1M 컨텍스트와 동영상 입력을 지원하지만, 단일 초장문 요청은 더 높은 티어를 유발합니다. 긴 동영상을 여러 구간으로 나눈 다음, 호출당 비용을 제어하려면 256K 이내의 청크로 입력하십시오.
4
Preview 카나리
qwen3.6-max-preview은 Preview 빌드입니다 — 가중치가 아직 계속 조정되고 있습니다. 중요한 경로에서는 메인 트래픽을 전환하기 전에 A/B 비교를 포함한 소규모 카나리를 실행하십시오.
5
도구 및 스트리밍
세 모델 모두 OpenAI 스타일의 tools 및 stream: true를 지원합니다. 기존 OpenAI 호환 Agent 프레임워크(OpenClaw, LangChain, LlamaIndex 등)에 도구 호출 로직을 다시 작성하지 않고 그대로 적용할 수 있습니다.
6
충전 보너스와 함께 활용하기
목록 가격은 이미 Alibaba의 공식 요율과 일치합니다. 충전 보너스와 함께 적용하면 실효 단가는 목록가의 약 85% 수준입니다. 더 큰 충전($1,000+)은 더 높은 보너스 비율을 받습니다 — 가장 좋은 마진을 위해 더 적고 큰 거래로 충전하십시오.
예. 다섯 모델은 모두 /v1/chat/completions(OpenAI Chat Completions와 호환)을 공유합니다. model 필드만 다릅니다(qwen3.6-max-preview / qwen3.6-flash / qwen3.6-plus / qwen3.6-27b / qwen3.6-35b-a3b) — 필요에 따라 같은 코드베이스에서 전환하면 됩니다.
오픈 가중치(27b / 35b-a3b)와 비공개 소스 계층의 차이점은 무엇입니까?
세 가지 주요 차이점이 있습니다: (1) 다운로드 가능한 가중치 — 오픈 가중치 체크포인트는 내부 감사, 규정 준수 서류 작성, 또는 향후 로컬 추론으로의 마이그레이션을 위해 Hugging Face에 있습니다; (2) 호스팅된 컴퓨팅 — APIYI가 오픈 가중치를 공식 릴레이에서 호스팅하므로 API만 호출하면 되고, GPU 임대 / 배포 / 운영이 필요하지 않습니다; (3) 더 단순한 과금 — 오픈 가중치 계층은 정액 요금을 사용하며, 계층이 없어 예산 편성이 더 쉽습니다. 성능 측면에서는 35B-A3B가 비공개 소스 Flash와 계보를 공유하며(배포 계층이 다름), 27B는 독립적인 밀집 모델로 코딩 능력이 훨씬 더 큰 파라미터 수를 가진 모델들과 견줄 만합니다.
가중치가 공개되어 있는데도 왜 APIYI의 호스팅 API를 사용합니까?
오픈 대형 모델을 자체 호스팅하려면 최소한 다음이 필요합니다: 성능이 충분한 GPU(27B는 최소 1개의 A100 40G가 필요하며, 35B-A3B는 더 많은 VRAM이 필요함), 추론 프레임워크(vLLM / TensorRT-LLM), 모니터링, 페일오버, 업그레이드 파이프라인입니다. APIYI의 호스팅된 공식 릴레이가 이 모든 것을 처리합니다 — token 단위로 과금되며, 수요에 따라 확장되고, 비공개 소스 계층과 동일한 OpenAI 호환 SDK를 공유합니다. API로 구축한 뒤 나중에 자체 호스팅으로 전환할지 결정하면 됩니다. 전환 경로도 매끄럽게 유지됩니다.
계층형 가격은 정확히 어떻게 작동합니까?
계층은 단일 요청의 총 입력 tokens에 따라 결정됩니다. 해당 요청의 모든 tokens(input + output)은 해당 계층의 요율로 과금됩니다. 예: 입력 tokens가 300K인 Flash 요청은 256K – 1000K에 해당하며, 요청 전체가 $0.68 / $4.08로 과금됩니다 — ‘처음 256K는 저렴하고 나머지 44K는 더 비싸다’처럼 나뉘지 않습니다.
Max-Preview는 Preview입니다 — 프로덕션에 사용할 수 있습니까?
예, 하지만 먼저 카나리로 실행하십시오. Qwen 팀은 후속 개정에서 계속 가중치를 다듬을 것이라고 밝혔습니다. 핵심 경로에서는 벤치마크 작업에 대해 A/B 테스트를 수행하고, 안정적인 버전이 나온 후에만 주요 트래픽을 전환하십시오.
Flash에 멀티모달 입력을 어떻게 보냅니까?
OpenAI의 Vision 호환 형식을 사용하십시오: messages에서 content를 각 요소가 {type: "text", text: ...} 또는 {type: "image_url", image_url: {url: ...}}인 배열로 보내십시오. 동영상의 경우 공식 문서의 video_url / frame-sampling 필드를 따르십시오.
APIYI의 가격은 Alibaba Cloud Bailian 공식 사이트와 같습니까?
정가는 공식 요율과 같습니다. 차이점은 APIYI가 충전 보너스를 더해 실질 단가를 정가의 약 85% 수준으로 낮추며, OpenAI 호환 생태계 전체(GPT / Claude / Gemini / DeepSeek / GLM 등)를 지원하는 통합 계정을 제공한다는 점입니다 — 여러 벤더 계정을 따로 관리할 필요가 없습니다.
함수 호출 / 도구 사용이 지원됩니까?
예. 세 모델 모두 OpenAI 표준 tools / tool_choice을 허용합니다. 기존 Agent 프레임워크의 도구 호출 로직을 재사용할 수 있습니다. Max-Preview는 다단계 도구 호출과 장기 계획에서 강점을 보입니다.
chain-of-thought 출력이 지원됩니까?
Max-Preview는 추론 작업에서 CoT를 자동으로 활성화합니다; Plus는 CoT가 항상 켜져 있습니다; Flash는 속도 우선이며 기본적으로 CoT를 출력하지 않습니다. 필드 이름은 Alibaba Cloud의 응답 형식(reasoning_content 등)을 따릅니다.
요청이 1M 컨텍스트를 초과하면 어떻게 됩니까?
Flash와 Plus는 1M tokens에서 상한이 걸리며, Max-Preview는 262K입니다. 상한을 초과하면 400이 반환됩니다. 보내기 전에 요약 / 청킹 / RAG 검색을 적용하십시오 — 모든 것을 한 번의 호출에 억지로 넣으려 하지 마십시오.
공식 OpenAI SDK를 바로 사용할 수 있습니까?
예. base_url를 https://api.apiyi.com/v1로 설정하고 위의 모델 ID 중 아무거나 model로 전달하면 됩니다 — 코드 수정 없는 마이그레이션입니다.
실패한 요청도 과금됩니까?
클라이언트 측 4xx 오류(param error / auth failure / content-moderation block)는 과금되지 않습니다. 추론에 도달하지 못한 서버 측 5xx 오류도 과금되지 않습니다. tokens를 성공적으로 반환한 요청은 클라이언트가 스트리밍 도중 취소하더라도 실제 token 수에 따라 과금됩니다.
요약: Qwen3.6 시리즈는 고부하 코딩 에이전트부터 대용량 멀티모달 디스패치까지 전체 수요 구간을 포괄합니다. Max-Preview는 국내 코딩 수준을 새로운 높이로 끌어올리고, Flash는 멀티모달 긴 컨텍스트 워크로드의 단가를 크게 낮추며, Plus는 믿을 수 있는 균형형 주력 모델입니다. APIYI의 공식 릴레이에서 호스팅되는 오픈 가중치 27B 및 35B-A3B 변형은 “GPU를 빌리지 않고도 제어 가능한 오픈 가중치”라는 과제를 완성합니다. 이 다섯 모델은 모두 OpenAI Chat 호환 엔드포인트를 공유하고, 공식 요율과 동일한 목록 가격을 적용하며, 충전 보너스를 더하면 목록가의 약 85% 수준까지 내려가므로, 현재 알리윈 공식 릴레이 채널에서 이용 가능한 최고의 가격 대비 성능 조합입니다.