Skip to main content
APIYI는 400개 이상의 주류 AI 모델을 지원합니다. 이 페이지에서는 상세한 모델 정보, 가격 및 사용 방법을 제공합니다.
엔터프라이즈급 전문적이고 안정적인 AI 대형 모델 API 허브 모든 모델은 공식 소스에서 가져와 릴레이하며, 약 20% 할인된 가격으로 제공됩니다(충전 보너스와 환율 이점을 결합함). 다양한 우수한 대형 모델을 통합하고 있습니다. 속도 제한이 없고, 계정 차단 위험이 없으며, 사용량 기반 과금, 장기적으로 안정적인 서비스를 제공합니다.

🔥 현재 권장 모델

다음은 현재 안정적으로 공급되는 인기 모델입니다. 전체 모델 목록과 실시간 가격은 APIYI Console Pricing Page 또는 사이트 내 Model Pricing Overview에서 확인하십시오.
모델 업그레이드 권장 사항: 최고의 성능을 위해 최신 모델 사용을 권장하지만, 다음 사항을 참고해 주십시오:
  1. 초기 불안정성은 흔합니다: 새로 출시된 모델은 공급업체의 제한된 연산 자원으로 인해 응답이 느리거나, 시간 초과가 발생하거나, 간헐적인 오류가 나타날 수 있습니다. 이는 보통 며칠에서 몇 주 내에 안정화됩니다
  2. 파라미터 호환성을 확인하십시오: 새 모델은 새로운 파라미터를 도입하거나 기존 파라미터를 변경할 수 있습니다(예: max_completion_tokensmax_tokens를 대체). 업그레이드하기 전에 API 파라미터가 이전 모델과 계속 호환되는지 확인하십시오
  3. 실서비스 반영 전에는 반드시 테스트하십시오: 새 모델을 프로덕션에 배포하기 전에 테스트 환경에서 충분히 검증하여 출력 품질과 API 호환성이 기대에 부합하는지 확인하십시오
컨텍스트 열의 ”—“은 공급업체가 확정 수치를 공개하지 않았음을 의미합니다. 콘솔과 공식 문서를 참고하십시오. 모든 가격은 100만 tokens당 정가이며 충전 보너스와 함께 적용할 수 있습니다.

모델 카테고리

🤖 OpenAI 시리즈

🆕 최신 모델

GPT-5.6 이중 그룹 공급: 기본 공식 릴레이 그룹(default / svip)은 공식 가격과 동일하며, 최대 20% 충전 보너스(정가의 약 83%)를 제공합니다. CodexReverse 그룹은 기본 0.7 할인율을 적용하므로 비용에 민감한 배치 작업에 더 적합합니다. 기존 GPT-5.5 코드는 model 필드만 교체하면 됩니다. GPT-5.6 출시 노트를 참조하십시오.
GPT Pro 시리즈(예: gpt-5.5-pro, gpt-5.4-pro) 사용 참고 사항:
  1. /v1/responses 엔드포인트 전용: /v1/chat/completions을 사용할 수 없으므로 호출 전에 SDK / 코드를 Responses API로 전환해야 합니다
  2. 매우 높은 비용: 한 번의 호출에 수 달러가 소요될 수 있으며, Default 그룹에서의 실수로 인한 사용을 방지하기 위해 SVIP 그룹 전용으로 제공됩니다
  3. 전문적이지 않은 용도에는 권장하지 않음: 일상적인 작업에는 GPT-5.6 Sol / Terra를 사용하고, Pro는 극도의 추론 깊이가 필요한 연구 및 최고 수준의 작업에만 적합합니다

✅ 안정 버전 / 클래식

GPT-5 및 이후 시리즈 사용 참고 사항:
  1. temperature 매개변수 temperature는 1로 설정해야 합니다(1만 지원)
  2. max_tokens 대신 max_completion_tokens을 사용하십시오
  3. top_p 매개변수를 전달하지 마십시오
이미지 및 동영상 생성 모델은 전용 페이지로 이동되었습니다. 전체 목록과 가격은 이미지 및 동영상 생성 모델을 참조하십시오.

🎭 Claude 시리즈 (Anthropic)

🆕 최신 모델

Fable 5 / Mythos 5의 30일 데이터 보관 준수: 이 모델들의 고급 기능 때문에 Bedrock과 Anthropic은 고위험 오용에 대한 추가 검사를 수행합니다. 이 두 모델의 경우, 심각한 남용을 탐지하기 위해 입력과 출력이 30일 동안 보관됩니다 — 기본적으로 자동 안전 시스템이 접근하며, 잠재적 피해가 표시될 때만 사람이 검토합니다. 보관은 AWS / Anthropic 측에서 이루어지며, APIYI는 순수한 투명 프록시이므로 자체적으로는 아무것도 보관하지 않습니다. 다른 Claude 모델에는 영향이 없습니다. Fable 5 출시 노트를 참조하십시오.

✅ 안정판 / 클래식

최신: Claude Opus 5는 절반 가격($5/$25, Opus 4.8과 동일)으로 Fable 5의 지능에 근접합니다 — 부담 없는 업그레이드입니다. Sonnet 5는 지금까지 가장 에이전틱한 Sonnet으로 소개되며, Opus 4.8에 가깝지만 더 빠르고 저렴합니다. 안정판: Opus 4.7과 Sonnet 4.6은 이미 운영 중인 프로덕션 워크플로에서 실전 검증되었고, Haiku 4.5는 뛰어난 가성비에 2배 속도를 제공합니다.

🌟 Google Gemini 시리즈

🆕 최신 모델

참고: Gemini 3 Pro Preview는 2026년 3월 9일에 중단되었습니다. Gemini 3.1 Pro Preview 또는 Gemini 3.6 Flash로 이전하십시오.

✅ 안정판 / 클래식

최신: Gemini 3.6 Flash와 3.5 Flash-Lite는 네이티브 Gemini 형식과 OpenAI 호환 형식 모두에서 각각 30개 이상의 테스트 사례로 엔드투엔드 검증되었으며, 모든 네이티브 도구가 활성화되어 있습니다. 연동하기 전에 3.6 Flash 개요3.5 Flash-Lite 개요를 읽어보십시오. 안정판: Gemini 2.5 Pro(2M 컨텍스트)와 Gemini 2.5 Flash는 안정된 운영 환경에 적합합니다.

🚀 xAI Grok 시리즈

🆕 최신 모델

✅ 안정판 / 클래식

Grok 4.5 token 효율: SWE Bench Pro에서 평균 출력 token은 15,954개에 불과하며, Opus 4.8(최대)의 약 1/4.2 수준입니다. 작업 단계를 절반으로 줄이고 동일한 작업의 실제 지출도 낮춥니다. 200K tokens를 초과하는 요청은 공급업체의 더 높은 장문 컨텍스트 요율로 과금됩니다.

🔍 DeepSeek 시리즈

🐘 중국 모델 시리즈

Zhipu AI (GLM)

🆕 최신: GLM-5.2 | ✅ 안정형 / 클래식: GLM-5.1, GLM-5, GLM-4.6
GLM-5.2 기능:
  • 컨텍스트가 GLM-5.1의 200K에서 1M token으로 확대되어, 프로젝트 규모 코드와 여러 개의 긴 문서를 한 번에 불러올 수 있습니다
  • 744B MoE, Terminal-Bench 2.1 81.0 / SWE-bench Pro 62.1로 장기 코딩에서 선도하는 오픈소스입니다
  • 공급사와 맞춘 가격으로 직접 알리바바 클라우드 공식 릴레이를 제공하며(고정 1:7 환율로 환산), 충전 보너스 포함 시 목록가의 약 85% 수준입니다
  • 긴 작업의 경우 timeout을 600초 이상으로 올리십시오. GLM-5.2 출시 노트를 참조하십시오

Alibaba Qwen

🆕 최신: Qwen3.7-Max | ✅ 안정형 / 클래식: Qwen3.6 시리즈, Qwen Max / Plus / Turbo

Moonshot Kimi 시리즈

🆕 최신: Kimi K3 | ✅ 안정형 / 클래식: Kimi K2.6, K2.5, K2
Kimi K3 사용 노트:
  • 정확히 1,048,576 token의 컨텍스트를 제공하며 전체 범위에서 고정 요금을 적용합니다. 티어가 바뀔 걱정 없이 전체 저장소나 긴 문서를 그대로 넣을 수 있습니다
  • 최대 출력은 기본 131,072이며 1,048,576 token까지 올릴 수 있습니다. thinking이 최대 속도로 동작하므로 output token 예산을 그에 맞게 잡으십시오
  • 자동 컨텍스트 캐싱은 캐시된 입력에 대해 $0.30/1M(캐시되지 않은 요율의 1/10)을 청구하므로, 다중 턴 대화에서 큰 이점을 제공합니다

ByteDance Seed 시리즈

🆕 최신: Seed 2.1 Turbo | ✅ 안정형 / 클래식: Seed 2.0 Pro / Lite / Mini
Seed 2.1 Turbo는 기본적으로 깊이 있는 사고를 활성화합니다: 별도 매개변수를 설정하지 않으면 한 줄 질문에도 먼저 수백 개의 thinking token이 출력됩니다(한 문장 자기소개를 측정한 결과 output token 444개, 그중 409개가 thinking이었음). thinking은 일반 output token으로 과금됩니다. 빈도가 높은 짧은 Q&A의 경우 thinking: {"type": "disabled"}를 기준선으로 사용하십시오. 통합 가이드를 참조하십시오.

🌐 MiniMax 시리즈

🆕 최신: MiniMax-M3 | ✅ 안정 / 클래식: MiniMax-M2.7, M2.5
MiniMax-M3 과금 참고 사항:
  • 단계별 과금: 0-512K 범위는 1M tokens당 입력 $0.30 / 출력 $1.20이며, 이를 초과하는 부분은 더 높은 구간으로 과금됩니다
  • 모델 이름은 대소문자를 구분합니다: MiniMax-M3 (MiniMax-M2.7-highspeed 같은 하위 모델도 마찬가지입니다)
  • 백만 token 컨텍스트 작업을 실행하기 전에 비용을 미리 추정하십시오

💰 요금 정보

과금 방식

  • 사용량 기반 과금: 실제 Token 사용량에 따라 과금됩니다
  • 최소 과금 없음: 사용한 만큼만 지불하면 됩니다
  • 잔액 유효 기간: 충전일로부터 365일 동안 유효하며, 다음 충전 시 자동으로 초기화됩니다(자세한 내용은 충전 프로모션 참조)
  • 실시간 차감: 각 호출 후 요금이 잔액에서 즉시 차감됩니다

요금 장점

  • 공식 릴레이를 통한 약간의 가격 우위
  • 대량 사용자는 더 나은 요금을 위해 고객 서비스에 문의할 수 있습니다
  • 신규 계정에는 통합이 정상적으로 작동하는지 확인할 수 있을 만큼의 $0.05 체험 크레딧이 제공됩니다

실시간 요금 확인

모든 모델의 최신 요금은 APIYI 콘솔 요금 페이지에서 확인하거나, 사이트 내 모델 요금 개요를 확인하십시오.

🛠️ 사용 권장 사항

모델 선택 가이드

프로그래밍 개발
  • 최고 성능: Claude Opus 5 (절반 가격으로 Fable 5에 근접한 지능), GPT-5.6 Sol (Terminal-Bench 2.1 88.8%), Claude Sonnet 5 (SWE-bench 85.2%), Kimi K3
  • 높은 비용 대비 성능: GPT-5.6 Terra (절반 가격으로 GPT-5.5 수준의 성능), Gemini 3.6 Flash, GLM-5.2, MiniMax-M3, DeepSeek V4 Flash
  • 대안: Grok 4.5, Qwen3.7-Max, Kimi K2.6, Gemini 3.5 Flash
텍스트 작성
  • 최고 선택: GPT-5.6 Sol / Terra, Claude Opus 5, Claude Sonnet 5, Gemini 3.6 Flash
  • 대안: chat-latest, Claude Sonnet 4.6, GLM-5.2, GPT-4.1
빠른 응답
  • 최고 선택: Gemini 3.5 Flash-Lite (기본적으로 추론하지 않으며 약 2초), Claude Haiku 4.5 (2배 빠름), GPT-5.6 Luna
  • 대안: Gemini 3.1 Flash Lite, Gemini 2.5 Flash, Seed 2.1 Turbo (추론을 명시적으로 비활성화)
긴 텍스트 처리
  • 초장문 컨텍스트: Gemini 2.5 Pro (2M), Kimi K3 (1M, 고정 요금), MiniMax-M3 (1M), GLM-5.2 (1M), Claude Opus 5 (1M)
  • 참고: 일부 모델은 특정 임계값을 초과하면 더 높은 과금 등급으로 전환됩니다(Grok 4.5는 200K 초과 시, MiniMax-M3는 512K 초과 시). 장시간 작업 전에 비용을 산정하십시오.
이미지 생성
  • 최신 권장: gpt-image-2.5-flare / gpt-image-2.5-sunburst (2026년 9월 출시, 네이티브 4K, 정밀한 크기/품질 제어, gpt-image-2와 동일한 가격, 각각 더 빠르고 정밀한 편집), Nano Banana Pro (4K HD, 최고의 텍스트 렌더링)
  • 높은 비용 대비 성능: Nano Banana 2 ($0.055/이미지, 종량제 사용 시 $0.025부터), Nano Banana Lite (이미지당 약 4초, $0.025/이미지)
  • 전문 디자인: Seedream 5.0 Pro ($0.12/호출, 대화형 편집 및 최대 10개의 참조 이미지), Seedream 5.0 Lite ($0.035/이미지)
  • 최저가: gpt-image-2-all (리버스 채널, $0.03/이미지)
동영상 생성
  • 공식 릴레이 우선 선택: VEO 3.1 Official (호출당 $0.3 / $1.2, 4/6/8초, 네이티브 동기화 오디오)
  • 중국계 공급업체의 주력 모델: Seedance 2.5 및 2.0 시리즈 (2.5 / standard / fast / mini), Wan2.7, HappyHorse 1.1
  • 참고: Sora 2 채널은 종료되었습니다. 위 옵션을 사용하십시오. 이미지 및 동영상 생성 모델을 참조하십시오.
웹 검색
  • 네이티브 웹 액세스: Grok 4 All, Grok 3 All (도구 호출 불필요)
  • 검색 그라운딩: Gemini 3.6 Flash / 3.5 Flash-Lite (네이티브 tools 활성화)

비용 최적화 권장 사항

  1. 단계별 사용: 간단한 작업에는 저렴한 모델을 사용하고, 복잡한 작업에는 고급 모델을 사용하십시오.
  2. 테스트 최적화: 먼저 소형 모델로 테스트하고, 요구 사항을 파악한 후 대형 모델을 사용하십시오.
  3. 일괄 처리: 유사한 작업을 대량으로 처리할 때 Luna / Lite / Mini 등급을 선택하십시오.
  4. 캐시 재사용: 각 공급업체의 컨텍스트 캐시를 활용하십시오(Kimi K3, Seed 2.1 Turbo 및 Claude 시리즈는 캐시된 입력에 최저 1/10의 요율을 적용합니다).
  5. 불필요한 추론 끄기: 일부 모델은 기본적으로 추론합니다(Seed 2.1 Turbo, Gemini 3.6 Flash). 짧고 빈번한 Q&A에서 이를 비활성화하면 비용과 시간을 모두 절약할 수 있습니다.

🔗 관련 자료

모델 목록은 지속적으로 업데이트됩니다. 새로 출시된 우수한 모델은 신속히 추가할 예정입니다. 최신 출시 소식은 변경 로그를 참고하십시오. 특정 모델 요구 사항이나 대량 요청이 필요하시면 고객센터에 문의해 주십시오.