Kimi K2.5는 APIYI에서 이용 가능합니다: 알리바바 클라우드 공식 릴레이 채널, OpenAI 호환 엔드포인트, 모델 ID
kimi-k2.5. Kimi의 공식 사이트와 달리, Thinking mode는 요청 본문에서 enable_thinking: true를 통해 명시적으로 활성화해야 합니다 — 기본적으로 모델은 Instant mode로 실행됩니다.주요 장점
256K 컨텍스트
256K tokens 추가 요금 없음 — 중간 규모 코드베이스나 긴 문서 전체를 한 번의 호출에 담을 수 있습니다.
사고 모드
enable_thinking: true로 심층 추론을 활성화합니다 — 복잡한 계획 수립, 근본 원인 분석, 에이전트를 위해 설계되었습니다.네이티브 멀티모달 + 시각적 코딩
이미지와 코드를 네이티브로 이해합니다 — UI 목업, 스크린샷, 다이어그램을 실행 가능한 코드로 바꾸는 데 탁월합니다.
안정적인 Alibaba Cloud 전송
Alibaba Cloud의 공식 전송 채널을 통해 라우팅됩니다 — 높은 동시 실행 수에서도 엔터프라이즈급 SLA를 제공합니다.
모델 정보
가격
가격 참고: APIYI는 0.88× 배수(공식 목록 가격의 88%)를 기본 그룹 요율로 사용합니다. 온보딩 / 대량 충전 보너스를 누적하면(예: $100 충전 시 $10 무료 및 그 이상) 실효 비용이 공식가의 80% 미만으로 내려갑니다. 자세한 내용은 충전 프로모션을 참조하십시오.
추론 모드를 활성화하는 방법
Kimi의 공식 사이트와 가장 큰 차이점은 APIYI가 기본적으로 Instant 모드를 사용한다는 점입니다. 요청 본문에서enable_thinking를 통해 Thinking을 명시적으로 활성화해야 합니다:
cURL 예제 (Thinking 활성화)
호출 방법
엔드포인트
기본 사용법(즉시 모드)
고급 사용법(추론 모드)
스트리밍
요청 매개변수
응답 형식
모범 사례
- 작업별로 모드를 전환합니다: 일상적인 채팅과 짧은 생성에는 Instant 모드를 켜 두고, 복잡한 추론, 코드 리뷰, 에이전트 계획에는
enable_thinking: true로 설정합니다. - 256K 컨텍스트를 활용합니다: 중간 규모의 저장소, 전체 제품 문서, 긴 회의 기록을 추가 비용 없이 한 번의 호출에 담을 수 있습니다.
- 멀티모달 비주얼 코딩: UI 스크린샷 / 디자인 목업을 보내고 K2.5가 한 번에 “읽기 → 계획 → 코딩”하도록 합니다.
- 절감 효과를 극대화합니다: $100+ 충전 보너스와 0.88× 그룹 요율을 함께 사용하면 — 실질 비용이 공식의 80% 아래로 내려갑니다.
- web_search 주의사항에 유의합니다: Moonshot의 내장
$web_search도구가 필요하면enable_thinking을 비활성화합니다.
자주 묻는 질문
왜 내 요청에서 추론 모드가 사용되지 않습니까?
왜 내 요청에서 추론 모드가 사용되지 않습니까?
추론 모드는 기본적으로 꺼져 있습니다. 요청 본문에
"enable_thinking": true이 포함되어 있는지 확인하십시오. OpenAI Python SDK에서는 이를 extra_body 안에 전달하고, Node.js SDK에서는 최상위 필드로 전달할 수 있습니다.APIYI의 Kimi K2.5는 Moonshot의 것과 같은 모델입니까?
APIYI의 Kimi K2.5는 Moonshot의 것과 같은 모델입니까?
네 — Alibaba Cloud의 공식 전송 채널을 통해 라우팅되는 동일한 상위 모델입니다. 차이점은 추론 모드가 기본적으로 꺼져 있으며
enable_thinking을 통해 사용하도록 설정해야 한다는 점뿐입니다.0.88× 그룹 요율은 어떻게 적용됩니까?
0.88× 그룹 요율은 어떻게 적용됩니까?
APIYI 콘솔에서 API token을 만들 때 Kimi K2.5를 포함하는 그룹에 할당하십시오 — 과금에는 자동으로 0.88× 요율 배수가 적용됩니다. 충전 보너스와 함께 사용하면 총 비용이 더 줄어듭니다. 충전 프로모션을 참조하십시오.
함수 호출 / 도구 사용을 지원합니까?
함수 호출 / 도구 사용을 지원합니까?
네. 표준 OpenAI 스타일의
tools 정의를 전달하십시오. 공식 $web_search 내장 도구는 추론 모드와 상호 배타적이라는 점에 유의하십시오 — 별도의 호출에서 사용하십시오.추론 모드에 추가 비용이 듭니까?
추론 모드에 추가 비용이 듭니까?
추론 추적은 output tokens로 계산되며 정상적으로 과금됩니다. 복잡한 작업은 더 많은 output tokens를 생성할 수 있으므로 더 깊은 추론이 필요할 때만 활성화하십시오.
관련 자료
API 매뉴얼
완전한 API 사용 가이드
충전 프로모션
보너스를 중복 적용해 가격을 더 낮출 수 있습니다
모델 정보
사용 가능한 모든 모델과 그룹을 둘러보세요
활용 사례
클라이언트 통합 안내