Kimi K2.5는 APIYI에서 사용 가능합니다: Alibaba Cloud 공식 전송 채널, OpenAI 호환 엔드포인트, 모델 ID
kimi-k2.5. Kimi의 공식 사이트와 달리 Thinking 모드는 요청 본문에서 enable_thinking: true를 통해 명시적으로 활성화해야 합니다 — 기본적으로 이 모델은 Instant 모드로 실행됩니다.주요 장점
256K 컨텍스트
추가 요금 없이 256K tokens — 중간 규모의 전체 코드베이스나 긴 문서를 한 번의 호출로 담을 수 있습니다.
추론 모드
enable_thinking: true로 심층 추론을 활성화합니다 — 복잡한 계획 수립, 근본 원인 분석, 에이전트를 위해 설계되었습니다.네이티브 멀티모달 + 시각적 코딩
이미지와 코드를 네이티브로 이해합니다 — UI 목업, 스크린샷, 다이어그램을 실행 가능한 코드로 바꾸는 데 뛰어납니다.
안정적인 Alibaba Cloud 전송
Alibaba Cloud의 공식 전송 채널을 통해 라우팅됩니다 — 높은 동시 실행 수에서도 엔터프라이즈급 SLA를 제공합니다.
모델 정보
가격
가격 참고: APIYI는 기본 그룹 요율로 0.88× 배수(공식 목록 가격의 88%)를 사용합니다. 온보딩 / 대량 충전 보너스(예: $100 충전 시 $10 무료 등)를 중첩하면 실효 비용이 공식의 80% 미만으로 내려갑니다. 자세한 내용은 충전 프로모션을 참고하십시오.
Thinking 모드를 활성화하는 방법
Kimi의 공식 사이트와 가장 큰 차이점은 APIYI가 기본적으로 Instant 모드를 사용한다는 점입니다. 요청 본문에서enable_thinking를 통해 Thinking을 명시적으로 활성화해야 합니다:
cURL 예제 (Thinking 활성화)
호출 방법
엔드포인트
기본 사용법 (즉시 모드)
고급 사용법 (추론 모드)
스트리밍
요청 매개변수
응답 형식
모범 사례
- 작업별로 모드를 전환합니다: 일상적인 채팅과 짧은 생성에는 Instant 모드를 켜 두고, 복잡한 추론, 코드 리뷰, 에이전트 계획에는
enable_thinking: true를 설정합니다. - 256K 컨텍스트를 활용합니다: 중간 규모의 repo, 전체 제품 문서, 또는 긴 회의 전사본을 한 번의 호출에 담을 수 있으며, 추가 요금은 없습니다.
- 멀티모달 시각적 코딩: UI 스크린샷 / 디자인 목업을 보내면 K2.5가 한 번에 “읽기 → 계획 → 코드”를 수행하게 할 수 있습니다.
- 절감 효과를 극대화합니다: $100 이상의 충전 보너스와 0.88× 그룹 요율 배수를 함께 적용하면 실효 비용이 공식의 80% 아래로 내려갑니다.
- web_search 주의사항을 유념합니다: Moonshot의 내장
$web_search도구가 필요하면enable_thinking을 비활성화합니다.
FAQ
왜 제 요청은 Thinking mode를 사용하지 않습니까?
왜 제 요청은 Thinking mode를 사용하지 않습니까?
Thinking mode는 기본적으로 꺼져 있습니다. 요청 본문에
"enable_thinking": true가 포함되어 있는지 확인하십시오. OpenAI Python SDK에서는 이를 extra_body 안에 전달하고, Node.js SDK에서는 최상위 필드로 전달할 수 있습니다.APIYI의 Kimi K2.5는 Moonshot의 모델과 동일한 모델입니까?
APIYI의 Kimi K2.5는 Moonshot의 모델과 동일한 모델입니까?
예 — 동일한 상류 모델이며, Alibaba Cloud의 공식 이전 채널을 통해 라우팅됩니다. 유일한 차이점은 Thinking mode가 기본적으로 꺼져 있으며
enable_thinking를 통해 선택적으로 활성화해야 한다는 점입니다.0.88× 그룹 요율은 어떻게 적용됩니까?
0.88× 그룹 요율은 어떻게 적용됩니까?
APIYI 콘솔에서 API token을 생성할 때 Kimi K2.5가 포함된 그룹에 할당하면 과금에 0.88× 배수가 자동으로 적용됩니다. 충전 보너스와 함께 사용하면 총 비용은 더 낮아집니다. 충전 프로모션을 참조하십시오.
함수 호출 / 도구 사용을 지원합니까?
함수 호출 / 도구 사용을 지원합니까?
예. 표준 OpenAI 스타일의
tools 정의를 전달하십시오. 공식 $web_search 내장 도구는 Thinking mode와 상호 배타적이므로, 별도의 호출로 사용해야 합니다.Thinking mode에 추가 비용이 발생합니까?
Thinking mode에 추가 비용이 발생합니까?
Thinking trace는 출력 token으로 계산되며 일반적으로 과금됩니다. 복잡한 작업에서는 출력 token이 훨씬 더 많이 생성될 수 있으므로, 더 깊은 추론이 필요할 때만 활성화하십시오.
관련 자료
API 매뉴얼
완전한 API 사용 가이드
충전 프로모션
보너스를 중첩해 가격을 더 낮춥니다
모델 정보
사용 가능한 모든 모델과 그룹을 둘러보세요
사용 사례
클라이언트 통합 안내서