Skip to main content
Kimi K2.5는 Moonshot AI의 네이티브 멀티모달 플래그십으로, 2026년 1월 27일에 출시되었습니다. 이 모델은 Visual Coding과 자율 Agent Swarm 오케스트레이션에 중점을 두며, 프리미엄 없이 제공되는 256K 컨텍스트 윈도우를 지원합니다. APIYI는 이를 알리바바 클라우드 공식 릴레이 채널로 통합하여 프로덕션 등급의 안정성을 제공합니다. 기본 그룹 요율 배수는 공식 가격의 0.88배이며, 충전 보너스를 누적 적용하면($100 충전 시 → $10 무료부터) 실질 비용이 공식 가격의 80% 미만으로 내려갑니다.
Kimi K2.5는 APIYI에서 이용 가능합니다: 알리바바 클라우드 공식 릴레이 채널, OpenAI 호환 엔드포인트, 모델 ID kimi-k2.5. Kimi의 공식 사이트와 달리, Thinking mode는 요청 본문에서 enable_thinking: true를 통해 명시적으로 활성화해야 합니다 — 기본적으로 모델은 Instant mode로 실행됩니다.

주요 장점

256K 컨텍스트

256K tokens 추가 요금 없음 — 중간 규모 코드베이스나 긴 문서 전체를 한 번의 호출에 담을 수 있습니다.

사고 모드

enable_thinking: true로 심층 추론을 활성화합니다 — 복잡한 계획 수립, 근본 원인 분석, 에이전트를 위해 설계되었습니다.

네이티브 멀티모달 + 시각적 코딩

이미지와 코드를 네이티브로 이해합니다 — UI 목업, 스크린샷, 다이어그램을 실행 가능한 코드로 바꾸는 데 탁월합니다.

안정적인 Alibaba Cloud 전송

Alibaba Cloud의 공식 전송 채널을 통해 라우팅됩니다 — 높은 동시 실행 수에서도 엔터프라이즈급 SLA를 제공합니다.

모델 정보

Kimi의 내장 $web_search 도구는 현재 Thinking 모드와 호환되지 않습니다. Moonshot의 안내에 따라 web_search 도구가 필요할 때는 enable_thinking를 비활성화하십시오. 이 제한은 공식 플랫폼과 동일합니다.

가격

가격 참고: APIYI는 0.88× 배수(공식 목록 가격의 88%)를 기본 그룹 요율로 사용합니다. 온보딩 / 대량 충전 보너스를 누적하면(예: $100 충전 시 $10 무료 및 그 이상) 실효 비용이 공식가의 80% 미만으로 내려갑니다. 자세한 내용은 충전 프로모션을 참조하십시오.

추론 모드를 활성화하는 방법

Kimi의 공식 사이트와 가장 큰 차이점은 APIYI가 기본적으로 Instant 모드를 사용한다는 점입니다. 요청 본문에서 enable_thinking를 통해 Thinking을 명시적으로 활성화해야 합니다:

cURL 예제 (Thinking 활성화)

호출 방법

엔드포인트

기본 사용법(즉시 모드)

고급 사용법(추론 모드)

스트리밍

요청 매개변수

응답 형식

모범 사례

  1. 작업별로 모드를 전환합니다: 일상적인 채팅과 짧은 생성에는 Instant 모드를 켜 두고, 복잡한 추론, 코드 리뷰, 에이전트 계획에는 enable_thinking: true로 설정합니다.
  2. 256K 컨텍스트를 활용합니다: 중간 규모의 저장소, 전체 제품 문서, 긴 회의 기록을 추가 비용 없이 한 번의 호출에 담을 수 있습니다.
  3. 멀티모달 비주얼 코딩: UI 스크린샷 / 디자인 목업을 보내고 K2.5가 한 번에 “읽기 → 계획 → 코딩”하도록 합니다.
  4. 절감 효과를 극대화합니다: $100+ 충전 보너스와 0.88× 그룹 요율을 함께 사용하면 — 실질 비용이 공식의 80% 아래로 내려갑니다.
  5. web_search 주의사항에 유의합니다: Moonshot의 내장 $web_search 도구가 필요하면 enable_thinking을 비활성화합니다.

자주 묻는 질문

추론 모드는 기본적으로 꺼져 있습니다. 요청 본문에 "enable_thinking": true이 포함되어 있는지 확인하십시오. OpenAI Python SDK에서는 이를 extra_body 안에 전달하고, Node.js SDK에서는 최상위 필드로 전달할 수 있습니다.
네 — Alibaba Cloud의 공식 전송 채널을 통해 라우팅되는 동일한 상위 모델입니다. 차이점은 추론 모드가 기본적으로 꺼져 있으며 enable_thinking을 통해 사용하도록 설정해야 한다는 점뿐입니다.
APIYI 콘솔에서 API token을 만들 때 Kimi K2.5를 포함하는 그룹에 할당하십시오 — 과금에는 자동으로 0.88× 요율 배수가 적용됩니다. 충전 보너스와 함께 사용하면 총 비용이 더 줄어듭니다. 충전 프로모션을 참조하십시오.
네. 표준 OpenAI 스타일의 tools 정의를 전달하십시오. 공식 $web_search 내장 도구는 추론 모드와 상호 배타적이라는 점에 유의하십시오 — 별도의 호출에서 사용하십시오.
추론 추적은 output tokens로 계산되며 정상적으로 과금됩니다. 복잡한 작업은 더 많은 output tokens를 생성할 수 있으므로 더 깊은 추론이 필요할 때만 활성화하십시오.

관련 자료

API 매뉴얼

완전한 API 사용 가이드

충전 프로모션

보너스를 중복 적용해 가격을 더 낮출 수 있습니다

모델 정보

사용 가능한 모든 모델과 그룹을 둘러보세요

활용 사례

클라이언트 통합 안내