Skip to main content
Kimi K2.5는 Moonshot AI의 네이티브 멀티모달 플래그십으로, 2026년 1월 27일에 출시되었습니다. 이 모델은 Visual Coding과 자율적인 Agent Swarm 오케스트레이션에 중점을 두며, 256K 컨텍스트 윈도우를 추가 요금 없이 제공합니다. APIYI는 이를 Alibaba Cloud 공식 전송 채널로 통합하여 프로덕션급 안정성을 제공합니다. 기본 그룹 요율은 **공식 가격의 0.88×**이며, 충전 보너스를 누적하면($100 충전 → $10 무료 등) 실효 비용이 공식 가격의 80% 미만으로 내려갑니다.
Kimi K2.5는 APIYI에서 사용 가능합니다: Alibaba Cloud 공식 전송 채널, OpenAI 호환 엔드포인트, 모델 ID kimi-k2.5. Kimi의 공식 사이트와 달리 Thinking 모드는 요청 본문에서 enable_thinking: true를 통해 명시적으로 활성화해야 합니다 — 기본적으로 이 모델은 Instant 모드로 실행됩니다.

주요 장점

256K 컨텍스트

추가 요금 없이 256K tokens — 중간 규모의 전체 코드베이스나 긴 문서를 한 번의 호출로 담을 수 있습니다.

추론 모드

enable_thinking: true로 심층 추론을 활성화합니다 — 복잡한 계획 수립, 근본 원인 분석, 에이전트를 위해 설계되었습니다.

네이티브 멀티모달 + 시각적 코딩

이미지와 코드를 네이티브로 이해합니다 — UI 목업, 스크린샷, 다이어그램을 실행 가능한 코드로 바꾸는 데 뛰어납니다.

안정적인 Alibaba Cloud 전송

Alibaba Cloud의 공식 전송 채널을 통해 라우팅됩니다 — 높은 동시 실행 수에서도 엔터프라이즈급 SLA를 제공합니다.

모델 정보

Kimi의 내장 $web_search 도구는 현재 Thinking 모드와 호환되지 않습니다. Moonshot의 안내에 따라 web_search 도구가 필요할 때는 enable_thinking을 비활성화하십시오. 이 제한은 공식 플랫폼과 동일합니다.

가격

가격 참고: APIYI는 기본 그룹 요율로 0.88× 배수(공식 목록 가격의 88%)를 사용합니다. 온보딩 / 대량 충전 보너스(예: $100 충전 시 $10 무료 등)를 중첩하면 실효 비용이 공식의 80% 미만으로 내려갑니다. 자세한 내용은 충전 프로모션을 참고하십시오.

Thinking 모드를 활성화하는 방법

Kimi의 공식 사이트와 가장 큰 차이점은 APIYI가 기본적으로 Instant 모드를 사용한다는 점입니다. 요청 본문에서 enable_thinking를 통해 Thinking을 명시적으로 활성화해야 합니다:

cURL 예제 (Thinking 활성화)

호출 방법

엔드포인트

기본 사용법 (즉시 모드)

고급 사용법 (추론 모드)

스트리밍

요청 매개변수

응답 형식

모범 사례

  1. 작업별로 모드를 전환합니다: 일상적인 채팅과 짧은 생성에는 Instant 모드를 켜 두고, 복잡한 추론, 코드 리뷰, 에이전트 계획에는 enable_thinking: true를 설정합니다.
  2. 256K 컨텍스트를 활용합니다: 중간 규모의 repo, 전체 제품 문서, 또는 긴 회의 전사본을 한 번의 호출에 담을 수 있으며, 추가 요금은 없습니다.
  3. 멀티모달 시각적 코딩: UI 스크린샷 / 디자인 목업을 보내면 K2.5가 한 번에 “읽기 → 계획 → 코드”를 수행하게 할 수 있습니다.
  4. 절감 효과를 극대화합니다: $100 이상의 충전 보너스와 0.88× 그룹 요율 배수를 함께 적용하면 실효 비용이 공식의 80% 아래로 내려갑니다.
  5. web_search 주의사항을 유념합니다: Moonshot의 내장 $web_search 도구가 필요하면 enable_thinking을 비활성화합니다.

FAQ

Thinking mode는 기본적으로 꺼져 있습니다. 요청 본문에 "enable_thinking": true가 포함되어 있는지 확인하십시오. OpenAI Python SDK에서는 이를 extra_body 안에 전달하고, Node.js SDK에서는 최상위 필드로 전달할 수 있습니다.
예 — 동일한 상류 모델이며, Alibaba Cloud의 공식 이전 채널을 통해 라우팅됩니다. 유일한 차이점은 Thinking mode가 기본적으로 꺼져 있으며 enable_thinking를 통해 선택적으로 활성화해야 한다는 점입니다.
APIYI 콘솔에서 API token을 생성할 때 Kimi K2.5가 포함된 그룹에 할당하면 과금에 0.88× 배수가 자동으로 적용됩니다. 충전 보너스와 함께 사용하면 총 비용은 더 낮아집니다. 충전 프로모션을 참조하십시오.
예. 표준 OpenAI 스타일의 tools 정의를 전달하십시오. 공식 $web_search 내장 도구는 Thinking mode와 상호 배타적이므로, 별도의 호출로 사용해야 합니다.
Thinking trace는 출력 token으로 계산되며 일반적으로 과금됩니다. 복잡한 작업에서는 출력 token이 훨씬 더 많이 생성될 수 있으므로, 더 깊은 추론이 필요할 때만 활성화하십시오.

관련 자료

API 매뉴얼

완전한 API 사용 가이드

충전 프로모션

보너스를 중첩해 가격을 더 낮춥니다

모델 정보

사용 가능한 모든 모델과 그룹을 둘러보세요

사용 사례

클라이언트 통합 안내서