Skip to main content
Grok은 xAI의 대표 모델 패밀리입니다. 현재 세대(Grok 4.x)는 5개의 제품 라인—플래그십 범용, 장문 컨텍스트 표준, 추론/비추론 변형, 코드 중심, 멀티 에이전트 협업—으로 구성되며, 모두 APIYI에서 사용할 수 있습니다. xAI의 공식 API 자체가 OpenAI 호환입니다(Chat Completions + Responses API). 별도의 독자 프로토콜이 없으므로, OpenAI SDK로 APIYI를 통해 Grok을 호출하면 공식 서버 측 도구(web search, X search, code execution, Remote MCP)를 포함한 전체 기능을 사용할 수 있습니다. 이 문서 그룹은 2026년 7월 13일(UTC+8)에 APIYI 게이트웨이에 대해 수행한 전체 실사용 테스트 — 56개의 요청/응답 로그 — 를 바탕으로 하므로, 여기에 명시된 모든 기능 경계는 검증되었습니다.
🚀 하이라이트: grok-4.5는 2026년 7월 8일에 출시된 xAI의 최신 플래그십(지식 기준일 2026년 2월)으로, 코딩 및 에이전트형 작업을 위해 설계되었습니다. grok-4.3과 grok-4.20 시리즈는 1M-token 컨텍스트 윈도우를 제공하며, Responses API 도구인 web_search / x_search / code_interpreter / MCP는 모두 APIYI에서 정상 동작하는 것으로 검증되었고, X search는 Grok만의 고유한 기능입니다. 또한 네이티브 responses 지원 덕분에 Grok은 OpenAI Codex에 바로 연결할 수 있습니다.

모델 라인업

grok-4.5

플래그십 · 코드 및 일반xAI의 가장 지능적인 모델로, 500K 컨텍스트를 제공하며 코딩, 에이전틱 작업, 지식 작업을 위해 설계되었습니다.

grok-4.3

표준 주력 모델플래그십 가격의 약 60% 수준에 1M 컨텍스트를 제공하며, 일상적인 채팅과 중간 수준의 추론에 균형 잡힌 선택입니다.

grok-4.20 변형

추론 / 비추론-reasoning-non-reasoning은 같은 가격과 1M 컨텍스트를 공유합니다. 사고 과정을 원하시는지에 따라 선택하십시오.

grok-build-0.1

코드 중심256K 컨텍스트와 시리즈 내 최저 가격을 제공하여, 고빈도 코드 완성과 가벼운 코딩 작업에 이상적입니다.

grok-4.20-multi-agent-beta-0309

멀티 에이전트 협업여러 에이전트가 복잡한 리서치 작업을 병렬로 수행합니다. 특수 과금 프로필이 적용됩니다. Multi-Agent Model을 참조하십시오.

더 많은 기능 페이지

채팅/추론/비전: Chat 및 추론; 실시간 검색: 웹 및 X 검색.

가격

표시된 가격은 xAI의 공식 가격과 일치합니다(2026-07-13에 APIYI 가격 API와 항목별로 대조하여 검증했습니다). APIYI의 할인은 충전 프로모션에서 비롯됩니다.
  • 별칭 grok-code-fast / grok-code-fast-1도 호출할 수 있습니다(연결성 검증 완료). 가격은 모델 정보 페이지를 참조하십시오.
  • 캐시된 입력 tokens는 할인된 요율로 과금됩니다. Grok 프리픽스 캐싱은 자동입니다 — 별도 설정이 필요하지 않습니다; 캐시 과금을 참조하십시오.
  • 표시 가격은 xAI 공식 가격과 일치합니다. 더 낮은 실효 비용을 위해 충전 프로모션을 함께 적용하십시오.

검증된 기능 매트릭스

2026-07-13 (UTC+8)에 APIYI 게이트웨이를 대상으로 테스트했습니다(✅ 작동 검증됨; — 미포함, 동일한 아키텍처에서는 동일할 것으로 예상됨):

엔드포인트

Codex에서 바로 사용하기

Grok은 /v1/responses를 기본적으로 지원하므로, 네이티브 responses 프로토콜을 통해 OpenAI Codex(데스크톱 앱 / IDE 확장 / CLI)에서 실행되는 몇 안 되는 비-OpenAI 모델 중 하나입니다. model = "grok-4.5"wire_api = "responses"config.toml에 설정하면 5분 안에 연결되며, Codex의 에이전트 기능(도구 호출, 추론 항목 등)도 모두 네이티브 프로토콜로 동작합니다. 이에 비해 APIYI의 Claude / Gemini는 OpenAI 호환 채팅 모드(wire_api = "chat" 폴백)에서만 실행되며, 이 경우 Codex / 에이전트 시나리오에서 프로토콜 호환성 문제가 발생합니다. 전체 설정 단계는 Codex 통합 가이드를 참조하십시오.
다음은 APIYI에서 지원되지 않습니다(검증됨 — 다음 함정은 피하십시오):
  • 레거시 Completions (/v1/completions): 상위 계층에서 거부됨 — 전체 Grok 4.x 라인은 추론 아키텍처이며 공식 수준에서 원시 텍스트 completion을 지원하지 않습니다
  • 레거시 라이브 검색 파라미터 search_parameters: xAI에서 제거됨(410 확인됨). 모든 라이브 검색은 Responses API 도구를 통해 이루어집니다 — Web 및 X 검색을 참조하십시오
  • Batch API / Files: 게이트웨이를 통해 라우팅되지 않으며, 키 풀 모드에는 적용되지 않습니다
  • Deferred Completions (deferred: true): 이 파라미터는 조용히 무시됩니다 — 요청은 동기적으로 실행되며 정상적으로 과금됩니다. 이에 의존하지 마십시오
  • Collections Search (RAG / file_search): xAI 콘솔에서 미리 구축된 collections가 필요하며, 키 풀 모드에는 적용되지 않습니다
  • Context Compaction (/v1/responses/compact), Priority Processing (service_tier: "priority" — 테스트에서는 기본값으로 폴백됩니다), WebSocket 모드, mTLS 인증: 모두 지원되지 않습니다

빠른 시작

어떤 모델을 선택할지: 기본값으로 grok-4.3를 사용합니다 (1M 컨텍스트, 균형 잡힌 가격); 코딩 에이전트와 복잡한 작업에는 grok-4.5로 업그레이드합니다; 빠르고 저비용의 응답이 필요할 때는 grok-4.20-0309-non-reasoning를 사용합니다 (체인 오브 소트 없이, 가장 저렴한 출력); 고빈도 코드 자동완성에는 grok-build-0.1를 사용합니다; 그리고 복잡한 리서치 작업에서만 멀티 에이전트 모델을 사용하십시오 (과금 증폭에 유의하십시오).

추론 token에 대한 과금 참고

grok-4.5 / grok-4.3 / grok-build-0.1 기본적으로 내부적으로 추론합니다: 응답에는 reasoning_content가 포함되며, 추론 token은 출력 과금에 포함됩니다. 테스트에서는 짧은 답변이 보이는 token은 30개뿐이었지만 출력 token 586개가 과금되었고(그중 556개는 추론 token이었습니다). 비용에 민감한 짧은 질의응답의 경우 grok-4.20-0309-non-reasoning로 전환하십시오. 자세한 내용은 Chat & 추론에서 확인하십시오.

FAQ

별도의 독자 프로토콜은 없습니다. xAI의 공식 REST API는 OpenAI 호환입니다: /v1/chat/completions (chat)와 /v1/responses (Responses API 및 서버 측 tools)입니다. OpenAI SDK의 대상으로 https://api.apiyi.com/v1를 지정하면 전체 기능을 사용할 수 있으며, “호환 모드 다운그레이드”는 없습니다.
Responses API를 사용하십시오: tools: [{"type": "web_search"}] (또는 x_search). Chat Completions의 기존 search_parameters 필드는 xAI에 의해 제거되었으며(410 확인됨) — 사용하지 마십시오. Web 및 X 검색을 참조하십시오.
이는 정상입니다. 모든 Grok 4.x 모델은 자신을 단순히 “Grok 4”라고만 식별하며(멀티 에이전트 모델은 자신을 Oppie라고 부릅니다), 4.5 / 4.3 같은 정확한 버전 번호는 보고하지 않습니다. 모델의 자기소개가 아니라 요청과 응답의 model 필드를 통해 식별을 확인하십시오.
필요 없습니다. Grok 프리픽스 캐싱은 자동입니다. usage.prompt_tokens_details.cached_tokens(테스트에서는 동일한 접두사의 두 번째 요청이 2688/2735 token에 캐시 적중했습니다). 게이트웨이는 키 풀 모드로 실행되므로 적중률에 대해 합리적인 기대를 가지십시오 — 캐시 과금을 참조하십시오.
400 오류가 발생합니다. 한도는 모델마다 다릅니다: grok-4.5는 500K, grok-4.3과 4.20 시리즈는 1M, grok-build-0.1은 256K입니다. 더 긴 콘텐츠는 요약하거나, 청크로 나누거나, RAG 검색을 사용하십시오.
4xx 클라이언트 오류(잘못된 매개변수 / 인증 실패)는 과금되지 않습니다. token이 실제로 반환된 요청은 실제 사용량 기준으로 과금됩니다. deferred: true는 조용히 무시되며 — 요청은 실제로는 동기적으로 실행되고 정상적으로 과금됩니다.

관련 문서

채팅 및 추론

스트리밍, 사고 과정, 구조화된 출력, 함수 호출, 비전, 캐싱

웹 및 X 검색

Responses API의 web_search / x_search 도구를 직접 다루는 방법

코드 실행 및 MCP

서버 측 Python 샌드박스 및 Remote MCP 통합

멀티 에이전트 모델

멀티 에이전트 모델의 기능과 과금 프로필

Codex에서 Grok 사용

네이티브 responses 프로토콜, 5분 만에 Codex에 연결

Grok 4.5 출시 심층 분석

xAI의 최신 플래그십에 대한 심층 분석

모델 정보

사용 가능한 모든 모델과 그룹