🚀 核心亮点:
grok-4.6 是 xAI 于 2026年8月7日 发布的最新旗舰,沿用 grok-4.5 的 1.5T 参数 V9 基座、提升全部来自后训练,挂牌价与 grok-4.5 完全相同;grok-4.3 与 grok-4.20 系列提供 100 万 tokens 上下文;Responses API 的 web_search / x_search / code_interpreter / MCP 四大工具在 API易 实测真实可用,其中 X 搜索是 Grok 独有的差异化能力;原生 responses 协议还意味着 Grok 可以直接接入 OpenAI Codex。全系可走 GrokOfficial 分组享 0.8x 倍率(8 折),详见下方「分组与折扣」。模型阵容
grok-4.6
最新旗舰 · 代码与 Agent2026/8/7 发布,500K 上下文。与 grok-4.5 同基座同价,长周期任务的自检与验证更强。
grok-4.5
上一代旗舰 · 同价500K 上下文,与 grok-4.6 挂牌同价,存量业务可继续使用。
grok-4.3
标准主力1M 上下文,价格是旗舰的六折出头,日常对话与中等推理的均衡之选。
grok-4.20 双变体
推理 / 非推理可选
-reasoning 与 -non-reasoning 同价同上下文(1M),按需选择是否输出思维链。grok-build-0.1
代码专用256K 上下文,全系最低单价,适合高频代码补全与轻量编程任务。
grok-4.20-multi-agent-beta-0309
多智能体协作多个 agent 并行协作解题,适合复杂研究任务。计费特性特殊,详见 Multi-Agent 模型。
更多能力页
对话/推理/视觉见 对话与推理;联网见 联网搜索与 X 搜索。
模型定价
挂牌价与 xAI 官网一致(已于 2026-07-13 经 API易 定价接口逐一核对,grok-4.6 于 2026-08-13 补核),API易 的折扣体现在 GrokOfficial 分组 0.8x 与 充值加赠活动 中,两者可叠加。
下表为 0 – 200K 上下文档位的挂牌价(Grok 全系按上下文长度阶梯计费,超过 200K 的档位见下方说明):
阶梯计费与缓存价
Grok 全系按单次请求的上下文长度分两档计费,分档点为 200K tokens(即 200Ki = 204,800)。超过该点的请求,输入与输出单价翻倍:
单位均为每 1M tokens。
grok-4.6 与 grok-4.5 唯一的价格差异在缓存读取($0.50 vs $0.30),输入输出完全相同。
其中 grok-4.6 两档的输入 / 输出 / 缓存读取价均已在 API易 控制台逐项核对;其余模型第二档的缓存读取价按官方「第二档单价翻倍」口径推算,以 模型价格页 的实时挂牌为准。
- 别名
grok-code-fast/grok-code-fast-1亦可调用(实测连通),定价以 模型价格页 为准。 - 缓存命中的输入 tokens 享受上表的缓存读取价,Grok 前缀缓存自动生效、无需配置,双端点与流式 / 非流式均已实测覆盖,详见 Grok 缓存计费指南。
- 长上下文任务请留意分档点:一次 210K tokens 的请求,全部 tokens 都按第二档计价,而不是只有超出的 10K 按第二档。拆分请求可以避开这一跳变。
分组与折扣
GrokOfficial 的模型能力与调用方式和默认分组完全一致,单独拆出这个分组只是为了做优惠、鼓励在 Grok 系列上多跑量。创建令牌时勾选该分组(或在已有 Grok 令牌上增加该分组)即可,代码一行不用改;grok-4.6 等模型在该分组下同样支持 Codex 场景使用。
折扣可与 充值加赠(10%–20%)叠加。以 grok-4.6 第一档为例:
实测能力矩阵
以下矩阵来自 2026-07-13 (UTC+8) 在 API易 网关的实测(✅ 实测通过;◐ 未实测、同架构预期一致;— 未覆盖,同架构预期一致):grok-4.6 那一列为什么还有 ◐:这套 56 组请求的实测跑于 2026-07-13,当时 4.6 尚未发布。2026-08-19 我们对 4.6 补测了基础对话、流式输出(含 usage)与 Prompt Caching 三项(覆盖 /v1/chat/completions 与 /v1/responses 双端点、流式与非流式,并逐条核对了账单),已改为实测结论。其余仍为 ◐ 的项目沿用同架构预期一致的判断:4.6 与 4.5 同为 1.5T 参数 V9 基座、同一套 API 协议与端点,上游也未公告任何参数层面的破坏性变更。生产接入前建议先在自己的用例上做一次小样验证。端点一览
在 Codex 中直接使用
因为原生支持/v1/responses,Grok 是少数能在 OpenAI Codex(桌面客户端 / IDE 插件 / CLI)里以 responses 原生协议直接使用的非 OpenAI 模型——config.toml 里 model = "grok-4.6"、wire_api = "responses" 即可,5 分钟接上,Codex 的工具调用、推理条目等 Agent 能力全走原生协议。对比之下,Claude / Gemini 在 API易 上只能走 OpenAI 兼容 chat 模式(wire_api = "chat" 兜底),在 Codex / Agent 场景存在协议不兼容。完整接入步骤见 Codex 接入教程。
快速开始
计费注意:思维链 tokens
grok-4.6 / grok-4.5 / grok-4.3 / grok-build-0.1 默认带内部推理:响应中返回 reasoning_content,且推理 tokens 计入输出计费。实测短问答中可见文本仅 30 tokens、实际计费输出 586 tokens(含 556 推理 tokens)。对成本敏感的短问答场景,建议改用 grok-4.20-0309-non-reasoning。详细说明见 对话与推理。
常见问题
Grok 有自己的原生 API 格式吗?
Grok 有自己的原生 API 格式吗?
没有独立私有协议。xAI 官方 REST API 就是 OpenAI 兼容格式:
/v1/chat/completions(对话)+ /v1/responses(Responses API 与 server-side 工具)。在 API易 上用 OpenAI SDK 把 base_url 指向 https://api.apiyi.com/v1 即为全功能调用,不存在”兼容模式阉割”。联网搜索怎么开?
联网搜索怎么开?
走 Responses API:
tools: [{"type": "web_search"}](或 x_search)。旧版 Chat Completions 的 search_parameters 参数已被 xAI 下线(实测 410),不要再使用。详见 联网搜索与 X 搜索。模型自我介绍说自己是 Grok 4,是不是模型不对?
模型自我介绍说自己是 Grok 4,是不是模型不对?
正常现象。Grok 4.x 全系的自我认知均为「Grok 4」(multi-agent 模型自称 Oppie),不会精确报出 4.6 / 4.5 / 4.3 等版本号。验证模型身份请以请求的
model 字段和响应 model 字段为准,而非模型的自我介绍。缓存需要配置吗?
缓存需要配置吗?
不需要。Grok 前缀缓存自动生效,响应
usage.prompt_tokens_details.cached_tokens 可自查命中量(/v1/responses 端点看 usage.input_tokens_details.cached_tokens)。命中量按 128 token 取整,两轮实测都吻合:8802 token 的前缀命中 8704、2735 token 的前缀命中 2688。xAI 官方明确缓存条目可能被驱逐、不保证 100% 命中,做成本测算请按无缓存价格打底。完整口径见 Grok 缓存计费指南。上下文超限会怎样?
上下文超限会怎样?
返回 400 错误。注意各档上限不同:grok-4.6 与 grok-4.5 为 500K,grok-4.3 与 4.20 系列为 1M,grok-build-0.1 为 256K。超长内容建议先做摘要 / 分段 / RAG 检索。
失败的请求会扣费吗?
失败的请求会扣费吗?
4xx 类客户端错误(参数错误 / 鉴权失败)不计费;已成功返回 tokens 的请求按实际消耗计费。注意
deferred: true 会被静默忽略——请求实际同步执行并正常计费。相关文档
对话与推理
流式、思维链、结构化输出、函数调用、视觉输入、缓存
缓存计费
命中省 75%、128 token 块粒度、长对话该走哪个端点
联网搜索与 X 搜索
Responses API 的 web_search / x_search 工具实战
代码执行与 MCP
服务端 Python 沙箱与 Remote MCP 工具接入
Multi-Agent 模型
多智能体协作模型的能力与计费特性
在 Codex 中使用 Grok
原生 responses 协议直连 Codex,5 分钟接上
Grok 4.6 发布解读
xAI 最新旗舰的基准、定价与迁移建议
Grok 4.5 发布解读
上一代旗舰的深度解读
模型信息总览
查看所有可用模型及分组