截至 2026 年 8 月 26 日,SpaceXAI 在当前模型总览中把 grok-4.6 作为代码和其他通用任务的旗舰推荐。它不是唯一仍可调用的文本模型:官方价格页同时列出 grok-4.5、grok-4.3、三种 grok-4.20 路线和面向代理式编码的 grok-build-0.1。
如果只是问“新项目先用哪个”,4.6 是最省解释成本的起点。如果任务需要 1M 上下文、完全关闭推理、Batch,或对单价特别敏感,4.3 仍值得成为对照组。4.20 的 reasoning、non-reasoning 与 multi-agent 不能只按版本号理解;Build 0.1 也不是一个便宜的通用聊天旗舰。
这里比较的是 xAI 直接 API 中以文本输出为主的模型合同。Grok 网页和 App 的模型选择、订阅用量,Grok Build 产品里的包含量,以及 Cursor 或第三方网关的加价与可用性,都是不同利用面。API 文档里出现某个 model ID,不等于每个产品、地区和账户都会显示同一个选择器。
先把当前型号放回各自的位置
| 模型 | 官方定位与关键合同 | 适合先验证的任务 | 主要边界 |
|---|---|---|---|
grok-4.6 | 当前旗舰;500K 上下文;文本/图像输入、文本输出;reasoning 为 low、medium、high、xhigh | 长步骤代理、复杂编码、知识工作、需要较强工具协作的通用应用 | 200K prompt 起整次请求进入高价档;不是自动联网 |
grok-4.5 | 上一代 500K 编码与代理模型;low、medium、high | 已经稳定运行、需要与 4.6 做回归对照的系统 | 标准输入/输出价与 4.6 相同,缓存价稍低,但官方默认推荐已转向 4.6 |
grok-4.3 | 1M 上下文;none、low、medium、high;支持 Batch | 大文档、结构化处理、高吞吐工具调用、需要关闭推理的任务 | 质量不能仅由更大窗口或低价推出;同样有 200K 长上下文价格跃升 |
grok-4.20-0309-reasoning | 1M、固定 reasoning 路线 | 需要保留 4.20 行为或做明确回归比较 | dated ID,不代表最新稳定默认值 |
grok-4.20-0309-non-reasoning | 1M、非推理路线 | 延迟敏感、输出规则清楚且可校验的请求 | “不推理”不等于所有简单任务都更便宜,失败重试仍会增加成本 |
grok-4.20-multi-agent-0309 | 多代理并行深度研究,官方标为 Beta | 有明确研究交付、能审核来源与综合结论的任务 | 多代理会改变调用路径和总消耗;Beta 不宜无回退地成为全量默认 |
grok-build-0.1 | 256K,专门训练于 agentic coding/workflow | 代码仓库修改、Web 开发、Grok Build 相关工作流 | 专用编码模型,不是 Grok 4.6 的通用低价版 |
这个表刻意没有把“最新”等同于“任何任务最优”。型号只是候选;输入分布、工具环境、reasoning 设置、超时、重试和验收标准共同决定最后的成本与成功率。
Grok 4.6 的升级到底落在哪里
Grok 4.6 模型页给出的直接 API 合同是:500,000 tokens 上下文,知识截止 2026 年 2 月 1 日,支持 Responses API 与 Chat Completions;可使用 function calling、Web Search、X Search 和 code execution。reasoning 默认 high,还可选 low、medium 或 xhigh。
SpaceXAI 在发布说明中把升级重点放在长时间运行的代理、复杂知识工作,以及交互式和视觉项目的多轮推进。供应商公布的表格显示 4.6 High 在多项代理和编码评估上高于 4.5 High,但不同测试的领先者并不一致。这些是供应商报告或收集的结果,不是本站复现的 benchmark,也不能证明你的中文客服、合同抽取或私有代码库一定获益。
更可靠的升级问题是:在同一批真实任务、同一工具权限和同一 reasoning 档位下,4.6 是否减少了人工干预、失败重试或未通过验收的输出。若 4.5 已经稳定,保留它作为短期控制组,比看到发布分数后直接全量换 ID 更容易识别回归。
4.6 也不会自动知道训练截止之后的事件。官方总览明确说明,实时信息需要显式启用 Web Search 或 X Search。启用工具后,还要把来源质量、工具调用次数和失败分支纳入评估;“Grok 与 X 有关系”不是免费、默认、无条件的实时事实保证。
为什么 4.3 仍可能赢下你的工作负载
grok-4.3 的名称更旧,却有几个 4.6 没有的合同差异:模型页列出 1,000,000 tokens 上下文、Batch 支持,以及 none 到 high 四档 reasoning。对于需要装入大量文档但任务本身不难、或需要稳定非推理输出的管道,这些差异可能比旗舰标签更重要。
价格也不同。在 prompt 少于 200K tokens 时,4.3 每百万 input / cached input / output 分别是 $1.25 / $0.20 / $2.50;4.6 是 $2 / $0.50 / $6。一个 100K input、20K output、无缓存无工具的请求,模型 token 估算约为:
- 4.3:
0.1 × $1.25 + 0.02 × $2.50 = $0.175 - 4.6:
0.1 × $2 + 0.02 × $6 = $0.32
这只说明单次 token 账单,不说明哪个结果更便宜。如果 4.3 需要两次重试而 4.6 一次通过,表面单价优势就可能消失。更合适的分母是“通过验收的任务”:
每个成功任务成本 = 全部请求 token + 工具调用 + 重试 + 人工修复成本,再除以通过任务数
大窗口也不意味着应把所有资料一次塞满。4.3 和 4.6 的 prompt 达到 200K 后,官方价格表会对整次请求的所有 tokens 使用长上下文档,而不只是对超过阈值的部分加价。4.3 变为 $2.50 / $0.40 / $5;4.6 变为 $4 / $1 / $12。先做检索、去重和上下文压缩,常比盲目追求最大窗口更能控制成本。

4.20 和 Multi-Agent 不是一条“更老的旗舰”
当前直接 API 价格页仍列出三个 4.20 model ID,短上下文价格都与 4.3 相同,窗口也都是 1M。但它们表示不同执行合同:
grok-4.20-0309-reasoning固定为推理路线;grok-4.20-0309-non-reasoning面向非推理执行;grok-4.20-multi-agent-0309让多个 agent 并行完成深度研究,且详情页明确写着 Beta。
多代理的价值取决于任务能否真正拆分、结果能否综合、引用能否审核。它也可能生成更多中间工作和工具调用,所以不能拿 $2.50 的 output 标价与单代理请求做一对一总成本推断。只有当单代理在可拆分研究任务上稳定漏项,而多代理能提高最终通过率时,额外执行路径才可能值得。
带 0309 的 ID 还能固定一次发布行为,适合回归敏感的工作流。官方的模型别名说明指出,无日期 alias 与 -latest 适合自动接收新版本,带日期 ID 则不会自动更新。开发阶段可以跟随 alias,生产中的高风险抽取或决策流程更适合先固定版本,再通过测试主动升级。
旧 ID 的迁移不能只看请求有没有报错
官方的2026 年 5 月迁移表已经把多个旧 slug 重新路由:Grok 4.1 Fast、Grok 4 Fast、grok-4-0709 和 grok-3 会落到 4.3 的不同 reasoning 设置;grok-code-fast-1 会落到 grok-build-0.1。旧请求仍返回成功,并不代表还在运行原模型,账单也按新目标模型的价格计算。
迁移时至少要完成四件事:
- 盘点代码、环境变量、配置中心、队列和第三方网关中的精确 model ID。
- 记录旧 slug 当前实际路由、reasoning 设置和 API 利用面,不把自动映射当成长期合同。
- 用相同样本比较候选模型,覆盖正常输入、长上下文、工具失败、结构化输出和安全拒绝。
- 把模型与 reasoning 放进可回退配置,先小流量验证,再扩大;同时观察通过率、P95 延迟、token、工具调用与重试。

若只需要一个落地起点:通用复杂任务先测 grok-4.6;低成本、大上下文或可关闭推理的任务把 grok-4.3 设为对照;已有 4.5 的系统先做回归而不是盲升;4.20 multi-agent 与 grok-build-0.1 只在它们的专用任务上单独证明价值。
当问题变成 Grok 与其他厂商的编码模型谁更适合,可以转到 Grok 4.6、GPT-5.6 Sol 与 Claude Fable 5 的同题选择。但在 Grok 系列内部,正确答案不是追最新数字,而是用清晰的 API 合同、同一组验收任务和可回退的版本配置,把升级变成可验证的工程决定。



