# 2026 年 Grok 文本模型对比：4.6、4.5、4.3 与 4.20 怎么选

> 截至 2026 年 8 月 26 日，介绍 Grok 4.6、4.5、4.3、4.20 与 Grok Build 0.1 的 API 定位、上下文、推理模式、价格阈值和迁移选择。

- Source: https://www.aifreeapi.com/zh/posts/grok-4-ai
- Language: zh
- Published: 2026-08-26
- Updated: 2026-08-26
- Publisher: AI Free API (https://www.aifreeapi.com)

截至 **2026 年 8 月 26 日**，SpaceXAI 在[当前模型总览](https://docs.x.ai/developers/models)中把 `grok-4.6` 作为代码和其他通用任务的旗舰推荐。它不是唯一仍可调用的文本模型：官方价格页同时列出 `grok-4.5`、`grok-4.3`、三种 `grok-4.20` 路线和面向代理式编码的 `grok-build-0.1`。

如果只是问“新项目先用哪个”，4.6 是最省解释成本的起点。如果任务需要 1M 上下文、完全关闭推理、Batch，或对单价特别敏感，4.3 仍值得成为对照组。4.20 的 reasoning、non-reasoning 与 multi-agent 不能只按版本号理解；Build 0.1 也不是一个便宜的通用聊天旗舰。

这里比较的是 **xAI 直接 API 中以文本输出为主的模型合同**。Grok 网页和 App 的模型选择、订阅用量，Grok Build 产品里的包含量，以及 Cursor 或第三方网关的加价与可用性，都是不同利用面。API 文档里出现某个 model ID，不等于每个产品、地区和账户都会显示同一个选择器。

## 先把当前型号放回各自的位置

| 模型 | 官方定位与关键合同 | 适合先验证的任务 | 主要边界 |
| --- | --- | --- | --- |
| `grok-4.6` | 当前旗舰；500K 上下文；文本/图像输入、文本输出；reasoning 为 low、medium、high、xhigh | 长步骤代理、复杂编码、知识工作、需要较强工具协作的通用应用 | 200K prompt 起整次请求进入高价档；不是自动联网 |
| `grok-4.5` | 上一代 500K 编码与代理模型；low、medium、high | 已经稳定运行、需要与 4.6 做回归对照的系统 | 标准输入/输出价与 4.6 相同，缓存价稍低，但官方默认推荐已转向 4.6 |
| `grok-4.3` | 1M 上下文；none、low、medium、high；支持 Batch | 大文档、结构化处理、高吞吐工具调用、需要关闭推理的任务 | 质量不能仅由更大窗口或低价推出；同样有 200K 长上下文价格跃升 |
| `grok-4.20-0309-reasoning` | 1M、固定 reasoning 路线 | 需要保留 4.20 行为或做明确回归比较 | dated ID，不代表最新稳定默认值 |
| `grok-4.20-0309-non-reasoning` | 1M、非推理路线 | 延迟敏感、输出规则清楚且可校验的请求 | “不推理”不等于所有简单任务都更便宜，失败重试仍会增加成本 |
| `grok-4.20-multi-agent-0309` | 多代理并行深度研究，官方标为 Beta | 有明确研究交付、能审核来源与综合结论的任务 | 多代理会改变调用路径和总消耗；Beta 不宜无回退地成为全量默认 |
| `grok-build-0.1` | 256K，专门训练于 agentic coding/workflow | 代码仓库修改、Web 开发、Grok Build 相关工作流 | 专用编码模型，不是 Grok 4.6 的通用低价版 |

这个表刻意没有把“最新”等同于“任何任务最优”。型号只是候选；输入分布、工具环境、reasoning 设置、超时、重试和验收标准共同决定最后的成本与成功率。

## Grok 4.6 的升级到底落在哪里

[Grok 4.6 模型页](https://docs.x.ai/developers/grok-4-6)给出的直接 API 合同是：500,000 tokens 上下文，知识截止 2026 年 2 月 1 日，支持 Responses API 与 Chat Completions；可使用 function calling、Web Search、X Search 和 code execution。reasoning 默认 high，还可选 low、medium 或 xhigh。

SpaceXAI 在[发布说明](https://x.ai/news/grok-4-6)中把升级重点放在长时间运行的代理、复杂知识工作，以及交互式和视觉项目的多轮推进。供应商公布的表格显示 4.6 High 在多项代理和编码评估上高于 4.5 High，但不同测试的领先者并不一致。这些是供应商报告或收集的结果，不是本站复现的 benchmark，也不能证明你的中文客服、合同抽取或私有代码库一定获益。

更可靠的升级问题是：在同一批真实任务、同一工具权限和同一 reasoning 档位下，4.6 是否减少了人工干预、失败重试或未通过验收的输出。若 4.5 已经稳定，保留它作为短期控制组，比看到发布分数后直接全量换 ID 更容易识别回归。

4.6 也不会自动知道训练截止之后的事件。官方总览明确说明，实时信息需要显式启用 Web Search 或 X Search。启用工具后，还要把来源质量、工具调用次数和失败分支纳入评估；“Grok 与 X 有关系”不是免费、默认、无条件的实时事实保证。

## 为什么 4.3 仍可能赢下你的工作负载

`grok-4.3` 的名称更旧，却有几个 4.6 没有的合同差异：[模型页](https://docs.x.ai/developers/models/grok-4.3)列出 1,000,000 tokens 上下文、Batch 支持，以及 `none` 到 `high` 四档 reasoning。对于需要装入大量文档但任务本身不难、或需要稳定非推理输出的管道，这些差异可能比旗舰标签更重要。

价格也不同。在 prompt 少于 200K tokens 时，4.3 每百万 input / cached input / output 分别是 **$1.25 / $0.20 / $2.50**；4.6 是 **$2 / $0.50 / $6**。一个 100K input、20K output、无缓存无工具的请求，模型 token 估算约为：

- 4.3：`0.1 × $1.25 + 0.02 × $2.50 = $0.175`
- 4.6：`0.1 × $2 + 0.02 × $6 = $0.32`

这只说明单次 token 账单，不说明哪个结果更便宜。如果 4.3 需要两次重试而 4.6 一次通过，表面单价优势就可能消失。更合适的分母是“通过验收的任务”：

`每个成功任务成本 = 全部请求 token + 工具调用 + 重试 + 人工修复成本，再除以通过任务数`

大窗口也不意味着应把所有资料一次塞满。4.3 和 4.6 的 prompt 达到 **200K** 后，官方[价格表](https://docs.x.ai/developers/pricing)会对整次请求的所有 tokens 使用长上下文档，而不只是对超过阈值的部分加价。4.3 变为 $2.50 / $0.40 / $5；4.6 变为 $4 / $1 / $12。先做检索、去重和上下文压缩，常比盲目追求最大窗口更能控制成本。

![Grok 4.6 与 4.3 的 200K prompt 价格阈值、短长上下文费率和 100K 输入加 20K 输出的单次成本示例](https://www.aifreeapi.com/posts/zh/grok-4-ai/img/long-context-cost-threshold.webp)

## 4.20 和 Multi-Agent 不是一条“更老的旗舰”

当前直接 API 价格页仍列出三个 4.20 model ID，短上下文价格都与 4.3 相同，窗口也都是 1M。但它们表示不同执行合同：

- `grok-4.20-0309-reasoning` 固定为推理路线；
- `grok-4.20-0309-non-reasoning` 面向非推理执行；
- `grok-4.20-multi-agent-0309` 让多个 agent 并行完成深度研究，且详情页明确写着 Beta。

多代理的价值取决于任务能否真正拆分、结果能否综合、引用能否审核。它也可能生成更多中间工作和工具调用，所以不能拿 $2.50 的 output 标价与单代理请求做一对一总成本推断。只有当单代理在可拆分研究任务上稳定漏项，而多代理能提高最终通过率时，额外执行路径才可能值得。

带 `0309` 的 ID 还能固定一次发布行为，适合回归敏感的工作流。官方的[模型别名说明](https://docs.x.ai/developers/models)指出，无日期 alias 与 `-latest` 适合自动接收新版本，带日期 ID 则不会自动更新。开发阶段可以跟随 alias，生产中的高风险抽取或决策流程更适合先固定版本，再通过测试主动升级。

## 旧 ID 的迁移不能只看请求有没有报错

官方的[2026 年 5 月迁移表](https://docs.x.ai/developers/migration/may-15-retirement)已经把多个旧 slug 重新路由：Grok 4.1 Fast、Grok 4 Fast、`grok-4-0709` 和 `grok-3` 会落到 4.3 的不同 reasoning 设置；`grok-code-fast-1` 会落到 `grok-build-0.1`。旧请求仍返回成功，并不代表还在运行原模型，账单也按新目标模型的价格计算。

迁移时至少要完成四件事：

1. 盘点代码、环境变量、配置中心、队列和第三方网关中的精确 model ID。
2. 记录旧 slug 当前实际路由、reasoning 设置和 API 利用面，不把自动映射当成长期合同。
3. 用相同样本比较候选模型，覆盖正常输入、长上下文、工具失败、结构化输出和安全拒绝。
4. 把模型与 reasoning 放进可回退配置，先小流量验证，再扩大；同时观察通过率、P95 延迟、token、工具调用与重试。

![Grok 文本模型从盘点 ID、确认路由、任务集测试到可回退配置、扩大验证和指标观测的六步迁移流程](https://www.aifreeapi.com/posts/zh/grok-4-ai/img/migration-validation-rollback.webp)

若只需要一个落地起点：通用复杂任务先测 `grok-4.6`；低成本、大上下文或可关闭推理的任务把 `grok-4.3` 设为对照；已有 4.5 的系统先做回归而不是盲升；4.20 multi-agent 与 `grok-build-0.1` 只在它们的专用任务上单独证明价值。

当问题变成 Grok 与其他厂商的编码模型谁更适合，可以转到 [Grok 4.6、GPT-5.6 Sol 与 Claude Fable 5 的同题选择](/zh/posts/gpt-5-6-sol-vs-claude-fable-5)。但在 Grok 系列内部，正确答案不是追最新数字，而是用清晰的 API 合同、同一组验收任务和可回退的版本配置，把升级变成可验证的工程决定。
