# GLM-5.3 与 DeepSeek V4 Pro 怎么选：接入、成本与 Agent 能力

> 基于 2026 年 8 月官方资料比较 GLM-5.3 与 DeepSeek V4 Pro：当前入口、1M 上下文、API 价格、推理与工具合同，以及可复现选型方法。

- Source: https://www.aifreeapi.com/zh/posts/glm-5-3-vs-deepseek-v4-pro
- Language: zh
- Published: 2026-08-15
- Updated: 2026-08-15
- Publisher: AI Free API (https://www.aifreeapi.com)

截至 **2026 年 8 月 15 日**，这两款模型不能只按跑分高低做选择。**GLM-5.3 已向 GLM Coding Plan 的 Lite、Pro、Max 用户开放，但通用按量 API 仍标注为即将上线；DeepSeek V4 Pro 已在 App、Web 和 API 正式可用。**

因此，短答案取决于你今天要走哪条路线：

- 已经使用 Claude Code、Codex、Cline 等受支持的编码工具，愿意按 Coding Plan 的订阅与积分规则评估，可立即把 GLM-5.3 加入候选。
- 要把模型接入自己的产品、按 token 计费，或需要非思考模式，DeepSeek V4 Pro 是当前能直接落地的选择。
- 只想知道谁“性能更强”，公开资料还不足以给出通用答案。Z.ai 的发布表中两者互有胜负，而且不同任务的 harness、上下文、超时和停止条件会改变结果。

## 先确认比较的是准确型号和准确入口

GLM-5.3 的正式模型 ID 是 `glm-5.3`。Z.ai 的[模型说明](https://docs.z.ai/guides/llm/glm-5.3)将它定义为文本输入、文本输出的旗舰模型，公布的上下文为 1M tokens，最大输出为 128K。它与 GLM-5.2 使用同一个基础模型，5.3 的提升来自后训练；这并不授权把 5.2 的 API 价格或实测结果自动搬到 5.3。

DeepSeek 的稳定调用 ID 是 `deepseek-v4-pro`，当前服务版本为 `DeepSeek-V4-Pro-0813`。稳定 ID 应放进请求；`0813` 用于记录本次评估所面对的服务版本。DeepSeek 的[正式版公告](https://api-docs.deepseek.com/news/news260813/)确认 V4 Pro 已于 8 月 13 日进入 GA，而不是仍处于 Preview。

| 当前合同 | GLM-5.3 | DeepSeek V4 Pro |
|---|---|---|
| 调用标识 | `glm-5.3` | `deepseek-v4-pro` |
| 当前状态 | Coding Plan 全档可用；通用 API 即将上线 | App、Web、API 已 GA |
| 输入/输出模态 | 文本 / 文本 | 文本 / 文本 |
| 上下文上限 | 1M | 1M |
| 最大输出 | 128K | 384K |
| 思考模式 | 始终思考，low/high/max | 可开关，low/high/max |
| 当前成本口径 | 订阅 + 积分 | API 按 tokens 计费 |
| 公开权重 | 官方表示安全评估后约两周发布；核验日尚不可得 | 本文只核验官方托管合同，不据此推导自部署状态 |

1M context 只是容量上限，不代表应该把整个仓库一次塞满，也不证明接近上限时仍能保持相同准确率。实际 Agent 更适合先检索相关文件，再按任务扩大上下文；否则预填充时间、缓存占用和无关信息都会增加。

## GLM-5.3 今天能在哪里使用？

GLM-5.3 当前的可用路线是 **GLM Coding Plan**。官方[切换模型指南](https://docs.z.ai/devpack/latest-model)给出的国际端点按客户端协议区分：Claude Code / Goose 使用 Anthropic-compatible 路线，Codex 使用 OpenAI Responses 路线，其他支持自定义模型的工具使用 Coding Plan 的 OpenAI-compatible 路线。

Claude Code 若要明确启用 1M 路由，模型名使用 `glm-5.3[1m]`，并设置对应的自动压缩窗口。这个后缀是 Coding Plan 的 Claude Code 路由约定，不是未来通用 Model API 的正式 ID。

更重要的是，[GLM-5.3 模型页](https://docs.z.ai/guides/llm/glm-5.3)仍写着通用 API 即将上线；当前[按量 API 价卡](https://docs.z.ai/guides/overview/pricing)也没有 GLM-5.3。看到 GLM-5.2 的输入 `$1.40/M`、缓存输入 `$0.26/M`、输出 `$4.40/M`，不能把它们当作 5.3 的价格。

Coding Plan 是另一种商品。核验时，月费页面显示 Lite `$18`、Pro `$72`、Max `$160`；额度同时受滚动 5 小时积分和每周积分约束。GLM-5.3 的积分公式按输入、缓存输入和输出分别乘以 6.9、1.7、24，再除以 10,000；工作日北京时间 14:00–18:00 按标准积分扣减，其余时段与周末为 50%。这些数字能估算订阅消耗，不能直接写成 GLM-5.3 的美元 token 单价。

## DeepSeek V4 Pro 的价格明天之后就不同

DeepSeek 的[模型与价格页](https://api-docs.deepseek.com/quick_start/pricing/)列出了当前和已排期的新价格。旧价格仅持续到 **2026 年 8 月 17 日 00:00（北京时间）**：

| 每 100 万 tokens | 旧价（切换前） | 8 月 17 日起闲时 | 8 月 17 日起高峰 |
|---|---:|---:|---:|
| 缓存命中输入 | $0.003625 | $0.022 | $0.044 |
| 缓存未命中输入 | $0.435 | $0.66 | $1.32 |
| 输出 | $0.87 | $1.98 | $3.96 |

高峰为北京时间 09:00–12:00、14:00–18:00，其余时间为闲时。思考 tokens 计入输出，不应只按最终可见答案估算成本。

假设一项仓库任务消耗 10 万未缓存输入与 5 万输出，不考虑缓存、重试、工具费和税费：切价后闲时约为 `0.1 × $0.66 + 0.05 × $1.98 = $0.165`，高峰约为 `$0.33`。同样的 token 量在 GLM Coding Plan 中约消耗 `189` 标准积分，但这来自预付订阅池，不能把 `$0.165` 与 `189` 直接比较。

真正可比的是：

`每个被验收任务成本 = 全部尝试的模型、工具与重试成本 ÷ 最终通过验收的任务数`

如果模型单次调用便宜却需要三次返工，或者订阅还有大量闲置额度，价卡上的单位价格不会等于真实交付成本。

![订阅积分与 API tokens 需要在验收任务层面比较](https://www.aifreeapi.com/posts/zh/glm-5-3-vs-deepseek-v4-pro/img/cost-units.webp)

## 官方表里没有一位全项目冠军

Z.ai 的[GLM-5.3 发布页](https://z.ai/blog/glm-5.3)公布了一张包含 DeepSeek-V4-Pro-0813 的比较表。下面只摘录会影响代码 Agent 选择的几行，并保留“发布方汇总值”这一属性：

| 评测 | GLM-5.3 | DeepSeek V4 Pro 0813 | 表内结果 |
|---|---:|---:|---|
| Terminal-Bench 2.1 | 88.2 | 87.9 | 接近，GLM 略高 |
| DeepSWE v1.1 | 66.9 | 62.7 | GLM 较高 |
| NL2Repo | 58.0 | 61.1 | DeepSeek 较高 |
| CyberGym | 84.5 | 83.3 | GLM 略高 |
| Toolathlon Verified | 73.0 | 74.1 | DeepSeek 较高 |
| AutomationBench v1.0.6 | 48.2 | 43.2 | GLM 较高 |
| Agents’ Last Exam CLI | 28.5 | 25.7 | GLM 较高 |

这张表能支持“值得在这些任务类型上复测”，不能支持“GLM 在所有编程任务上更强”。例如，GLM 的 Terminal-Bench 2.1 运行使用特定 Claude Code 版本、65,536 最大新 tokens 和 6 小时超时；NL2Repo 又使用 1M context、64K 输出与额外判断规则。对手数据的所有运行细节并未逐项以同等完整度公开。

DeepSeek 自己的[更新日志](https://api-docs.deepseek.com/updates/)报告 Terminal Bench 2.1 为 87.9、DeepSWE 为 62.7，并说明代码 Agent 结果来自 DeepSeek Harness minimal、max effort 等设置。这些发布表不能替代独立的同环境复跑。若你的 Agent 会更换文件选择、上下文压缩、工具修复或重试策略，最终结果可能不同。

## 两套 Agent 合同会直接改变迁移成本

GLM-5.3 始终进行思考。标准合同只接受 `low`、`high`、`max`，默认 `max`；Coding Plan 为兼容不同客户端，会把 `disabled`、`none`、`minimal` 等值归一到较低 effort，而不是完全关闭思考。需要低延迟的分类、抽取或短格式转换时，这一点会增加验证义务。

DeepSeek V4 Pro 可关闭思考，Chat Completions 中默认开启且 effort 默认 `high`。它还提供 Responses 与 Anthropic-compatible 路线，但“兼容”不是完整等价。DeepSeek 的[Responses 说明](https://api-docs.deepseek.com/guides/responses_api/)列出若干不支持或会被忽略的状态、工具和多模态参数；[Anthropic 兼容说明](https://api-docs.deepseek.com/guides/anthropic_api/)也要求显式使用 Pro ID，否则不支持的模型名可能映射到 Flash。

工具循环还有一个会直接导致故障的差异。DeepSeek 在 thinking + tools 场景要求完整回传上一条 assistant message，包括 `reasoning_content`、`content` 和 `tool_calls`，再追加 `role: tool` 结果；只保留可见 `content` 可能收到 HTTP 400。GLM 的实际工具行为则要同时核对 Coding Plan 客户端与所选协议，不应只凭“支持 Function Calling”推导完整 JSON Schema 行为。

## 用同一批真实任务决定，而不是继续加总跑分

准备 12–20 个近期真实发生、能够客观验收的任务，覆盖小修复、跨文件修改、长任务和工具调用。对两个候选尽量使用同一 Agent 客户端，并固定：

![同一仓库和相同条件下的双候选测试与重试计成本流程](https://www.aifreeapi.com/posts/zh/glm-5-3-vs-deepseek-v4-pro/img/accepted-task-loop.webp)

1. 同一个仓库 commit、文件权限和初始说明；
2. 相同的检索、MCP、shell 与网络权限；
3. 对应的最高/中等 effort 策略，而不是一个 max、一个 non-thinking；
4. 相同的超时、最大轮数、重试预算和人工介入规则；
5. 预先写好的 tests、schema、截图或事实检查；
6. 每次运行的输入、缓存、输出、工具、积分/美元、耗时和人工修复。

如果两个 provider 无法在同一协议下完整复现工具功能，把这种差异记为“路线摩擦”，不要偷偷修到看起来一样。模型选择的停止条件也应提前写好：某个候选不支持必需入口、连续两批任务都低于验收线，或单位被验收任务成本稳定更高时，就不必继续扩大测试。

今天最稳妥的结论是：**GLM-5.3 更适合已经在受支持编码工具中评估新模型的团队；DeepSeek V4 Pro 更适合现在就要通用 API、App/Web 或可关闭思考模式的团队。** 如果两条路线都可用，公开跑分只能确定测试优先级，最终采购应由你自己的被验收任务成本、稳定性和运维摩擦决定。
