截至 2026 年 8 月 15 日,这两款模型不能只按跑分高低做选择。GLM-5.3 已向 GLM Coding Plan 的 Lite、Pro、Max 用户开放,但通用按量 API 仍标注为即将上线;DeepSeek V4 Pro 已在 App、Web 和 API 正式可用。
因此,短答案取决于你今天要走哪条路线:
- 已经使用 Claude Code、Codex、Cline 等受支持的编码工具,愿意按 Coding Plan 的订阅与积分规则评估,可立即把 GLM-5.3 加入候选。
- 要把模型接入自己的产品、按 token 计费,或需要非思考模式,DeepSeek V4 Pro 是当前能直接落地的选择。
- 只想知道谁“性能更强”,公开资料还不足以给出通用答案。Z.ai 的发布表中两者互有胜负,而且不同任务的 harness、上下文、超时和停止条件会改变结果。
先确认比较的是准确型号和准确入口
GLM-5.3 的正式模型 ID 是 glm-5.3。Z.ai 的模型说明将它定义为文本输入、文本输出的旗舰模型,公布的上下文为 1M tokens,最大输出为 128K。它与 GLM-5.2 使用同一个基础模型,5.3 的提升来自后训练;这并不授权把 5.2 的 API 价格或实测结果自动搬到 5.3。
DeepSeek 的稳定调用 ID 是 deepseek-v4-pro,当前服务版本为 DeepSeek-V4-Pro-0813。稳定 ID 应放进请求;0813 用于记录本次评估所面对的服务版本。DeepSeek 的正式版公告确认 V4 Pro 已于 8 月 13 日进入 GA,而不是仍处于 Preview。
| 当前合同 | GLM-5.3 | DeepSeek V4 Pro |
|---|---|---|
| 调用标识 | glm-5.3 | deepseek-v4-pro |
| 当前状态 | Coding Plan 全档可用;通用 API 即将上线 | App、Web、API 已 GA |
| 输入/输出模态 | 文本 / 文本 | 文本 / 文本 |
| 上下文上限 | 1M | 1M |
| 最大输出 | 128K | 384K |
| 思考模式 | 始终思考,low/high/max | 可开关,low/high/max |
| 当前成本口径 | 订阅 + 积分 | API 按 tokens 计费 |
| 公开权重 | 官方表示安全评估后约两周发布;核验日尚不可得 | 本文只核验官方托管合同,不据此推导自部署状态 |
1M context 只是容量上限,不代表应该把整个仓库一次塞满,也不证明接近上限时仍能保持相同准确率。实际 Agent 更适合先检索相关文件,再按任务扩大上下文;否则预填充时间、缓存占用和无关信息都会增加。
GLM-5.3 今天能在哪里使用?
GLM-5.3 当前的可用路线是 GLM Coding Plan。官方切换模型指南给出的国际端点按客户端协议区分:Claude Code / Goose 使用 Anthropic-compatible 路线,Codex 使用 OpenAI Responses 路线,其他支持自定义模型的工具使用 Coding Plan 的 OpenAI-compatible 路线。
Claude Code 若要明确启用 1M 路由,模型名使用 glm-5.3[1m],并设置对应的自动压缩窗口。这个后缀是 Coding Plan 的 Claude Code 路由约定,不是未来通用 Model API 的正式 ID。
更重要的是,GLM-5.3 模型页仍写着通用 API 即将上线;当前按量 API 价卡也没有 GLM-5.3。看到 GLM-5.2 的输入 $1.40/M、缓存输入 $0.26/M、输出 $4.40/M,不能把它们当作 5.3 的价格。
Coding Plan 是另一种商品。核验时,月费页面显示 Lite $18、Pro $72、Max $160;额度同时受滚动 5 小时积分和每周积分约束。GLM-5.3 的积分公式按输入、缓存输入和输出分别乘以 6.9、1.7、24,再除以 10,000;工作日北京时间 14:00–18:00 按标准积分扣减,其余时段与周末为 50%。这些数字能估算订阅消耗,不能直接写成 GLM-5.3 的美元 token 单价。
DeepSeek V4 Pro 的价格明天之后就不同
DeepSeek 的模型与价格页列出了当前和已排期的新价格。旧价格仅持续到 2026 年 8 月 17 日 00:00(北京时间):
| 每 100 万 tokens | 旧价(切换前) | 8 月 17 日起闲时 | 8 月 17 日起高峰 |
|---|---|---|---|
| 缓存命中输入 | $0.003625 | $0.022 | $0.044 |
| 缓存未命中输入 | $0.435 | $0.66 | $1.32 |
| 输出 | $0.87 | $1.98 | $3.96 |
高峰为北京时间 09:00–12:00、14:00–18:00,其余时间为闲时。思考 tokens 计入输出,不应只按最终可见答案估算成本。
假设一项仓库任务消耗 10 万未缓存输入与 5 万输出,不考虑缓存、重试、工具费和税费:切价后闲时约为 0.1 × $0.66 + 0.05 × $1.98 = $0.165,高峰约为 $0.33。同样的 token 量在 GLM Coding Plan 中约消耗 189 标准积分,但这来自预付订阅池,不能把 $0.165 与 189 直接比较。
真正可比的是:
每个被验收任务成本 = 全部尝试的模型、工具与重试成本 ÷ 最终通过验收的任务数
如果模型单次调用便宜却需要三次返工,或者订阅还有大量闲置额度,价卡上的单位价格不会等于真实交付成本。

官方表里没有一位全项目冠军
Z.ai 的GLM-5.3 发布页公布了一张包含 DeepSeek-V4-Pro-0813 的比较表。下面只摘录会影响代码 Agent 选择的几行,并保留“发布方汇总值”这一属性:
| 评测 | GLM-5.3 | DeepSeek V4 Pro 0813 | 表内结果 |
|---|---|---|---|
| Terminal-Bench 2.1 | 88.2 | 87.9 | 接近,GLM 略高 |
| DeepSWE v1.1 | 66.9 | 62.7 | GLM 较高 |
| NL2Repo | 58.0 | 61.1 | DeepSeek 较高 |
| CyberGym | 84.5 | 83.3 | GLM 略高 |
| Toolathlon Verified | 73.0 | 74.1 | DeepSeek 较高 |
| AutomationBench v1.0.6 | 48.2 | 43.2 | GLM 较高 |
| Agents’ Last Exam CLI | 28.5 | 25.7 | GLM 较高 |
这张表能支持“值得在这些任务类型上复测”,不能支持“GLM 在所有编程任务上更强”。例如,GLM 的 Terminal-Bench 2.1 运行使用特定 Claude Code 版本、65,536 最大新 tokens 和 6 小时超时;NL2Repo 又使用 1M context、64K 输出与额外判断规则。对手数据的所有运行细节并未逐项以同等完整度公开。
DeepSeek 自己的更新日志报告 Terminal Bench 2.1 为 87.9、DeepSWE 为 62.7,并说明代码 Agent 结果来自 DeepSeek Harness minimal、max effort 等设置。这些发布表不能替代独立的同环境复跑。若你的 Agent 会更换文件选择、上下文压缩、工具修复或重试策略,最终结果可能不同。
两套 Agent 合同会直接改变迁移成本
GLM-5.3 始终进行思考。标准合同只接受 low、high、max,默认 max;Coding Plan 为兼容不同客户端,会把 disabled、none、minimal 等值归一到较低 effort,而不是完全关闭思考。需要低延迟的分类、抽取或短格式转换时,这一点会增加验证义务。
DeepSeek V4 Pro 可关闭思考,Chat Completions 中默认开启且 effort 默认 high。它还提供 Responses 与 Anthropic-compatible 路线,但“兼容”不是完整等价。DeepSeek 的Responses 说明列出若干不支持或会被忽略的状态、工具和多模态参数;Anthropic 兼容说明也要求显式使用 Pro ID,否则不支持的模型名可能映射到 Flash。
工具循环还有一个会直接导致故障的差异。DeepSeek 在 thinking + tools 场景要求完整回传上一条 assistant message,包括 reasoning_content、content 和 tool_calls,再追加 role: tool 结果;只保留可见 content 可能收到 HTTP 400。GLM 的实际工具行为则要同时核对 Coding Plan 客户端与所选协议,不应只凭“支持 Function Calling”推导完整 JSON Schema 行为。
用同一批真实任务决定,而不是继续加总跑分
准备 12–20 个近期真实发生、能够客观验收的任务,覆盖小修复、跨文件修改、长任务和工具调用。对两个候选尽量使用同一 Agent 客户端,并固定:

- 同一个仓库 commit、文件权限和初始说明;
- 相同的检索、MCP、shell 与网络权限;
- 对应的最高/中等 effort 策略,而不是一个 max、一个 non-thinking;
- 相同的超时、最大轮数、重试预算和人工介入规则;
- 预先写好的 tests、schema、截图或事实检查;
- 每次运行的输入、缓存、输出、工具、积分/美元、耗时和人工修复。
如果两个 provider 无法在同一协议下完整复现工具功能,把这种差异记为“路线摩擦”,不要偷偷修到看起来一样。模型选择的停止条件也应提前写好:某个候选不支持必需入口、连续两批任务都低于验收线,或单位被验收任务成本稳定更高时,就不必继续扩大测试。
今天最稳妥的结论是:GLM-5.3 更适合已经在受支持编码工具中评估新模型的团队;DeepSeek V4 Pro 更适合现在就要通用 API、App/Web 或可关闭思考模式的团队。 如果两条路线都可用,公开跑分只能确定测试优先级,最终采购应由你自己的被验收任务成本、稳定性和运维摩擦决定。



