AIFreeAPI Logo

GLM-5.3 与 DeepSeek V4 Pro 怎么选:接入、成本与 Agent 能力

A
9 分钟阅读AI 模型对比

今天的关键差异不是一行跑分:GLM-5.3 已进入 Coding Plan,但通用 API 尚未开放;DeepSeek V4 Pro 已可在 App、Web 与 API 使用,并将在 8 月 17 日切换峰谷价。

GLM-5.3 与 DeepSeek V4 Pro 的接入路线和代码 Agent 选型对比

截至 2026 年 8 月 15 日,这两款模型不能只按跑分高低做选择。GLM-5.3 已向 GLM Coding Plan 的 Lite、Pro、Max 用户开放,但通用按量 API 仍标注为即将上线;DeepSeek V4 Pro 已在 App、Web 和 API 正式可用。

因此,短答案取决于你今天要走哪条路线:

  • 已经使用 Claude Code、Codex、Cline 等受支持的编码工具,愿意按 Coding Plan 的订阅与积分规则评估,可立即把 GLM-5.3 加入候选。
  • 要把模型接入自己的产品、按 token 计费,或需要非思考模式,DeepSeek V4 Pro 是当前能直接落地的选择。
  • 只想知道谁“性能更强”,公开资料还不足以给出通用答案。Z.ai 的发布表中两者互有胜负,而且不同任务的 harness、上下文、超时和停止条件会改变结果。

先确认比较的是准确型号和准确入口

GLM-5.3 的正式模型 ID 是 glm-5.3。Z.ai 的模型说明将它定义为文本输入、文本输出的旗舰模型,公布的上下文为 1M tokens,最大输出为 128K。它与 GLM-5.2 使用同一个基础模型,5.3 的提升来自后训练;这并不授权把 5.2 的 API 价格或实测结果自动搬到 5.3。

DeepSeek 的稳定调用 ID 是 deepseek-v4-pro,当前服务版本为 DeepSeek-V4-Pro-0813。稳定 ID 应放进请求;0813 用于记录本次评估所面对的服务版本。DeepSeek 的正式版公告确认 V4 Pro 已于 8 月 13 日进入 GA,而不是仍处于 Preview。

当前合同GLM-5.3DeepSeek V4 Pro
调用标识glm-5.3deepseek-v4-pro
当前状态Coding Plan 全档可用;通用 API 即将上线App、Web、API 已 GA
输入/输出模态文本 / 文本文本 / 文本
上下文上限1M1M
最大输出128K384K
思考模式始终思考,low/high/max可开关,low/high/max
当前成本口径订阅 + 积分API 按 tokens 计费
公开权重官方表示安全评估后约两周发布;核验日尚不可得本文只核验官方托管合同,不据此推导自部署状态

1M context 只是容量上限,不代表应该把整个仓库一次塞满,也不证明接近上限时仍能保持相同准确率。实际 Agent 更适合先检索相关文件,再按任务扩大上下文;否则预填充时间、缓存占用和无关信息都会增加。

GLM-5.3 今天能在哪里使用?

GLM-5.3 当前的可用路线是 GLM Coding Plan。官方切换模型指南给出的国际端点按客户端协议区分:Claude Code / Goose 使用 Anthropic-compatible 路线,Codex 使用 OpenAI Responses 路线,其他支持自定义模型的工具使用 Coding Plan 的 OpenAI-compatible 路线。

Claude Code 若要明确启用 1M 路由,模型名使用 glm-5.3[1m],并设置对应的自动压缩窗口。这个后缀是 Coding Plan 的 Claude Code 路由约定,不是未来通用 Model API 的正式 ID。

更重要的是,GLM-5.3 模型页仍写着通用 API 即将上线;当前按量 API 价卡也没有 GLM-5.3。看到 GLM-5.2 的输入 $1.40/M、缓存输入 $0.26/M、输出 $4.40/M,不能把它们当作 5.3 的价格。

Coding Plan 是另一种商品。核验时,月费页面显示 Lite $18、Pro $72、Max $160;额度同时受滚动 5 小时积分和每周积分约束。GLM-5.3 的积分公式按输入、缓存输入和输出分别乘以 6.9、1.7、24,再除以 10,000;工作日北京时间 14:00–18:00 按标准积分扣减,其余时段与周末为 50%。这些数字能估算订阅消耗,不能直接写成 GLM-5.3 的美元 token 单价。

DeepSeek V4 Pro 的价格明天之后就不同

DeepSeek 的模型与价格页列出了当前和已排期的新价格。旧价格仅持续到 2026 年 8 月 17 日 00:00(北京时间)

每 100 万 tokens旧价(切换前)8 月 17 日起闲时8 月 17 日起高峰
缓存命中输入$0.003625$0.022$0.044
缓存未命中输入$0.435$0.66$1.32
输出$0.87$1.98$3.96

高峰为北京时间 09:00–12:00、14:00–18:00,其余时间为闲时。思考 tokens 计入输出,不应只按最终可见答案估算成本。

假设一项仓库任务消耗 10 万未缓存输入与 5 万输出,不考虑缓存、重试、工具费和税费:切价后闲时约为 0.1 × $0.66 + 0.05 × $1.98 = $0.165,高峰约为 $0.33。同样的 token 量在 GLM Coding Plan 中约消耗 189 标准积分,但这来自预付订阅池,不能把 $0.165189 直接比较。

真正可比的是:

每个被验收任务成本 = 全部尝试的模型、工具与重试成本 ÷ 最终通过验收的任务数

如果模型单次调用便宜却需要三次返工,或者订阅还有大量闲置额度,价卡上的单位价格不会等于真实交付成本。

订阅积分与 API tokens 需要在验收任务层面比较
订阅积分与 API tokens 需要在验收任务层面比较

官方表里没有一位全项目冠军

Z.ai 的GLM-5.3 发布页公布了一张包含 DeepSeek-V4-Pro-0813 的比较表。下面只摘录会影响代码 Agent 选择的几行,并保留“发布方汇总值”这一属性:

评测GLM-5.3DeepSeek V4 Pro 0813表内结果
Terminal-Bench 2.188.287.9接近,GLM 略高
DeepSWE v1.166.962.7GLM 较高
NL2Repo58.061.1DeepSeek 较高
CyberGym84.583.3GLM 略高
Toolathlon Verified73.074.1DeepSeek 较高
AutomationBench v1.0.648.243.2GLM 较高
Agents’ Last Exam CLI28.525.7GLM 较高

这张表能支持“值得在这些任务类型上复测”,不能支持“GLM 在所有编程任务上更强”。例如,GLM 的 Terminal-Bench 2.1 运行使用特定 Claude Code 版本、65,536 最大新 tokens 和 6 小时超时;NL2Repo 又使用 1M context、64K 输出与额外判断规则。对手数据的所有运行细节并未逐项以同等完整度公开。

DeepSeek 自己的更新日志报告 Terminal Bench 2.1 为 87.9、DeepSWE 为 62.7,并说明代码 Agent 结果来自 DeepSeek Harness minimal、max effort 等设置。这些发布表不能替代独立的同环境复跑。若你的 Agent 会更换文件选择、上下文压缩、工具修复或重试策略,最终结果可能不同。

两套 Agent 合同会直接改变迁移成本

GLM-5.3 始终进行思考。标准合同只接受 lowhighmax,默认 max;Coding Plan 为兼容不同客户端,会把 disablednoneminimal 等值归一到较低 effort,而不是完全关闭思考。需要低延迟的分类、抽取或短格式转换时,这一点会增加验证义务。

DeepSeek V4 Pro 可关闭思考,Chat Completions 中默认开启且 effort 默认 high。它还提供 Responses 与 Anthropic-compatible 路线,但“兼容”不是完整等价。DeepSeek 的Responses 说明列出若干不支持或会被忽略的状态、工具和多模态参数;Anthropic 兼容说明也要求显式使用 Pro ID,否则不支持的模型名可能映射到 Flash。

工具循环还有一个会直接导致故障的差异。DeepSeek 在 thinking + tools 场景要求完整回传上一条 assistant message,包括 reasoning_contentcontenttool_calls,再追加 role: tool 结果;只保留可见 content 可能收到 HTTP 400。GLM 的实际工具行为则要同时核对 Coding Plan 客户端与所选协议,不应只凭“支持 Function Calling”推导完整 JSON Schema 行为。

用同一批真实任务决定,而不是继续加总跑分

准备 12–20 个近期真实发生、能够客观验收的任务,覆盖小修复、跨文件修改、长任务和工具调用。对两个候选尽量使用同一 Agent 客户端,并固定:

同一仓库和相同条件下的双候选测试与重试计成本流程
同一仓库和相同条件下的双候选测试与重试计成本流程
  1. 同一个仓库 commit、文件权限和初始说明;
  2. 相同的检索、MCP、shell 与网络权限;
  3. 对应的最高/中等 effort 策略,而不是一个 max、一个 non-thinking;
  4. 相同的超时、最大轮数、重试预算和人工介入规则;
  5. 预先写好的 tests、schema、截图或事实检查;
  6. 每次运行的输入、缓存、输出、工具、积分/美元、耗时和人工修复。

如果两个 provider 无法在同一协议下完整复现工具功能,把这种差异记为“路线摩擦”,不要偷偷修到看起来一样。模型选择的停止条件也应提前写好:某个候选不支持必需入口、连续两批任务都低于验收线,或单位被验收任务成本稳定更高时,就不必继续扩大测试。

今天最稳妥的结论是:GLM-5.3 更适合已经在受支持编码工具中评估新模型的团队;DeepSeek V4 Pro 更适合现在就要通用 API、App/Web 或可关闭思考模式的团队。 如果两条路线都可用,公开跑分只能确定测试优先级,最终采购应由你自己的被验收任务成本、稳定性和运维摩擦决定。