Ox Alpha 确实是 GLM-5.3-Flash。 智谱在 2026 年 8 月 26 日的官方发布说明中确认,正式发布前曾用匿名模型 Ox-Alpha 在 OpenCode 和 OpenRouter 接受真实流量测试。现在应使用的正式模型 ID 是 glm-5.3-flash,而不是继续把匿名入口当成长期合同。
这次变化同时带来三个可以直接行动的结论:
- 托管 API 已有明确模型 ID、请求参数和按 token 价格;
- GLM Coding Plan 的“3 倍额度”是订阅积分规则,不能换算成 API 单价;
- 开源权重已经可下载,但“18B 激活参数”不代表只要 18 GB 内存。官方 FP8 仓库本身约 305.8 GiB,运行时和上下文缓存还要额外空间。
下面的“实测”边界也先说清:我们读取了官方仓库的 62 个 safetensors 文件大小,并在一台 Apple M4、16 GB 统一内存、根卷可用约 135 GiB 的机器上执行了部署前置检查。结果在下载前就已经失败——磁盘装不下原生仓库,内存更无法加载完整权重。因此这里给出的是可复现的 API 合同、成本计算和本地部署停线判断,不会虚构一次并未发生的 tokens/s 或质量测试。
从 Ox Alpha 迁移,先把“身份”与“接口”拆开
匿名测试证明的是模型曾在真实工作流中被使用,不证明 OpenCode、OpenRouter、Z.AI Model API 与本地服务共享同一 endpoint、价格、缓存或返回事件。最稳妥的迁移动作不是替换一串名称后直接上线,而是把正式模型当作一次新的 provider contract:
- 保存一批 Ox Alpha 的真实输入、工具权限、超时、最终结果和验收状态,作为回归基线;
- 在你选择的正式利用面创建新配置,模型写成
glm-5.3-flash; - 明确启用 thinking,并重新处理推理内容、最终正文和流式工具参数;
- 用相同任务验证结构化输出、工具循环、多模态输入、重试与计费;
- 只有新路径通过验收后,才逐步切换生产流量。
Z.AI 的模型文档列出视频、图像、文本和文件输入,输出为文本;上下文上限为 1M tokens,最大输出为 128K。托管 API 中 thinking.type 只支持 enabled,推荐 reasoning_effort: "max"。这意味着旧配置如果假设可以关闭 thinking,就不能原样搬过来。
下面是 Z.AI 通用 Model API 的最小 Chat Completions 请求。其官方 API 说明给出的 base URL 是 https://api.z.ai/api/paas/v4;Coding Plan 使用专用 endpoint,不能把两条路线混成一个示例。
bashexport ZAI_API_KEY="替换为你自己的密钥" curl -sS "https://api.z.ai/api/paas/v4/chat/completions" \ -H "Authorization: Bearer ${ZAI_API_KEY}" \ -H "Content-Type: application/json" \ -d '{ "model": "glm-5.3-flash", "messages": [ { "role": "user", "content": "检查这段迁移计划,返回风险、验收条件和第一步。" } ], "thinking": { "type": "enabled", "clear_thinking": false }, "reasoning_effort": "high", "temperature": 1, "max_tokens": 4096 }'
这段请求是依据当前官方合同整理的可复制起点,不是一次成功响应证明:本次环境没有可用的 Z.AI API key。真正接入时至少记录 HTTP 状态、首 token、总耗时、input/cached/output tokens、工具循环是否完成,以及结果是否通过业务验收。只得到 HTTP 200 仍不能说明迁移成功。
流式工具调用还需要同时开启 stream: true 与 tool_stream: true,按顺序拼接 delta.tool_calls[*].function.arguments,并分别处理 reasoning 与最终内容。不要把尚未完整的 JSON 参数直接交给工具,也不要因为客户端只显示最终文字就丢弃诊断所需的流式事件。

API 价格:先区分常规价和 9 月 9 日前的折扣价
截至 2026 年 8 月 30 日,Z.AI 官方价格页按每百万 tokens 列出三项费用:
| 项目 | 常规价 | 当前五折价 |
|---|---|---|
| 输入 tokens | $0.15 | $0.075 |
| 缓存输入 tokens | $0.03 | $0.015 |
| 输出 tokens | $0.50 | $0.25 |
五折活动在 2026 年 9 月 9 日 24:00(UTC+8) 结束。折扣结束后,常规价才是长期预算基线;缓存存储当前另标为限时免费,也不应当作永久合同。
一次请求的模型费用可以写成:
费用 = 未缓存输入 ÷ 1,000,000 × 输入价 + 缓存输入 ÷ 1,000,000 × 缓存价 + 输出 ÷ 1,000,000 × 输出价
例如,一次任务消耗 1,000,000 个未缓存输入 tokens 和 100,000 个输出 tokens:
- 活动期:
1 × $0.075 + 0.1 × $0.25 = $0.10; - 常规价:
1 × $0.15 + 0.1 × $0.50 = $0.20。
如果同样的 1,000,000 输入中有 90% 命中缓存,且仍输出 100,000 tokens:
- 活动期:
0.1 × $0.075 + 0.9 × $0.015 + 0.1 × $0.25 = $0.046; - 常规价:
0.1 × $0.15 + 0.9 × $0.03 + 0.1 × $0.50 = $0.092。
这两个算例只比较模型 token 费用,不含工具调用、联网搜索、失败重试、税费、汇率或人工修复。真正有意义的分母不是“每次请求”,而是“每个通过验收的任务”:
通过任务成本 =(模型 + 工具 + 重试 + 人工 + 运维)÷ 通过任务数
GLM Coding Plan 则使用订阅与积分配额。官方说 Flash 的可用额度相对 GLM-5.3 增至 3 倍,非高峰调用只消耗 50% 标准积分;这些规则适合比较编码工具里的可用量,却不能直接填进上面的 Model API 公式。
本地部署前置实测:305.8 GiB 才是第一个现实门槛
GLM-5.3-Flash 是 320B 总参数、18B 激活参数的 MoE 模型。18B 描述的是每个 token 参与计算的激活参数规模,不是完整权重只占 18B 级内存。官方 Hugging Face 模型仓库采用 MIT 许可;本轮通过公开模型 API 读取文件元数据,62 个 .safetensors 合计 328,337,455,672 bytes,约 305.79 GiB。
这个结果与 vLLM 官方 recipe写明的“native FP8 weights 约 306 GiB,且尚未包含 runtime 和 KV-cache overhead”一致。BF16 版本的权重内存约为两倍。长上下文还会占用 KV cache;混合注意力架构另外维护 KDA state pool,并发可能先被这部分内存限制。
你可以在下载前自己复现权重体积:
bashcurl -fsSL \ 'https://huggingface.co/api/models/zai-org/GLM-5.3-Flash?blobs=true' | jq '[.siblings[] | select(.rfilename | endswith(".safetensors")) | .size] | {files: length, bytes: add, GiB: (add / 1073741824)}'
然后检查本机资源。macOS 可运行:
bashsysctl -n hw.memsize df -h /
Linux 服务器可运行:
bashfree -h df -h / nvidia-smi --query-gpu=name,memory.total --format=csv
本次 M4 机器只有 16 GB 统一内存与约 135 GiB 可用磁盘,因此没有必要开始 305.79 GiB 下载:存储先失败,内存差距更大。这就是一次有效的部署实测结论——在零下载成本处停止,而不是等数百 GiB 传完后才发现不能加载。

硬件通过后,也不要用一条通用命令假装生产可用
官方模型卡列出 SGLang、vLLM、TokenSpeed、Transformers、KTransformers 和 Unsloth。它们不是同一个成熟度和硬件合同。当前 vLLM recipe 以多卡 GPU 拓扑为起点,示例包括 TP4 的 GB200;SGLang cookbook 还区分 Blackwell、H100/H200 与 AMD ROCm 的 cache dtype、attention backend 和已验证范围。
因此,采购或启动前至少写下这些验收条件:
- 权重能放入本地存储,并预留下载临时文件、容器镜像和日志空间;
- GPU/加速器总内存不仅覆盖权重,还覆盖 runtime、KV cache、KDA state、视觉编码峰值与并发;
- 所选 framework 的当前版本明确支持该 GPU、FP8/BF16 类型和 GLM-5.3-Flash 架构;
- 用固定的 input/output 长度测试启动、首 token、吞吐、并发、工具调用与多模态;
- 在相同任务与验收条件下比较托管 API 总成本,而不是只比较电费或 token 标价。
本地模板与托管 API 也有一个容易踩错的差异:官方托管 API 写明 thinking 不能关闭;本地 SGLang recipe 则允许通过 chat template 参数改变 thinking 行为。它们是两种利用面的合同,不能用本地能力反推托管 API 会接受相同参数。
如果你的目标只是尽快验证业务任务,先用正式 Model API 建立回归与成本数据通常更省时间。只有当数据边界、稳定吞吐、长期利用率或定制推理确实能抵消多卡硬件与运维成本时,本地部署才进入下一轮采购评估。若还需要比较 GLM 与其他新模型,可再看同语种的 GLM-5.3 与 DeepSeek V4 Pro 选型指南;它解决的是模型选择,而这里解决的是从匿名入口到可验收正式路线。
最终迁移完成的标志,不是配置里出现了新模型名,而是四件事同时成立:正式 ID 与 endpoint 正确、真实任务通过回归、账单能用 token 明细复算、本地或托管路线都没有隐藏未验证的硬件与协议假设。



