Ox Alpha의 정체는 GLM-5.3-Flash입니다. Zhipu AI는 2026년 8월 26일 공식 발표에서 출시 전에 Ox-Alpha라는 익명 이름으로 OpenCode와 OpenRouter의 실제 트래픽을 테스트했다고 확인했습니다. 정식 Model Code는 glm-5.3-flash입니다.
이 사실은 기존 Ox Alpha 작업을 버리지 않아도 된다는 뜻입니다. 그러나 preview endpoint, 무료 기간, 캐시, rate limit, stream event까지 그대로 유지된다는 뜻은 아닙니다. 정식 경로는 새 provider contract로 검수해야 합니다.
먼저 세 경로를 분리하면 판단이 빨라집니다.
- Model API가 필요하면 input, cached input, output 사용량과 정식 endpoint를 확인합니다.
- GLM Coding Plan을 쓰면 token 단가가 아니라 포인트와 지원 도구, 비혼잡 시간 차감을 확인합니다.
- 오픈 가중치를 운영하려면 18B 활성 파라미터가 아니라 전체 checkpoint, runtime, KV/KDA cache와 동시 처리량을 계산합니다.
API 부분은 현재 공식 요청 계약과 비용식까지 검증했습니다. 사용 가능한 Z.AI key가 없어 성공 응답이나 latency를 실측했다고 주장하지 않습니다. 로컬 부분은 공식 repository의 실제 파일 크기와 M4 16 GB 환경을 대조했습니다. native FP8는 다운로드 전에 불가능 판정이 났습니다.
Ox Alpha 결과를 회귀 테스트로 바꾸는 방법
기존 세션 중 실제로 통과한 10~20개를 고릅니다. prompt만 저장하지 말고 tool 권한, timeout, 최대 turn, 생성 파일, 최종 합격 조건을 함께 남깁니다. 이 데이터가 정식 Flash 경로의 기준선입니다.
공식 모델 문서는 text, image, video, file 입력과 text 출력, 1M context, 최대 128K output을 명시합니다. hosted API에서 thinking.type은 enabled만 지원합니다. reasoning_effort는 low, high, max이며 기본값은 max입니다.
마이그레이션에서는 다음 실패를 일부러 찾아야 합니다.
model을glm-5.3-flash로 바꿨지만 계정에 권한이 없는 경우- reasoning content와 최종 content를 한 필드로 처리하는 경우
- stream 중 완성되지 않은 tool arguments JSON을 실행하는 경우
- 이미지·파일·구조화 출력 fixture가 기존과 다르게 처리되는 경우
- HTTP 200은 받았지만 실제 검수나 비용 기준을 통과하지 못한 경우
일반 Z.AI Model API의 base URL은 공식 API reference에 나온 https://api.z.ai/api/paas/v4입니다. Coding Plan은 전용 endpoint를 사용하므로 두 경로의 key와 base URL을 섞으면 안 됩니다.
json{ "model": "glm-5.3-flash", "messages": [ { "role": "user", "content": "마이그레이션 계획의 위험과 검수 조건을 반환해 주세요." } ], "thinking": {"type": "enabled", "clear_thinking": false}, "reasoning_effort": "high", "temperature": 1, "max_tokens": 4096 }
실제 호출에서는 HTTP status, 첫 token/전체 latency, input·cached input·output usage, 재시도, tool loop 완료, 최종 합격 여부를 함께 기록합니다.

캐시가 높은 Agent도 출력 비용을 빼면 안 된다
2026년 8월 30일 기준 Z.AI 공식 가격은 백만 tokens당 다음과 같습니다.
| 사용량 | 정상 가격 | 50% 할인 가격 |
|---|---|---|
| 미캐시 input | $0.15 | $0.075 |
| cached input | $0.03 | $0.015 |
| output | $0.50 | $0.25 |
할인은 2026년 9월 9일 24:00(UTC+8) 에 끝납니다. 장기 예산은 정상 가격으로 계산해야 합니다. 캐시 저장도 별도로 limited-time free이므로 영구 무료로 가정하지 않습니다.
한 번 통과한 Agent 작업이 input 300만 tokens, cache hit 95%, output 30만 tokens를 사용했다고 가정하겠습니다. 할인 기간 모델 비용은 다음과 같습니다.
0.15 × $0.075 + 2.85 × $0.015 + 0.3 × $0.25 = $0.129
정상 가격에서는 $0.258입니다. cache hit이 높아도 output 비중이 커지면 비용은 빠르게 증가합니다. 여기에 유료 tool, web search, 재시도, 세금, 환율, 사람의 수정 비용은 포함되지 않았습니다.
따라서 비교 단위는 요청당 가격이 아니라 다음이 되어야 합니다.
통과 작업당 비용 = (모델 + 도구 + 재시도 + 사람 + 운영) ÷ 통과 작업 수
Coding Plan의 “GLM-5.3 대비 3배 사용 가능 quota”는 subscription 포인트 계약입니다. 위 API 식에 3을 나누는 근거가 아닙니다.
18B active를 18 GB 요구량으로 읽으면 실패한다
GLM-5.3-Flash는 총 320B, token당 18B 활성 파라미터를 사용하는 MoE입니다. 활성 파라미터는 계산량을 줄이지만 전체 expert 가중치는 저장해야 합니다.
MIT license로 공개된 공식 Hugging Face repository의 metadata를 읽으면 62개 .safetensors가 328,337,455,672 bytes, 305.79 GiB입니다. 공식 vLLM recipe도 native FP8 가중치를 runtime과 KV cache 전 기준 약 306 GiB로 설명합니다. BF16은 가중치 메모리만 약 두 배입니다.
다운로드 전에 직접 확인할 수 있습니다.
bashcurl -fsSL \ 'https://huggingface.co/api/models/zai-org/GLM-5.3-Flash?blobs=true' | jq '[.siblings[] | select(.rfilename | endswith(".safetensors")) | .size] | {files: length, bytes: add, GiB: (add / 1073741824)}'
테스트한 Apple M4 노트북은 unified memory 16 GB, root volume 여유 공간 약 135 GiB였습니다. 저장 공간부터 305.79 GiB repository를 수용하지 못하며, 메모리도 전체 가중치를 load할 수 없습니다. 그러므로 이 환경에 tokens/s 수치는 없습니다. 수백 GiB를 전송하기 전에 중단한 것이 재현 가능한 실측 결과입니다.
이 결과를 “모든 Mac과 모든 community quantization이 불가능하다”로 확대하면 안 됩니다. 제3자 양자화는 다운로드하거나 품질을 검증하지 않았습니다.

다중 GPU가 있어도 남는 네 가지 검수
공식 model card는 SGLang, vLLM, TokenSpeed, Transformers, KTransformers, Unsloth를 제시합니다. 지원 GPU와 성숙도는 서로 다릅니다. vLLM의 대표 FP8 예시는 GB200에서 TP4를 사용합니다. SGLang 공식 cookbook은 KV pool 외에 KDA state pool을 별도로 다루며 Blackwell, H100/H200, AMD 조합의 verified 범위를 구분합니다.
운영 전에 다음을 확인합니다.
- checkpoint, 임시 파일, container image, log까지 저장 공간에 여유가 있는가
- 가속기 메모리가 weights, runtime, KV/KDA cache, multimodal peak, 목표 concurrency를 감당하는가
- 선택한 build가 GPU, precision, sparse attention, reasoning/tool parser를 실제 지원하는가
- 고정 길이에서 startup, first token, throughput, 동시 요청, tools, 이미지·비디오를 재현할 수 있는가
hosted API에서는 thinking을 끌 수 없지만 일부 local recipe는 chat template 동작을 바꿀 수 있습니다. local 기능을 hosted parameter 계약으로 역추론하면 안 됩니다.
품질과 비용을 빨리 확인하려면 정식 API로 회귀 데이터부터 만드는 편이 낫습니다. 데이터 통제나 지속적인 높은 사용률이 여러 GPU, 전력, 운영, idle cost를 정당화할 때 로컬 배포를 다시 계산하세요. 다른 provider와의 선택이 필요하면 한국어 GLM-5.3과 DeepSeek V4 Pro 비교는 별도의 판단을 제공합니다.
마이그레이션 완료는 새 이름을 넣은 순간이 아닙니다. 같은 작업이 통과하고, usage로 청구액을 복원할 수 있으며, 선택한 route의 endpoint와 memory 가정이 모두 검증된 순간입니다.



