Ox Alpha era GLM-5.3-Flash. Zhipu AI confirmó en el anuncio oficial del 26 de agosto de 2026 que probó el modelo de forma anónima como Ox-Alpha con tráfico real de OpenCode y OpenRouter antes del lanzamiento. El código formal del modelo es glm-5.3-flash.
La identidad conserva el valor de tus pruebas anteriores, pero no garantiza que el endpoint de preview, el precio, el caché, los límites o los eventos de streaming hayan sido renombrados sin cambios. La migración segura trata la versión oficial como un contrato nuevo.
La decisión práctica es esta:
- usa la Model API para validar pronto calidad y coste con una ruta alojada;
- usa GLM Coding Plan si tu flujo vive en herramientas compatibles y la unidad relevante es su sistema de puntos;
- estudia los pesos abiertos cuando control de datos o utilización sostenida justifiquen varios aceleradores y operación propia.
La licencia MIT permite usar los pesos, pero no reduce por sí sola la memoria, la electricidad ni el trabajo de operación.
Una migración aceptada conserva resultados, no supuestos
Selecciona entre 10 y 20 sesiones de Ox Alpha que hayan superado una condición observable: tests, schema, artefacto entregable o revisión de negocio. Conserva entrada, herramientas, permisos, timeout, número de pasos y resultado. Esa colección es el baseline.
La documentación oficial del modelo especifica entrada de texto, imagen, vídeo y archivo; salida de texto; contexto de 1M y máximo de 128K tokens de salida. En la API alojada thinking.type solo admite enabled. reasoning_effort puede ser low, high o max, con max por defecto.
Al construir la ruta formal, comprueba:
- El modelo es
glm-5.3-flashy la cuenta tiene acceso real. - El cliente separa reasoning de la respuesta final.
- Los argumentos JSON de una tool call se ensamblan por completo antes de ejecutarse.
- Los fixtures de imagen, vídeo, archivo y salida estructurada siguen pasando.
- Los contadores de input, cached input y output reconstruyen la factura.
La referencia de Z.AI sitúa la Model API general en https://api.z.ai/api/paas/v4. Coding Plan usa un endpoint dedicado; no es correcto mezclar la clave de suscripción con un ejemplo de pago por uso.
bashexport ZAI_API_KEY="TU_CLAVE" curl -sS 'https://api.z.ai/api/paas/v4/chat/completions' \ -H "Authorization: Bearer ${ZAI_API_KEY}" \ -H 'Content-Type: application/json' \ -d '{ "model": "glm-5.3-flash", "messages": [{ "role": "user", "content": "Revisa este plan de migración y devuelve riesgos y criterios de aceptación." }], "thinking": {"type": "enabled", "clear_thinking": false}, "reasoning_effort": "high", "temperature": 1, "max_tokens": 4096 }'
La solicitud respeta el contrato publicado, pero no se presenta como una aceptación ejecutada: no había una clave Z.AI utilizable en el entorno de prueba. En tu ejecución registra estado HTTP, latencia al primer token y total, usage, reintentos, cierre del bucle de herramientas y aceptación final. Un 200 no basta.

La disponibilidad de cuenta, pago o ruta desde un país concreto debe comprobarse en la plataforma oficial. Las páginas de terceros no demuestran cobertura regional.
Precio: la promoción divide la factura por dos, no para siempre
A 30 de agosto de 2026, la tarifa oficial por millón de tokens es:
| Medidor | Precio normal | Promoción 50% |
|---|---|---|
| Input sin caché | $0,15 | $0,075 |
| Input en caché | $0,03 | $0,015 |
| Output | $0,50 | $0,25 |
La promoción termina el 9 de septiembre de 2026 a las 24:00 (UTC+8). El presupuesto estable debe usar la tarifa normal. El almacenamiento del caché también figura como gratuito por tiempo limitado, no como coste cero permanente.
Ejemplo: una tarea aceptada consume 750.000 tokens de entrada, con 50% de caché, y 80.000 de salida. Durante la promoción cuesta:
0,375 × $0,075 + 0,375 × $0,015 + 0,08 × $0,25 = $0,05375
Con la tarifa normal cuesta $0,1075. Faltan herramientas, búsqueda web, reintentos, impuestos, cambio de divisa y correcciones humanas. La comparación útil es coste total dividido por tareas aceptadas.
La afirmación de “tres veces más cuota” pertenece a los puntos de GLM Coding Plan. No autoriza a dividir entre tres el precio de Model API.
Prueba local: el repositorio no cabe en un equipo de 16 GB
GLM-5.3-Flash es un MoE de 320B parámetros totales y 18B activos por token. Los 18B reducen cómputo por token, pero el servidor debe almacenar el checkpoint completo.
El repositorio oficial de Hugging Face, con licencia MIT, expone 62 archivos .safetensors. La consulta de metadatos sumó 328.337.455.672 bytes, o 305,79 GiB. La receta oficial de vLLM redondea los pesos FP8 nativos a 306 GiB antes del runtime y del KV cache; BF16 necesita aproximadamente el doble solo para pesos.
Puedes medirlo sin descargar el modelo:
bashcurl -fsSL \ 'https://huggingface.co/api/models/zai-org/GLM-5.3-Flash?blobs=true' | jq '[.siblings[] | select(.rfilename | endswith(".safetensors")) | .size] | {files: length, bytes: add, GiB: (add / 1073741824)}'
El equipo de prueba fue un Apple M4 con 16 GB de memoria unificada y unos 135 GiB libres. El repositorio FP8 ya supera el disco disponible y los pesos no caben en memoria. Por eso no existe una cifra honesta de tokens por segundo en ese equipo. Parar antes de transferir cientos de GiB es el resultado correcto del preflight.
Esto no demuestra que toda cuantización comunitaria falle en todo Mac. No se descargó ni validó ninguna cuantización de terceros, por lo que no se le puede atribuir automáticamente la calidad o soporte del checkpoint oficial.

Qué falta incluso después de superar los 306 GiB
La model card enumera SGLang, vLLM, TokenSpeed, Transformers, KTransformers y Unsloth, pero no comparten la misma cobertura de hardware. La receta vLLM empieza con topologías multi-GPU, como TP4 sobre GB200. El cookbook de SGLang separa KV pool y KDA state pool, y distingue combinaciones verificadas y no verificadas para distintas familias de aceleradores.
Antes de considerar operativo un servidor, exige:
- espacio para pesos, temporales, imágenes de contenedor y logs;
- memoria para pesos, runtime, KV/KDA cache, picos multimodales y concurrencia;
- soporte explícito del build para GPU, precisión, sparse attention y parsers;
- una prueba fija de arranque, primer token, throughput, herramientas e inputs multimodales;
- coste por tarea aceptada incluyendo hardware, energía, ingeniería y capacidad ociosa.
La API alojada no permite desactivar thinking, mientras algunas recetas locales exponen controles del chat template. Una capacidad local no cambia el contrato de parámetros de la nube.
Empieza por la API si necesitas datos rápidos de calidad y coste. Reabre la opción local cuando control de datos o carga sostenida puedan compensar la infraestructura. Si además comparas proveedores, la guía española de GLM-5.3 frente a DeepSeek V4 Pro resuelve esa decisión distinta.
La migración termina cuando las mismas tareas vuelven a pasar, la factura se puede reconstruir y no quedan supuestos ocultos sobre endpoint o memoria; no cuando el nuevo nombre aparece en un archivo de configuración.



