Zhipu AI официально подтвердила: модель, которую до релиза анонимно тестировали как Ox-Alpha в OpenCode и OpenRouter, — это GLM-5.3-Flash. Подтверждение опубликовано в сообщении о релизе от 26 августа 2026 года. Для постоянной интеграции используется идентификатор glm-5.3-flash.
Но из совпадения модели не следует совпадение сервиса. Старый endpoint, бесплатный период, лимит, кэш и формат событий могли принадлежать конкретному провайдеру. Поэтому миграция должна проверять новый контракт, а не только строку model.
Для разработчика из России есть ещё один предварительный вопрос: доступен ли официальный аккаунт, пополнение и нужный endpoint именно сейчас. Документация Z.AI описывает глобальную платформу, но не обещает отдельный российский способ оплаты или гарантированный региональный маршрут. Сначала проверьте это в собственном аккаунте; сторонние витрины из выдачи не являются доказательством официальной доступности.
Четыре проверки вместо простого переименования
Сохраните несколько успешно завершённых сессий Ox Alpha: вход, разрешённые инструменты, таймаут, число шагов, артефакты и критерий приёмки. Они станут контрольной выборкой для нового пути.
Затем проверьте четыре уровня:
- Доступ. Ключ и баланс относятся к нужной платформе, а модель действительно разрешена аккаунту.
- Запрос. Указан
glm-5.3-flash; thinking включён; уровень усилия выбран явно. - Поток и инструменты. Клиент отдельно обрабатывает reasoning и финальный текст, а JSON аргументов tool call собирается полностью до запуска функции.
- Результат. Те же задачи проходят машинные тесты или бизнес-приёмку, а usage позволяет восстановить счёт.
В официальном описании модели указаны текст, изображения, видео и файлы на входе, текст на выходе, контекст до 1M и максимум 128K выходных токенов. В hosted API thinking отключить нельзя; рекомендуются temperature: 1, top_p: 0.95 и reasoning_effort: max.
Минимальный запрос к обычному Model API выглядит так:
bashexport ZAI_API_KEY="ваш_ключ" curl -sS 'https://api.z.ai/api/paas/v4/chat/completions' \ -H "Authorization: Bearer ${ZAI_API_KEY}" \ -H 'Content-Type: application/json' \ -d '{ "model": "glm-5.3-flash", "messages": [{ "role": "user", "content": "Проверь план миграции и верни риски и критерии приёмки." }], "thinking": {"type": "enabled", "clear_thinking": false}, "reasoning_effort": "high", "temperature": 1, "max_tokens": 4096 }'
Base URL подтверждён справочником Z.AI API. У GLM Coding Plan отдельный endpoint, поэтому подписку нельзя подключать к этому примеру простой заменой ключа. В среде проверки рабочего ключа Z.AI не было: команда соответствует текущей схеме, но не выдаётся за успешно принятый ответ. При своём запуске фиксируйте код HTTP, задержку, usage, повторы, завершение tool loop и итог приёмки.

Сколько стоит принятая задача
На 30 августа официальный прайс разделяет входные, кэшированные входные и выходные токены:
| Счётчик, за 1 млн | Обычная цена | Скидка 50% |
|---|---|---|
| Вход | $0,15 | $0,075 |
| Кэшированный вход | $0,03 | $0,015 |
| Выход | $0,50 | $0,25 |
Акция заканчивается 9 сентября 2026 года в 24:00 (UTC+8). Для долгосрочного бюджета используйте обычные ставки. Хранение кэша отдельно помечено как временно бесплатное.
Пример: принятая задача использовала 500 000 входных токенов, из них 60% попали в кэш, и 50 000 выходных. Во время акции модельная часть стоит:
0,2 × $0,075 + 0,3 × $0,015 + 0,05 × $0,25 = $0,032
После акции та же форма нагрузки стоит $0,064. Это не включает платные инструменты, поиск, повторы, налоги, конвертацию валют и ручные исправления. Сравнивайте полные расходы на одну принятую задачу, а не только цену миллиона входных токенов.
«В три раза больше доступной квоты» относится к баллам GLM Coding Plan. Это не коэффициент для цены Model API.
Почему 18B active не означает 18 GB памяти
GLM-5.3-Flash — MoE-модель с 320B общих и 18B активных параметров. На каждом токене вычисляется часть экспертов, но хранить нужно полный checkpoint.
Официальный репозиторий Hugging Face опубликован по MIT. Запрос открытых метаданных показал 62 файла safetensors общим размером 328 337 455 672 байта, или 305,79 GiB. Официальный recipe vLLM указывает те же примерно 306 GiB для FP8 до памяти runtime и KV cache; BF16 требует примерно вдвое больше только для весов.
Размер можно получить без скачивания модели:
bashcurl -fsSL \ 'https://huggingface.co/api/models/zai-org/GLM-5.3-Flash?blobs=true' | jq '[.siblings[] | select(.rfilename | endswith(".safetensors")) | .size] | {files: length, bytes: add, GiB: (add / 1073741824)}'
Предварительная проверка на Apple M4 с 16 GB объединённой памяти и 135 GiB свободного места остановилась ещё до загрузки: нативный репозиторий не помещается на диск, а веса — в память. Поэтому на этой машине нет честного результата по скорости генерации. Такой ранний отказ полезнее, чем сотни гигабайт бесполезного трафика.

Он не доказывает, что любая сторонняя квантизация невозможна. Квантизированные community-сборки не проверялись, а значит им нельзя автоматически приписывать качество и поддержку официального checkpoint.
Что проверять на сервере с достаточной памятью
В официальной карточке перечислены SGLang, vLLM, TokenSpeed, Transformers, KTransformers и Unsloth. Их поддержка железа различается. vLLM приводит многокарточные конфигурации, включая TP4 на GB200. Cookbook SGLang отдельно настраивает KV pool и KDA state pool и помечает часть аппаратных комбинаций как непроверенные.
До запуска подтвердите:
- запас диска для весов, временных файлов, образов и логов;
- память ускорителей для весов, runtime, KV/KDA cache, визуального encoder и нужной конкуренции;
- поддержку GPU, precision и sparse attention конкретной версией framework;
- стабильный старт, first-token latency, throughput, tool calls и мультимодальные входы на фиксированной нагрузке;
- итоговую стоимость с учётом оборудования, энергии, инженерного времени и простоя.
Hosted API требует включённый thinking, тогда как локальный chat template в некоторых recipes допускает иное поведение. Это разные контракты: локальную настройку нельзя переносить обратно в облачный запрос.
Если задача — быстро оценить качество и цену, сначала соберите данные через официальный API. Локальный кластер имеет смысл после того, как требования к данным или устойчивая загрузка оправдают многокарточную инфраструктуру. Для отдельного выбора между провайдерами есть русское сравнение GLM-5.3 и DeepSeek V4 Pro; здесь критерий другой — воспроизводимый переход от анонимного теста к формальному и измеримому маршруту.



