AIFreeAPI Logo

Как запустить Qwen3.8-Flash-Next локально через Unsloth и не ошибиться с памятью

A
4 min readРуководства по ИИ

75 ГБ — нижняя граница самого малого кванта, а не комфортная конфигурация. Сначала посчитайте общий запас памяти, затем выбирайте quant и полезный контекст.

Русская схема локального запуска Qwen3.8-Flash-Next через Unsloth с архитектурой, квантами, бюджетами 75, 96 и 128 ГБ, командами и Go/No-Go

Qwen3.8-Flash-Next можно запустить локально, но это не «модель на 6B», которую достаточно поместить в обычную видеокарту. Шесть миллиардов — число параметров основного MoE, активируемых для одного токена. В официальной карточке Qwen указаны 125B параметров основной модели, ещё 51B в N-gram embeddings и 4B MTP. Нужные веса всё равно должны находиться в памяти, на диске или проходить через offload.

По текущей оценке Unsloth, самый маленький 1-bit quant требует не менее 75 ГБ общей памяти, а разумная стартовая машина для него имеет 96 ГБ RAM или unified memory. Для 4-bit в таблице уже стоит около 112 ГБ. Поэтому 128 ГБ — рабочая лаборатория для Q3/Q4, но не обещание свободного контекста 262K.

Быстрый ответ для разных конфигураций

Оценивайте память, свободную во время inference. На Mac она общая для модели, macOS и приложений. В системе с дискретной GPU важны и VRAM, и RAM, и скорость переноса между ними.

Реально доступная памятьПрактическое решение
До 64 ГБПолный Flash-Next GGUF не подходит; выбирайте меньшую модель
Около 96 ГБНачинайте с 1–3-bit, короткого контекста и одного процесса
Около 128 ГБМожно проверять Q3 и отдельные Q4, контролируя ОС и KV-кэш
192–256 ГБ и большеВыше запас для Q4/Q5 и длинного контекста, но 262K всё равно не обязателен

Unsloth публикует следующие размеры: UD-IQ1_S 72,5 ГБ, UD-IQ1_M 74,5 ГБ, UD-Q2_K_XL 78,9 ГБ, UD-IQ3_XXS 82 ГБ, UD-Q3_K_XL 90 ГБ, UD-IQ4_XS 93,7 ГБ и UD-Q4_K_XL 111,3 ГБ. В общей таблице требований 1/2/3/4-bit соответствуют примерно 75/79/90/112 ГБ.

Размер файла и безопасный бюджет процесса — разные величины. Добавьте KV-кэш, вычислительные буферы, runtime, ОС и клиент. Для vision нужен отдельный projector; в текущем GGUF-репозитории его BF16-вариант занимает около 908 МБ. Если система уходит в постоянный swap, модель формально загрузилась, но конфигурация не стала полезной.

Пошаговый русский план Qwen3.8-Flash-Next: реальный бюджет памяти, таблица GGUF Unsloth, запуск по alias, проверка первого сеанса и границы Go/No-Go
Пошаговый русский план Qwen3.8-Flash-Next: реальный бюджет памяти, таблица GGUF Unsloth, запуск по alias, проверка первого сеанса и границы Go/No-Go

Не перепутайте Flash-Next, Flash и 27B

Qwen/Qwen3.8-Flash-Next — открытая multimodal MoE и ранняя версия архитектуры будущего Qwen4. Qwen сочетает Gated DeltaNet с Qwen Sparse Attention, а N-gram embeddings увеличивают ёмкость и лучше подходят для выгрузки в host memory.

Qwen3.8-Flash — управляемая версия в сервисе Qwen. По описанию Qwen, у неё по умолчанию 1M context и встроенные инструменты. Локальный GGUF не получает эти продуктовые функции автоматически.

Qwen3.8-27B — отдельная плотная модель. Если у вас 24–48 ГБ, полезнее начать с руководства по Qwen3.8-27B для локального coding agent, а не пытаться превратить Flash-Next в маленькую модель экстремальным offload.

Опубликованные Qwen результаты по coding, agents и tool use объясняют интерес к модели, но остаются данными производителя в заданных harness. Они не доказывают качество 1-bit GGUF и не предсказывают скорость конкретного Mac или GPU+RAM.

Надёжный запуск через alias кванта

Используйте свежую сборку llama.cpp, где есть поддержка новой архитектуры. Текущая страница Unsloth GGUF позволяет обратиться к quant по alias:

bash
llama serve -hf unsloth/Qwen3.8-Flash-Next-GGUF:UD-Q4_K_XL

На машине класса 96 ГБ замените Q4 на вариант, который помещается с запасом. Команда Unsloth выглядит так:

bash
unsloth run --model unsloth/Qwen3.8-Flash-Next-GGUF:UD-Q4_K_XL

Alias безопаснее ручного пути к shard. В проверенной версии длинной инструкции Unsloth локальный каталог был написан как GGFF, а следующая команда сочетала каталог UD-IQ1_S с именем файла UD-Q4_K_XL. Это может быть быстро исправлено. При ручном скачивании сначала посмотрите реальные имена файлов и передавайте runtime фактический первый shard.

Начните с context 8K или 16K. Нативные 262 144 токена и расширение до миллиона описывают максимум модели, а не обязательную локальную настройку. Увеличивайте контекст ступенями и следите за памятью и временем обработки prompt.

Проверка важнее факта загрузки

Первый сеанс должен ответить на пять вопросов:

  1. Доступен ли локальный /v1/models и какой model ID возвращает сервер?
  2. Загружен ли именно Flash-Next и нужный quant, а не 27B или облачный alias?
  3. Сколько памяти остаётся после загрузки, нет ли swap и сколько занимает первый токен?
  4. Что происходит при одинаковом prompt на 8K, 16K и большем context?
  5. Если нужен agent, сохраняются ли tool name, типы arguments, tool result и следующий ход?

После этого дайте двум-трём quant один набор из 5–10 проверяемых задач. Считайте завершённые задачи, ручные исправления, сбои инструментов и полное время. Измерение Unsloth по KLD и top-1 recovery полезно для предварительного выбора, но это не accepted-task rate вашего проекта.

Out-of-memory, тяжёлый swap, сломанный tool JSON после длинного prompt или неприемлемая задержка — полноценный результат No-Go. Снизьте context, выберите другой quant или меньшую модель. Бесконечная настройка не исправляет нехватку физической памяти.

Карта локальной памяти и проверки Qwen3.8-Flash-Next с квантами Unsloth, уровнями 64–256 ГБ, командами запуска, составом памяти и критериями Go/No-Go
Карта локальной памяти и проверки Qwen3.8-Flash-Next с квантами Unsloth, уровнями 64–256 ГБ, командами запуска, составом памяти и критериями Go/No-Go

Когда эксперимент оправдан

Flash-Next имеет смысл проверять, если доступно хотя бы около 96 ГБ, вы принимаете риск низкобитного quant и вам действительно нужна большая ёмкость для agentic или long-context задач. Для Q3/Q4 заметно удобнее реально свободные 128 ГБ, особенно если на машине можно закрыть IDE, браузер и сборки.

Если нужен лёгкий фоновый помощник или потолок составляет 64 ГБ, меньшая модель даст более предсказуемую задержку и меньше ручного ремонта. Архитектура Flash-Next снижает вычисления на токен, но не отменяет хранение большой таблицы весов и N-gram embeddings.

Перед скачиванием проверьте официальный репозиторий Qwen и актуальную инструкцию Unsloth. На страницах весов сейчас указана лицензия qwen-community-1.0; для коммерческого использования или распространения нужно читать сам текст лицензии, а не только метку.