Qwen3.8-Flash-Next можно запустить локально, но это не «модель на 6B», которую достаточно поместить в обычную видеокарту. Шесть миллиардов — число параметров основного MoE, активируемых для одного токена. В официальной карточке Qwen указаны 125B параметров основной модели, ещё 51B в N-gram embeddings и 4B MTP. Нужные веса всё равно должны находиться в памяти, на диске или проходить через offload.
По текущей оценке Unsloth, самый маленький 1-bit quant требует не менее 75 ГБ общей памяти, а разумная стартовая машина для него имеет 96 ГБ RAM или unified memory. Для 4-bit в таблице уже стоит около 112 ГБ. Поэтому 128 ГБ — рабочая лаборатория для Q3/Q4, но не обещание свободного контекста 262K.
Быстрый ответ для разных конфигураций
Оценивайте память, свободную во время inference. На Mac она общая для модели, macOS и приложений. В системе с дискретной GPU важны и VRAM, и RAM, и скорость переноса между ними.
| Реально доступная память | Практическое решение |
|---|---|
| До 64 ГБ | Полный Flash-Next GGUF не подходит; выбирайте меньшую модель |
| Около 96 ГБ | Начинайте с 1–3-bit, короткого контекста и одного процесса |
| Около 128 ГБ | Можно проверять Q3 и отдельные Q4, контролируя ОС и KV-кэш |
| 192–256 ГБ и больше | Выше запас для Q4/Q5 и длинного контекста, но 262K всё равно не обязателен |
Unsloth публикует следующие размеры: UD-IQ1_S 72,5 ГБ, UD-IQ1_M 74,5 ГБ, UD-Q2_K_XL 78,9 ГБ, UD-IQ3_XXS 82 ГБ, UD-Q3_K_XL 90 ГБ, UD-IQ4_XS 93,7 ГБ и UD-Q4_K_XL 111,3 ГБ. В общей таблице требований 1/2/3/4-bit соответствуют примерно 75/79/90/112 ГБ.
Размер файла и безопасный бюджет процесса — разные величины. Добавьте KV-кэш, вычислительные буферы, runtime, ОС и клиент. Для vision нужен отдельный projector; в текущем GGUF-репозитории его BF16-вариант занимает около 908 МБ. Если система уходит в постоянный swap, модель формально загрузилась, но конфигурация не стала полезной.

Не перепутайте Flash-Next, Flash и 27B
Qwen/Qwen3.8-Flash-Next — открытая multimodal MoE и ранняя версия архитектуры будущего Qwen4. Qwen сочетает Gated DeltaNet с Qwen Sparse Attention, а N-gram embeddings увеличивают ёмкость и лучше подходят для выгрузки в host memory.
Qwen3.8-Flash — управляемая версия в сервисе Qwen. По описанию Qwen, у неё по умолчанию 1M context и встроенные инструменты. Локальный GGUF не получает эти продуктовые функции автоматически.
Qwen3.8-27B — отдельная плотная модель. Если у вас 24–48 ГБ, полезнее начать с руководства по Qwen3.8-27B для локального coding agent, а не пытаться превратить Flash-Next в маленькую модель экстремальным offload.
Опубликованные Qwen результаты по coding, agents и tool use объясняют интерес к модели, но остаются данными производителя в заданных harness. Они не доказывают качество 1-bit GGUF и не предсказывают скорость конкретного Mac или GPU+RAM.
Надёжный запуск через alias кванта
Используйте свежую сборку llama.cpp, где есть поддержка новой архитектуры. Текущая страница Unsloth GGUF позволяет обратиться к quant по alias:
bashllama serve -hf unsloth/Qwen3.8-Flash-Next-GGUF:UD-Q4_K_XL
На машине класса 96 ГБ замените Q4 на вариант, который помещается с запасом. Команда Unsloth выглядит так:
bashunsloth run --model unsloth/Qwen3.8-Flash-Next-GGUF:UD-Q4_K_XL
Alias безопаснее ручного пути к shard. В проверенной версии длинной инструкции Unsloth локальный каталог был написан как GGFF, а следующая команда сочетала каталог UD-IQ1_S с именем файла UD-Q4_K_XL. Это может быть быстро исправлено. При ручном скачивании сначала посмотрите реальные имена файлов и передавайте runtime фактический первый shard.
Начните с context 8K или 16K. Нативные 262 144 токена и расширение до миллиона описывают максимум модели, а не обязательную локальную настройку. Увеличивайте контекст ступенями и следите за памятью и временем обработки prompt.
Проверка важнее факта загрузки
Первый сеанс должен ответить на пять вопросов:
- Доступен ли локальный
/v1/modelsи какой model ID возвращает сервер? - Загружен ли именно Flash-Next и нужный quant, а не 27B или облачный alias?
- Сколько памяти остаётся после загрузки, нет ли swap и сколько занимает первый токен?
- Что происходит при одинаковом prompt на 8K, 16K и большем context?
- Если нужен agent, сохраняются ли tool name, типы arguments, tool result и следующий ход?
После этого дайте двум-трём quant один набор из 5–10 проверяемых задач. Считайте завершённые задачи, ручные исправления, сбои инструментов и полное время. Измерение Unsloth по KLD и top-1 recovery полезно для предварительного выбора, но это не accepted-task rate вашего проекта.
Out-of-memory, тяжёлый swap, сломанный tool JSON после длинного prompt или неприемлемая задержка — полноценный результат No-Go. Снизьте context, выберите другой quant или меньшую модель. Бесконечная настройка не исправляет нехватку физической памяти.

Когда эксперимент оправдан
Flash-Next имеет смысл проверять, если доступно хотя бы около 96 ГБ, вы принимаете риск низкобитного quant и вам действительно нужна большая ёмкость для agentic или long-context задач. Для Q3/Q4 заметно удобнее реально свободные 128 ГБ, особенно если на машине можно закрыть IDE, браузер и сборки.
Если нужен лёгкий фоновый помощник или потолок составляет 64 ГБ, меньшая модель даст более предсказуемую задержку и меньше ручного ремонта. Архитектура Flash-Next снижает вычисления на токен, но не отменяет хранение большой таблицы весов и N-gram embeddings.
Перед скачиванием проверьте официальный репозиторий Qwen и актуальную инструкцию Unsloth. На страницах весов сейчас указана лицензия qwen-community-1.0; для коммерческого использования или распространения нужно читать сам текст лицензии, а не только метку.



