AIFreeAPI Logo

Qwen3.8-27B для локального агентного программирования: стоит ли выбирать её основной моделью?

A
4 min readСравнение ИИ

Qwen3.8-27B уже можно считать одной из наиболее интересных 27B-моделей для локального coding agent. Но лучший выбор определяется не запуском GGUF, а тем, заканчивает ли ваш конкретный контур задачи без дорогого CPU offload и ручного ремонта.

Локальная рабочая станция с Qwen3.8-27B, где решение зависит от запаса памяти, контекста, инструментов и принятого результата

Qwen3.8-27B стоит ставить в начало списка локальных моделей для проверки, но не назначать победителем заранее. Для агентного программирования важна не способность ответить на один prompt, а полный цикл: прочитать инструкции репозитория, вызвать нужный инструмент, изменить несколько файлов, запустить тесты, понять ошибку и довести diff до состояния, которое примет разработчик.

Поэтому вопрос «запускается ли 27B на моём компьютере» слишком узкий. Практический вопрос звучит иначе: помещаются ли выбранное квантование и рабочий контекст без разрушительного offload, а результат оказывается дешевле по времени и ручным правкам, чем у альтернативы?

Короткий вывод по конфигурациям

  • 24 ГБ VRAM или примерно столько же свободной unified memory: Q4_K_M можно проверять на ограниченных текстовых задачах. Это не гарантия быстрого агента с контекстом 64K.
  • 32–48 ГБ доступной памяти: Q4 получает более разумный запас под KV cache и инструменты; можно проверять более высокое квантование, но реальную GPU residency всё равно надо измерить.
  • От 48 ГБ: длинные циклы с контекстом 64K становятся практичнее. Нативные 262K — максимальная возможность модели, а не обязательная рабочая настройка.
  • Тяжёлый CPU offload или строгая автономность: меньшая локальная модель либо гибрид с облачным маршрутом часто даёт больше принятых задач за то же время.

Это не рейтинг видеокарт. Сборка runtime, KV cache, длина prompt, индекс репозитория и параллельный build способны изменить результат сильнее, чем надпись «24 GB» на коробке.

Что у Qwen3.8-27B действительно подтверждено

В официальной карточке модели Qwen3.8-27B описана как post-trained dense causal language model на 27 млрд параметров с vision encoder и лицензией Apache-2.0. Она понимает изображения и видео, по умолчанию использует thinking и поддерживает reasoning_effort и preserve_thinking. Нативный контекст составляет 262 144 токена; YaRN позволяет расширение до миллиона.

Qwen также публикует результаты 73,0 на Terminal-Bench 2.1, 61,7 на SWE-bench Pro, 42,3 на NL2Repo-Bench, 42,2 на DeepSWE 1.1 и 79,0 на QwenSWEBench. Это серьёзный повод для теста, но не независимая проверка локального GGUF. Значения получены в указанных производителем harness и настройках; часть наборов исправлялась, а часть принадлежит самому Qwen.

Отдельно важно не переносить демонстрации Qwen3.8-Max на открытую 27B-модель. Общая версия поколения и показанный автономный проект ещё не доказывают одинаковую производительность, трассы или масштаб.

Файл Q4 — не вся память процесса

Текущий официальный GGUF от ggml-org даёт удобную отправную точку:

АртефактРазмер файлаЧто это значит
Q4_K_Mоколо 18,97 ГБреалистичный первый вариант для 24-гигабайтного класса
Q8_0около 28,60 ГБвыше точность весов, но заметно больше требуемый запас
BF16 vision projectorоколо 0,93 ГБдополнительная нагрузка, если агенту нужны изображения

К этим файлам добавляются KV cache, runtime buffers, ОС, сам coding agent, индекс файлов и память компилятора или тестов. При увеличении контекста растёт KV cache. Если часть вычислений уходит на CPU, модель может формально работать, но задержка многошагового цикла станет неприемлемой.

Документация Ollama по контексту рекомендует не меньше 64K для coding tools и agents и прямо предупреждает о росте памяти. При этом автоматическое значение для систем с 24–48 GiB VRAM составляет лишь 32K. После запуска проверяйте в ollama ps фактические CONTEXT и PROCESSOR, а не только факт загрузки.

Два варианта размещения весов, KV cache, runtime, репозитория и тестов показывают безопасный запас и опасное переполнение памяти
Два варианта размещения весов, KV cache, runtime, репозитория и тестов показывают безопасный запас и опасное переполнение памяти

Как поднять минимальный локальный контур

Самый короткий путь для актуального llama.cpp опубликован рядом с GGUF:

bash
llama serve -hf ggml-org/Qwen3.8-27B-GGUF

Используйте свежую сборку llama.cpp: модель вышла 14 августа 2026 года, поэтому поддержка конвертации и шаблонов ещё быстро меняется.

Для Ollama официальный импорт GGUF начинается с Modelfile:

text
FROM ./Qwen3.8-27B-Q4_K_M.gguf PARAMETER num_ctx 65536 PARAMETER temperature 1 PARAMETER top_p 0.95 PARAMETER top_k 20
bash
ollama create qwen3.8-27b-local -f ./Modelfile ollama run qwen3.8-27b-local ollama ps

Если требуется coding agent, Qwen Code поддерживает локальные OpenAI-compatible endpoints Ollama, LM Studio и vLLM через provider типа openai. Для Ollama можно указать http://your-ollama-host:11434/v1, заменив your-ollama-host на имя, доступное процессу агента. id должен совпадать с именем, которое отдаёт сервер; ключ-заглушку безопаснее брать из переменной окружения.

Сбой tool call ещё не доказывает слабость модели. Сначала проверьте версию runtime, chat template, фактическое усечение контекста и соответствие API schema. Но если на фиксированной конфигурации вызовы регулярно имеют неверное имя или аргументы, это уже честный No-Go для автономного использования.

Принимайте решение по задачам репозитория

Соберите 8–12 задач, которые команда уже умеет проверять: небольшой bugfix, изменение нескольких файлов, ремонт падающего теста, соблюдение локальных инструкций и случай, где очевидную реализацию нужно отвергнуть. Не используйте только генерацию лендинга или игры с одного prompt — она не проверяет агентный цикл.

Для каждой попытки записывайте:

МетрикаУсловие
Принятое завершениеdiff проходит review и релевантные тесты
Валидность tool callsкорректны имя инструмента, структура и аргументы
Повторыновые prompts, перезапуски и повторные вызовы
Ручной ремонтобъём правок и steering после попытки модели
Полное времяот выдачи задачи до принятого результата
Пиковые ресурсыVRAM/unified memory, offload, контекст и нагрузка тестов
Метрики реальной задачи поступают на весы и направляют решение в проход, ограниченный проход или отказ
Метрики реальной задачи поступают на весы и направляют решение в проход, ограниченный проход или отказ

Сравнивайте модели при одинаковых runtime, quantization, context, harness и наборе задач. Главная величина — стоимость принятой задачи: машинное время плюс человеческий ремонт. Медленная модель с устойчивыми tool calls может быть выгоднее быстрой, которая трижды зацикливается.

Go/No-Go для Qwen3.8-27B

Дайте Go как основному локальному worker, если машина сохраняет запас памяти на нужном контексте, tool calls стабильны, а доля принятых задач и время до review лучше текущего маршрута. На 24 ГБ разумнее выдать условный Go для Q4 и узких текстовых задач.

Дайте No-Go как единственной модели, если нужен тяжёлый CPU offload, репозитории регулярно требуют огромного контекста или unattended success важнее локальности. В таком случае оставьте Qwen3.8-27B для подходящих патчей, а архитектурные и редкие сложные задачи отправляйте меньшему специализированному или более сильному hosted-маршруту.

Qwen3.8-27B может оказаться лучшей локальной LLM именно для вашего агентного программирования. Это докажет не название и не launch benchmark, а повторяемые принятые изменения в вашем репозитории при допустимых памяти, задержке и ручной работе.