Qwen3.8-27B es uno de los candidatos de 27B más interesantes para un agente de código local. Eso no lo convierte automáticamente en el mejor.
La programación agéntica no es autocompletar una función ni generar una demo de una sola vez. El modelo debe leer las reglas del repositorio, llamar herramientas con argumentos válidos, modificar varios archivos, ejecutar pruebas, entender un fallo y producir un cambio que un desarrollador acepte. La pregunta útil no es «¿puedo cargarlo?», sino: ¿puede esta cuantización, con este hardware y este runtime, completar trabajo real con un coste razonable de tiempo y corrección humana?
La respuesta rápida según tu memoria disponible
| Memoria realmente disponible | Punto de partida | Qué debes comprobar |
|---|---|---|
| 24 GB de VRAM o memoria unificada | Q4_K_M y tareas de texto acotadas | que 64K de contexto no provoquen descarga pesada a CPU |
| 32–48 GB | Q4 con margen más realista; comparar cuantizaciones superiores | residencia en GPU, velocidad con el repositorio cargado y memoria para tests |
| 48 GB o más | bucles de agente con 64K o más resultan más cómodos | 262K nativos siguen siendo un techo, no un valor obligatorio |
| Mucha descarga a CPU | modelo menor o ruta híbrida | latencia acumulada, reintentos y coste por tarea aceptada |
En una GPU de 24 GB, Q4 puede servir para verificar compatibilidad. No presupongas que quedará espacio para un KV cache grande, el agente, el índice del repositorio y el proceso de build. En un Mac, cuenta la memoria unificada que queda libre después del sistema y las herramientas, no la cifra comercial total.
Qué confirma la ficha de Qwen3.8-27B
La ficha oficial de Qwen describe un modelo causal dense de 27.000 millones de parámetros, con licencia Apache-2.0 y vision encoder. Entiende imágenes y vídeo, activa thinking por defecto y ofrece controles reasoning_effort y preserve_thinking. Su ventana nativa es de 262.144 tokens y puede ampliarse hasta un millón mediante YaRN.
Qwen informa de 73,0 en Terminal-Bench 2.1, 61,7 en SWE-bench Pro, 42,3 en NL2Repo-Bench, 42,2 en DeepSWE 1.1 y 79,0 en QwenSWEBench. Son cifras suficientes para justificar una evaluación. No son una prueba independiente de tu GGUF: dependen del harness, el contexto, la temperatura y los conjuntos usados por el fabricante; algunos incluyen tareas corregidas o benchmarks internos.
Tampoco conviene trasladar al modelo 27B las demostraciones autónomas publicadas para Qwen3.8-Max. Pertenecer a la misma generación no implica el mismo tamaño, las mismas trazas ni la misma tasa de finalización.
El archivo Q4 de 18,97 GB no es toda la memoria
El repositorio GGUF de ggml-org ofrece actualmente estas referencias:
Qwen3.8-27B-Q4_K_M.gguf: unos 18,97 GB;Qwen3.8-27B-Q8_0.gguf: unos 28,60 GB;- proyector visual BF16: unos 0,93 GB.
Son tamaños de archivos, no la memoria total del proceso. Hay que sumar el KV cache, buffers del runtime, sistema operativo, agente, índice del repositorio y compilador o pruebas. Un contexto más largo aumenta el KV cache. El proyector añade otra carga cuando el flujo necesita imágenes.
La guía de contexto de Ollama recomienda al menos 64K para agentes y herramientas de código, y advierte de que el consumo crece con el contexto. Sin embargo, el valor automático es 4K por debajo de 24 GiB, 32K entre 24 y 48 GiB y 256K desde 48 GiB. Por eso cargar Q4 en una tarjeta de 24 GB no garantiza el contexto que quieres para el agente.
Después de arrancar, usa ollama ps para comprobar CONTEXT y PROCESSOR. Si una parte grande acaba en CPU, un prompt corto puede parecer aceptable mientras que un ciclo de ocho llamadas y dos pruebas resulta demasiado lento.

Una ruta mínima con llama.cpp u Ollama
La conversión de ggml-org incluye el camino más corto para un servidor llama.cpp actual:
bashllama serve -hf ggml-org/Qwen3.8-27B-GGUF
Usa una versión reciente: Qwen3.8-27B se publicó el 14 de agosto de 2026 y el soporte de conversión y plantillas aún puede cambiar deprisa.
Si ya utilizas Ollama, su importación oficial de GGUF permite crear un Modelfile:
textFROM ./Qwen3.8-27B-Q4_K_M.gguf PARAMETER num_ctx 65536 PARAMETER temperature 1 PARAMETER top_p 0.95 PARAMETER top_k 20
bashollama create qwen3.8-27b-local -f ./Modelfile ollama run qwen3.8-27b-local ollama ps
Para conectar un agente, la configuración de proveedores de Qwen Code admite endpoints locales compatibles con OpenAI de Ollama, LM Studio y vLLM. En Ollama puedes usar http://your-ollama-host:11434/v1, sustituyendo your-ollama-host por un nombre resoluble desde el proceso del agente; el id debe coincidir con el modelo expuesto por el servidor.
Si fallan las llamadas de herramientas, revisa versión del runtime, chat template, truncado de contexto y esquema de la API antes de culpar al razonamiento. Si, con todo fijo, los nombres o argumentos siguen llegando mal, sí tienes un No-Go para uso desatendido.
Prueba cambios de repositorio, no demos
Prepara entre 8 y 12 tareas cuyo resultado tu equipo sepa revisar: un bug pequeño, un cambio entre varios archivos, una prueba fallida que obligue a reparar, una tarea sujeta a instrucciones locales y un caso donde la implementación tentadora deba rechazarse.
Registra cada intento con el mismo criterio:
| Medida | Qué cuenta |
|---|---|
| Finalización aceptada | el diff pasa revisión y las pruebas relevantes |
| Validez de tools | nombres, estructura y argumentos correctos |
| Reintentos | reinicios, llamadas repetidas y nuevos prompts |
| Corrección humana | edición o dirección adicional tras el intento |
| Tiempo total | desde el inicio hasta un resultado aceptado |
| Recursos máximos | VRAM/memoria unificada, descarga a CPU, contexto y build |

Mantén iguales cuantización, runtime, contexto, agent harness y tareas al comparar. La métrica decisiva es el coste por tarea aceptada: tiempo de máquina más reparación humana. Un modelo algo más lento con tools fiables puede superar a otro rápido que obliga a repetir tres veces.
Cuándo dar Go a Qwen3.8-27B
Dale Go como worker local principal si mantienes margen de memoria con el contexto necesario, las llamadas de herramientas son estables y la tasa de cambios aceptados mejora tu ruta actual. Con 24 GB, limita el Go a Q4 y tareas de texto acotadas hasta medir el sistema completo.
Dale No-Go como única ruta cuando necesites mucha descarga a CPU, el monorepo exija contexto enorme de forma habitual o el éxito sin supervisión importe más que el control local. En esos casos suele funcionar mejor un worker local pequeño para cambios predecibles y una escalada alojada para la cola difícil.
Qwen3.8-27B puede ser tu mejor LLM local para programación agéntica. La prueba no será su etiqueta de 27B ni una cifra del lanzamiento: serán los cambios revisables y probados que produzca repetidamente dentro de tu presupuesto real de memoria, latencia y trabajo humano.



