AIFreeAPI Logo

¿Es Qwen3.8-27B el mejor LLM local para programación agéntica?

A
5 min readComparativa de IA

Qwen3.8-27B merece estar entre los primeros modelos de 27B que pruebes para un agente de código local. Sin embargo, que Q4 cargue en 24 GB no demuestra que pueda editar, probar y reparar un repositorio con 64K de contexto.

Estación local que evalúa Qwen3.8-27B mediante margen de memoria, contexto, herramientas, pruebas y trabajo aceptado

Qwen3.8-27B es uno de los candidatos de 27B más interesantes para un agente de código local. Eso no lo convierte automáticamente en el mejor.

La programación agéntica no es autocompletar una función ni generar una demo de una sola vez. El modelo debe leer las reglas del repositorio, llamar herramientas con argumentos válidos, modificar varios archivos, ejecutar pruebas, entender un fallo y producir un cambio que un desarrollador acepte. La pregunta útil no es «¿puedo cargarlo?», sino: ¿puede esta cuantización, con este hardware y este runtime, completar trabajo real con un coste razonable de tiempo y corrección humana?

La respuesta rápida según tu memoria disponible

Memoria realmente disponiblePunto de partidaQué debes comprobar
24 GB de VRAM o memoria unificadaQ4_K_M y tareas de texto acotadasque 64K de contexto no provoquen descarga pesada a CPU
32–48 GBQ4 con margen más realista; comparar cuantizaciones superioresresidencia en GPU, velocidad con el repositorio cargado y memoria para tests
48 GB o másbucles de agente con 64K o más resultan más cómodos262K nativos siguen siendo un techo, no un valor obligatorio
Mucha descarga a CPUmodelo menor o ruta híbridalatencia acumulada, reintentos y coste por tarea aceptada

En una GPU de 24 GB, Q4 puede servir para verificar compatibilidad. No presupongas que quedará espacio para un KV cache grande, el agente, el índice del repositorio y el proceso de build. En un Mac, cuenta la memoria unificada que queda libre después del sistema y las herramientas, no la cifra comercial total.

Qué confirma la ficha de Qwen3.8-27B

La ficha oficial de Qwen describe un modelo causal dense de 27.000 millones de parámetros, con licencia Apache-2.0 y vision encoder. Entiende imágenes y vídeo, activa thinking por defecto y ofrece controles reasoning_effort y preserve_thinking. Su ventana nativa es de 262.144 tokens y puede ampliarse hasta un millón mediante YaRN.

Qwen informa de 73,0 en Terminal-Bench 2.1, 61,7 en SWE-bench Pro, 42,3 en NL2Repo-Bench, 42,2 en DeepSWE 1.1 y 79,0 en QwenSWEBench. Son cifras suficientes para justificar una evaluación. No son una prueba independiente de tu GGUF: dependen del harness, el contexto, la temperatura y los conjuntos usados por el fabricante; algunos incluyen tareas corregidas o benchmarks internos.

Tampoco conviene trasladar al modelo 27B las demostraciones autónomas publicadas para Qwen3.8-Max. Pertenecer a la misma generación no implica el mismo tamaño, las mismas trazas ni la misma tasa de finalización.

El archivo Q4 de 18,97 GB no es toda la memoria

El repositorio GGUF de ggml-org ofrece actualmente estas referencias:

  • Qwen3.8-27B-Q4_K_M.gguf: unos 18,97 GB;
  • Qwen3.8-27B-Q8_0.gguf: unos 28,60 GB;
  • proyector visual BF16: unos 0,93 GB.

Son tamaños de archivos, no la memoria total del proceso. Hay que sumar el KV cache, buffers del runtime, sistema operativo, agente, índice del repositorio y compilador o pruebas. Un contexto más largo aumenta el KV cache. El proyector añade otra carga cuando el flujo necesita imágenes.

La guía de contexto de Ollama recomienda al menos 64K para agentes y herramientas de código, y advierte de que el consumo crece con el contexto. Sin embargo, el valor automático es 4K por debajo de 24 GiB, 32K entre 24 y 48 GiB y 256K desde 48 GiB. Por eso cargar Q4 en una tarjeta de 24 GB no garantiza el contexto que quieres para el agente.

Después de arrancar, usa ollama ps para comprobar CONTEXT y PROCESSOR. Si una parte grande acaba en CPU, un prompt corto puede parecer aceptable mientras que un ciclo de ocho llamadas y dos pruebas resulta demasiado lento.

Dos equipajes con los mismos pesos, cache, runtime y herramientas muestran la diferencia entre ir al límite y conservar margen de memoria
Dos equipajes con los mismos pesos, cache, runtime y herramientas muestran la diferencia entre ir al límite y conservar margen de memoria

Una ruta mínima con llama.cpp u Ollama

La conversión de ggml-org incluye el camino más corto para un servidor llama.cpp actual:

bash
llama serve -hf ggml-org/Qwen3.8-27B-GGUF

Usa una versión reciente: Qwen3.8-27B se publicó el 14 de agosto de 2026 y el soporte de conversión y plantillas aún puede cambiar deprisa.

Si ya utilizas Ollama, su importación oficial de GGUF permite crear un Modelfile:

text
FROM ./Qwen3.8-27B-Q4_K_M.gguf PARAMETER num_ctx 65536 PARAMETER temperature 1 PARAMETER top_p 0.95 PARAMETER top_k 20
bash
ollama create qwen3.8-27b-local -f ./Modelfile ollama run qwen3.8-27b-local ollama ps

Para conectar un agente, la configuración de proveedores de Qwen Code admite endpoints locales compatibles con OpenAI de Ollama, LM Studio y vLLM. En Ollama puedes usar http://your-ollama-host:11434/v1, sustituyendo your-ollama-host por un nombre resoluble desde el proceso del agente; el id debe coincidir con el modelo expuesto por el servidor.

Si fallan las llamadas de herramientas, revisa versión del runtime, chat template, truncado de contexto y esquema de la API antes de culpar al razonamiento. Si, con todo fijo, los nombres o argumentos siguen llegando mal, sí tienes un No-Go para uso desatendido.

Prueba cambios de repositorio, no demos

Prepara entre 8 y 12 tareas cuyo resultado tu equipo sepa revisar: un bug pequeño, un cambio entre varios archivos, una prueba fallida que obligue a reparar, una tarea sujeta a instrucciones locales y un caso donde la implementación tentadora deba rechazarse.

Registra cada intento con el mismo criterio:

MedidaQué cuenta
Finalización aceptadael diff pasa revisión y las pruebas relevantes
Validez de toolsnombres, estructura y argumentos correctos
Reintentosreinicios, llamadas repetidas y nuevos prompts
Corrección humanaedición o dirección adicional tras el intento
Tiempo totaldesde el inicio hasta un resultado aceptado
Recursos máximosVRAM/memoria unificada, descarga a CPU, contexto y build
Una secuencia de repositorio, herramienta, prueba fallida, reparación y entrega aceptada representa la evaluación de trabajo real
Una secuencia de repositorio, herramienta, prueba fallida, reparación y entrega aceptada representa la evaluación de trabajo real

Mantén iguales cuantización, runtime, contexto, agent harness y tareas al comparar. La métrica decisiva es el coste por tarea aceptada: tiempo de máquina más reparación humana. Un modelo algo más lento con tools fiables puede superar a otro rápido que obliga a repetir tres veces.

Cuándo dar Go a Qwen3.8-27B

Dale Go como worker local principal si mantienes margen de memoria con el contexto necesario, las llamadas de herramientas son estables y la tasa de cambios aceptados mejora tu ruta actual. Con 24 GB, limita el Go a Q4 y tareas de texto acotadas hasta medir el sistema completo.

Dale No-Go como única ruta cuando necesites mucha descarga a CPU, el monorepo exija contexto enorme de forma habitual o el éxito sin supervisión importe más que el control local. En esos casos suele funcionar mejor un worker local pequeño para cambios predecibles y una escalada alojada para la cola difícil.

Qwen3.8-27B puede ser tu mejor LLM local para programación agéntica. La prueba no será su etiqueta de 27B ni una cifra del lanzamiento: serán los cambios revisables y probados que produzca repetidamente dentro de tu presupuesto real de memoria, latencia y trabajo humano.