Qwen3.8-Flash-Next puede ejecutarse en local, pero no es un modelo de 6B que quepa sin más en una GPU doméstica. Unsloth fija 75 GB como memoria total mínima para su quant de 1 bit más pequeño y recomienda un equipo con 96 GB de RAM o memoria unificada. Para 4 bits, su tabla ya ronda 112 GB. Un Mac o una estación de 128 GB es una plataforma razonable de prueba, no una garantía para usar 262K de contexto junto a todas las aplicaciones habituales.
La cifra de 6B describe los parámetros del modelo principal activados por token. La ficha oficial de Qwen enumera 125B parámetros en el MoE principal, 51B adicionales en N-gram embeddings y 4B MTP. Los pesos necesarios siguen teniendo que residir en RAM, VRAM, memoria unificada o una ruta de offload.
Decide con la memoria que queda libre
En Apple Silicon, macOS, el modelo, la caché KV y las aplicaciones comparten la misma memoria. En un sistema con GPU discreta importan tanto VRAM y RAM como la velocidad del enlace y la cantidad de capas descargadas. Si Docker, el IDE, el navegador y una compilación ya ocupan 25 GB, un equipo rotulado como 128 GB no dispone de 128 GB para inferencia.
La tabla actual de Unsloth permite planificar así:
| Quant | Tamaño publicado | Lectura práctica |
|---|---|---|
UD-IQ1_S | 72,5 GB | Ruta mínima; prioriza que quepa sobre el margen de calidad |
UD-IQ1_M | 74,5 GB | Otro punto de partida de 1 bit para equipos de 96 GB |
UD-Q2_K_XL | 78,9 GB | Prueba de baja memoria con algo más de calidad |
UD-IQ3_XXS | 82 GB | Candidato para 96 GB si el contexto empieza corto |
UD-Q3_K_XL | 90 GB | Más sensato en 128 GB con margen real |
UD-IQ4_XS | 93,7 GB | Variante compacta de clase 4-bit; la caché va aparte |
UD-Q4_K_XL | 111,3 GB | Punto orientado a calidad para hosts con bastante margen |
La guía de Unsloth resume los requisitos totales de 1/2/3/4 bits en 75/79/90/112 GB; después sube a 200 GB para 5 bits, 270 GB para 8 bits y 355 GB para BF16. Son cifras del publicador para orientar la selección, no una calculadora exacta del proceso.
Hay que añadir sistema operativo, runtime, buffers, caché KV y cliente. Si se usa visión, el repositorio actual incluye un projector BF16 independiente de unos 908 MB. Que el proceso cargue y acto seguido fuerce swap continuo no convierte la configuración en utilizable.
Por debajo de 64 GB, el GGUF completo de Flash-Next no es una base razonable. En torno a 96 GB conviene empezar con 1–3 bits, solo texto y contexto corto. Con 128 GB se pueden comparar Q3 y algunos Q4. Incluso con 192/256 GB, el contexto nativo de 262.144 tokens no tiene por qué ser el valor inicial.

Si el límite real está entre 24 y 48 GB y la tarea es programación agéntica local, la guía de Qwen3.8-27B trata un modelo denso distinto y mucho más ajustado a ese hardware.
Tres nombres que no comparten contrato
Qwen/Qwen3.8-Flash-Next es el modelo abierto multimodal MoE de este artículo y una vista previa de la arquitectura prevista para Qwen4. Combina Gated DeltaNet con Qwen Sparse Attention y amplía capacidad mediante N-gram embeddings.
Qwen3.8-Flash es el servicio gestionado de Qwen. Su descripción oficial añade características de producto como contexto de 1M por defecto y herramientas integradas. Un GGUF local no hereda esas funciones.
Qwen3.8-27B es un modelo denso de 27B, no un quant pequeño de Flash-Next. Sus requisitos, comandos y resultados no son intercambiables.
Qwen publica resultados sólidos de coding, agents y uso de herramientas. Sirven para justificar una evaluación, pero son mediciones del fabricante con harness concretos. No demuestran que un quant de 1 bit conserve los argumentos de herramienta en tu runtime ni anticipan la latencia del primer token en tu máquina.
Arranca con el alias, no con una ruta inventada
Instala una versión reciente de llama.cpp que soporte la arquitectura. El repositorio GGUF de Unsloth publica aliases de quant y permite iniciar la descarga y el servidor sin reconstruir nombres de shards:
bashllama serve -hf unsloth/Qwen3.8-Flash-Next-GGUF:UD-Q4_K_XL
En un host de 96 GB hay que sustituir Q4 por un alias de bajo bit que encaje con margen. Unsloth también documenta su propia entrada:
bashunsloth run --model unsloth/Qwen3.8-Flash-Next-GGUF:UD-Q4_K_XL
La ruta por alias evita un problema actual de la documentación manual. En la versión comprobada, el ejemplo usa GGFF como directorio local y después mezcla un directorio UD-IQ1_S con un archivo UD-Q4_K_XL. Puede corregirse pronto. Si descargas a mano, lista los archivos reales y pasa al runtime el primer shard que exista; no adivines la ruta.
Empieza con 8K o 16K de contexto. Los 262.144 tokens nativos y la extensión hasta un millón son capacidad máxima, no valor local obligatorio. Sube por etapas con el mismo prompt y registra caché, tiempo de procesamiento y swap.
Cinco comprobaciones para la primera sesión
- Consulta
/v1/modelsy guarda el model ID que expone el servidor. - Envía una petición de texto corta y confirma que se cargó Flash-Next con el quant elegido.
- Mide memoria libre después de cargar, tiempo al primer token, velocidad sostenida y swap.
- Repite la misma tarea con 8K, 16K y más contexto para observar el coste real.
- Si usarás un agente, valida nombre de herramienta, tipos de argumentos, resultado y siguiente turno; una buena respuesta en prosa no prueba el contrato.
Después compara dos o tres quants sobre 5–10 tareas de repositorio que tu equipo pueda juzgar. Cuenta tareas terminadas, reparación manual, fallos de tool calling y tiempo total. Las medidas KLD y top-1 de Unsloth ayudan a filtrar, pero no son la tasa de cambios aceptados en tu proyecto.
OOM, swap constante, JSON de herramientas roto después de un prompt largo o una espera inicial inaceptable son resultados No-Go. Reduce contexto, cambia de quant o usa un modelo menor. Cargar pesos solo prueba compatibilidad básica.

Cuándo merece la pena Flash-Next
El experimento tiene sentido con al menos un sistema de clase 96 GB, tolerancia al riesgo de cuantización baja y una tarea que se beneficie de la capacidad de un modelo sparse grande. Para comparar Q3/Q4, 128 GB realmente disponibles ofrecen una base mejor, sobre todo si se pueden cerrar procesos pesados.
No es una buena elección para un asistente ligero permanente, un techo de 64 GB o una carga donde la latencia predecible importe más que la capacidad. La arquitectura reduce cálculo por token, pero no elimina el almacenamiento de pesos y N-gram embeddings.
Antes de descargar, consulta el repositorio oficial de Qwen y la guía actual de Unsloth. Las páginas de pesos muestran hoy la etiqueta qwen-community-1.0; para uso comercial o redistribución hay que leer el texto real de la licencia, no tomar la etiqueta como asesoramiento jurídico.



