El equipo de Qwen, la división de inteligencia artificial de Alibaba, liberó el 26 de agosto los pesos de Qwen3.8-Flash-Next, un modelo que la propia compañía describe como adelanto experimental de la arquitectura que usará Qwen4, la próxima generación de la familia. El modelo combina 125.000 millones de parámetros con una capa adicional de 51.000 millones dedicada a un mecanismo nuevo, pero activa solo 6.000 millones por token, según la ficha técnica que Qwen publicó en Hugging Face.
Esa distancia entre el tamaño total y lo que efectivamente se enciende en cada cálculo es la firma de un modelo de mezcla de expertos (MoE, por sus siglas en inglés): en vez de usar toda la red para cada palabra que genera, el sistema enruta cada token hacia un subconjunto reducido de subredes especializadas. Qwen3.8-Flash-Next reparte ese trabajo entre 512 expertos, de los cuales 10 se activan por ruteo más uno fijo en cada paso, distribuidos en 48 capas.
Qué cambia en la arquitectura
El repositorio que Qwen publicó en GitHub atribuye el salto a cuatro cambios. El primero es un esquema de atención híbrido: capas de Gated DeltaNet, que comprimen el historial de la conversación en una memoria de tamaño fijo, alternadas con Qwen Sparse Attention, que selecciona qué bloques de contexto revisar en detalle en lugar de mirar toda la ventana. El segundo es un residual con puertas dinámicas de cuatro ramas, que regula cuánta información fluye entre capas. El tercero es el N-gram embedding, la capa de 51.000 millones de parámetros que guarda secuencias cortas de palabras como entradas propias y corre en la memoria RAM del sistema en lugar de la GPU, con un costo adicional bajo según Qwen. El cuarto es Muon, un optimizador de entrenamiento con una ortogonalización refinada.
La ventana de contexto, la cantidad de texto que el modelo puede tener en cuenta a la vez, llega nativamente a 262.144 tokens y se extiende hasta 1.000.000 mediante la técnica YaRN, la misma que Qwen ya usaba en Qwen3.8-27B.
El anuncio y el precio que viene
Qwen difundió el lanzamiento el mismo 26 de agosto desde su cuenta oficial en X, en inglés: "Meet Qwen3.8-Flash, a multimodal MoE and an early preview of the Qwen4 architecture, now open-weight". El posteo adelantó que la versión de producción, Qwen3.8-Flash, llegará pronto a la API de QwenCloud a 0,16 dólares por millón de tokens de entrada y 0,47 por millón de salida.
Esa tarifa sale unas 12 veces más barata que Qwen3.8-Max, que cuesta 2,00 y 6,00 dólares por millón de tokens de entrada y salida respectivamente. Los pesos que ya pueden descargarse llevan la licencia "qwen-community-1.0", distinta tanto del Apache 2.0 sin condiciones de Qwen3.8-27B como del esquema comercial por escalones que Qwen le puso a Qwen3.8-Max hace dos semanas.
Las cifras que Qwen eligió mostrar
Entrena a aproximadamente 1/9 del costo de Qwen3.7-Plus y lo supera en tareas de código y de oficina.
Es la afirmación central que Qwen hace sobre la eficiencia del modelo, tomada de su propio repositorio. Ninguna cifra de costo absoluto de entrenamiento acompaña esa comparación.
Qwen también publicó una tabla de benchmarks, pruebas estandarizadas para medir capacidades específicas, que enfrenta a Flash-Next contra Qwen3.7-Plus, DeepSeek-V4-Flash y Claude Opus 4.6 de Anthropic:
| Prueba | Flash-Next | Claude Opus 4.6 |
|---|---|---|
| SWE-bench Pro | 62,5 | 53,4 |
| CoWorkBench | 73,9 | 68,2 |
| JobBench | 55,7 | 36,6 |
| DeepSWE 1.1 | 58,7 | sin dato |
En las cuatro pruebas, Flash-Next también supera a DeepSeek-V4-Flash (54,4 en DeepSWE, 56,0 en SWE-bench Pro, 45,1 en CoWorkBench y 41,3 en JobBench) y a su propio antecesor Qwen3.7-Plus, que en JobBench queda en 27,6. Son las condiciones que fijó el propio Qwen: un único intento por prueba y sin harness ni metodología detallados en la ficha pública. Al cierre de esta nota, ningún tablero externo, ni Artificial Analysis ni los rankings comunitarios de código abierto, había corrido el modelo de forma independiente.
Lo que todavía no se sabe
Qwen3.8-Flash-Next es, por diseño, una muestra parcial: adelanta la arquitectura de Qwen4 pero no es Qwen4. La compañía no precisó cuándo llegará la familia completa ni si mantendrá esta misma combinación de atención híbrida, residual con puertas y N-gram embedding a mayor escala. Tampoco detalló el tamaño del corpus de entrenamiento ni el hardware usado para alcanzar ese recorte de costo de 1/9 que reclama frente a Qwen3.7-Plus.
