Qwen 3.8 Flash Next se presenta como una prueba para desarrolladores de la arquitectura prevista para Qwen 4, no como el buque insignia definitivo de Alibaba. Su diseño multimodal Mixture of Experts tendría 125.000 millones de parámetros —incluidos 51.000 millones de embeddings N gram—, pero activaría unos 6.000 mil...
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s planned Qwen 3.8 Flash Next release, how does its multimodal Mixture of Experts architecture (125 billion total parameters. Article summary: Qwen 3.8 Flash Next is being positioned as an early, open weight developer test of the architecture intended for Qwen 4—not as Alibaba’s finished flagship.. Topic tags: general web, agents, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thum
Alibaba está posicionando Qwen 3.8-Flash-Next como un adelanto para desarrolladores de la arquitectura que pretende utilizar en la futura familia Qwen 4. La diferencia es importante: no se trataría del producto estrella terminado, sino de una versión temprana para probar herramientas, flujos de inferencia y aplicaciones multimodales antes del lanzamiento principal. 9
Por ahora, las cifras de rendimiento, coste y disponibilidad deben leerse como afirmaciones de la compañía. La evaluación definitiva dependerá de que Alibaba publique los pesos, la documentación técnica y pruebas independientes.
El diseño comunicado sería un modelo multimodal nativo basado en Mixture-of-Experts (MoE), con 125.000 millones de parámetros en total. De esa cifra, 51.000 millones corresponderían a parámetros de embeddings N-gram, mientras que el modelo activaría aproximadamente 6.000 millones por token. 9
En un modelo denso, prácticamente toda la red participa en el procesamiento de cada token. En cambio, un sistema MoE mantiene una gran reserva de expertos especializados y utiliza un mecanismo de enrutamiento para seleccionar solo una parte en cada paso. La idea es conservar una capacidad amplia sin pagar siempre el coste computacional de utilizar todos los parámetros.
En la práctica, ese enfoque puede reducir las operaciones de coma flotante, las exigencias de ancho de banda de memoria y el coste de servir el modelo frente a un sistema denso de tamaño total comparable. Sin embargo, el ahorro real depende también de la infraestructura, la distribución de los expertos, la comunicación entre aceleradores y la eficiencia del software de inferencia.
La programación es uno de los casos de uso en los que la especialización dispersa puede resultar especialmente útil. Distintos expertos podrían aprender patrones relacionados con lenguajes de programación, repositorios, uso de herramientas, depuración o análisis de bases de código extensas.
Alibaba vincula esta arquitectura con la posibilidad de alcanzar un rendimiento cercano a la frontera con aproximadamente una novena parte del coste de entrenamiento de Qwen 3.7-Plus. Esa cifra debe entenderse como un objetivo de eficiencia basado en el enrutamiento disperso, los cambios de arquitectura y el diseño de embeddings; no demuestra que Flash-Next vaya a igualar a los principales modelos cerrados en todos los benchmarks ni en cualquier flujo de trabajo real de desarrollo.
Las evaluaciones independientes de programación todavía serán necesarias para comprobar si la ventaja se mantiene fuera de las pruebas internas.
La etiqueta de «preview» o vista previa sugiere una función principalmente técnica y de ecosistema. Los desarrolladores podrían utilizar Flash-Next para preparar:
El futuro modelo insignia Qwen 4 aún podría incorporar más entrenamiento, un postentrenamiento más avanzado, variantes de mayor tamaño, un trabajo de seguridad más amplio y una validación final de benchmarks. Por eso, el adelanto no debería interpretarse como una fotografía completa de lo que Alibaba ofrecerá con Qwen 4.
Flash-Next llega en un momento de expansión de la serie. Alibaba ya ha puesto a disposición Qwen3.8-27B bajo la licencia Apache 2.0. Es un modelo multimodal nativo de la clase de 27.000 millones de parámetros, con una ventana de contexto nativa de 262.000 tokens que puede ampliarse hasta 1 millón de tokens. 6
En el extremo superior se encuentra Qwen3.8-Max. Los reportes indican que sus pesos se distribuyen con una licencia propia y más restrictiva, en lugar de los términos Apache 2.0 del modelo de 27.000 millones. 12 La división permite una adopción más amplia en el segmento de menor tamaño, al tiempo que Alibaba conserva mayor control sobre las capacidades más costosas de operar.
Esto también introduce una cautela comercial. Si la licencia de Max o de Flash-Next exige acuerdos separados, establece umbrales para grandes despliegues o contempla obligaciones de reparto de ingresos, el concepto de «pesos abiertos» tendría límites relevantes. Los datos disponibles respaldan que Max está sujeto a restricciones, pero los requisitos exactos —incluido cualquier umbral de ingresos— deben confirmarse en el texto oficial de la licencia. 12
Los modelos Qwen forman parte de una estrategia de extremo a extremo: atraer desarrolladores mediante modelos accesibles y convertir ese uso en demanda para Alibaba Cloud, mientras la empresa invierte en centros de datos, capacidad de cómputo e infraestructura para entrenar y servir sistemas avanzados. Alibaba afirmó que los fondos obtenidos en su colocación de acciones en Hong Kong financiarían capacidades de IA de «full stack», es decir, de toda la cadena tecnológica. 2
La compañía recaudó 80.000 millones de dólares hongkoneses, equivalentes a unos 10.200 millones de dólares, mediante la venta de 710 millones de acciones a 112,70 dólares hongkoneses cada una. 3 El precio supuso un descuento del 8,4 % respecto al cierre anterior, mientras que el libro de órdenes habría recibido una demanda cercana a 28.000 millones de dólares. 4
Para los accionistas, el intercambio es directo: la operación acelera la inversión en IA, pero la emisión de nuevas acciones diluye sus participaciones y eleva el riesgo de ejecución si el gasto no se transforma con suficiente rapidez en ingresos de nube, API y aplicaciones. 4
En la carrera china por los modelos con pesos abiertos, ganar un benchmark es solo una parte del objetivo. Alibaba también necesita atraer ajustes derivados, herramientas compatibles, cargas de trabajo en la nube y comunidades de desarrolladores antes que rivales como DeepSeek.
Las referencias a sistemas potenciales como «Ox Alpha» siguen siendo especulativas mientras no vayan acompañadas de un lanzamiento atribuible, pesos verificables o un informe técnico. Del mismo modo, las cifras de un ecosistema de más de 460 modelos compatibles con 119 idiomas deben entenderse como métricas del ecosistema de Alibaba, no como una medición de las capacidades de un único modelo Qwen.
La apuesta estratégica es clara: los modelos multimodales dispersos y baratos de entrenar podrían permitir a Alibaba competir a la vez por la adopción masiva de modelos abiertos y por los despliegues premium a escala de nube. La incógnita será si las pruebas independientes confirman la calidad en programación y el ahorro de entrenamiento, y si las licencias permiten a las grandes empresas adoptar estos modelos sin vaciar de contenido su promesa de apertura.
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
Qwen 3.8 Flash Next se presenta como una prueba para desarrolladores de la arquitectura prevista para Qwen 4, no como el buque insignia definitivo de Alibaba.
Qwen 3.8 Flash Next se presenta como una prueba para desarrolladores de la arquitectura prevista para Qwen 4, no como el buque insignia definitivo de Alibaba. Su diseño multimodal Mixture of Experts tendría 125.000 millones de parámetros —incluidos 51.000 millones de embeddings N gram—, pero activaría unos 6.000 millones por token.
La compañía apunta a un rendimiento cercano a la frontera en programación con un coste de entrenamiento de aproximadamente una novena parte del de Qwen 3.7 Plus, una afirmación aún pendiente de validación independiente.