O Qwen 3.8 Flash Next é apresentado como uma prévia para desenvolvedores da arquitetura que deve sustentar o Qwen 4, e não como o principal modelo final da Alibaba. A arquitetura Mixture of Experts teria 125 bilhões de parâmetros, incluindo 51 bilhões em embeddings N gram, mas ativaria cerca de 6 bilhões por token.
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s planned Qwen 3.8 Flash Next release, how does its multimodal Mixture of Experts architecture (125 billion total parameters. Article summary: Qwen 3.8 Flash Next is being positioned as an early, open weight developer test of the architecture intended for Qwen 4—not as Alibaba’s finished flagship.. Topic tags: general web, agents, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thum
O Qwen 3.8-Flash-Next está sendo apresentado como um teste antecipado, com pesos abertos, da arquitetura que deverá formar a base da família Qwen 4. A Alibaba não o posiciona como seu modelo definitivo ou como um novo topo de linha, mas como uma oportunidade para desenvolvedores experimentarem a próxima geração de treinamento, ajuste fino, inferência e aplicações multimodais. 9
A proposta é ambiciosa: concentrar muita capacidade total em um modelo que utiliza apenas uma fração dos parâmetros a cada token. Isso poderia reduzir o custo computacional sem abrir mão de especialização — sobretudo em tarefas de programação e uso de agentes de IA. Ainda assim, os números de desempenho, economia e disponibilidade devem ser tratados como declarações da empresa até que os pesos, a documentação técnica e avaliações independentes sejam publicados.
O modelo teria 125 bilhões de parâmetros no total, incluindo 51 bilhões de parâmetros de embeddings N-gram, mas ativaria somente cerca de 6 bilhões por token. 9
Essa é a lógica da arquitetura Mixture-of-Experts (MoE), ou mistura de especialistas. Em vez de encaminhar cada trecho de texto por toda a rede — como faria um modelo denso —, o sistema seleciona um pequeno grupo de especialistas mais adequado para cada token ou tarefa.
Na prática, o modelo mantém um grande conjunto de capacidades especializadas, mas não precisa executar tudo ao mesmo tempo. Isso pode diminuir:
Os 51 bilhões de parâmetros N-gram acrescentam uma camada distinta à estratégia. Embeddings desse tipo podem ajudar o sistema a fazer consultas locais e rápidas sobre padrões de tokens, embora o impacto real dependa da implementação completa — algo que só poderá ser avaliado com a documentação e os pesos oficiais.
A codificação é uma área em que a especialização esparsa pode ser particularmente útil. Diferentes especialistas podem aprender padrões ligados a linguagens de programação, estruturas de repositórios, uso de ferramentas, depuração e manutenção de contexto em bases de código extensas.
Por isso, a afirmação de que o Flash-Next poderia alcançar desempenho “próximo à fronteira” com aproximadamente um nono do custo de treinamento do Qwen 3.7-Plus deve ser entendida como uma meta de eficiência. A alegação provavelmente dependeria da combinação entre roteamento esparso, mudanças arquiteturais e o desenho dos embeddings — não apenas da contagem de parâmetros.
Ela também não significa, por si só, que o modelo irá igualar os principais sistemas fechados em todos os benchmarks ou em fluxos de trabalho reais de programação. Até o momento, não há avaliações independentes suficientes para confirmar a qualidade alegada em tarefas de código de longo prazo, agentes autônomos ou desenvolvimento de software em produção.
A escolha de lançar o Flash-Next antes do Qwen 4 parece ter uma finalidade prática: permitir que a comunidade prepare o ecossistema. Desenvolvedores poderão testar integração com ferramentas, pipelines multimodais, servidores de inferência e métodos de ajuste fino antes da chegada da família principal. 9
Isso também deixa espaço para que o futuro Qwen 4 tenha:
Em outras palavras, o Flash-Next funciona mais como uma versão de transição para a comunidade técnica do que como um produto acabado que representaria sozinho a capacidade máxima da Alibaba.
O Flash-Next chega em meio a uma expansão da linha Qwen 3.8. A Alibaba já disponibilizou o Qwen3.8-27B sob a licença Apache 2.0. O modelo multimodal teria 27 bilhões de parâmetros, uma janela de contexto nativa de 262 mil tokens e possibilidade de extensão para 1 milhão de tokens. 6
No outro extremo está o Qwen3.8-Max, voltado ao segmento de maior capacidade. Relatos indicam, porém, que seus pesos são distribuídos sob uma licença própria e mais restritiva, em vez dos termos amplamente permissivos da Apache 2.0 usados no modelo de 27 bilhões de parâmetros. 12
Essa divisão oferece à Alibaba duas vantagens: facilita a adoção do modelo menor por desenvolvedores e empresas, ao mesmo tempo que preserva maior controle comercial sobre a capacidade mais cara de treinar e operar.
A disponibilidade dos pesos não equivale automaticamente a liberdade irrestrita para qualquer uso comercial. Se a licença do Max ou do Flash-Next estabelecer limites de faturamento, exigir um acordo separado ou prever participação na receita para grandes implantações, isso representaria uma restrição relevante ao conceito de “pesos abertos”.
Há indicações de que o Max possui limitações de licença, mas o gatilho exato para eventual compartilhamento de receita e os demais termos precisam ser conferidos no texto jurídico oficial. Com as informações disponíveis, não é possível tratar uma obrigação específica de revenue sharing como fato estabelecido. 12
Para empresas, essa distinção é importante: baixar um modelo, modificá-lo e executá-lo localmente pode estar sujeito a regras diferentes das aplicáveis a um serviço comercial de grande escala.
O lançamento dos modelos faz parte de uma estratégia mais ampla da Alibaba. A empresa pretende usar modelos acessíveis ou de pesos abertos para atrair desenvolvedores, aplicações e demanda para a Alibaba Cloud, enquanto amplia a infraestrutura necessária para treinar e servir sistemas avançados.
Em Hong Kong, a companhia levantou HK$ 80 bilhões, equivalentes a cerca de US$ 10,2 bilhões, com a venda de 710 milhões de novas ações a HK$ 112,70 cada. A Alibaba disse que os recursos seriam destinados a capacidades de IA de ponta a ponta, incluindo infraestrutura. 2 3
O preço representou um desconto de 8,4% em relação ao fechamento anterior, enquanto o livro de ofertas teria recebido aproximadamente US$ 28 bilhões em demanda. 4
Para os acionistas, o dilema é direto: a captação acelera os investimentos em IA, mas a emissão de novas ações dilui a participação dos investidores atuais. Também aumenta o risco de execução caso os gastos com computação, data centers, modelos e chips não se convertam rapidamente em receita de nuvem, APIs e aplicações. 4
Na corrida chinesa por modelos de pesos abertos, vencer um benchmark é apenas parte da disputa. A Alibaba também precisa conquistar:
Esse ecossistema é uma frente importante da competição com projetos como o DeepSeek. Já referências a possíveis sistemas como “Ox Alpha” continuam especulativas enquanto não houver lançamento atribuível, pesos disponíveis ou relatório técnico correspondente.
Da mesma forma, números como uma comunidade com mais de 460 modelos e suporte a 119 idiomas devem ser lidos como métricas do ecossistema Qwen divulgado pela Alibaba, e não como uma medida da capacidade de um único modelo.
O Flash-Next representa uma aposta clara: modelos multimodais, esparsos e mais baratos de treinar poderiam dar à Alibaba força tanto na adoção aberta quanto na oferta premium em escala de nuvem.
Mas as principais perguntas continuam em aberto. Será que avaliações independentes confirmarão a qualidade em programação? A economia de treinamento será reproduzida fora dos números da empresa? O custo de inferência permanecerá baixo em aplicações reais? E as condições de licenciamento permitirão que grandes empresas adotem o modelo sem esvaziar o valor de ser “aberto”?
Até que essas respostas apareçam, o Qwen 3.8-Flash-Next deve ser visto como uma prévia técnica promissora — e não como prova definitiva de que o Qwen 4 alcançará a fronteira dos modelos de IA.
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
O Qwen 3.8 Flash Next é apresentado como uma prévia para desenvolvedores da arquitetura que deve sustentar o Qwen 4, e não como o principal modelo final da Alibaba.
O Qwen 3.8 Flash Next é apresentado como uma prévia para desenvolvedores da arquitetura que deve sustentar o Qwen 4, e não como o principal modelo final da Alibaba. A arquitetura Mixture of Experts teria 125 bilhões de parâmetros, incluindo 51 bilhões em embeddings N gram, mas ativaria cerca de 6 bilhões por token.
A Alibaba afirma buscar desempenho próximo ao de modelos de fronteira, especialmente em programação, com cerca de um nono do custo de treinamento do Qwen 3.7 Plus — uma alegação ainda sem validação independente sufici...