Anunciado em 28 de setembro de 2026, o lançamento inclui código para pré treinamento, ajuste fino supervisionado (SFT) e aprendizado por reforço (RL) pós treinamento, voltado ao ecossistema Ascend. Os cartões dos modelos informam cerca de 505 bilhões de parâmetros no Pro e 92 bilhões no Flash, com 512 mil tokens de...
Publicado porEditado com GPT-6 LunaImagens geradas com GPT Image 2
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: What did Huawei open-source for openPangu-2.0 on September 28, 2026, and how does the new Ascend-native pretraining, supervised fine-tuning. Article summary: On September 28, 2026, Huawei open-sourced **Ascend-native code for openPangu-2.0 pretraining, supervised fine-tuning (SFT), and post-training reinforcement learning (RL)**. That is a training-stack release: the earlier . Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
A Huawei anunciou em 28 de setembro de 2026 a liberação de código do openPangu-2.0 para pré-treinamento, ajuste fino supervisionado (SFT) e aprendizado por reforço (RL) no pós-treinamento. A mudança amplia o que está disponível para desenvolvedores: antes, os lançamentos das versões Pro e Flash ofereciam pesos dos modelos e recursos de inferência; agora, também há projetos voltados a etapas de treinamento e adaptação. 1
2
27
O projeto openPangu-2.0-Training contempla pré-treinamento e SFT. Já o openPangu-2.0-RL é voltado ao aprendizado por reforço no pós-treinamento. Os dois foram desenvolvidos para o ecossistema de treinamento da Huawei baseado em Ascend. 1
Em outras palavras, não se trata apenas de disponibilizar mais um modelo pronto para uso: o lançamento acrescenta código para trabalhar em fases que ajudam a treinar e adaptar modelos. Ainda assim, o anúncio descreve o foco geral dos projetos, mas não detalha, por si só, todo o poder computacional, os dados ou as configurações necessários para reproduzir os treinamentos originais. 1
Os cartões publicados descrevem as duas versões como modelos de mistura de especialistas (MoE). Os números informados são: 19
27
| Modelo | Parâmetros totais | Parâmetros ativos por token | Janela de contexto | Tokens de pré-treinamento informados |
|---|---|---|---|---|
| openPangu-2.0-Pro | Cerca de 505 bilhões | Cerca de 18 bilhões | 512 mil tokens | Cerca de 34 trilhões |
| openPangu-2.0-Flash | Cerca de 92 bilhões | Cerca de 6 bilhões | 512 mil tokens | Cerca de 34 trilhões |
Os cerca de 34 trilhões de tokens são informados para cada modelo, não como um total combinado das duas versões. 19
27
Os cartões do Pro e do Flash descrevem uma etapa unificada de SFT, planejada para combinar capacidades de raciocínio “lento” e “rápido”. Depois, entram múltiplas etapas de RL especializadas e a destilação de políticas on-line (OPD). Essa descrição apresenta a abordagem de pós-treinamento atribuída aos modelos; a liberação de código anunciada em setembro é uma iniciativa separada. 19
27
1
Os cartões também descrevem uma combinação de atenção latente multi-head (MLA) com camadas de atenção DSA e SWA, em proporção de 1:2. A atenção de janela deslizante (SWA) lida com o contexto local, enquanto as camadas DSA esparsas agregam informações de alcance mais longo. 19
27
Entre outros recursos listados estão uma arquitetura mHC de quatro fluxos, um módulo de predição de múltiplos tokens (MTP) com três cabeças e o otimizador Muon. São características de projeto descritas nos cartões dos modelos, não novidades anunciadas como parte do lançamento de código de setembro. 19
27
Os pesos e o código de inferência já publicados permitem executar os modelos Pro e Flash disponibilizados. Com os novos projetos, desenvolvedores que trabalham no ecossistema Ascend também passam a ter código para explorar pré-treinamento, SFT e RL no pós-treinamento. 1
2
27
O anúncio, porém, não detalha todos os fluxos de trabalho compatíveis nem os requisitos de hardware. Portanto, a liberação amplia as ferramentas disponíveis para trabalhar com o ciclo de vida dos modelos, mas não deve ser confundida com uma garantia de que os treinamentos originais possam ser reproduzidos sem recursos e configurações adicionais. 1
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
Anunciado em 28 de setembro de 2026, o lançamento inclui código para pré treinamento, ajuste fino supervisionado (SFT) e aprendizado por reforço (RL) pós treinamento, voltado ao ecossistema Ascend.
Anunciado em 28 de setembro de 2026, o lançamento inclui código para pré treinamento, ajuste fino supervisionado (SFT) e aprendizado por reforço (RL) pós treinamento, voltado ao ecossistema Ascend. Os cartões dos modelos informam cerca de 505 bilhões de parâmetros no Pro e 92 bilhões no Flash, com 512 mil tokens de contexto e aproximadamente 34 trilhões de tokens de pré treinamento em cada versão.
A novidade permite que desenvolvedores no Ascend explorem etapas de treinamento e adaptação, mas o anúncio não especifica todos os requisitos para reproduzir os treinamentos originais.