Mas há uma ressalva importante: o número ainda é uma meta, não uma especificação final. O modelo está nos primeiros estágios do pré-treinamento, a contagem definitiva de parâmetros não foi decidida e a informação ainda não foi confirmada de forma independente pela Reuters .
Segundo reportagem do Financial Times publicada em 7 de agosto de 2026, a ByteDance iniciou o treinamento de um grande modelo de linguagem com até 10 trilhões de parâmetros . O pré-treinamento costuma durar de três a seis meses antes das etapas de ajuste fino e preparação para uma eventual distribuição .
Na prática, isso significa que ainda pode levar tempo até que qualquer versão seja disponibilizada ao público. A ByteDance também avalia se levará o treinamento até o teto de 10 trilhões. Uma reportagem anterior do LatePost mencionava um modelo com mais de 5 trilhões de parâmetros, o que sugere que o escopo do projeto pode ter aumentado .
Caso a ByteDance atinja a marca anunciada, seu modelo entrará no grupo dos maiores projetos de IA conhecidos atualmente:
| Modelo | Parâmetros estimados | Situação ou observação |
|---|---|---|
| Novo modelo da ByteDance | Até 10 trilhões | Em pré-treinamento; seria o maior modelo conhecido já tentado por uma empresa chinesa |
| Anthropic Claude Mythos 5 | Cerca de 8 trilhões | Já lançado, mas com os recursos mais avançados restritos a organizações selecionadas nos Estados Unidos |
| Moonshot AI Kimi K3 | 2,8 trilhões | O projeto da ByteDance teria mais de três vezes essa escala |
| Modelo principal da OpenAI | Não divulgado; estimado na casa dos trilhões | A empresa não informa publicamente a contagem exata |
O Claude Fable 5, versão voltada a um público mais amplo, foi lançado em junho de 2026 com salvaguardas para limitar o uso em áreas sensíveis. Já o Mythos 5 permaneceu associado ao Project Glasswing, voltado a um grupo restrito de organizações avaliadas .
Ainda assim, comparar modelos apenas pelo número de parâmetros pode levar a conclusões erradas. Essa métrica descreve principalmente a escala da arquitetura, e não mede sozinha a qualidade das respostas, a eficiência ou a capacidade prática do sistema.
O número de 10 trilhões se refere, segundo os relatos, ao total de parâmetros da arquitetura. Modelos de ponta frequentemente usam uma abordagem chamada Mixture-of-Experts (MoE), ou mistura de especialistas. Nela, apenas uma parte dos parâmetros é ativada para processar cada solicitação.
Assim, um modelo com 10 trilhões de parâmetros totais poderia usar apenas uma fração — por exemplo, 1 ou 2 trilhões — em cada inferência. A taxa exata de ativação é um dos fatores que determinarão quanto o sistema realmente se compara ao Mythos 5 .
Por isso, o número anunciado não deve ser interpretado como uma garantia de desempenho superior. Sem conhecer a arquitetura completa, a quantidade de parâmetros ativos, os dados de treinamento e os resultados de testes independentes, a comparação permanece limitada.
O fundador da ByteDance, Zhang Yiming, teria orientado a equipe Seed a não usar a chamada destilação de modelos para desenvolver o novo sistema, mesmo que isso faça a empresa ficar temporariamente atrás de rivais domésticos .
Na destilação, um modelo menor aprende a partir das respostas produzidas por um modelo maior e mais avançado. A técnica pode acelerar o desenvolvimento, mas se tornou alvo de disputas no setor de IA por envolver o uso dos resultados de sistemas concorrentes.
Relatos indicam que Zhang reiterou a posição em uma reunião de gestão por volta de 6 de agosto de 2026. A orientação foi apresentada como uma aposta de longo prazo, baseada em desenvolvimento independente e na disposição de abrir mão de ganhos imediatos . A relação regulatória delicada da ByteDance com o governo dos Estados Unidos, especialmente por causa do TikTok, também teria influenciado a decisão e o desejo de reduzir riscos jurídicos e ligados a controles de exportação .
A ByteDance criou a divisão Seed no início de 2023, após a repercussão do lançamento do ChatGPT . A equipe se tornou o núcleo de pesquisa da empresa em modelos fundamentais — sistemas que servem de base para diferentes aplicações de IA.
Os principais dados conhecidos são:
A escala do modelo coloca a ByteDance no centro da competição entre laboratórios chineses e americanos por sistemas de fronteira — os modelos mais avançados disponíveis em cada momento .
O projeto também enfrenta obstáculos práticos. Os Estados Unidos impuseram controles à exportação de chips avançados de IA para a China, o que força empresas chinesas a recorrer a hardware doméstico e a estoques acumulados . A infraestrutura necessária para treinar um modelo desse porte representa, portanto, um desafio técnico e financeiro relevante.
A iniciativa ocorre depois do impacto do DeepSeek R1, lançado em janeiro de 2025. O modelo reforçou a percepção de que laboratórios chineses podem alcançar resultados competitivos em relação à fronteira tecnológica mesmo sob restrições de acesso a chips .
Enquanto isso, o próprio Mythos 5 passou a ser tratado como um ativo estratégico nos Estados Unidos. Em junho de 2026, o acesso às suas capacidades mais sensíveis foi suspenso brevemente por questões de segurança nacional e depois parcialmente restaurado para organizações consideradas confiáveis .
A empresa ainda não informou se o modelo de 10 trilhões de parâmetros será lançado publicamente. Até agora, sua estratégia predominante tem sido manter os principais modelos fechados e integrá-los diretamente a produtos próprios, em vez de distribuí-los como projetos de código aberto.
O principal nome da ByteDance no mercado de consumo é o Doubao (豆包), que incorpora modelos da série Seed em recursos de conversa, assistência e geração de conteúdo . Entre as prioridades de IA da empresa para 2026 estão também os modelos de mundo, com a meta de alcançar desempenho comparável ao Genie 3, do Google, até o fim do ano; o agente de programação Seedance; e a expansão comercial do Doubao .
Se for concluído, o modelo de 10 trilhões provavelmente servirá como base para o Doubao e para outros produtos internos, em vez de ser disponibilizado como um modelo aberto independente. Essa, porém, é uma possibilidade baseada na estratégia atual da empresa, não uma decisão anunciada pela ByteDance.
A iniciativa representa uma aposta de longo prazo em IA de escala de fronteira, mas ainda não equivale ao lançamento de um novo concorrente pronto para uso. O projeto está no início do pré-treinamento, a contagem final pode ser menor que 10 trilhões e não há confirmação independente sobre todos os detalhes.
O aspecto estratégico é tão importante quanto o número: a ByteDance tenta construir capacidade própria, sem depender da destilação de modelos rivais, ao mesmo tempo que amplia sua infraestrutura e concentra esforços na divisão Seed. O resultado final — em desempenho, eficiência e disponibilidade — só poderá ser avaliado quando o treinamento terminar e houver testes verificáveis.