A MiniMax disponibilizou em 3 de agosto de 2026 os pesos do H3 Base: um Transformer denso de 33 bilhões de parâmetros que gera vídeo em 768p com áudio estéreo sincronizado. O sistema H3 completo aceita texto, imagens, vídeo e áudio, mas as etapas Context IR e Regenerate 2K não fizeram parte da liberação de pesos.
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: What did MiniMax’s August 2026 open-weight release of H3-Base on Hugging Face include—covering H3’s 33B-parameter dense single-stream H3-Omn. Article summary: MiniMax’s August 3, 2026 Hugging Face release made the **H3-Base generation weights** available, not the entire three-stage H3 system. It brought a large multimodal, audio-native video model into local and customizable w. Topic tags: general, education, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, cha
A liberação da MiniMax no Hugging Face, em agosto de 2026, deve ser entendida como a abertura dos pesos do H3-Base — a etapa de geração do sistema H3 — e não como a publicação de todos os modelos necessários para reproduzir o serviço hospedado da empresa de ponta a ponta.
Na prática, o H3-Base gera vídeo e áudio sincronizados em 768p. Já o processamento avançado de contexto e a etapa de regeneração em 2K continuam separados e não foram abertos. 1
5
A MiniMax publicou os pesos do H3 no Hugging Face em 3 de agosto de 2026. A versão disponível se concentra no H3-Base, incluindo pesos de tarefas FL2VA e Ref2VA. 1
13
O núcleo é o H3-Omni-Transformer, um Transformer denso de fluxo único com 33 bilhões de parâmetros. Em vez de gerar a trilha sonora depois do vídeo, o modelo trata áudio e imagem no mesmo processo de geração, fazendo a remoção conjunta de ruído dos dois sinais.
O H3 pode trabalhar com um contexto multimodal que combina texto, imagens, vídeos e áudio, produzindo vídeo com som estéreo nativo. 5
10
Há uma ressalva técnica importante: os 33 bilhões de parâmetros se referem ao núcleo gerador H3-Omni-Transformer, e não necessariamente a tudo que precisa ser carregado numa implantação completa. O pipeline também inclui um encoder H3, além de componentes VisualVAE e AudioVAE. 10
13
A MiniMax descreve o H3 como um sistema dividido em três módulos:
Esse ponto evita uma confusão comum: instalar o H3-Base localmente não equivale a ter todo o produto H3 exibido em demonstrações de 2K. O sistema completo suporta vídeos de até 15 segundos e resolução de até 2K, mas o gerador aberto é a etapa de 768p. 5
9
O diferencial central do H3 é a geração de vídeo e áudio em um único fluxo. O H3-Omni-Transformer, com 33 bilhões de parâmetros, usa arquitetura Transformer densa. Cerca de 13 bilhões de parâmetros estão em ramificações relacionadas a AdaLN; as saídas dessa parte podem ser pré-calculadas e armazenadas em cache. 10
O pipeline de representação inclui encoder, VAE visual e VAE de áudio. As descrições técnicas reportadas indicam que o VAE visual comprime o vídeo em 16 vezes no espaço e 4 vezes no tempo. O desenho de tokenização chega a uma redução espacial efetiva de 32 vezes. 1
14
Essas etapas de compressão são fundamentais para tornar a geração de vídeo viável, mas também explicam por que o número de 33 bilhões, sozinho, não resume o tamanho do pipeline nem sua exigência computacional.
O H3 completo foi projetado para receber combinações de texto, imagens estáticas, clipes de vídeo e áudio como referências. Pode produzir clipes com áudio estéreo nativo, em até 2K e com duração de até 15 segundos. 5
10
Os pesos do H3-Base abrem espaço para inferência local, quantização, adaptadores, estudos de ajuste fino e ferramentas criativas próprias. Mas eles não incluem o Context-IR nem o modelo de regeneração em 2K. Portanto:
Coberturas publicadas apontaram preço de 0,8 yuan por segundo para geração em 2K pela API, com entrada de áudio gratuita e as primeiras cinco imagens de referência sem cobrança na oferta mencionada. 14
27
Esses valores devem ser lidos como preço de API divulgado naquele momento, não como tabela global permanente: serviços, regiões e condições comerciais podem variar.
Materiais promocionais da MiniMax e do SGLang também afirmaram que o H3 custaria cerca de um terço do Seedance 2.0 em uma comparação específica e poderia rodar localmente em duas RTX 5090 ou uma RTX 6000. 28
31
Isso não representa um requisito mínimo universal. São alegações de implantação ligadas a determinada combinação de software, precisão numérica e descarregamento de memória. Além do Transformer de 33 bilhões de parâmetros, a carga de trabalho inclui encoder e VAEs. 13
Uma operação auto-hospedada pode manter imagens de produtos, filmagens ainda não lançadas, vozes e prompts dentro da própria organização, sem enviá-los a uma API externa de geração. Isso pode ser relevante para equipes que trabalham com materiais confidenciais.
Ainda assim, rodar localmente não elimina a necessidade de controles de acesso, verificação dos direitos sobre os materiais de entrada, revisão das saídas e governança interna.
Pesos abertos permitem conectar a geração a bibliotecas de ativos, sistemas de aprovação criativa, ferramentas de renderização e pós-produção. Também facilitam testes de quantização e adaptações voltadas a tarefas específicas.
Antes de adotar o modelo, porém, organizações devem revisar a licença. Reportagens de terceiros descrevem restrições geográficas para uso local nos Estados Unidos, na União Europeia, no Reino Unido e na Coreia do Sul. 4
O caso de uso mais direto está em equipes que produzem muitas variações curtas: peças publicitárias, vídeos de produto para e-commerce, conceitos visuais, animatics e testes para redes sociais.
Um gerador local em 768p com áudio integrado pode reduzir o atrito nas primeiras rodadas criativas, especialmente para equipes que já dispõem de GPUs compatíveis. Mas não é substituto pronto para qualquer demanda audiovisual: faltam as etapas abertas de contexto e 2K, e vídeos curtos gerados por IA continuam exigindo revisão humana, edição e gestão de direitos.
A MiniMax abriu uma parte relevante do H3: o H3-Base, baseado em um Transformer de fluxo único com 33 bilhões de parâmetros, capaz de gerar conjuntamente vídeo e áudio estéreo nativo.
Mas a abertura é menor do que o sistema H3 completo pode sugerir. Context-IR e Regenerate-2K permaneceram fechados. Por isso, o H3-Base é uma fundação personalizável de geração em 768p — não um sistema aberto completo de vídeo em 2K. 5
9
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
A MiniMax disponibilizou em 3 de agosto de 2026 os pesos do H3 Base: um Transformer denso de 33 bilhões de parâmetros que gera vídeo em 768p com áudio estéreo sincronizado.
A MiniMax disponibilizou em 3 de agosto de 2026 os pesos do H3 Base: um Transformer denso de 33 bilhões de parâmetros que gera vídeo em 768p com áudio estéreo sincronizado. O sistema H3 completo aceita texto, imagens, vídeo e áudio, mas as etapas Context IR e Regenerate 2K não fizeram parte da liberação de pesos.
A abertura permite testes locais e integração a fluxos próprios, porém equipes precisam avaliar licença, hardware e as limitações para não confundir o H3 Base com uma solução local completa em 2K.