Viktig presisering: Reuters' rapport R bruker ikke kodenavnet "M3 Pro" direkte, men The Information og kinesiske kilder som Sina Finance og NetEase bekrefter at den interne betegnelsen er M3 Pro DF1. Det endelige navnet kan endre seg.
MiniMax har hatt en rask utvikling:
| Modell | Lansert | Parametere | Arkitektur | Nøkkelfunksjoner |
|---|---|---|---|---|
| MiniMax-M1 | Juni 2025 | 456B totalt / 45,9B aktive | MoE + hybrid attention | Første åpne vektmodell med hybrid attention; 1M kontekst; Apache 2.0; hevdes å slå DeepSeek R1 på flere oppgaver BPW |
| MiniMax-M3 | 1. juni 2026 | ~428B totalt / ~23B aktive | MoE (Sparse Attention) | Frontend-koding (59,0 % SWE-bench Pro), 1M token kontekst, multimodalt bilde/video/computer-use; åpne vekter på Hugging Face BBP |
| M3 Pro (planlagt) | Tredje kvartal 2026? | 2,7 billioner totalt (antakelig MoE) | TBA | Potensielt verdens største åpne vektmodell R |
Hoppet fra M3's ~428 milliarder parametere til 2,7 billioner er en 6,3-dobling av totalt parametertall. Dersom MiniMax viderefører MoE-arkitekturen, vil antall aktive parametere per forespørsel fortsatt være i titalls- eller hundremilliardersklassen, men det totale fotavtrykket blir enestående for en åpen vektmodell R.
DeepSeek V4 Pro er DeepSeek's flaggskipmodell med åpne vekter, lansert 23. april 2026 D. Nøkkelforskjeller:
De fleste analyser påpeker at MiniMax M3 og DeepSeek V4 Pro "knapt konkurrerer" – de er optimalisert for ulike arbeidsmengder: M3 for multimodale agentoppgaver og langkontekst, V4 Pro for rendyrket tekstbasert algoritmisk koding til lavere kostnad DD.
Kinesiske KI-laboratorier har lansert en rekke kraftige åpne vektmodeller i 2025–2026:
Dette viser en bevisst strategi fra kinesiske KI-laboratorier om å lansere modeller med åpne vekter (ofte under Apache 2.0 eller MIT), i motsetning til mange vestlige laboratorier som holder sine frontend-modeller lukkede RPD.
Den raske strømmen av kinesiske åpne vektmodeller signaliserer flere ting:
En åpen vektmodell med 2,7 billioner parametere byr på ekstreme utfordringer:
MiniMax har imidlertid vist imponerende effektivitetsteknikk – M1 ble trent med 70 % mindre datakraft enn DeepSeek R1 mens den oppnådde konkurransedyktige resultater PW, og M3 bruker sparse attention-mekanismer B. Sannsynligvis vil de bruke tilsvarende innovasjoner for 2,7 billioner-modellen.
Kinesiske åpne vektmodeller har fått stor global utbredelse av flere grunner:
Trenden viser at Kina ikke lenger bare er en maskinvarebegrenset følger innen KI – de er ledende innen utgivelse av åpne vektmodeller, og bruker åpenhet som et konkurransefortrinn mot vestlige lukkede modeller. Den planlagte 2,7 billioner-modellen, dersom den realiseres, vil være det sterkeste signalet så langt.