La tarification de l'API s'établit à 0,14 $ par million de jetons en entrée et 0,28 $ par million de jetons en sortie, avec une entrée en cache à seulement 0,028 $ par million de jetons . Cela fait de V4-Flash l'une des API de raisonnement de pointe les moins chères disponibles — moins chère que Gemini 2.5 Flash à 0,30 $/2,50 $ par million de jetons .
Une version "0731" ré-entraînée, publiée le 31 juillet 2026, constitue la bêta publique officielle de l'API. Cette version surpasserait le modèle V4-Pro-Preview sur les benchmarks d'agents, avec un score de 82,7 sur Terminal Bench 2.1 et de 76,7 sur Cybergym . Le modèle prend en charge des modes de raisonnement configurables (effort de réflexion standard, élevé et maximal) ainsi qu'un mode sans réflexion pour les pipelines à haut débit .
MiniMax a lancé H3 le 31 juillet 2026, le positionnant comme un modèle de génération multimodale généraliste capable de traiter du texte, des images, des vidéos et de l'audio dans un contexte unifié . Le modèle génère jusqu'à 15 secondes de vidéo en résolution 2K (2560 × 1440) à 24 images par seconde avec un son stéréo natif produit lors de la même inférence — aucun pipeline audio séparé n'est nécessaire .
H3 accepte jusqu'à 9 images + 3 clips vidéo + 3 pistes audio comme entrées de référence simultanées . MiniMax s'est engagé à publier les poids du modèle dans les jours suivant le lancement, étendant ainsi l'approche open-weight à la génération vidéo, alors que la plupart des concurrents commerciaux restent propriétaires . La société affirme que le coût par seconde de H3 en résolution 2K est inférieur au tiers de celui de ses rivaux grand public .
ByteDance a annoncé Seedance 2.5 lors de sa conférence Volcano Engine FORCE le 23 juin 2026 , avec un accès public à l'API ouvert le 16 juillet 2026 .
L'amélioration phare : génération vidéo en un seul passage de 30 secondes — un clip complet est produit en une seule génération continue, sans avoir à assembler des segments plus courts . La résolution atteint jusqu'à 4K (3840 × 2160) avec une profondeur de couleur de 10 bits . Le modèle accepte jusqu'à 50 entrées de référence multimodales — images, clips audio, modèles 3D blancs, images de style et directions de scène — contre 12 dans la version précédente .
ByteDance a également publié une fonction d'édition au niveau régional, permettant aux utilisateurs de modifier des zones spécifiques d'un clip généré sans avoir à régénérer l'intégralité de la séquence . Les applications couvrent le cinéma, la publicité, l'éducation, la fabrication industrielle et la simulation de conduite autonome .
Ces trois lancements, concentrés autour du 31 juillet 2026, partagent des thèmes stratégiques communs :
Le cadre original suggérait que ces trois lancements avaient eu lieu le 26 décembre 2024, accompagnés d'affirmations plus larges selon lesquelles les modèles open-source chinois représenteraient 41 % des téléchargements mondiaux et que les États-Unis accuseraient la Chine de distillation de modèles. Les résultats de recherche disponibles ne confirment ni la date de décembre 2024 ni ces statistiques spécifiques. Ces affirmations pourraient concerner des événements antérieurs liés à DeepSeek-V3 ou Qwen, mais cette analyse n'a pas pu les vérifier via les sources fournies.
| Modèle | Date de lancement | Spécifications clés |
|---|---|---|
| DeepSeek V4-Flash | Aperçu : 24 avril 2026 ; Bêta publique : 31 juillet 2026 | 284B MoE (13B actifs), contexte 1M, 0,14 $/M tokens en entrée |
| MiniMax H3 | 31 juillet 2026 | Vidéo 2K de 15 s, son stéréo natif, poids ouverts promis |
| ByteDance Seedance 2.5 | Annoncé le 23 juin 2026 ; API le 16 juillet 2026 | 30 s en un seul passage, 4K, 50 entrées de référence multimodales |
Ces trois modèles — DeepSeek V4-Flash, MiniMax H3 et ByteDance Seedance 2.5 — représentent une accélération coordonnée du secteur chinois de l'IA au milieu de l'année 2026, caractérisée par des coûts plus bas, une distribution open-weight et des capacités de génération considérablement allongées.