| Variante | Paramètres totaux | Paramètres actifs | Fenêtre de contexte | Sortie max |
|---|---|---|---|---|
| V4-Pro | 1,6 billion (MoE) | ~49B par token | 1M tokens | 384K tokens |
| V4-Flash | 284 milliards (MoE) | ~13B par token | 1M tokens | 384K tokens |
Les deux variantes sont multimodales (texte, image, vidéo), prennent en charge la sortie JSON et les appels d'outils, et sont disponibles via API et sur le web .
| Variante | Entrée (hors pointe) | Sortie (hors pointe) | Cache réussi |
|---|---|---|---|
| V4-Pro | 0,435 $ | 0,87 $ | 90 % de réduction |
| V4-Flash | 0,14 $ | 0,28 $ | 90 % de réduction |
DeepSeek a également proposé une promotion de 75 % sur V4-Pro jusqu'au début mai 2026 . À titre de comparaison, le prix de sortie de GPT-5.5 est d'environ 30 $/MTok, ce qui rend V4-Flash environ 107 fois moins cher en sortie .
Les résultats des benchmarks de DeepSeek V4 racontent une histoire nuancée :
Mise en garde importante de l'évaluation NIST CAISI (mai 2026) : Les benchmarks auto-déclarés par DeepSeek revendiquent une parité avec GPT-5.4 et Opus 4.6, mais l'évaluation indépendante de CAISI a révélé que V4 est « nettement moins performant » sur des benchmarks non publics, ce qui suggère que certains scores auto-déclarés pourraient être gonflés . L'indice d'intelligence d'Artificial Analysis attribue à GPT-5.5 (high) une note de 53 contre 41* pour DeepSeek V4 Pro (Reasoning, High Effort) — GPT-5.5 est plus intelligent et plus rapide (69 tok/s contre 56 tok/s), mais DeepSeek est dramatiquement moins cher (0,18 $ contre 4,35 $/MTok en mode raisonnement) .
L'équipe Qwen d'Alibaba a présenté Qwen 3.8 Max à la World AI Conference de Shanghai le 19 juillet 2026 . C'est le premier modèle phare de l'équipe à dépasser 1 billion de paramètres.
| Attribut | Détail |
|---|---|
| Paramètres totaux | 2,4 billions (MoE sparse) |
| Architecture | Mixture-of-Experts, multimodal (texte + vision confirmée) |
| Fenêtre de contexte | 983 616 tokens via le point d'accès Qwen Cloud ; ~1M dans certaines sources |
| Sortie max | 64 000 tokens |
| Licence | Pas encore publiée ; Alibaba indique une ouverture des poids « bientôt » |
Aucun tarif à l'utilisation n'a été publié. L'accès se fait actuellement par abonnement via Qwen Chat et des partenaires API sélectionnés. BenchLM liste le prix de l'aperçu Qwen 3.8 Max Preview comme « Non listé » . Certains observateurs tiers affichent un tarif automatique de 1,50 $/5,00 $ par million de tokens d'entrée/sortie, mais cela n'est pas confirmé par Alibaba .
Alibaba déclare que Qwen 3.8 est « juste derrière Fable 5 » (le meilleur modèle Claude d'Anthropic), ce qui, dans le classement d'Alibaba, le placerait devant GPT-5.5 et DeepSeek V4 . Des gains sont revendiqués en codage, productivité professionnelle, développement full-stack, analyse de données et workflows de bureau par rapport à Qwen 3.7 Max .
Cependant, aucun benchmark indépendant n'a été publié. BenchLM, un site de suivi des benchmarks, suit 321 benchmarks pour Qwen 3.8 Max Preview avec 0 résultat vérifié au 20 juillet 2026 . Comme le résume une analyse : « Qwen 3.8 mérite d'être testé, mais il est trop tôt pour le considérer comme un remplacement stable en production pour Kimi K3, GPT-5.6 Sol ou Claude Fable 5 » .
Pour contexte, les prédécesseurs de Qwen ont posé des bases solides : Qwen 3.6-Max-Preview (20 avril 2026) était un modèle textuel de 35B de paramètres totaux / 3B actifs avec un contexte de 262K, revendiquant la première place sur six benchmarks de codage et d'agents . Qwen 3.7-Max (mai 2026) a étendu la fenêtre de contexte à 1M de tokens avec des capacités agentiques de raisonnement . Mais aucun n'était généralement considéré comme étant au niveau des modèles de frontière, en dehors du codage agentique.
Alibaba positionne explicitement Qwen 3.8 comme « juste derrière Fable 5 » . Si cette affirmation se vérifie lors d'évaluations indépendantes, elle placerait Qwen 3.8 devant GPT-5.5 et bien au-dessus de DeepSeek V4. Mais sans aucun benchmark vérifié, cela reste une affirmation marketing, pas un fait établi. Le Fable 5 d'Anthropic semble être le leader actuel reconnu de la frontière, selon le propre cadre d'Alibaba .
La tarification agressive de DeepSeek a déclenché une course vers le bas des coûts d'API. V4-Flash à 0,14 $/M en entrée est radicalement moins cher que n'importe quel modèle occidental de frontière. Alibaba n'a pas encore fixé le prix de Qwen 3.8, mais Qwen 3.6 était déjà proposé à un prix agressif (~1,25 $/7,50 $ entrée/sortie) .
La licence MIT pour DeepSeek V4 signifie que l'auto-hébergement est également possible, comprimant encore davantage les marges des fournisseurs propriétaires . Comme le résume une analyse, l'effet pratique est que « les développeurs peuvent désormais accéder à des capacités proches de la frontière (pour les tâches de codage) à une fraction du coût de GPT-5.5 ou Claude ».