V4 Flash constitue le volet orienté efficacité de la famille DeepSeek V4. Il cible les usages à fort volume et sensibles à la latence : conversation, extraction, classification, assistance au code et agents logiciels.
Son architecture MoE donne au modèle accès à un vaste ensemble d’experts spécialisés, tout en limitant le calcul mobilisé à chaque étape. Sur les 284 milliards de paramètres du modèle, 13 milliards seulement sont actifs par token . Le dépôt peut atteindre 304 milliards de paramètres si l’on inclut le module DSpark de génération spéculative .
| Caractéristique | Valeur |
|---|---|
| Paramètres totaux | 284 milliards |
| Paramètres actifs | 13 milliards par token |
| Architecture | Mixture-of-Experts (MoE) |
| Fenêtre de contexte | 1 million de tokens |
| Sortie maximale | 384 000 tokens |
| Précision | FP4 + FP8 mixte |
| Licence | MIT |
| Taille du téléchargement | Environ 160 Go |
Sources :
V4 Flash et V4 Pro sont distribués avec des poids ouverts sous licence MIT. Cette licence autorise l’utilisation commerciale, la modification et la redistribution sans redevances, sous réserve du respect des conditions habituelles de la licence .
Les poids sont disponibles sur Hugging Face et peuvent être hébergés sur une infrastructure privée. Pour les entreprises, cela ouvre plusieurs possibilités : déployer le modèle dans leur propre environnement, l’adapter à un domaine précis ou construire un produit commercial sans dépendre exclusivement d’une API externe.
La licence ne supprime toutefois pas les contraintes techniques. En FP8, les poids seuls représentent environ 284 Go. Pour exploiter pleinement le contexte d’un million de tokens, une configuration de quatre GPU NVIDIA H200 SXM5, soit 564 Go de mémoire vidéo au total, est recommandée .
La fenêtre de contexte exceptionnelle de V4 Flash repose sur une architecture d’attention hybride qui combine deux mécanismes de compression.
La Compressed Sparse Attention (CSA) compresse les entrées clé-valeur selon un ratio de 4:1 sur la longueur de la séquence, grâce à un regroupement piloté par softmax. Un indexeur baptisé « Lightning Indexer », exécuté en FP4, sélectionne ensuite les 512 blocs compressés les plus pertinents pour chaque requête .
L’objectif est de réduire fortement le nombre d’éléments examinés sans perdre les informations les plus utiles au raisonnement.
La Heavily Compressed Attention (HCA) applique une compression de 128:1 pour les contextes extrêmement longs. Cette branche est dense : elle ne réalise pas de sélection sparse et prend en charge une grande partie de l’historique compressé .
Les couches CSA et HCA alternent dans le modèle. À partir de la deuxième couche, les couches paires utilisent la compression 4:1 de CSA ; à partir de la troisième, les couches impaires utilisent HCA et son ratio de 128:1. Une fenêtre glissante portant sur les 128 derniers tokens bruts reste toujours disponible afin de préserver les informations les plus récentes .
Le point de contrôle de V4 Flash combine plusieurs formats numériques :
nvidia/DeepSeek-V4-Flash-NVFP4 .Cette approche réduit le volume de données à transférer et à conserver en mémoire par rapport à un modèle entièrement stocké en FP8. Elle ne rend pas pour autant le modèle léger : même quantifié, V4 Flash reste destiné en priorité aux fournisseurs d’inférence et aux équipes disposant d’une infrastructure GPU conséquente.
DeepSeek V4 Flash expose le paramètre configurable reasoning_effort. Les développeurs peuvent ainsi ajuster le compromis entre rapidité, coût et profondeur d’analyse :
Pour une application, cette granularité peut permettre d’utiliser le mode rapide pour le tri ou la classification, puis de réserver les modes plus coûteux aux étapes qui exigent véritablement plusieurs cycles de raisonnement .
L’API DeepSeek V4 Flash est facturée 0,14 $ par million de tokens d’entrée en cas de défaut de cache, et 0,28 $ par million de tokens de sortie . Lorsque l’entrée est déjà en cache — par exemple un prompt système ou un préambule fréquemment réutilisé — le tarif descend à 0,0028 $ par million de tokens, soit une réduction de 98 % .
À titre de comparaison, le coût de sortie annoncé pour V4 Flash est 54 fois inférieur à celui de Sonnet 4.6, à 15 $ par million de tokens, et 107 fois inférieur à celui de GPT-5.5, à 30 $ . Plusieurs analyses le décrivent ainsi comme l’API de niveau frontier la moins chère disponible .
Pour les développeurs, l’enjeu est moins le prix d’une requête isolée que la possibilité de multiplier les appels : vérification de code, routage entre modèles, extraction de données ou exécution de tâches agentiques peuvent devenir des opérations d’infrastructure plutôt que des fonctions premium.
La version de production V4-Flash-0731 n’introduit pas une nouvelle architecture. Les gains annoncés proviennent principalement d’un post-entraînement supplémentaire . Le journal de mise à jour officiel indique notamment les résultats suivants :
DeepSeek affirme que cette version atteint désormais un niveau comparable à celui de V4 Pro sur les benchmarks de programmation et d’agents . Le traditionnel classement « Pro plus puissant, Flash plus rapide » devient donc moins évident pour certaines tâches agentiques .
Les sources examinées ne permettent toutefois pas de confirmer un score précis sur SWE-bench pour V4-Flash-0731 . Les chiffres disponibles doivent donc être lus dans le contexte des benchmarks et des conditions de test concernés, plutôt que comme une preuve générale de supériorité sur tous les modèles concurrents.
Le lancement de DeepSeek Harness montre que l’entreprise cherche à aller au-delà du seul modèle de langage. Un harness est une couche logicielle qui orchestre l’exécution d’un agent : elle peut gérer le contexte, appeler des outils, suivre l’état d’une tâche et coordonner plusieurs étapes.
Le nom DeepSeek Harness est apparu dans le journal de modifications de V4-Flash-0731, accompagné de la mention « à paraître prochainement » . Le 1er août 2026, DeepSeek a invité des développeurs de projets open source liés aux frameworks d’agents à participer à une bêta fermée . Les candidats doivent fournir leur identifiant GitHub et des exemples de travaux représentatifs .
L’équipe d’ingénierie de Harness aurait été constituée en mars 2026, au moment de l’arrivée de Cui Tianyi chez DeepSeek . Les informations plus précises concernant ses fonctions antérieures, notamment chez TSY Capital et Jane Street, reposent toutefois sur une seule publication et n’ont pas été corroborées indépendamment dans les sources examinées.
Aucune date publique de lancement de DeepSeek Harness n’a été annoncée . Pour l’instant, il faut donc le considérer comme un projet en phase de test, et non comme un produit disponible au public.
La stratégie attribuée à Liang Wenfeng, PDG de DeepSeek, met l’accent sur des modèles à la fois abordables et performants, présentés comme une voie vers l’intelligence artificielle générale . Deux choix illustrent concrètement cette orientation :
DeepSeek évolue face à Alibaba et sa famille Qwen, ByteDance et Doubao, Moonshot AI, MiniMax et Z.AI . La famille V4 se distingue, selon plusieurs sources, par la combinaison d’une fenêtre de contexte d’un million de tokens et de poids ouverts sous licence MIT .
Des informations font également état de préparatifs en vue d’une introduction en Bourse, mais ni le calendrier ni les éventuels établissements chargés de l’opération n’ont été confirmés .
Les informations disponibles dessinent un tableau clair de V4 Flash, mais plusieurs éléments doivent être présentés avec prudence :
Le signal le plus important est ailleurs : DeepSeek ne cherche pas seulement à proposer un modèle moins cher. Avec V4 Flash, la licence MIT, le contexte d’un million de tokens, les contrôles de raisonnement et le projet Harness, l’entreprise tente de rendre toute la chaîne de l’IA agentique — du modèle à l’exécution — plus ouverte et moins coûteuse.