DeepSeek V4 est une famille de modèles à poids ouverts, composée de V4 Pro, le modèle le plus puissant, et de V4 Flash, plus rapide et moins coûteux. Les deux modèles proposent une fenêtre de contexte d’un million de tokens et sont disponibles en téléchargement ainsi que via une API.
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What is DeepSeek V4, released as a preview on April 24, 2026, and why does it matter despite being unlikely to replicate the global shock ca. Article summary: DeepSeek V4 is DeepSeek’s open weight, preview generation model family: a large frontier oriented model (V4 Pro) and a smaller, faster model (V4 Flash).. Topic tags: general web, llm, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thumbnails, icons, and tiny thumbnail layout
DeepSeek V4 est la nouvelle famille de modèles de langage à poids ouverts de la start-up chinoise DeepSeek. Présentée en avant-première le 24 avril 2026, elle se décline en deux versions : V4-Pro, conçue pour les tâches exigeantes, et V4-Flash, plus légère, plus rapide et destinée aux usages à grande échelle. 1415
Les deux modèles reposent sur une architecture Mixture of Experts — ou mélange d’experts — qui n’active qu’une partie du réseau pour chaque token traité :
À titre indicatif, un million de tokens peut représenter plusieurs centaines de milliers de mots, selon la langue et la nature du texte. Cette capacité permet de travailler avec de très grands dépôts de code, des corpus documentaires volumineux ou l’historique complet d’un agent logiciel.
V4-Pro est le modèle vitrine de DeepSeek. Il vise le raisonnement complexe, la programmation, les agents capables d’utiliser des outils et les tâches où plusieurs étapes doivent être enchaînées. DeepSeek affirme qu’il rivalise avec les meilleurs modèles propriétaires du marché et qu’il obtient d’excellents résultats dans les évaluations de raisonnement, de connaissances et de codage. 1415
V4-Flash poursuit une autre logique : activer beaucoup moins de paramètres afin de réduire la latence et le coût de fonctionnement. Il est donc mieux adapté aux applications qui doivent traiter un grand volume de requêtes, comme l’assistance au développement, le classement de documents ou certains services automatisés.
La différence importante est que DeepSeek ne réserve pas ces modèles à un service en ligne fermé. Les poids sont téléchargeables et les deux versions sont également accessibles via une API. Les développeurs peuvent ainsi choisir entre un déploiement contrôlé sur leur propre infrastructure et un accès hébergé à la demande. 1415
Les tarifs annoncés pour l’API sont particulièrement bas : des sources spécialisées ont rapporté environ 1,74 dollar par million de tokens en entrée et 3,48 dollars en sortie pour V4-Pro, contre 0,14 dollar en entrée et 0,28 dollar en sortie pour V4-Flash. Ces montants correspondent toutefois à la preview et peuvent évoluer. 8
DeepSeek présente V4 comme un modèle de pointe en matière de raisonnement, de connaissances générales, de programmation et de capacités « agentiques », c’est-à-dire d’exécution de tâches à l’aide d’outils et d’actions successives. Le laboratoire revendique notamment un niveau de performance proche des meilleurs modèles propriétaires et des résultats de premier plan parmi les modèles ouverts. 1415
Il faut néanmoins distinguer une annonce de laboratoire d’une validation indépendante. V4 étant encore une version preview, ses résultats ne suffisent pas à établir une équivalence générale avec Claude, Gemini ou d’autres modèles fermés. Les performances peuvent varier selon les langues, les logiciels utilisés, la longueur des tâches et les besoins de fiabilité d’une entreprise.
Pour les développeurs, l’intérêt est déjà concret : DeepSeek positionne V4 pour le codage et les agents utilisant des outils, avec des intégrations ou des modes d’utilisation prévus pour des environnements comme Claude Code, OpenClaw et CodeBuddy. Cette compatibilité signifie qu’il est possible de tester une solution moins chère, accessible par API ou auto-hébergeable ; elle ne prouve pas que V4 atteint la même qualité dans tous les scénarios. 14
La fenêtre de contexte n’est pas seulement un chiffre spectaculaire. Pour exploiter réellement un million de tokens, un modèle doit pouvoir conserver et retrouver l’information utile sans multiplier démesurément les calculs et la mémoire nécessaires.
DeepSeek V4 utilise pour cela une forme d’attention hybride et sélective. Les éléments récents ou importants sont traités plus finement, tandis que les informations plus anciennes peuvent être compressées dans une représentation mémoire plus compacte. L’objectif est de limiter les calculs et la mémoire dite KV cache, utilisée pour conserver les éléments déjà traités pendant la génération.
Selon DeepSeek et Hugging Face, avec un contexte d’un million de tokens, V4-Pro n’aurait besoin que de 27 % des opérations d’inférence par token de V3.2 et de 10 % de sa mémoire KV cache. Pour V4-Flash, ces proportions seraient respectivement de 10 % et 7 %. 16
Si ces chiffres se confirment sur des charges de travail réelles, ils pourraient rendre plus abordables les agents qui travaillent longtemps, l’analyse de bases de code persistantes et l’exploitation de vastes archives de recherche. La promesse de V4 n’est donc pas seulement de « lire plus », mais de le faire à un coût suffisamment faible pour que cette capacité soit utilisable en production.
L’enjeu le plus stratégique de V4 se trouve peut-être en dehors du modèle lui-même. Il s’agit du premier grand modèle DeepSeek adapté aux puces Ascend de Huawei, plutôt que d’être principalement pensé pour les processeurs graphiques de Nvidia. Cette évolution intervient alors que les restrictions américaines à l’exportation compliquent l’accès de la Chine aux accélérateurs d’IA les plus avancés. 23
Un modèle performant qui fonctionne efficacement sur du matériel chinois contribue à valider une chaîne nationale complète : modèle, processeur, interconnexions, compilateurs, bibliothèques et services cloud. Cela rejoint l’objectif de Pékin de réduire sa dépendance technologique et de construire un écosystème d’IA davantage autonome.
Reuters a par ailleurs rapporté une forte demande pour les puces Ascend 950 de Huawei après le lancement de V4, des entreprises chinoises cherchant à sécuriser des capacités de calcul. 17
L’hypothèse la plus intéressante est celle de systèmes à l’échelle d’un « supernœud » : si ces configurations offrent des performances utilisables, des outils logiciels suffisamment matures, une chaîne d’approvisionnement fiable et un coût total inférieur, elles pourraient amplifier les gains d’efficacité de V4 et faire émerger une infrastructure chinoise parallèle. C’est une trajectoire stratégique plausible, pas encore un remplacement démontré de l’infrastructure mondiale dominée par Nvidia.
Faire fonctionner un modèle sur une puce Ascend ne revient pas à remplacer Nvidia. La force de Nvidia ne tient pas uniquement à la puissance brute de ses GPU. Elle repose aussi sur les interconnexions entre processeurs, l’écosystème logiciel CUDA, les bibliothèques optimisées, les outils de développement, les compétences disponibles et l’intégration dans les principaux services cloud.
Les informations publiques ne permettent pas non plus d’établir quelle proportion de l’entraînement complet de V4 a été réalisée sur des puces chinoises, par opposition à l’optimisation du modèle ou à son exécution en inférence. Les affirmations selon lesquelles l’intégralité de l’entraînement aurait été réalisée sur du matériel national doivent donc être considérées comme non vérifiées. 23
Le véritable test sera celui de la durée : Huawei devra démontrer que ses puces peuvent être produites en volume, exploitées avec des logiciels suffisamment performants et utilisées par des équipes qui connaissent aujourd’hui très bien l’environnement Nvidia.
DeepSeek R1 avait surpris le marché en montrant qu’un laboratoire chinois pouvait proposer un modèle de raisonnement performant à un coût présenté comme très inférieur aux attentes. À l’époque, cette démonstration a remis en cause plusieurs hypothèses sur le prix du calcul et l’avance des acteurs américains.
V4 arrive dans un paysage différent. Les investisseurs, les chercheurs et les développeurs savent désormais que des modèles chinois ouverts et bon marché peuvent être compétitifs. L’effet de surprise est donc mécaniquement moindre.
Son importance pourrait toutefois être plus profonde sur le plan opérationnel. V4 réunit quatre éléments :
En résumé : R1 a changé la perception du marché ; V4 pourrait changer les conditions d’exploitation. Son enjeu n’est pas nécessairement de provoquer un nouveau choc boursier, mais de montrer qu’un modèle ouvert, efficace et orienté vers les agents peut s’inscrire dans une pile technologique contrôlée en Chine — même si cette pile est encore loin d’avoir démontré qu’elle pouvait supplanter l’écosystème Nvidia.
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
DeepSeek V4 est une famille de modèles à poids ouverts, composée de V4 Pro, le modèle le plus puissant, et de V4 Flash, plus rapide et moins coûteux.
DeepSeek V4 est une famille de modèles à poids ouverts, composée de V4 Pro, le modèle le plus puissant, et de V4 Flash, plus rapide et moins coûteux. Les deux modèles proposent une fenêtre de contexte d’un million de tokens et sont disponibles en téléchargement ainsi que via une API.
DeepSeek revendique des performances proches des meilleurs modèles propriétaires en raisonnement, en programmation et dans les tâches d’agent — des affirmations qui devront encore être vérifiées par des évaluations in...