DeepSeek V4.1 Flash accepte jusqu’à un million de tokens de contexte, sans garantir pour autant le rappel fiable de chaque détail. Son architecture active environ 8 milliards de paramètres par token lors de la lecture de l’entrée, contre 16 milliards lors de la génération ; CSA2 et le stockage FP4 réduisent aussi la...
Publié parModifié avec GPT-6 SolImages générées avec GPT Image 2
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What is DeepSeek-V4.1-Flash, and how do its 552B-parameter multimodal Causal Encoder–Decoder MoE architecture, 20-layer encoder and 20-layer. Article summary: DeepSeek-V4.1-Flash is DeepSeek’s multimodal, open-weight MoE model designed for long, input-heavy agent sessions. It supports contexts of up to one million tokens while reducing the computation and KV-cache storage need. Topic tags: general, academic, documentation, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, chart
Pour un agent qui consulte un long historique, des documents et parfois des images avant de répondre, la question n’est pas seulement de faire entrer un million de tokens dans la fenêtre de contexte. Il faut aussi traiter cette entrée et conserver les informations utiles sans faire exploser les besoins en mémoire. C’est le pari de DeepSeek-V4.1-Flash, un modèle multimodal à poids ouverts fondé sur une architecture à mélange d’experts (Mixture-of-Experts, ou MoE). Sa limite annoncée d’un million de tokens ne signifie toutefois pas qu’il retrouvera à coup sûr chaque détail d’une session aussi longue. 2
8
La lecture et l’écriture ne mobilisent pas les mêmes ressources. Le cœur du modèle compte 552 milliards de paramètres et 40 couches : 20 pour un encodeur causal, puis 20 pour un décodeur. Le cache de clés et valeurs, dit cache KV, utilisé par le décodeur est projeté à partir des états finaux de l’encodeur, plutôt que produit séparément par chaque couche du décodeur. Selon DeepSeek, environ 8 milliards de paramètres sont activés par token pendant le préremplissage — le traitement de l’entrée — contre 16 milliards pendant le décodage, lorsque le modèle génère sa réponse. Cette différence compte surtout pour les agents qui lisent beaucoup plus qu’ils n’écrivent. 2
8
Le cache de l’historique est comprimé. Avec Compressed Sparse Attention 2 (CSA2), chaque couche d’attention se voit attribuer l’un de trois modes fixes, Full, Reindex ou Reuse, afin de partager des informations mises en cache et de réutiliser des sélections d’attention. Associé au stockage FP4 du cache KV principal, ce mécanisme ramène, d’après DeepSeek, l’empreinte du cache KV global à 890 octets par token, soit environ le quart de celle de DeepSeek-V4-Flash. Il s’agit d’une comparaison de taille de cache, pas d’une promesse de diviser par quatre le coût total de chaque déploiement. 6
8
Certaines données sont recalculées plutôt que conservées. La technique SWA Bounded Replay reconstitue les états KV manquants de l’attention à fenêtre glissante en rejouant uniquement la fenêtre de tokens la plus récente, sans devoir garder ces états sur SSD. La fiche du modèle chiffre ainsi l’empreinte du cache KV persistant à environ un huitième de celle de V4-Flash. Ce ratio concerne le stockage persistant : il ne doit pas être confondu avec le quart annoncé pour le cache global. 5
9
Une fiche du modèle décrit un entraînement à partir de zéro sur un corpus multimodal de 45 000 milliards de tokens, un entraînement de l’attention clairsemée sur des séquences de 64 000 tokens, puis une extension du contexte à un million de tokens au cap des 34 000 milliards de tokens. DeepSeek attribue également les progrès du modèle à de nouvelles méthodes de préentraînement et à une phase ultérieure plus étendue d’entraînement par renforcement, sans que les éléments cités permettent d’en détailler davantage la recette. 9
16
Le modèle traite nativement le texte et les images, et DeepSeek indique que cette capacité multimodale est disponible via son API. Les éléments cités ne permettent pas, en revanche, de dresser un bilan chiffré fiable de ses performances en vision. 2
16
Dans les évaluations publiées par DeepSeek, la version de base atteint des résultats comparables à V4-Pro-Base en connaissances, raisonnement et programmation, avec des gains de 5 à 10 % sur des évaluations tenues à l’écart de l’entraînement, tout en utilisant environ un tiers de ses paramètres totaux et un quart de ses paramètres activés. DeepSeek affirme aussi que le modèle publié dépasse V4-Pro sur les tâches d’agents. Les extraits cités ne permettent toutefois pas une comparaison solide, test par test : il ne s’agit pas d’un face-à-face indépendant. 1
16
Sur l’API de DeepSeek, le nom à utiliser est deepseek-flash. Les poids publiés sont indiqués sous licence MIT. La documentation du modèle décrit une mise en service avec SGLang ; des fiches recensent également la prise en charge de Transformers et de vLLM. Avant un déploiement, il faut vérifier les possibilités exactes de l’environnement choisi, notamment pour les images et les très longs contextes. 8
9
16
DeepSeek indique que V4-Flash et V4-Flash-Vision-Exp sont retirés : leurs anciens noms API, deepseek-v4-flash et deepseek-v4-flash-vision-exp, sont temporairement redirigés vers V4.1-Flash. L’entreprise a également annoncé qu’à compter du 14 septembre 2026, les requêtes adressées à deepseek-v4-pro seraient dirigées vers V4.1-Flash au tarif Flash, dans l’attente de V4.1-Pro. Si une application dépend d’un comportement propre à Pro, mieux vaut contrôler le modèle qui répond effectivement aux requêtes plutôt que se fier au seul nom appelé. 16
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
DeepSeek V4.1 Flash accepte jusqu’à un million de tokens de contexte, sans garantir pour autant le rappel fiable de chaque détail.
DeepSeek V4.1 Flash accepte jusqu’à un million de tokens de contexte, sans garantir pour autant le rappel fiable de chaque détail. Son architecture active environ 8 milliards de paramètres par token lors de la lecture de l’entrée, contre 16 milliards lors de la génération ; CSA2 et le stockage FP4 réduisent aussi la taille du cache KV.
DeepSeek annonce des gains dans ses propres évaluations. Le modèle est accessible sous le nom API deepseek flash, tandis que les anciennes appellations changent de routage.