DeepSeek affirme que V4.1 Flash n’utilise, pour son cache KV, qu’un quart de la HBM et un huitième du stockage SSD requis par la génération précédente. Après l’annonce, Samsung Electronics et SK Hynix ont chacune perdu plus de 3 % en séance à Séoul, signe d’une remise en cause rapide des anticipations sur la mémoire...
Publié parModifié avec GPT-5.6 TerraImages générées avec GPT Image 2
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: How did DeepSeek’s September 10 V4.1 Flash release, which reduced key-value cache consumption to about one-quarter of its predecessor’s high. Article summary: The selloff reflected a rapid reassessment of the “AI equals ever-more memory” trade. DeepSeek’s V4.1-Flash showed that serving long-context models can be made far less memory-intensive, while Amodei’s proposed slowing o. Topic tags: general, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
L’annonce de DeepSeek V4.1-Flash, le 10 septembre, a perturbé un scénario boursier devenu très simple : des modèles toujours plus grands, des contextes toujours plus longs et davantage d’agents IA devaient entraîner une hausse continue des besoins en mémoire à haute bande passante (HBM), en NAND et en stockage.
Le modèle ne rend pas la mémoire inutile. Il suggère en revanche que l’architecture logicielle et la gestion du cache peuvent réduire très sensiblement la quantité de mémoire nécessaire pour servir une même charge de travail d’IA. 61
25
Le cache clé-valeur, ou KV cache, conserve des informations sur l’état de l’attention d’un modèle pendant qu’il répond à une requête. Il est particulièrement important dans les longues conversations et les usages « agentiques » : il évite de recalculer en permanence tout l’historique.
DeepSeek indique que V4.1-Flash ramène les besoins de son cache KV à un quart de la HBM et à un huitième du stockage SSD de la génération précédente. 61 Selon la fiche technique du modèle, ce gain vient d’une architecture d’encodeur-décodeur causal : le cache KV global du décodeur est projeté à partir des états cachés finaux de l’encodeur. Une technique de déploiement baptisée SWA Bounded Replay évite par ailleurs de conserver certains états de cache à fenêtre glissante sur SSD.
52
Des analyses indépendantes ont évalué l’empreinte du cache KV global à environ 890 octets par jeton, soit près d’un quart de celle de V4-Flash. Cette conception pourrait permettre de gérer environ quatre à huit fois plus d’utilisateurs avec la même empreinte de cache KV. 53 DeepSeek précise aussi que le modèle active 8 milliards de paramètres par jeton lors du préremplissage (prefill) et 16 milliards lors de la phase de génération, avec un objectif d’efficacité sur les charges riches en entrées.
52
La question pour les investisseurs n’était pas de savoir si les systèmes d’IA ont encore besoin de mémoire : ils en ont incontestablement besoin. Elle était de savoir si la mémoire requise par unité d’inférence produite pouvait baisser bien plus vite que ne le supposaient les modèles de revenus et de demande.
Si un modèle comparable peut traiter davantage de requêtes longues en parallèle à matériel égal, les fournisseurs de cloud peuvent tirer plus de débit de leur parc de HBM et de stockage existant. Cette possibilité fragilise les hypothèses sur les volumes futurs, la tension de l’offre et le pouvoir de fixation des prix dans la HBM, la DRAM, les SSD d’entreprise et les équipements de stockage associés.
En Corée du Sud, les actions de Samsung Electronics et de SK Hynix ont chacune reculé de plus de 3 % en séance après l’annonce, selon les informations publiées. 17 L’inquiétude a gagné l’ensemble de la chaîne d’infrastructure IA : fabricants de mémoire, stockage, réseaux et calcul. Une plus faible empreinte mémoire ne touche pas nécessairement toutes ces catégories avec la même intensité, mais elle modifie l’économie du déploiement des modèles.
Le cas de SanDisk illustre la dépendance croissante du scénario d’investissement aux anticipations de demande liées à l’IA. Sur la période, son cours affichait une fourchette sur 52 semaines d’environ 85 à 2 354 dollars, alors que le consensus des analystes restait à l’achat ou à l’achat modéré. 35
37 Un consensus favorable ne répond toutefois pas à l’interrogation centrale : quelle part de la demande future de stockage dépend d’architectures d’inférence toujours plus gourmandes en mémoire ?
L’annonce de DeepSeek a constitué un choc d’efficacité. L’appel de Dario Amodei à « rythmer la frontière » (pace the frontier) a ouvert un autre débat : celui de la vitesse de progression des capacités de l’IA, et donc des dépenses d’infrastructure qui l’accompagnent.
Dans un essai publié en septembre, le directeur général d’Anthropic a proposé de ralentir volontairement le rythme d’amélioration des modèles de pointe afin de dégager du temps pour les travaux d’alignement et de sûreté. Il a notamment évoqué des évaluateurs tiers intégrés aux entreprises, une coordination entre sociétés des pays démocratiques et, à terme, des accords entre gouvernements. 4
5
Il ne s’agissait pas d’un appel à arrêter tout développement de l’IA. Mais le soutien public d’autres dirigeants du secteur a conduit les marchés à envisager qu’une coordination volontaire ou de futures règles puissent modérer les dépenses en accélérateurs, centres de données et mémoire. Les contrats à terme sur le Nasdaq 100 auraient ainsi perdu 1 % ce week-end-là, dans un contexte de réexamen du pari boursier sur l’IA. 8
Pour les investisseurs, la combinaison était inconfortable : DeepSeek suggérait qu’un service d’IA peut exiger moins de mémoire par charge de travail ; le débat sur le ralentissement des modèles suggérait, lui, une croissance potentiellement moins rapide des charges de travail elles-mêmes.
L’investisseur Michael Burry a qualifié les appels à ralentir le développement de l’IA d’« intéressés » (self-serving). Selon lui, un ralentissement profiterait aux laboratoires déjà dominants tout en rendant le rattrapage plus difficile pour les petits concurrents. Il a également mis en doute l’idée que les chatbots actuels conduisent à une intelligence artificielle générale. 15
Ces propos relèvent d’une critique des incitations, non d’une preuve des motivations des entreprises. De même, l’idée que les discours sur la sûreté viseraient à servir de futurs projets d’introduction en Bourse doit être comprise comme une allégation de Burry, et non comme un fait établi. 11
15
La conclusion la plus solide est précise : DeepSeek a remis en cause une version trop mécanique de la thèse haussière sur la mémoire IA. L’entreprise montre que les logiciels, l’architecture des modèles, la quantification et les techniques de gestion du cache peuvent réduire de façon importante l’intensité mémoire de l’inférence. 52
55
Cela ne prouve pas que la demande totale de mémoire va diminuer. Les réductions annoncées portent sur le cache KV pendant l’inférence et sont comparées à l’architecture précédente de DeepSeek. Elles ne signifient pas que le modèle entier, ni un centre de données entier, consomme 75 % de HBM et 87,5 % de SSD en moins. Elles ne suppriment pas non plus les besoins de mémoire liés aux poids du modèle ou à son entraînement. 25
Des coûts de service plus faibles peuvent aussi faire exploser les usages : davantage d’utilisateurs, des contextes plus longs et plus de boucles d’agents. L’issue dépendra donc du rapport entre deux forces : le gain d’efficacité par requête et la hausse du nombre, de la taille et de la complexité des requêtes.
DeepSeek V4.1-Flash n’a pas invalidé le scénario de long terme en faveur de la HBM, de la NAND ou de l’infrastructure IA. Il l’a rendu plus conditionnel.
Il n’est plus possible de présumer que la hausse de l’usage de l’IA se convertira automatiquement, et à proportion égale, en hausse de la mémoire consommée par charge de travail. La vraie question est désormais de savoir si les gains d’efficacité dépasseront l’expansion des déploiements d’IA. DeepSeek apporte une preuve que l’inférence peut devenir beaucoup plus sobre ; l’entreprise ne tranche pas, à elle seule, la trajectoire future de l’usage mondial de l’IA, de l’entraînement des modèles et de la demande matérielle.
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
DeepSeek affirme que V4.1 Flash n’utilise, pour son cache KV, qu’un quart de la HBM et un huitième du stockage SSD requis par la génération précédente.
DeepSeek affirme que V4.1 Flash n’utilise, pour son cache KV, qu’un quart de la HBM et un huitième du stockage SSD requis par la génération précédente. Après l’annonce, Samsung Electronics et SK Hynix ont chacune perdu plus de 3 % en séance à Séoul, signe d’une remise en cause rapide des anticipations sur la mémoire IA.
L’appel de Dario Amodei, patron d’Anthropic, à ralentir la progression des modèles de pointe a ajouté une inquiétude : les dépenses d’infrastructure IA pourraient croître moins vite que prévu.