DeepSeek affirme que V4.1 Flash requiert un quart de la HBM et un huitième du stockage SSD de la génération précédente pour son cache KV, un élément clé du coût de l’inférence. Cette amélioration a alimenté les craintes sur l’intensité mémoire des services d’IA et a pesé sur les valeurs du secteur, de Samsung et SK...
Publié parModifié avec GPT-5.6 TerraImages générées avec GPT Image 2
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: How did DeepSeek’s September 10, 2026 release of its V4.1 Flash AI model—whose architectural changes reduced key-value-cache usage to about. Article summary: The selloff was a rapid repricing of an AI-memory scarcity thesis, not proof that memory demand has permanently collapsed. DeepSeek showed that serving long-context models can require far less KV-cache HBM and persistent. Topic tags: general, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts wi
DeepSeek V4.1-Flash a ébranlé une hypothèse centrale du pari boursier sur l’infrastructure d’IA : un modèle plus performant n’implique pas nécessairement toujours plus de mémoire et de stockage pour chaque service déployé.
La réaction des marchés correspond avant tout à une révision des anticipations sur la quantité de matériel nécessaire par requête d’IA. Elle ne prouve pas que le cycle de demande de mémoire lié à l’IA est terminé.
DeepSeek indique que V4.1-Flash n’a besoin, pour son cache clé-valeur (ou cache KV), que d’un quart de la mémoire à haute bande passante (HBM) et d’un huitième du stockage SSD requis par la génération précédente. L’entreprise souligne que le coût des requêtes utilisant un cache existant peut représenter une part importante des dépenses des agents IA. 29
Le cache KV conserve l’état d’attention des tokens déjà traités. Il permet ainsi au modèle de poursuivre une conversation ou une tâche longue sans recalculer tout le contexte antérieur. C’est une contrainte importante pour servir des modèles en production, surtout avec des contextes longs et des agents autonomes.
La nuance est essentielle : DeepSeek ne dit pas que l’ensemble d’un système d’IA consomme soudainement 75 % de HBM et 87,5 % de stockage en moins. La comparaison porte sur le cache KV et sur l’architecture précédente de DeepSeek. Les poids du modèle, l’infrastructure d’entraînement et d’autres besoins continuent de mobiliser beaucoup de mémoire et de stockage. 25
Pour les investisseurs, le raisonnement était direct : si une même activité d’inférence peut être assurée avec beaucoup moins de mémoire de cache, un parc de serveurs donné peut potentiellement gérer davantage de sessions. Cela réduit les anticipations de mémoire nécessaire par charge de travail — et donc, à court terme, les perspectives de demande et de prix pour la HBM ou le stockage d’entreprise.
À Séoul, les actions Samsung ont perdu 3,5 % et celles de SK Hynix 2,2 % après l’annonce, selon les informations publiées à l’époque. 49 Lors des échanges américains suivants, les titres de la mémoire et du stockage ont également subi des pressions : les investisseurs réévaluaient les besoins en HBM et en SSD de l’infrastructure IA.
51
52
Il serait toutefois excessif d’attribuer chaque mouvement de Bourse à une seule sortie de modèle. Les semi-conducteurs réagissent aussi aux résultats d’entreprises, à l’offre disponible, aux taux d’intérêt, à l’appétit général pour le risque et aux prévisions de dépenses des grands groupes technologiques. Mais l’épisode montre la sensibilité des valorisations à une idée simple : l’innovation logicielle peut faire baisser le matériel nécessaire pour fournir une unité de service IA.
Cette annonce est intervenue au moment d’un autre débat susceptible d’inquiéter les marchés. Dans son essai We Must Pace the Frontier, Dario Amodei, directeur général d’Anthropic, a plaidé pour un ralentissement du rythme de progression des capacités de l’IA afin de laisser aux entreprises et aux pouvoirs publics le temps de sécuriser ces systèmes.
Il a précisé qu’il ne proposait ni l’arrêt de l’entraînement ni celui du progrès technique. Son plan évoque notamment des évaluateurs tiers intégrés aux entreprises, une coordination entre démocraties et une coordination mondiale. 40
Les marchés peuvent y voir un risque de report de certaines dépenses en accélérateurs, réseaux, mémoire et centres de données. Le jour cité dans les comptes rendus de marché, les contrats à terme du Nasdaq-100 perdaient 1,77 % ; Marvell reculait de plus de 7 %, Intel d’environ 6 % et Micron de plus de 5 %. 51
Les deux sujets restent distincts :
Ensemble, ils rendent moins automatiques les scénarios les plus agressifs de croissance des infrastructures IA.
L’investisseur Michael Burry a qualifié la rhétorique en faveur d’un ralentissement de « self-serving », c’est-à-dire dictée par l’intérêt propre des acteurs en place. Selon lui, elle pourrait favoriser les grands laboratoires déjà établis en compliquant l’arrivée de concurrents, alimenter le « hype & puffery » avant d’éventuelles introductions en Bourse, et servir de couverture à un ralentissement de la croissance.
Il a également soutenu que les grands modèles de langage (LLM) ne sont pas une intelligence artificielle générale, ou AGI, et qu’il n’y aurait donc « rien » de ce type à ralentir. 14
Ce sont les opinions de Michael Burry sur la concurrence, les valorisations et les capacités de l’IA ; elles ne constituent pas une conclusion technique établie. Elles illustrent néanmoins la double lecture du débat : sécurité d’un côté, intérêts économiques de l’autre.
La version la plus simple du scénario haussier était linéaire : modèles plus grands, fenêtres de contexte plus longues et davantage d’utilisateurs d’IA devaient entraîner une hausse continue des besoins en HBM, NAND et stockage.
DeepSeek introduit une force contraire : l’efficacité de l’architecture.
Pour analyser la demande, il faut séparer deux variables :
La baisse de la première variable ne dicte pas automatiquement la seconde. Une inférence moins chère et plus efficace peut accroître l’adoption et générer plus de requêtes au total. À l’inverse, si les gains d’efficacité se diffusent plus vite que les usages ne progressent, le matériel requis pour un même volume de services IA pourrait diminuer.
V4.1-Flash concerne surtout le service d’inférence et le cache KV. La comparaison de DeepSeek ne supprime ni la mémoire des poids du modèle ni celle mobilisée pour l’entraînement. 25 Or l’entraînement et l’inférence n’exercent pas les mêmes contraintes sur le calcul, la mémoire et les interconnexions.
La vraie inconnue n’est donc pas de savoir si le gain annoncé est significatif — il l’est — mais s’il modifiera la demande globale. Les investisseurs devront suivre l’adoption de techniques comparables, la croissance des usages à contexte long et des agents, l’évolution des prix de la HBM et du stockage, ainsi que le rythme de l’entraînement et du déploiement des modèles de pointe.
Pour l’instant, cette baisse des valeurs mémoire rappelle surtout que la rareté de la mémoire pour l’IA n’est pas un pari à sens unique : l’innovation dans les modèles peut réduire le matériel nécessaire par requête aussi vite que de nouveaux usages augmentent le nombre de requêtes.
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
DeepSeek affirme que V4.1 Flash requiert un quart de la HBM et un huitième du stockage SSD de la génération précédente pour son cache KV, un élément clé du coût de l’inférence.
DeepSeek affirme que V4.1 Flash requiert un quart de la HBM et un huitième du stockage SSD de la génération précédente pour son cache KV, un élément clé du coût de l’inférence. Cette amélioration a alimenté les craintes sur l’intensité mémoire des services d’IA et a pesé sur les valeurs du secteur, de Samsung et SK Hynix à Micron et SanDisk.
L’effet à long terme reste incertain : une inférence moins coûteuse peut aussi accélérer les usages, tandis que l’entraînement des grands modèles demeure très gourmand en mémoire.