DeepSeek afirma que V4.1 Flash necesita para su caché KV una cuarta parte de la HBM y una octava parte del SSD que requería la generación anterior. La noticia llevó a replantear las previsiones de demanda de memorias para IA: Samsung Electronics y SK Hynix cayeron más de un 3% intradía en Corea del Sur.
Publicado porEditado con GPT-5.6 TerraImágenes generadas con GPT Image 2
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: How did DeepSeek’s September 10 V4.1 Flash release, which reduced key-value cache consumption to about one-quarter of its predecessor’s high. Article summary: The selloff reflected a rapid reassessment of the “AI equals ever-more memory” trade. DeepSeek’s V4.1-Flash showed that serving long-context models can be made far less memory-intensive, while Amodei’s proposed slowing o. Topic tags: general, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
La presentación de DeepSeek V4.1-Flash, el 10 de septiembre, incomodó a un mercado apoyado en una idea cada vez más extendida: modelos más grandes, contextos más largos y más agentes de IA implicarían una demanda sostenida de memoria de alto ancho de banda (HBM), NAND y equipos de almacenamiento.
La novedad técnica no vuelve innecesaria la memoria. Pero sí mostró que la cantidad necesaria para atender una misma carga de trabajo de IA puede reducirse de forma considerable gracias a la arquitectura del modelo y a una gestión más eficiente de la caché. 61
25
La caché de claves y valores, o caché KV, conserva información del estado de atención mientras un modelo responde a una petición. Es especialmente relevante en conversaciones de contexto largo y en cargas de trabajo con agentes, porque permite reutilizar el contexto previo en lugar de procesar toda la conversación desde cero.
DeepSeek sostiene que V4.1-Flash reduce el uso de HBM de su caché KV a una cuarta parte y el almacenamiento SSD a una octava parte frente a la generación previa. 61 Según la ficha técnica del modelo, el resultado procede de un diseño causal de codificador-decodificador: la caché KV global del decodificador se proyecta desde los estados ocultos finales del codificador. Además, una técnica de despliegue denominada SWA Bounded Replay evita guardar determinados estados de caché de ventana deslizante en SSD.
52
La cobertura independiente de su lanzamiento situó la huella de la caché KV global en unos 890 bytes por token, aproximadamente una cuarta parte de la de V4-Flash, y estimó que el diseño podría atender entre cuatro y ocho veces más usuarios con la misma capacidad de caché KV. 53 DeepSeek también afirma que activa 8.000 millones de parámetros por token durante el procesamiento inicial de la entrada (prefill) y 16.000 millones durante la generación de la respuesta, un planteamiento dirigido a mejorar la eficiencia de cargas intensivas en entrada.
52
La cuestión inmediata no era si los sistemas de IA necesitan memoria: la necesitan. La preocupación era si la memoria requerida por cada unidad de inferencia podría caer mucho más rápido de lo previsto en numerosos modelos de ingresos y demanda.
Si un modelo comparable puede atender más solicitudes simultáneas de contexto largo con una reserva fija de HBM o almacenamiento, los proveedores de nube podrían extraer más rendimiento de la infraestructura ya instalada. Esa posibilidad introduce riesgo en las previsiones sobre volúmenes futuros, escasez de oferta y poder de fijación de precios en HBM, DRAM, SSD empresariales y equipos de almacenamiento relacionados.
Las acciones de Samsung Electronics y SK Hynix cayeron más de un 3% intradía en Corea del Sur tras el lanzamiento, según los reportes. 17 La inquietud se extendió porque la apuesta bursátil por la infraestructura de IA conecta a fabricantes de memoria con proveedores de almacenamiento, redes y capacidad de cómputo: una menor huella de memoria puede cambiar la economía de desplegar modelos, aunque no reduzca por igual la demanda de todas las categorías de hardware.
El caso de SanDisk ilustra hasta qué punto la tesis de inversión se había vuelto sensible a las expectativas sobre la IA. Los datos de mercado del periodo mostraban un rango de 52 semanas aproximado de 85 a 2.354 dólares, mientras el consenso de analistas seguía siendo de compra o compra moderada. 35
37 Sin embargo, un consenso favorable no resuelve la incógnita central: qué parte de la futura demanda de almacenamiento depende de que las arquitecturas de inferencia sigan siendo cada vez más intensivas en memoria.
La noticia de DeepSeek fue un shock de eficiencia. El llamado de Dario Amodei a «moderar el ritmo de la frontera» introdujo una cuestión distinta: la velocidad a la que crecerán las capacidades de IA y, en consecuencia, la inversión en infraestructura.
En un ensayo publicado en septiembre, el CEO de Anthropic defendió que las empresas reduzcan deliberadamente la velocidad de mejora de los modelos de frontera y empleen ese tiempo adicional en alineamiento y seguridad. Propuso evaluadores externos integrados con acceso a las compañías, coordinación entre empresas de países democráticos y, más adelante, acuerdos entre gobiernos. 4
5
La propuesta no pedía detener todo el desarrollo de IA. Aun así, el respaldo público de otros líderes destacados llevó a los mercados a contemplar si una coordinación voluntaria o futuras políticas públicas podrían moderar el gasto en aceleradores, centros de datos y memoria que sostiene la apuesta más amplia por la IA. Se informó de una caída del 1% en los futuros del Nasdaq 100 ese fin de semana, mientras el debate ponía bajo escrutinio esa operación de mercado. 8
Juntos, ambos acontecimientos crearon una combinación incómoda para los inversores: DeepSeek sugería que los servicios de IA pueden necesitar menos memoria por carga de trabajo, mientras el debate sobre moderar la frontera abría la posibilidad de un crecimiento más lento de esas cargas de trabajo.
El inversor Michael Burry desestimó los llamados a ralentizar el desarrollo de IA como «interesados». Su argumento fue que una desaceleración podría beneficiar a los laboratorios de frontera ya establecidos y dificultar que competidores más pequeños los alcancen. También cuestionó que los chatbots actuales estén en el camino hacia una inteligencia artificial general. 15
Sus declaraciones son una crítica a los incentivos, no una prueba de las motivaciones de esas empresas. Del mismo modo, cualquier afirmación de que los mensajes sobre seguridad están diseñados para favorecer salidas a bolsa previstas debe entenderse como una alegación de Burry, no como un hecho establecido. 11
15
La conclusión más sólida es acotada, pero relevante: DeepSeek cuestionó una versión simplista de la tesis alcista de las memorias para IA. Demostró que el software, la arquitectura del modelo, la cuantización y las técnicas de gestión de caché pueden reducir de forma sustancial la intensidad de memoria de la inferencia. 52
55
No demostró que la demanda total de memoria vaya a disminuir. Las reducciones anunciadas se refieren a la caché KV durante la inferencia y se comparan con la arquitectura anterior de DeepSeek. No significan que el modelo completo o el centro de datos use un 75% menos de HBM y un 87,5% menos de SSD, ni eliminan la memoria destinada a los pesos del modelo o al entrenamiento. 25
Además, unos costes de servicio más bajos pueden ampliar el uso: una inferencia más barata podría facilitar más usuarios, contextos más extensos y más ciclos de agentes. El resultado final para la demanda dependerá de qué fuerza prevalezca: la eficiencia por petición o el crecimiento en el número y la complejidad de las peticiones.
DeepSeek V4.1-Flash no invalida la perspectiva a largo plazo para HBM, NAND o la infraestructura de IA. Pero hace esa perspectiva más condicionada. Ya no es prudente asumir que un mayor uso de IA se traduce, uno a uno, en más consumo de memoria por carga de trabajo.
La pregunta útil es si las ganancias de eficiencia superarán al despliegue de la IA. DeepSeek aportó evidencia de que la inferencia puede hacerse mucho más ligera en memoria; no resolvió a qué ritmo crecerán después el uso global de IA, la escala del entrenamiento y la demanda de hardware.
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
DeepSeek afirma que V4.1 Flash necesita para su caché KV una cuarta parte de la HBM y una octava parte del SSD que requería la generación anterior.
DeepSeek afirma que V4.1 Flash necesita para su caché KV una cuarta parte de la HBM y una octava parte del SSD que requería la generación anterior. La noticia llevó a replantear las previsiones de demanda de memorias para IA: Samsung Electronics y SK Hynix cayeron más de un 3% intradía en Corea del Sur.
La propuesta de Dario Amodei, CEO de Anthropic, de moderar el ritmo de avance de los modelos de frontera añadió dudas sobre el crecimiento futuro de la inversión en infraestructura de IA.