DeepSeek afirma que V4.1 Flash necesita una cuarta parte de la HBM y una octava parte del almacenamiento SSD para su caché KV frente a la generación anterior. La noticia llevó a los inversores a revisar la hipótesis de que cada avance de la IA exige automáticamente más memoria y almacenamiento por carga de trabajo.
Publicado porEditado con GPT-5.6 TerraImágenes generadas con GPT Image 2
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: How did DeepSeek’s September 10, 2026 release of its V4.1 Flash AI model—whose architectural changes reduced key-value-cache usage to about. Article summary: The selloff was a rapid repricing of an AI-memory scarcity thesis, not proof that memory demand has permanently collapsed. DeepSeek showed that serving long-context models can require far less KV-cache HBM and persistent. Topic tags: general, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts wi
La presentación de DeepSeek V4.1-Flash obligó al mercado a reconsiderar una premisa clave de la apuesta por el hardware de inteligencia artificial: que modelos más capaces siempre requieren más memoria y almacenamiento por cada servicio desplegado.
La reacción fue una revisión rápida de esa expectativa, amplificada por otro debate distinto —la conveniencia de moderar el ritmo de desarrollo de la IA de frontera—. No prueba que haya terminado el ciclo de demanda de memoria ligado a la IA, pero sí muestra que no es una apuesta de una sola dirección.
DeepSeek afirmó que la caché de clave-valor, o caché KV, de V4.1-Flash necesita solo una cuarta parte de la memoria de alto ancho de banda (HBM) y una octava parte del almacenamiento SSD que requería la generación previa. La empresa destacó que los costes de los aciertos de caché pueden representar una parte importante del gasto en cargas de trabajo de agentes de IA. 29
La caché KV guarda el estado de atención de los tokens anteriores. Gracias a ello, un modelo puede continuar una conversación o una tarea sin recalcular todo el contexto ya procesado. Es, por tanto, una restricción relevante para servir inferencia, especialmente en interacciones largas y en sistemas de agentes.
Hay una precisión fundamental: DeepSeek no dijo que un modelo completo o un centro de datos necesite de golpe un 75% menos de HBM y un 87,5% menos de almacenamiento. La comparación se refiere a los requisitos de la caché KV frente a la arquitectura anterior de DeepSeek. Los pesos del modelo, la infraestructura de entrenamiento y otros componentes continúan consumiendo cantidades sustanciales de memoria y almacenamiento. 25
La lectura para los inversores fue inmediata. Si un modelo puede atender una actividad de inferencia comparable usando mucha menos memoria para la caché, un conjunto fijo de equipos de IA podría gestionar más sesiones. Eso puede reducir, al menos a corto plazo, las previsiones sobre la intensidad de memoria por carga de trabajo y sobre la demanda o los precios de HBM y almacenamiento empresarial.
En Seúl, las acciones de Samsung bajaron un 3,5% y las de SK Hynix un 2,2% después del lanzamiento, según la cobertura de ese momento. 49 En las operaciones posteriores en Estados Unidos también hubo presión sobre empresas de memoria y almacenamiento: los informes vincularon la revisión de las perspectivas de infraestructura de IA con las menores necesidades de HBM y SSD atribuidas a DeepSeek.
51
52
Eso no demuestra que un solo lanzamiento explique todos los movimientos bursátiles. Las acciones de semiconductores reaccionan también a previsiones de resultados, oferta y demanda, tipos de interés, apetito por el riesgo y planes de inversión de los grandes operadores de centros de datos. Pero la caída dejó clara la sensibilidad de estas valoraciones a cualquier señal de que el software y la arquitectura de los modelos pueden reducir el hardware necesario por unidad de servicio de IA.
La mejora de eficiencia coincidió con una inquietud diferente sobre la demanda. Dario Amodei, consejero delegado de Anthropic, defendió en su ensayo We Must Pace the Frontier moderar la velocidad de mejora de las capacidades de IA para que empresas y gobiernos tengan tiempo de alinear y proteger sistemas cada vez más capaces.
Amodei distinguió expresamente entre «moderar» y detener el entrenamiento o el progreso técnico. Su propuesta incluye evaluadores externos integrados en las empresas, coordinación entre gobiernos democráticos y coordinación global. 40
Los mercados podían interpretar una trayectoria más lenta de mejoras de capacidades —incluso sin una pausa de entrenamiento— como un riesgo de aplazamiento para parte del gasto en aceleradores, redes, memoria y centros de datos. En la jornada recogida por los informes de mercado, los futuros del Nasdaq-100 caían un 1,77%; Marvell perdía más de un 7%, Intel cerca de un 6% y Micron más de un 5%. 51
Son dos cuestiones separadas:
Juntas, hicieron que las previsiones más agresivas de demanda de infraestructura para IA parecieran menos automáticas.
El inversor Michael Burry calificó de «interesada» la retórica de frenar el desarrollo. Sostuvo que podría favorecer a los laboratorios de IA de frontera ya consolidados al dificultar la competencia, aportar «hype & puffery» —promoción y grandilocuencia— de cara a posibles salidas a bolsa y ofrecer cobertura para un crecimiento que se estuviera desacelerando.
También afirmó que los grandes modelos de lenguaje, o LLM, no son inteligencia artificial general (AGI) y que, por tanto, no habría nada de esa naturaleza que frenar. 14
Son opiniones de Burry sobre competencia, valoración y capacidades de IA, no conclusiones técnicas establecidas. Para el mercado, lo relevante es que el debate sobre moderar el desarrollo se está leyendo tanto desde la óptica de la seguridad como desde la de los incentivos empresariales.
La versión más simple de la tesis era lineal: modelos más grandes, ventanas de contexto más extensas y más usuarios de IA implicarían más capacidad de HBM, NAND y almacenamiento. DeepSeek incorpora una fuerza compensatoria importante: la eficiencia arquitectónica.
Un marco más útil separa la demanda en dos variables:
Que baje la primera variable no determina automáticamente la segunda. Una inferencia más barata y eficiente puede impulsar la adopción y multiplicar las solicitudes totales. Pero, si la eficiencia se propaga más rápido de lo que crece el uso, puede reducir el hardware necesario para ofrecer un determinado volumen de resultados de IA.
V4.1-Flash afecta de forma más directa al servicio de inferencia y a la caché KV. La comparación comunicada por DeepSeek no elimina la memoria destinada a los pesos del modelo ni al entrenamiento. 25 La distinción importa porque entrenar y servir modelos imponen exigencias diferentes de cómputo, memoria e interconexión.
La cuestión central no es si la mejora de eficiencia comunicada es relevante —lo es—, sino si modifica la demanda agregada. Para responderla habrá que observar la adopción de técnicas similares de ahorro de caché, el crecimiento de las cargas de contexto largo y de agentes, los precios de HBM y almacenamiento, y si el entrenamiento y el despliegue de modelos de frontera mantienen su aceleración.
Por ahora, la venta de acciones debe entenderse como una advertencia contra la idea de que la escasez de memoria para IA es una operación garantizada en un único sentido. La innovación en modelos puede reducir el hardware requerido por solicitud con la misma rapidez con que los nuevos casos de uso elevan el número de solicitudes.
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
DeepSeek afirma que V4.1 Flash necesita una cuarta parte de la HBM y una octava parte del almacenamiento SSD para su caché KV frente a la generación anterior.
DeepSeek afirma que V4.1 Flash necesita una cuarta parte de la HBM y una octava parte del almacenamiento SSD para su caché KV frente a la generación anterior. La noticia llevó a los inversores a revisar la hipótesis de que cada avance de la IA exige automáticamente más memoria y almacenamiento por carga de trabajo.
La presión se agravó por el debate sobre moderar el ritmo de avance de la IA de frontera, que el mercado interpretó como un posible retraso del gasto en infraestructura.