DeepSeek afirma que V4.1 Flash reduce a una cuarta parte la HBM destinada a su caché KV y a una octava parte el almacenamiento persistente de esa caché frente a V4 Flash. La noticia presionó primero a Samsung Electronics y SK Hynix en Corea del Sur, y después coincidió con una caída más amplia de valores tecnológico...
Publicado porEditado con GPT-5.6 TerraImágenes generadas con GPT Image 2
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: How did DeepSeek’s V4.1 Flash model trigger a selloff in memory-chip and broader technology stocks, what architectural changes did it introd. Article summary: DeepSeek V4.1 Flash caused a sharp reassessment of AI-memory demand because it claimed to cut the KV-cache memory used in long-context inference to one-quarter of its predecessor’s level and persistent SSD use to one-eig. Topic tags: general, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
DeepSeek V4.1 Flash inquietó a los inversores porque cuestionó una premisa central del auge de la infraestructura de IA: que un mayor uso de inteligencia artificial exige inevitablemente más memoria para cada carga de trabajo. Las ganancias de eficiencia que comunica la compañía son relevantes para la inferencia con contextos largos, pero se concentran en una parte concreta del sistema —la caché clave-valor o caché KV— y no describen toda la memoria ni toda la capacidad de cálculo necesarias para entrenar o servir grandes modelos. 9
10
La caché KV guarda el estado de atención de los tokens anteriores para que el modelo no tenga que recalcular el contexto en cada paso. Es especialmente importante —y costosa— en conversaciones largas y en flujos de trabajo con agentes de IA.
DeepSeek señala que V4.1 Flash combina la reutilización de caché KV entre capas en Compressed Sparse Attention 2 con almacenamiento KV en FP4. Según sus datos, la huella de su caché KV global es de 890 bytes por token, aproximadamente una cuarta parte de la de V4-Flash. 9
También presentó una técnica de despliegue denominada SWA Bounded Replay para la atención de ventana corta. En vez de conservar esa caché de forma permanente en SSD o en la memoria del servidor, el sistema usa temporalmente un conjunto distribuido de DRAM del host y recompone una cantidad limitada de contexto cuando hay un fallo de caché. DeepSeek afirma que esto reduce la huella persistente de la caché KV a cerca de una octava parte de la generación anterior. 1
9
En términos prácticos, esas cifras equivaldrían a cerca de 75% menos HBM —memoria de alto ancho de banda— y 87,5% menos capacidad SSD persistente, pero solo para la función de caché KV frente a V4-Flash. 9
10
Podría ser así en un sistema de inferencia cuyo principal cuello de botella sea la capacidad disponible para cachés KV activas. Si cada petición de contexto largo consume una cuarta parte de la memoria anterior, la misma asignación de HBM podría alojar, en teoría, unas cuatro veces más cachés activas.
Pero esa es una implicación de capacidad derivada de la cifra por token, no un resultado independiente y verificado de concurrencia de extremo a extremo. El número real de usuarios simultáneos también depende de los pesos del modelo, el cómputo disponible, la red, la longitud de las solicitudes, el procesamiento por lotes, los objetivos de latencia y el software de servicio.
El mercado no interpretó que DeepSeek hubiera eliminado la necesidad de memoria. La preocupación se centró en la intensidad futura de la demanda. Los fabricantes de HBM y las compañías de NAND y SSD empresariales se han beneficiado de la expectativa de que sistemas de IA cada vez más capaces requerirían más memoria y almacenamiento. Una mejora de eficiencia abre la posibilidad de que cada carga de inferencia necesite menos bits de memoria y menos almacenamiento persistente.
El 11 de septiembre, Samsung Electronics cayó 3,5% y SK Hynix retrocedió 2,2% en Corea del Sur tras el anuncio de DeepSeek, según Bloomberg. 17 Otros reportes describieron descensos superiores al 3% para ambas compañías en Seúl, mientras Micron y SanDisk resistían inicialmente mejor en la negociación estadounidense.
8
Para los inversores, el riesgo era principalmente de valoración: si las cargas de IA se vuelven menos intensivas en memoria, podrían revisarse las previsiones de crecimiento de la demanda, el poder de fijación de precios y el gasto de capital de los proveedores de memoria.
El movimiento pasó de una preocupación específica sobre la eficiencia de la inferencia a una reevaluación más amplia de la apuesta por el gasto en infraestructura de IA.
Tras los llamamientos para ralentizar el desarrollo de la IA de frontera, hubo debilidad en varios mercados: SK Hynix y Samsung bajaron 6,4% y 4,1%, respectivamente, y la japonesa Kioxia cedió 6,4%. También cotizaron a la baja nombres europeos de semiconductores como ASML, Infineon, ASM International, BE Semiconductor y STMicroelectronics. 18 Otro informe señaló caídas de 11% para SoftBank, de 6,5% para Kioxia y de 1,2% para Taiwan Semiconductor Manufacturing en la negociación asiática.
19
En la preapertura de Estados Unidos, Marvell llegó a caer cerca de 8%, mientras Intel, Micron y SanDisk registraban descensos de alrededor de 6%. 20
No debe interpretarse esta secuencia como prueba de que un único lanzamiento de DeepSeek causó mecánicamente todas las caídas. Los tipos de interés, las valoraciones y las dudas sobre el crecimiento de la IA afectan al mismo tiempo a las tecnológicas. Aun así, el anuncio aportó una razón concreta para poner a prueba una premisa vulnerable: que el crecimiento del uso de IA se traduzca automáticamente en una demanda proporcionalmente mayor de memoria por consulta. 17
La venta de acciones se intensificó después de que el CEO de Anthropic, Dario Amodei, pidiera a las empresas de IA que redujeran el ritmo de avance de las capacidades de los modelos de frontera. Su marco buscaba ganar tiempo para gestionar riesgos de uso indebido y seguridad.
Para los inversores en infraestructura, esto añadió una segunda inquietud, distinta de la mejora de eficiencia anunciada por DeepSeek:
Son dos ideas económicamente diferentes, pero el mercado podía ver ambas como desafíos a una expansión de IA valorada bajo el supuesto de un crecimiento ininterrumpido. Los reportes vincularon directamente el retroceso más amplio del sector de chips con las preocupaciones por las peticiones de ralentizar el desarrollo de IA. 18
20
El inversor Michael Burry criticó el mensaje de ralentización por considerarlo interesado. Sostuvo que los ejecutivos de las principales compañías de IA podrían beneficiarse de presentar su tecnología como algo que avanza peligrosamente rápido, y desestimó ese discurso como «hype & puffery» de cara a OPV. 14
Su argumento es que una desaceleración puede favorecer a las empresas ya consolidadas frente a competidores más pequeños, al tiempo que refuerza la escasez, la credibilidad y el relato de futuras salidas a bolsa. Es la interpretación de Burry sobre los incentivos de estas compañías; no demuestra que las preocupaciones de seguridad sean insinceras o infundadas. 14
El anuncio de DeepSeek es relevante porque sus técnicas no son una singularidad desde el punto de vista de la inversión. La menor precisión, la compresión de caché, el rediseño de la atención, la reutilización y mejores sistemas de servicio son líneas de desarrollo que otros creadores de modelos también pueden seguir. Por ello, una mayor eficiencia de memoria en inferencia representa un riesgo estructural para proveedores cuyas expectativas dependen de que aumente el contenido de memoria por petición de IA. 9
Sin embargo, las afirmaciones tienen límites importantes.
DeepSeek no afirmó que su modelo completo o su centro de datos necesiten 75% menos HBM y 87,5% menos SSD. La comparación se limita a los requisitos de caché KV durante la inferencia y se hace frente a su arquitectura anterior. Los pesos del modelo, otra memoria del sistema, las redes y otras necesidades de almacenamiento quedan fuera de esa comparación. 10
Las mejoras divulgadas no demuestran reducciones equivalentes en el cómputo y la memoria necesarios para entrenar modelos de frontera. Presentar una optimización de caché KV como evidencia de un desplome de toda la demanda de semiconductores para IA exageraría lo que el anuncio realmente demuestra. 10
Una inferencia más barata y menos intensiva en memoria reduce el consumo por solicitud. Pero también puede hacer viables en más casos los asistentes de contexto largo, los flujos de agentes y los despliegues propios. Si ello incrementa suficientemente el número de usuarios y aplicaciones, la demanda total de memoria podría mantenerse sólida o crecer, pese a que cada carga individual requiera menos recursos.
DeepSeek V4.1 Flash expuso un punto débil del relato alcista sobre la memoria para IA: la demanda de memoria por carga de inferencia puede caer con fuerza a medida que mejoran la arquitectura de los modelos y el software de servicio. Su cifra comunicada de 890 bytes por token para la caché KV global y una huella persistente de una octava parte ayudan a entender por qué los inversores revisaron rápidamente sus hipótesis sobre HBM y SSD. 9
Pero la evidencia no permite calificarlo como un shock inmediato de demanda para toda la industria de chips. Los recortes anunciados se limitan a la caché KV en inferencia, no al entrenamiento de modelos ni a toda la infraestructura de un centro de datos. El resultado a largo plazo dependerá de la pugna entre dos fuerzas: menor intensidad de memoria por tarea de IA y una posible adopción mucho más amplia gracias a costes inferiores.
Para quien invierte en acciones de memoria, la pregunta ya no es simplemente si crecerá el uso de IA. Es si el crecimiento total de las cargas de trabajo podrá superar la velocidad con la que los sistemas de IA aprenden a usar la memoria de forma más eficiente.
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
DeepSeek afirma que V4.1 Flash reduce a una cuarta parte la HBM destinada a su caché KV y a una octava parte el almacenamiento persistente de esa caché frente a V4 Flash.
DeepSeek afirma que V4.1 Flash reduce a una cuarta parte la HBM destinada a su caché KV y a una octava parte el almacenamiento persistente de esa caché frente a V4 Flash. La noticia presionó primero a Samsung Electronics y SK Hynix en Corea del Sur, y después coincidió con una caída más amplia de valores tecnológicos en Asia, Europa y Estados Unidos.
La cuestión decisiva es si el menor uso de memoria por consulta reducirá las compras totales de chips o abaratará la IA lo suficiente como para multiplicar los usos y la demanda agregada.