La contratación llega en un momento estratégico. El informe técnico de DeepSeek V3 ya describe la destilación de la capacidad de razonamiento de sus modelos de la serie R1 A. La metodología de MiniLLM —que utiliza la divergencia KL inversa para la destilación generativa— podría mejorar directamente la eficiencia y la estructura de costes de futuros modelos.
DeepSeek cerró su primera ronda de financiación externa el 16 de junio de 2026, recaudando aproximadamente 7.400 millones de dólares (50.000 millones de yuanes) a una valoración posterior a la inversión de entre 52.000 y 59.000 millones de dólares RFF. Esta ronda convierte a DeepSeek en la startup de inteligencia artificial más valiosa de China F.
Los términos clave del acuerdo:
El capital proporciona una reserva para contratar talento de primer nivel como Gu, financiar la enorme capacidad de cómputo necesaria para el entrenamiento a escala V4 (modelos MoE de 1,6 billones de parámetros) y mantener los precios de la API muy por debajo de los de OpenAI y Anthropic NO.
DeepSeek publicó los modelos de vista previa de V4 —con pesos abiertos bajo licencias MIT y Apache 2.0— los días 22 al 24 de abril de 2026 RDA. El informe de Tencent News indica que la "V4 正式版" (versión oficial/final) se lanzará a mediados de julio de 2026 N.
Ambos se publicaron con pesos abiertos en Hugging Face y puntos de acceso API a precios significativamente más bajos que los modelos frontera estadounidenses —aproximadamente 1/34 del coste de Claude Opus 4.7 en tokens de entrada CHA.
El 1 de mayo de 2026, el Centro para la Innovación y Estándares de IA (CAISI) de la NIST, el instituto de estándares del gobierno estadounidense, publicó una evaluación en la que afirmaba: "DeepSeek V4 es el modelo de IA de China (PRC) más capaz evaluado por CAISI hasta la fecha" en los ámbitos de ciberseguridad, ingeniería de software, ciencias naturales y razonamiento abstracto N. Bloomberg informó de forma independiente del mismo hallazgo B.
Sin embargo, la evaluación de CAISI también señaló que V4-Pro va por detrás de los principales modelos frontera estadounidenses en aproximadamente ocho meses en los puntos de referencia de razonamiento y matemáticas NBG. En términos de puntuaciones Elo estimadas, V4 Pro obtuvo alrededor de 800, mientras que GPT-5.5 obtuvo 1260 IL.
Este es un matiz crítico: la designación de "modelo chino más capaz" confirma el liderazgo de DeepSeek dentro de China, pero también cuantifica públicamente la distancia que la separa de OpenAI y Anthropic.
Los tres movimientos están estrechamente sincronizados y se refuerzan mutuamente:
La contratación de Yuxian Gu inyecta experiencia mundial en destilación en el momento exacto en que DeepSeek está lanzando V4, un modelo que ya utiliza técnicas de destilación. Los métodos de Gu podrían mejorar directamente la eficiencia y la estructura de costes de futuros modelos, permitiendo a DeepSeek hacer más con menos potencia de cómputo.
La ronda de 7.400 millones de dólares proporciona la reserva de capital para contratar agresivamente talento como Gu, financiar el enorme cómputo necesario para el entrenamiento a escala V4 y mantener los precios de la API muy por debajo de los competidores estadounidenses.
El lanzamiento completo de V4 es el vehículo de producto que debe demostrar que DeepSeek puede cerrar la brecha de unos ocho meses identificada por la NIST. Es la demostración pública de que la estrategia está funcionando.
DeepSeek compite por comprimir su ciclo de I+D inyectando capital, atrayendo talento de primer nivel en destilación y llevando V4 a producción, todo ello con el objetivo de cerrar la brecha cuantificada con los modelos frontera estadounidenses lo más rápido posible. El éxito de esta estrategia triple dependerá de la rapidez con que la innovación algorítmica pueda compensar las limitaciones de hardware y de si la próxima generación de modelos consigue reducir la brecha de ocho meses.