Datos clave de las fuentes:
Los benchmarks independientes de la evaluación CAISI del NIST muestran que DeepSeek V4 Pro compite directamente con lo mejor de OpenAI y Anthropic :
| Benchmark | DeepSeek V4 Pro | OpenAI GPT-5.5 | Anthropic Opus 4.6 |
|---|---|---|---|
| GPQA Diamond (razonamiento científico) | 90.1% | 96% | 91% |
| MMLU-Pro (conocimiento general) | 87.5% | ~92% | 89.1% |
| SWE-bench Verified (programación) | 80.6% | ~75% | ~78% |
Aspectos destacados adicionales de rendimiento:
La historia financiera de la IA china es tan dramática como la técnica:
Alibaba (Qwen) sigue una estrategia de ecosistema de código abierto: la mayoría de los modelos se lanzan bajo Apache 2.0, son fáciles de ajustar y gratuitos para auto-alojar . Esto convirtió a Qwen en la familia de modelos más descargada en Hugging Face. La contrapartida es la monetización: la IA de Alibaba es un éxito, pero es difícil convertirla en un negocio directamente rentable, según informó The New York Times
. Sin embargo, Alibaba ha comenzado a dar un giro: el buque insignia Qwen 3.6 Max Preview se lanzó como un modelo de API cerrado y propietario en abril de 2026
.
DeepSeek adopta un enfoque híbrido: publica los pesos de su V4 bajo licencia MIT (1.6 billones de parámetros Mixture-of-Experts, 49 mil millones de parámetros activos), al tiempo que ofrece un nivel de API económico . Su arquitectura (MoE con activación extremadamente dispersa) permite un rendimiento de vanguardia con un costo de inferencia drásticamente menor.
Los titulares occidentales (OpenAI, Anthropic, Google) se basan principalmente en API cerradas y propietarias con precios elevados. OpenAI y Anthropic han lanzado niveles "nano" y "mini" más baratos en respuesta a la presión, pero ninguno iguala la relación precio-rendimiento de nivel frontier de DeepSeek .