Ling 3.0 flash tiene 124.000 millones de parámetros, pero activa aproximadamente 5.100 millones por token: un diseño MoE que busca contener el coste y la latencia de la inferencia. Ant lo posiciona para tareas repetitivas de programación, llamadas a herramientas y agentes, con una ventana de contexto nativa de 256.0...
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: How did Ant Group Bailing’s July 30, 2026 release of the open-source Ling-3.0-flash execution model—coinciding with Jensen Huang’s first X p. Article summary: The release is evidence for a “sparse execution-model” strategy, not proof that parameter count has ceased to matter. Ling-3.0-flash concentrates computation on roughly 5.1B parameters per token while retaining 124B para. Topic tags: general, general web, user generated, documentation, education. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text,
Para desplegar IA en tareas repetitivas de programación, llamadas a herramientas y automatización de flujos, la pregunta ya no es solo qué modelo acumula más parámetros. También cuenta cuál entrega una calidad suficiente con la menor latencia y el menor coste de inferencia.
Ling-3.0-flash, de Ant Group, resume bien ese cambio de prioridades. El modelo cuenta con 124.000 millones de parámetros totales, pero activa aproximadamente 5.100 millones por token. Ant lo presenta como un modelo de razonamiento híbrido rentable para tareas de alta frecuencia, con una ventana de contexto nativa de 256.000 tokens que puede ampliarse hasta un millón.
Ling-3.0-flash utiliza una arquitectura de mezcla de expertos o mixture of experts (MoE). En vez de emplear todos sus parámetros para procesar cada token, dirige cada parte del trabajo a un subconjunto de expertos.
En términos prácticos, el sistema conserva una gran reserva de capacidad aprendida, pero cada generación depende de una fracción mucho menor de esa capacidad. Ant afirma que Ling-3.0-flash equivale a cerca del 12,4 % de los parámetros totales y al 8,1 % de los parámetros activos de su modelo Ring-2.6-1T, de la clase de un billón de parámetros. La compañía también describe una arquitectura de atención lineal híbrida que alterna capas KDA y MLA, junto con enrutamiento MoE disperso.
Esto no convierte el número total de parámetros en una métrica irrelevante. La capacidad total sigue influyendo en lo que el modelo puede representar, y la calidad del enrutamiento determina si una arquitectura MoE aprovecha realmente ese potencial. Pero la activación selectiva modifica la economía del servicio: la velocidad y el coste dependen más de los parámetros y del cómputo de atención utilizados por token que del total de pesos almacenados.
Ant sostiene que Ling-3.0-flash iguala o supera a Ring-2.6-1T en la mayoría de las comparativas de referencia que publicó. Una publicación contemporánea de la cuenta Ling de Ant resumió el resultado como un desempeño igual o superior al de su modelo insignia de 1T en la mayoría de las pruebas, usando aproximadamente una octava parte de los parámetros totales y una doceava parte de los parámetros activos.
Es una comparación interna significativa, especialmente porque el modelo está orientado de forma explícita a cargas de trabajo de agentes en producción. Sin embargo, no demuestra que Ling-3.0-flash supere a todos los modelos generalistas más grandes en cualquier tarea.
Hay varias cautelas importantes:
Para evaluar el modelo, los equipos deberían probarlo con cargas representativas: esquemas reales de herramientas, contexto de repositorios, requisitos de latencia, comportamiento ante reintentos y coste de los errores.
La ficha del modelo destaca evaluaciones como SWE-Bench Pro, SWE-Bench Multilingual, Tau3-banking-AA, MCP-Atlas y SkillsBench. También menciona su uso con entornos orientados a agentes, entre ellos Claude Code, Kilo Code, Qwen Code, Hermes Agent y OpenClaw. 1
Son objetivos relevantes porque los sistemas de agentes pueden multiplicar el volumen de tokens. Un flujo que lee archivos, invoca herramientas, recibe resultados, revisa un plan y reintenta una operación puede consumir muchos más tokens que una respuesta de chat aislada. En ese contexto, un modelo de menor coste que ejecute con fiabilidad los pasos rutinarios puede aportar más valor que un modelo generalista más caro utilizado en cada turno.
Una arquitectura razonable, por tanto, sería escalonada:
Ant documenta una ventana de contexto nativa de 256.000 tokens, ampliable hasta un millón. Puede resultar útil para bases de código extensas, largos historiales de uso de herramientas o un estado de trabajo persistente.
OpenRouter lista para el modelo una ventana de contexto servida de 262.144 tokens. 6
No obstante, disponer de contexto largo no equivale a demostrar una capacidad multiagente superior. Puede facilitar la conservación de información compartida durante un flujo, pero los sistemas multiagente fiables también dependen de la orquestación, el diseño de memoria, los permisos de las herramientas, los traspasos entre agentes y la evaluación. Las fuentes disponibles respaldan las especificaciones de contexto largo y el enfoque agéntico del modelo, no una ventaja cuantificada frente a rivales en despliegues multiagente.
Ling-3.0-flash se presentó el 24 de julio de 2026. Según la publicación de lanzamiento de Ant, hubo acceso gratuito y temporal a la API en OpenRouter y en la plataforma de Ant hasta el 3 de agosto. El modelo también está disponible en Hugging Face, donde el proyecto describe su enfoque en pruebas de agentes y marcos de trabajo para este tipo de sistemas. 1
En OpenRouter, el precio listado es de 0,021 dólares por millón de tokens de entrada y 0,063 dólares por millón de tokens de salida, con una ventana de contexto de 262.144 tokens. 6 Estas cifras permiten probar flujos de gran volumen, aunque el coste real, la latencia, la disponibilidad y la calidad de salida pueden variar según el proveedor y las condiciones de despliegue.
La página de descubrimiento de modelos de OpenRouter muestra percentiles distintos para inteligencia, programación y capacidades agénticas: 49, 56 y 54, respectivamente. Es otra señal de por qué una sola clasificación general resulta insuficiente para valorar un modelo centrado en ejecución. 12
El lanzamiento coincidió con la primera publicación de Jensen Huang en X. El consejero delegado de Nvidia compartió una carta en la que defendía que los modelos abiertos fortalecen la seguridad y la ciberseguridad, aceleran la innovación y su difusión, y apoyan la soberanía tecnológica junto a los modelos cerrados de frontera.
La coincidencia convirtió a Ling-3.0-flash en un ejemplo oportuno dentro del debate sobre los pesos abiertos: cuando estos están disponibles, los desarrolladores pueden inspeccionar, alojar, ajustar e integrar los modelos con mayor control. Pero ambos hechos no prueban una asociación ni una conexión técnica entre Nvidia y Ant Group.
Ling-3.0-flash es, sobre todo, un argumento a favor de una estrategia de modelos de ejecución evaluados por coste y rendimiento. Un MoE disperso puede combinar una amplia capacidad almacenada con una activación mucho menor por token, lo que potencialmente abarata y acelera los bucles frecuentes de los agentes sin obligar a aceptar las limitaciones de un modelo pequeño.
Sus afirmaciones de rendimiento necesitan replicación independiente y el modelo no debe tratarse como sustituto universal de los sistemas generalistas más grandes. Aun así, sus especificaciones, sus evaluaciones orientadas a agentes, su contexto largo y el bajo precio listado para la API justifican probar modelos dispersos especializados allí donde el coste de inferencia y la latencia sean restricciones decisivas. 1
6
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
Ling 3.0 flash tiene 124.000 millones de parámetros, pero activa aproximadamente 5.100 millones por token: un diseño MoE que busca contener el coste y la latencia de la inferencia.
Ling 3.0 flash tiene 124.000 millones de parámetros, pero activa aproximadamente 5.100 millones por token: un diseño MoE que busca contener el coste y la latencia de la inferencia. Ant lo posiciona para tareas repetitivas de programación, llamadas a herramientas y agentes, con una ventana de contexto nativa de 256.000 tokens ampliable hasta un millón.
Las comparativas publicadas por Ant frente a su modelo Ring 2.6 1T son relevantes, pero deben validarse con cargas de trabajo reales e independientes.