Ling 3.0 flash VL es un modelo de pesos abiertos bajo licencia MIT de inclusionAI, el laboratorio de IA de Ant Group, capaz de recibir texto, imágenes y vídeo. Su arquitectura MoE tiene 124.000 millones de parámetros en total, aunque activa aproximadamente 5.500 millones por token; admite un contexto de hasta 256K t...
Publicado porEditado con GPT-5.6 TerraImágenes generadas con GPT Image 2
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What is Ant Group and inclusionAI’s open-source Ling-3.0-flash-VL, released on September 9, 2026, and how do its 124-billion-parameter mixtu. Article summary: Ling-3.0-flash-VL is inclusionAI/Ant Group’s MIT-licensed, open-weight vision-language extension of the Ling-3.0-flash reasoning model. Its main distinction is that vision is intended to participate in an agentic feedbac. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Ling-3.0-flash-VL es un modelo visión-lenguaje de pesos abiertos desarrollado por inclusionAI, el equipo de IA de Ant Group. Parte de la familia de razonamiento Ling-3.0-flash y emplea una arquitectura de mezcla de expertos o MoE (mixture of experts): reúne 124.000 millones de parámetros, pero activa cerca de 5.500 millones para procesar cada token. La idea es conservar una gran capacidad total sin asumir, en cada paso de inferencia, el coste de cálculo de un modelo denso de 124.000 millones de parámetros. 3
12
Lo que lo diferencia no es solo que pueda analizar imágenes o vídeo. Ant Group lo presenta como un modelo para agentes visuales: sistemas que pueden inspeccionar una pantalla, un documento o una página web; ejecutar una acción mediante una herramienta; revisar el resultado visual; y rectificar si no han alcanzado el objetivo. A este ciclo lo denomina un circuito cerrado de retroalimentación visual. 12
Ling-3.0-flash-VL recibe texto, imágenes y vídeo, y genera salida en texto. Su ventana de contexto declarada llega a 256K tokens, una capacidad orientada a documentos extensos, conversaciones multimodales largas y flujos de agentes que necesitan conservar un historial amplio de la tarea. 3
4
Las descripciones disponibles hablan de una arquitectura híbrida que combina Kimi Delta Attention con capas de atención latente multi-cabeza con compuertas. Para el vídeo utiliza codificación posicional VideoRoPE, diseñada para conservar la información temporal entre fotogramas. 1
6
Según sus creadores, el contenido visual forma parte del flujo de razonamiento, en vez de ser un complemento añadido al final de un modelo textual. De ahí su posicionamiento como modelo «multimodal nativo». 1
12
Los modelos MoE contienen varios grupos especializados de parámetros, conocidos como expertos. Un mecanismo de enrutamiento selecciona solo una parte de ellos para cada token. En Ling-3.0-flash-VL, las cifras comunicadas son 124B de parámetros totales y aproximadamente 5,5B de parámetros activos por token. 3
12
La diferencia es relevante:
Eso no convierte su despliegue en algo sencillo: alojar unos pesos abiertos de este tamaño sigue requiriendo mucha memoria e ingeniería de sistemas. Pero explica por qué se comercializa dentro de una gama «flash», pese a su elevada cifra de parámetros totales. 3
5
Un sistema visión-lenguaje convencional puede resolver tareas de una sola interacción: describir una fotografía, extraer texto de un recibo o responder preguntas sobre un gráfico. Ling-3.0-flash-VL está planteado para un ciclo más largo:
Este enfoque resulta especialmente pertinente para la automatización de interfaces gráficas —GUI, por sus siglas en inglés— y para tareas de software que dependen de lo que aparece en pantalla. Por ejemplo, un agente podría examinar el estado de una interfaz, realizar una acción, observar la pantalla resultante y decidir si ha llegado al estado esperado.
El modelo no sustituye al navegador, a las herramientas, a los permisos ni a las salvaguardas del flujo de trabajo. Esos componentes externos determinan qué acciones puede ejecutar realmente y bajo qué límites.
Ant Group y la cobertura relacionada mencionan como usos previstos la generación de frontend, la automatización de GUI y la interpretación de informes médicos. 12 Este último caso debe entenderse como un uso de apoyo: no demuestra fiabilidad clínica autónoma ni seguridad para tomar decisiones médicas sin supervisión.
El modelo se publicó como pesos abiertos bajo licencia MIT. Se han comunicado versiones de pesos en BF16 y FP8, mientras que las compilaciones FP4 e INT4 figuraban como previstas o próximas en la cobertura inicial. 3
4
También se ha informado de orientación de servicio para SGLang y una ruta de vLLM ajustada para Ling. 3
4 Para un entorno de producción, esto debe verse como un punto de partida, no como una garantía de compatibilidad: conviene probar la revisión concreta del modelo, la cuantización, el preprocesado multimodal, la longitud de contexto, el hardware y la versión del framework que se vayan a utilizar.
La cobertura recoge dos cifras del Artificial Analysis Intelligence Index:
No son resultados necesariamente contradictorios si cambió la versión del índice, pero no deben compararse como si procedieran de la misma escala de evaluación. La conclusión prudente es más limitada: se han comunicado señales de eficiencia competitiva en relación con sus parámetros activos. Eso no demuestra por sí solo que el modelo sea fiable en cualquier agente, entorno de producción o flujo clínico. 3
4
Su relevancia no se limita a que Ling haya añadido entradas de imagen y vídeo. Se presenta como el primer modelo abierto de la línea Ling que integra la visión en una secuencia iterativa de planificación, acción, comprobación visual y corrección. Su diseño MoE disperso intenta hacer ese enfoque de agente multimodal más eficiente en cómputo que un modelo denso de tamaño equivalente. 3
12
Para desarrolladores, el caso de uso más sólido es un flujo acotado en el que la evidencia visual sea importante y cada acción pueda comprobarse: revisar una página renderizada frente a un diseño, navegar por una interfaz controlada o extraer y contrastar información entre documentos. Las demostraciones y evaluaciones comunicadas por el proveedor son señales prometedoras, pero un despliegue fiable sigue dependiendo de pruebas específicas para cada tarea, controles de permisos, gestión de errores y supervisión humana.
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
Ling 3.0 flash VL es un modelo de pesos abiertos bajo licencia MIT de inclusionAI, el laboratorio de IA de Ant Group, capaz de recibir texto, imágenes y vídeo.
Ling 3.0 flash VL es un modelo de pesos abiertos bajo licencia MIT de inclusionAI, el laboratorio de IA de Ant Group, capaz de recibir texto, imágenes y vídeo. Su arquitectura MoE tiene 124.000 millones de parámetros en total, aunque activa aproximadamente 5.500 millones por token; admite un contexto de hasta 256K tokens.
Su principal apuesta es el ciclo visual «observar, actuar, verificar y corregir», pensado para automatización de interfaces, desarrollo frontend y análisis asistido de informes.