NVIDIA señala que Jetson AGX Orin y AGX Thor pueden ejecutar localmente Nemotron 3.5 Lightning y Qwen3.8 27B; en Thor, NVFP4 y la decodificación especulativa lograron hasta 6,28 veces más rendimiento de decodificación... Nemotron 3.5 Lightning es un modelo MoE de 30.000 millones de parámetros con 3.000 millones acti...
Publicado porEditado con GPT-5.6 TerraImágenes generadas con GPT Image 2
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: How does NVIDIA’s September 4 developer guide show that Jetson AGX Thor and AGX Orin modules can run compact reasoning and agentic AI models. Article summary: NVIDIA’s September 4 guide argues that recent compact open models, combined with Jetson-optimized serving and decoding techniques, make multi-step reasoning and agent loops practical on-device rather than requiring a rou. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Ejecutar modelos capaces de razonar en varios pasos en un dispositivo integrado solía obligar a elegir entre capacidad y velocidad de respuesta. La guía de NVIDIA publicada el 4 de septiembre sostiene que ese equilibrio está cambiando: modelos abiertos optimizados, inferencia de baja precisión y una decodificación más rápida permiten llevar IA de razonamiento y agentes autónomos directamente a los módulos Jetson AGX Orin y Jetson AGX Thor. 1
El dato más llamativo es una mejora de hasta 6,28 veces en el rendimiento de decodificación frente a BF16 en Jetson AGX Thor al combinar cuantización NVFP4 y decodificación especulativa. No es una garantía universal de tokens por segundo: depende del modelo y de la carga de trabajo. Pero ilustra por qué los agentes locales empiezan a ser una opción viable para robótica, vehículos y equipos industriales. 1
NVIDIA identifica a Nemotron 3.5 Lightning y Qwen3.8-27B como opciones para Jetson AGX Orin y Jetson AGX Thor. Los desarrolladores pueden servir estos modelos con vLLM en Jetson y aplicar dos técnicas complementarias para mejorar la eficiencia de la inferencia. 1
NVFP4 emplea representaciones de coma flotante de cuatro bits para reducir tanto el trabajo de cálculo como la memoria necesaria para las operaciones del modelo. En la inferencia integrada, mover pesos y activaciones con rapidez puede ser un límite tan importante como la potencia de cómputo disponible durante la generación. 1
Thor está especialmente orientado a esta técnica porque su GPU Blackwell incorpora soporte nativo para FP4 mediante Transformer Engine, según NVIDIA. 3
La decodificación especulativa divide la tarea entre propuesta y verificación. Un modelo borrador más pequeño propone varios tokens siguientes; el modelo principal los verifica juntos y conserva la decisión final. Si acepta varios de esos tokens, la respuesta avanza más de un token en un único paso de verificación. 1
La ganancia depende de cuántos tokens del borrador sean aceptados. Por eso el resultado cambia según el modelo, el prompt y la configuración de decodificación: es una optimización de la carga de trabajo, no un multiplicador fijo de rendimiento.
Ambos modelos reflejan estrategias distintas para desplegar IA en el borde, es decir, en el propio dispositivo donde se generan o utilizan los datos.
Nemotron 3.5 Lightning es un modelo mixture-of-experts (MoE) de 30.000 millones de parámetros, aunque solo activa 3.000 millones por token. NVIDIA lo presenta como un modelo para la capa de ejecución de agentes persistentes que trabajan de forma continua. 2
Esta arquitectura puede resultar adecuada para un agente que responde con frecuencia o repite ciclos operativos: interpreta un evento, usa una herramienta autorizada, revisa el resultado y decide si continúa o escala el caso. Más que la cifra total de parámetros, importan los parámetros activos por token y la velocidad de generación sostenida.
Qwen3.8-27B es un modelo denso: los 27.000 millones de parámetros participan en cada token. NVIDIA lo sitúa como una alternativa sólida en Jetson junto con Nemotron 3.5 Lightning. 1
Puede ser apropiado cuando una aplicación toma menos decisiones, pero exige más de cada una. La contrapartida es que activar toda la red en cada token puede requerir más cómputo que un modelo MoE disperso.
La recomendación práctica de NVIDIA es medir los modelos con la aplicación real: longitud de prompts y respuestas, herramientas disponibles, presupuesto de latencia, memoria y patrón de decisiones. 1
Un agente que debe emitir muchas respuestas puede beneficiarse de un modelo disperso con salida rápida. Un sistema que toma menos decisiones, pero de mayor dificultad, puede aceptar una generación más lenta a cambio del comportamiento de un modelo denso. Ninguna de las dos arquitecturas es mejor en todos los escenarios de borde.
NVIDIA informa de una mejora máxima de 6,28 veces en rendimiento de decodificación respecto de BF16 al combinar NVFP4 y decodificación especulativa en Jetson AGX Thor. La configuración óptima de esta última varió según el modelo: DSpark funcionó mejor con Nemotron 3.5 Lightning y DFlash2, con Qwen3.8-27B. 1
La métrica importa porque la decodificación —la generación progresiva de los tokens de salida— suele determinar la sensación de respuesta inmediata en un agente interactivo. Aun así, no debe interpretarse como una promesa de velocidad para cualquier prompt, modelo o instalación. La calidad del modelo borrador, la tasa de aceptación de tokens, el tamaño de lote, la longitud del contexto y la configuración del entorno de ejecución afectan al rendimiento real. 1
Un modelo que infiere en el dispositivo evita que cada solicitud de razonamiento necesite un viaje de ida y vuelta a un centro de datos. En sistemas físicos, esto puede traducirse en menos demora ligada a la red, operación continua con conectividad intermitente y capacidad para mantener en el equipo los flujos de sensores y registros operativos. NVIDIA destaca el valor del razonamiento y los agentes en el borde cuando importan la residencia local de los datos y la respuesta en tiempo real. 1
Eso no elimina el papel de la nube. Las organizaciones pueden seguir recurriendo a infraestructura centralizada para entrenar modelos, gestionar flotas de equipos, analizar grandes volúmenes de información o resolver tareas que superen la memoria y el cómputo del dispositivo. El cambio relevante es que la conexión al centro de datos ya no tiene que estar en la ruta crítica de cada decisión.
NVIDIA menciona asistentes dentro del habitáculo, detección de anomalías en tiempo real y robots que operan en entornos duros o remotos. 1
Son casos con una condición común: el sistema debe interpretar el contexto local y reaccionar lo bastante rápido para resultar útil. Entre las aplicaciones potenciales figuran:
Los mejores candidatos no son simplemente dispositivos capaces de ejecutar un modelo de lenguaje. Son aquellos en los que el tiempo de respuesta, la privacidad o residencia de los datos y la resistencia a desconexiones tienen valor operativo directo.
Jetson AGX Thor es la plataforma de gama alta de NVIDIA para cargas exigentes de IA física. La empresa afirma que combina una GPU Blackwell con 128 GB de memoria y ofrece hasta 2.070 TFLOPS FP4 dentro de un margen de consumo de 130 W. 3
Este perfil encaja con el foco de la guía en NVFP4, decodificación de alto rendimiento y modelos locales de razonamiento de mayor tamaño. AGX Orin sigue siendo relevante para despliegues integrados ya consolidados, mientras que Thor apunta a trabajos generativos y multimodales más exigentes.
En la gama de entrada, NVIDIA ha anunciado Jetson Orin Nano 2 para robótica, drones de reparto e inspección y sistemas de IA de visión. La compañía prevé que el módulo y el kit para desarrolladores estén disponibles en la primera mitad de 2027. 1
La cartera dibuja así una estrategia escalonada: sistemas pequeños para IA de borde de entrada, AGX Orin para despliegues integrados maduros y AGX Thor para aplicaciones que requieren más memoria y cómputo para razonamiento generativo local.
La guía de NVIDIA no afirma que cualquier modelo de frontera pueda ejecutarse cómodamente en cualquier módulo integrado. Su conclusión es más concreta: modelos de razonamiento compactos, despliegue con vLLM, cuantización NVFP4 y decodificación especulativa pueden hacer viables agentes locales capaces en hardware de la familia Jetson. 1
Para los desarrolladores, el siguiente paso es empírico: probar el modelo objetivo en el Jetson objetivo con los prompts, herramientas, ventanas de contexto y requisitos de tiempo de respuesta reales del producto. La mejora de hasta 6,28 veces muestra el potencial de la optimización; la prueba con la aplicación concreta determinará si ese potencial se convierte en un sistema de IA de borde útil. 1
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
NVIDIA señala que Jetson AGX Orin y AGX Thor pueden ejecutar localmente Nemotron 3.5 Lightning y Qwen3.8 27B; en Thor, NVFP4 y la decodificación especulativa lograron hasta 6,28 veces más rendimiento de decodificación...
NVIDIA señala que Jetson AGX Orin y AGX Thor pueden ejecutar localmente Nemotron 3.5 Lightning y Qwen3.8 27B; en Thor, NVFP4 y la decodificación especulativa lograron hasta 6,28 veces más rendimiento de decodificación... Nemotron 3.5 Lightning es un modelo MoE de 30.000 millones de parámetros con 3.000 millones activos por token, mientras que Qwen3.8 27B es denso y activa sus 27.000 millones de parámetros en cada token.
La inferencia local reduce la dependencia de la conexión con centros de datos en robots, vehículos y sistemas industriales, pero cada producto debe medirse con sus propios prompts, herramientas, límites de memoria y o...