APXInf es un motor de inferencia de código abierto de Infinigence AI, la Universidad Tsinghua y la Universidad Jiao Tong de Shanghái, pensado para ejecutar modelos de IA en el propio robot. Combina un entorno de ejecución en Rust con interfaces de Python y optimizaciones de canalización, grafos, operaciones de GPU y...
Publicado porEditado con GPT-6 SolImágenes generadas con GPT Image 2
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What is APXInf, the open source embodied edge inference engine released by Infinigence AI with Tsinghua University and Shanghai Jiao Tong Un. Article summary: APXInf is an open source inference engine from Infinigence AI, Tsinghua University, and Shanghai Jiao Tong University for running embodied AI policies close to a robot’s sensors and actuators.. Topic tags: general web, llm, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thum
Cuando un robot observa su entorno, el modelo necesita transformar esa información en una acción con poca demora. APXInf aborda esa parte del problema: es un motor de inferencia de código abierto presentado por Infinigence AI junto con la Universidad Tsinghua y la Universidad Jiao Tong de Shanghái para ejecutar modelos de IA corporizada cerca de los sensores y actuadores. No sustituye al controlador de motores del robot; busca acortar el tiempo que tarda el modelo en producir una acción. 14
4
APXInf utiliza un entorno de ejecución ligero escrito en Rust para gestionar la ejecución y la memoria. Sus interfaces de Python permiten llamar a las políticas desde código habitual en robótica, mientras las operaciones más exigentes quedan en la capa de alto rendimiento. Para adaptar un modelo, el flujo documentado parte de un checkpoint de referencia —una versión concreta de sus parámetros— y de entradas de prueba fijas. Antes de optimizarlo, se comparan las salidas y valores intermedios de la adaptación con los de la referencia: acelerar una política sirve de poco si cambia inadvertidamente lo que decide. 3
5
1
La reducción de latencia no depende de una única técnica. La canalización organiza las etapas de inferencia para recortar esperas a lo largo del recorrido completo; la captura de grafos y la reutilización de búferes evitan repetir tareas de preparación; los kernels, operaciones ajustadas para la GPU, aceleran cálculos costosos; y la cuantización en formatos como FP8 o INT8 puede reducir cálculo y tráfico de memoria. El objetivo es que generar acciones resulte más rápido y predecible en el equipo que lleva el robot. 8
5
1
La comparación difundida para π0.5 en FP8 sobre Jetson Thor sitúa la inferencia de extremo a extremo en menos de 26 ms, frente a 278 ms de una configuración sin optimizar: una latencia aproximadamente 10,7 veces menor. También comunica 38,46 inferencias por segundo, frente a unas 3,6 por segundo que se deducen de 278 ms. Son cifras de inferencia, no una demostración de que el circuito completo —captar datos, decidir y accionar— funcione a 38,46 Hz en cualquier robot. 8
9
Hay una salvedad para quien quiera reproducir la cifra: el repositorio del proyecto publica también 41,16 ms y 24,3 Hz para π0.5 en FP8 sobre Jetson AGX Thor. Las fuentes facilitadas no establecen que esa medición y la comparación con el punto de partida de 278 ms se hayan hecho bajo condiciones idénticas; por tanto, no conviene presentarlas como un único resultado intercambiable. Algunas crónicas mencionan además 46 Hz, aunque en el mismo texto aparece 38,46 Hz: esta última frecuencia concuerda aproximadamente con una inferencia cada 26 ms. 5
6
La cobertura del lanzamiento menciona π0.5 y WALL-OSS y plataformas RTX 4090, Jetson Orin y Jetson Thor. El repositorio describe de forma más específica su primera ruta muy optimizada para π0.5 en Thor y Orin, con opciones BF16, FP8 e INT8. El soporte anunciado para una plataforma no implica que cada combinación de modelo, precisión y dispositivo alcance la misma latencia. 4
5
APXInf ocupa el lado de inferencia y despliegue del ecosistema RLinf. La integración descrita para evaluar π0.5 con aceleración de APXInf conserva las transformaciones de OpenPI, y la capa orientada al robot ofrece un servidor WebSocket compatible con su interfaz. Compatibilidad de interfaz no significa que todos los checkpoints de OpenPI ya estén adaptados. 5
15
La hoja de ruta contempla más modelos de visión, lenguaje y acción (VLA), modelos de visión y lenguaje (VLM) y modelos del mundo; Qwen y GR00T figuran entre las adaptaciones previstas. También plantea ampliar las plataformas y los sistemas de cálculo compatibles. Son planes, no garantías de soporte actual. Antes de trasladar los 26 ms a otro robot, habría que repetir la prueba con su checkpoint, precisión, dispositivo y límites de potencia: la latencia puede variar, y una inferencia rápida por sí sola no prueba el éxito de una tarea en control continuo ni un rendimiento sostenido bajo restricciones térmicas. 9
5
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
APXInf es un motor de inferencia de código abierto de Infinigence AI, la Universidad Tsinghua y la Universidad Jiao Tong de Shanghái, pensado para ejecutar modelos de IA en el propio robot.
APXInf es un motor de inferencia de código abierto de Infinigence AI, la Universidad Tsinghua y la Universidad Jiao Tong de Shanghái, pensado para ejecutar modelos de IA en el propio robot. Combina un entorno de ejecución en Rust con interfaces de Python y optimizaciones de canalización, grafos, operaciones de GPU y cuantización.
Para π0.5 en FP8 sobre Jetson Thor se ha difundido una caída de 278 ms a menos de 26 ms, equivalente a unas 38,46 inferencias por segundo.