APXInf est un moteur d’inférence open source développé par Infinigence AI avec l’université Tsinghua et l’université Jiao tong de Shanghai. Son environnement d’exécution en Rust, ses interfaces Python et ses optimisations de pipeline, de graphe, de noyaux de calcul et de quantification visent un déploiement rapide e...
Publié parModifié avec GPT-6 SolImages générées avec GPT Image 2
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What is APXInf, the open source embodied edge inference engine released by Infinigence AI with Tsinghua University and Shanghai Jiao Tong Un. Article summary: APXInf is an open source inference engine from Infinigence AI, Tsinghua University, and Shanghai Jiao Tong University for running embodied AI policies close to a robot’s sensors and actuators.. Topic tags: general web, llm, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thum
Sur un robot, une décision produite trop tard peut perdre son intérêt. APXInf s’attaque à cette partie du problème : exécuter un modèle d’IA incarnée au plus près des capteurs et des actionneurs, plutôt que de laisser l’inférence devenir un goulet d’étranglement. Infinigence AI l’a publié en open source avec l’université Tsinghua et l’université Jiao-tong de Shanghai. APXInf produit des actions à partir des observations ; il n’est pas, à lui seul, le contrôleur des moteurs. 4
9
Un environnement d’exécution minimal en Rust prend en charge l’exécution et la gestion des ressources. Des interfaces Python permettent d’appeler les politiques depuis des logiciels de robotique existants. Pour porter un modèle, la démarche décrite consiste à fixer un point de contrôle de référence et des entrées de test, puis à comparer les sorties — y compris des valeurs intermédiaires — avant d’appliquer les optimisations. L’objectif est d’éviter qu’un gain de vitesse ne masque une divergence dans les calculs du modèle. 3
5
Ces optimisations agissent à plusieurs niveaux : l’ordonnancement du pipeline cherche à réduire les attentes entre les étapes ; la capture du graphe de calcul et la réutilisation de tampons limitent les préparatifs répétés ; des noyaux GPU adaptés accélèrent les opérations coûteuses ; enfin, la quantification en FP8 ou INT8 peut diminuer les calculs et les transferts de données. Leur intérêt est de réduire et de rendre plus prévisible le temps nécessaire à la génération d’une action sur le matériel embarqué. 8
5
Pour π0.5 en FP8 sur Jetson Thor, la comparaison publiée fait passer la latence d’inférence de bout en bout de 278 ms sans optimisation à moins de 26 ms avec APXInf, soit une réduction d’environ 10,7 fois. Elle indique 38,46 inférences par seconde, contre environ 3,6 si l’on rapporte une inférence aux 278 ms initiaux. Cette fréquence concerne l’inférence du modèle : elle ne démontre pas que la boucle complète, de la capture des capteurs à l’exécution physique d’un mouvement, fonctionne à 38,46 Hz. 8
9
Une distinction compte pour qui veut reproduire le résultat : le dépôt du projet affiche également 41,16 ms et 24,3 Hz pour π0.5 en FP8 sur Jetson AGX Thor. Il ne faut donc pas présenter les « moins de 26 ms » de la comparaison publiée comme la latence de toutes les configurations ou de toutes les mesures du dépôt. Certains articles mentionnent aussi 46 Hz, mais 38,46 Hz est le chiffre cohérent avec 26 ms et repris dans la comparaison. 5
6
8
Les présentations du lancement citent π0.5 et WALL-OSS, ainsi que les plateformes RTX 4090, Jetson Orin et Jetson Thor. Le dépôt décrit plus précisément un premier parcours fortement optimisé pour π0.5 sur Thor et Orin, avec des options BF16, FP8 et INT8 : la présence d’un matériel ou d’un modèle dans les annonces ne signifie pas que chaque combinaison bénéficie de la même optimisation. 4
5
APXInf constitue le volet inférence et déploiement de l’écosystème RLinf. Son paquet destiné aux robots propose notamment une interface WebSocket compatible avec OpenPI. Cette compatibilité porte sur l’interface de service ; elle ne signifie pas que tous les points de contrôle OpenPI ont déjà été portés. 1
5
La feuille de route prévoit davantage de modèles vision-langage-action (VLA), de modèles vision-langage (VLM) et de modèles du monde ; Qwen et GR00T sont cités parmi les adaptations en cours. Elle évoque aussi d’autres plateformes et environnements d’exécution. Ce sont des projets, pas une garantie de prise en charge actuelle. Pour évaluer APXInf sur un robot donné, il faudra refaire les mesures avec son point de contrôle, sa précision numérique, son matériel et ses limites de puissance et de température. Une inférence plus rapide ne prouve, à elle seule, ni la réussite des tâches ni la tenue des performances sur la durée. 9
5
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
APXInf est un moteur d’inférence open source développé par Infinigence AI avec l’université Tsinghua et l’université Jiao tong de Shanghai.
APXInf est un moteur d’inférence open source développé par Infinigence AI avec l’université Tsinghua et l’université Jiao tong de Shanghai. Son environnement d’exécution en Rust, ses interfaces Python et ses optimisations de pipeline, de graphe, de noyaux de calcul et de quantification visent un déploiement rapide et prévisible sur l’appareil.
Pour π0.5 en FP8 sur Jetson Thor, une comparaison publiée annonce moins de 26 ms par inférence, contre 278 ms sans optimisation, soit environ 38,46 inférences par seconde.