APXInf è un motore open source di inferenza per modelli di AI incarnata, sviluppato da Infinigence AI con le università Tsinghua e Shanghai Jiao Tong. Abbina un runtime leggero in Rust a interfacce Python e interviene su pipeline, grafi di esecuzione, kernel GPU e quantizzazione per ridurre i ritardi nell’elaborazione.
Pubblicato daModificato con GPT-6 SolImmagini generate con GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is APXInf, the open source embodied edge inference engine released by Infinigence AI with Tsinghua University and Shanghai Jiao Tong Un. Article summary: APXInf is an open source inference engine from Infinigence AI, Tsinghua University, and Shanghai Jiao Tong University for running embodied AI policies close to a robot’s sensors and actuators.. Topic tags: general web, llm, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thum
APXInf è un motore di inferenza open source pensato per eseguire modelli di AI incarnata vicino ai sensori e agli attuatori di un robot, anziché affidare la generazione delle azioni a un servizio remoto. È stato presentato da Infinigence AI insieme alla Tsinghua University e alla Shanghai Jiao Tong University. Il suo compito è accorciare il tempo tra un’osservazione e l’azione proposta dal modello: non è il controllore che pilota direttamente i motori. 14
4
Il runtime, scritto in Rust, gestisce esecuzione, memoria e risorse; le interfacce Python permettono agli sviluppatori di richiamare le policy dal codice robotico. Nel flusso di porting descritto per il progetto si parte da un checkpoint di riferimento e da input di prova fissati, si confrontano risultati e valori intermedi con quelli originali e solo dopo si applicano le ottimizzazioni. È un passaggio importante: accelerare un modello serve a poco se le azioni prodotte cambiano in modo inatteso. 3
5
Le ottimizzazioni agiscono su più livelli: la pipeline coordina le fasi dell’inferenza; la cattura del grafo di esecuzione e il riutilizzo dei buffer limitano il lavoro ripetuto a ogni chiamata; i kernel GPU ottimizzati velocizzano le operazioni più costose. La quantizzazione, per esempio in FP8 o INT8, può inoltre ridurre calcoli e traffico di memoria. L’obiettivo è ottenere tempi di risposta più brevi e prevedibili sul dispositivo a bordo del robot. 8
5
Nel confronto diffuso per π0.5 in FP8 su Jetson Thor, la latenza di inferenza end-to-end passa da 278 ms per la versione non ottimizzata a meno di 26 ms con APXInf: circa 10,7 volte più veloce. Il dato riportato è 38,46 inferenze al secondo, contro circa 3,6 ricavabili dai 278 ms iniziali. Alcuni resoconti menzionano anche 46 Hz, ma 26 ms e 38,46 Hz sono i valori coerenti tra loro nello stesso confronto. Si parla di frequenza di inferenza, non di una misura dell’intero ciclo sensore–attuatore né di una prova che ogni robot possa essere controllato a quella frequenza. 8
6
C’è anche un’altra distinzione utile: la tabella di benchmark del repository riporta per π0.5 FP8 su Jetson AGX Thor 41,16 ms e 24,3 inferenze al secondo. Non va trattata come se fosse lo stesso test del confronto promozionale sotto i 26 ms; per confrontarli occorrono condizioni di prova equivalenti. 5
8
Al lancio sono citati π0.5 e WALL-OSS, insieme a RTX 4090, Jetson Orin e Jetson Thor. Il repository descrive in particolare il percorso ottimizzato iniziale di π0.5 su Thor e Orin e opzioni BF16, FP8 e INT8. APXInf copre il lato inferenza e distribuzione dell’ecosistema RLinf; il pacchetto rivolto al robot offre anche un server WebSocket compatibile con l’interfaccia OpenPI. Compatibilità dell’interfaccia, però, non significa che ogni checkpoint OpenPI sia già stato portato. 4
5
1
La roadmap include ulteriori modelli vision-language-action (VLA), vision-language (VLM) e modelli del mondo, con Qwen e GR00T in fase di adattamento, oltre al lavoro su altri backend e piattaforme. Sono piani, non garanzie di supporto attuale. Prima di trasferire il risultato ottenuto su Thor a un altro checkpoint, una diversa precisione o un dispositivo con limiti di potenza più stretti, occorre ripetere il benchmark: velocità di inferenza, riuscita del compito e prestazioni sostenute entro i vincoli termici del robot sono misure diverse. 9
5
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
APXInf è un motore open source di inferenza per modelli di AI incarnata, sviluppato da Infinigence AI con le università Tsinghua e Shanghai Jiao Tong.
APXInf è un motore open source di inferenza per modelli di AI incarnata, sviluppato da Infinigence AI con le università Tsinghua e Shanghai Jiao Tong. Abbina un runtime leggero in Rust a interfacce Python e interviene su pipeline, grafi di esecuzione, kernel GPU e quantizzazione per ridurre i ritardi nell’elaborazione.
Per π0.5 in FP8 su Jetson Thor, il confronto pubblicato indica meno di 26 ms contro 278 ms della versione non ottimizzata, pari a circa 38,46 inferenze al secondo.