APXInf ist eine quelloffene Inferenz Engine von Infinigence AI, der Tsinghua Universität und der Shanghai Jiao Tong University für KI Modelle, die direkt auf Roboterhardware laufen. Für π0.5 in FP8 auf Jetson Thor wird eine Inferenzlatenz von unter 26 statt 278 Millisekunden angegeben.
Veröffentlicht vonBearbeitet mit GPT-6 SolBilder erstellt mit GPT Image 2
Forschungsantwort

Create a landscape editorial hero image for this Studio Global article: What is APXInf, the open source embodied edge inference engine released by Infinigence AI with Tsinghua University and Shanghai Jiao Tong Un. Article summary: APXInf is an open source inference engine from Infinigence AI, Tsinghua University, and Shanghai Jiao Tong University for running embodied AI policies close to a robot’s sensors and actuators.. Topic tags: general web, llm, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thum
Wenn ein Roboter aus Kamerabildern eine Bewegung ableiten soll, zählt nicht nur die Qualität des KI-Modells. Entscheidend ist auch, wie lange die Berechnung der nächsten Aktion dauert. APXInf setzt genau dort an: Die von Infinigence AI gemeinsam mit der Tsinghua-Universität und der Shanghai Jiao Tong University veröffentlichte Open-Source-Engine führt Modelle für Embodied AI – also KI für Systeme, die ihre Umgebung wahrnehmen und darin handeln – nahe an Sensoren und Aktoren aus. APXInf berechnet Modellantworten; die eigentliche Motorsteuerung ist nicht seine Aufgabe. 14
4
Eine schlanke Rust-Laufzeit verwaltet Ausführung und Speicher. Über Python-Schnittstellen können Entwicklerinnen und Entwickler die Modelle aus bestehender Robotik-Software aufrufen, ohne die leistungsrelevanten Berechnungen selbst in Python umsetzen zu müssen. Beim Portieren eines Modells beginnt der dokumentierte Ablauf mit einem festgelegten Referenz-Checkpoint und Testeingaben. Erst nachdem Ausgaben und Zwischenwerte mit der Referenz abgeglichen wurden, folgen die Optimierungen. So soll zunächst sichergestellt werden, dass die schnellere Implementierung dieselbe Berechnung ausführt. 3
5
Die Beschleunigung verteilt sich auf mehrere Ebenen: Pipeline-Optimierungen sollen Verzögerungen entlang des Inferenzpfads verringern. Graph Capture und wiederverwendete Speicherpuffer vermeiden wiederholte Vorbereitungsschritte. Angepasste GPU-Kernel beschleunigen aufwendige Rechenoperationen; Quantisierung etwa mit FP8 oder INT8 kann Rechenaufwand und Speicherverkehr senken. Das Ziel sind kurze und möglichst vorhersehbare Antwortzeiten beim Einsatz auf dem Roboter. 8
5
Für π0.5 in FP8 auf Jetson Thor nennt die veröffentlichte Gegenüberstellung eine End-to-End-Inferenzlatenz von 278 Millisekunden ohne Optimierung und unter 26 Millisekunden mit APXInf – eine Verringerung um ungefähr den Faktor 10,7. Dazu wird eine Rate von 38,46 Inferenzen pro Sekunde angegeben; aus 278 Millisekunden ergeben sich rechnerisch rund 3,6 pro Sekunde für die Vergleichsbasis. Die 38,46 sind eine Inferenzrate, kein Beleg dafür, dass der vollständige Weg von der Sensoraufnahme bis zur Motorbewegung bei jedem Roboter mit 38,46 Hz läuft. Einzelne Berichte nennen auch 46 Hz; die mehrfach angeführten 26 Millisekunden und 38,46 Hz passen rechnerisch zueinander. 8
6
Wichtig für den Vergleich: Die Tabelle im öffentlichen Projekt-Repository weist für Jetson AGX Thor mit FP8 auch 41,16 Millisekunden beziehungsweise 24,3 Hz aus. Der Wert unter 26 Millisekunden sollte deshalb nicht ohne Kenntnis des jeweiligen Testaufbaus mit dem Repository-Wert gleichgesetzt werden. 5
8
Zum Start werden π0.5 und WALL-OSS sowie Jetson Orin, Jetson Thor und RTX 4090 genannt. Das Repository beschreibt insbesondere einen optimierten π0.5-Pfad für Thor und Orin und führt BF16, FP8 und INT8 als Präzisionsoptionen auf. APXInf übernimmt innerhalb des RLinf-Umfelds die Inferenz und Bereitstellung: Für eine APXInf-beschleunigte π0.5-Auswertung dokumentiert RLinf die Beibehaltung der OpenPI-Transformationen. Das roboterseitige Paket bietet zudem einen OpenPI-kompatiblen WebSocket-Server. Diese Schnittstellenkompatibilität bedeutet nicht, dass bereits jeder OpenPI-Checkpoint portiert wurde. 4
5
Auf der Roadmap stehen weitere VLA-Modelle (Vision-Language-Action), VLMs (Vision-Language-Modelle) und Weltmodelle; Qwen und GR00T befinden sich demnach in Anpassung. Auch zusätzliche Hardware-Backends und Plattformen sind geplant – nicht bereits pauschal unterstützt. 9 Wer APXInf für einen konkreten Roboter beurteilen will, muss mit dem eigenen Checkpoint, Zahlenformat, Gerät und Leistungsbudget messen. Inferenzlatenz allein belegt weder erfolgreiche Aufgaben im laufenden Regelkreis noch dauerhaftes Tempo unter den Strom- und Wärmegrenzen eines Roboters.
5
8
Studio Global AI
Diese Seite enthält eine quellengestützte Antwort, die Sie in Studio Global fortsetzen können.
APXInf ist eine quelloffene Inferenz Engine von Infinigence AI, der Tsinghua Universität und der Shanghai Jiao Tong University für KI Modelle, die direkt auf Roboterhardware laufen.
APXInf ist eine quelloffene Inferenz Engine von Infinigence AI, der Tsinghua Universität und der Shanghai Jiao Tong University für KI Modelle, die direkt auf Roboterhardware laufen. Für π0.5 in FP8 auf Jetson Thor wird eine Inferenzlatenz von unter 26 statt 278 Millisekunden angegeben.
Das Projekt kombiniert eine schlanke Rust Laufzeit mit Python Schnittstellen. Die veröffentlichten Leistungswerte hängen von Modell, Präzision, Hardware und Testaufbau ab.