APXInf je otevřený engine pro spouštění modelů přímo na robotu; nenahrazuje jeho řídicí jednotku. U modelu π0.5 ve formátu FP8 na Jetson Thor autoři uvádějí zkrácení latence inference z 278 ms na méně než 26 ms.
PublikovalUpraveno pomocí GPT-6 SolObrázky vytvořeny pomocí GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is APXInf, the open source embodied edge inference engine released by Infinigence AI with Tsinghua University and Shanghai Jiao Tong Un. Article summary: APXInf is an open source inference engine from Infinigence AI, Tsinghua University, and Shanghai Jiao Tong University for running embodied AI policies close to a robot’s sensors and actuators.. Topic tags: general web, llm, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thum
Když robot zpracuje obraz z kamery, model musí včas navrhnout další akci. APXInf je otevřený inferenční engine, který má tento výpočet spouštět co nejblíže senzorům a akčním členům robota. Zveřejnila jej společnost Infinigence AI ve spolupráci s univerzitami Tsinghua a Shanghai Jiao Tong. APXInf není nový robotický model ani samotný motorový regulátor: jeho úkolem je zkrátit dobu mezi vstupem pro model a jím vypočtenou akcí. 14
4
Lehké běhové prostředí napsané v Rustu spravuje provádění výpočtů a paměť. Rozhraní pro Python umožňuje vývojářům volat modelovou politiku z prostředí, které už používají v robotickém softwaru. Při převodu modelu do APXInf se podle popsaného postupu nejprve stanoví referenční checkpoint a testovací vstupy. Výstupy i mezivýsledky převedené verze se porovnají s referencí; teprve poté přicházejí na řadu výkonové optimalizace. Jde o důležitou kontrolu, protože rychlejší výpočet by neměl nepozorovaně změnit chování modelu. 3
5
Zrychlení má několik vrstev. Pipeline organizuje jednotlivé kroky inference tak, aby se neplýtvalo časem v celé výpočetní cestě. Zachycený výpočetní graf a opakovaně použitelné paměťové buffery omezují režii při opakovaném spouštění. Vyladěné GPU kernely, tedy výpočetní operace na grafickém procesoru, urychlují náročné části modelu. Kvantizace do formátů, jako jsou FP8 či INT8, může snížit objem výpočtů a přenosů dat. Smyslem jejich kombinace je rychlejší a předvídatelnější generování akcí přímo na robotu. 8
5
Ve zveřejněném srovnání pro π0.5 ve formátu FP8 na Jetson Thor klesla latence inference od vstupu po výstup z 278 ms u neoptimalizované výchozí varianty na méně než 26 ms. To odpovídá přibližně 10,7násobnému zkrácení latence. Uváděných 38,46 inferencí za sekundu lze srovnat s přibližně 3,6 inferencemi za sekundu, které odpovídají 278 ms. Nejde však o důkaz, že celý cyklus každého robota — od sejmutí dat ze senzorů po provedení pohybu — poběží na 38,46 Hz. Některé zprávy zmiňují také 46 Hz; pro toto srovnání je vhodnější držet se opakovaně uváděné dvojice méně než 26 ms a 38,46 Hz. 8
6
Ani všechna zveřejněná měření APXInf nejsou zaměnitelná. Tabulka v repozitáři například uvádí pro π0.5 v FP8 na Jetson AGX Thor latenci 41,16 ms a 24,3 Hz. Údaj pod 26 ms z úvodního srovnání proto není univerzální hodnotou pro každé měření na Thor; při porovnávání je nutné ověřit přesné podmínky testu. 5
8
Při uvedení projektu byly jmenovány modely π0.5 a WALL-OSS a platformy RTX 4090, Jetson Orin a Jetson Thor. Repozitář zvlášť popisuje vysoce optimalizovanou cestu první verze pro π0.5 na Thor a Orin a možnosti přesnosti BF16, FP8 a INT8. To neznamená, že každá kombinace uvedeného modelu, zařízení a přesnosti má stejnou míru optimalizace. 4
5
APXInf představuje inferenční a nasazovací část ekosystému RLinf, zaměřeného na práci s robotickými modely. Balíček určený pro napojení robota nabízí také WebSocket server kompatibilní s rozhraním OpenPI. Kompatibilita rozhraní ale sama o sobě neznamená, že už je do APXInf převeden každý checkpoint OpenPI. 5
1
V plánech jsou další modely typu VLA (obraz, jazyk a akce), VLM (obraz a jazyk) i modely prostředí; uvádějí se například adaptace Qwen a GR00T a práce na dalších hardwarových backendech. Jde o plán, nikoli o příslib současné podpory. Výsledek pro Thor nelze bez nového měření přenést na jiný checkpoint, přesnost, zařízení ani napájecí limit. Samotná rychlost inference navíc neprokazuje úspěšnost robota při úkolu ani dlouhodobý výkon při jeho tepelných a energetických omezeních. 9
5
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
APXInf je otevřený engine pro spouštění modelů přímo na robotu; nenahrazuje jeho řídicí jednotku.
APXInf je otevřený engine pro spouštění modelů přímo na robotu; nenahrazuje jeho řídicí jednotku. U modelu π0.5 ve formátu FP8 na Jetson Thor autoři uvádějí zkrácení latence inference z 278 ms na méně než 26 ms.
Údaj 38,46 inferencí za sekundu není zaručenou frekvencí celé řídicí smyčky robota.