Criado pela Infinigence AI com a Universidade Tsinghua e a Universidade Jiao Tong de Xangai, o APXInf executa modelos de IA incorporada no dispositivo usado pelo robô. Na comparação divulgada para o π0.5 em FP8 no Jetson Thor, a latência de inferência caiu de 278 ms para menos de 26 ms, com taxa informada de 38,46 i...
Publicado porEditado com GPT-6 SolImagens geradas com GPT Image 2
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: What is APXInf, the open source embodied edge inference engine released by Infinigence AI with Tsinghua University and Shanghai Jiao Tong Un. Article summary: APXInf is an open source inference engine from Infinigence AI, Tsinghua University, and Shanghai Jiao Tong University for running embodied AI policies close to a robot’s sensors and actuators.. Topic tags: general web, llm, agents, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clickbait thum
Quando um robô usa um modelo de IA para decidir o próximo movimento, não basta que a resposta esteja correta: ela precisa chegar a tempo. O APXInf é um motor de inferência de código aberto, lançado pela Infinigence AI em colaboração com a Universidade Tsinghua e a Universidade Jiao Tong de Xangai, para executar esses modelos perto dos sensores e atuadores, no próprio dispositivo. Seu papel é encurtar o intervalo entre receber uma observação e gerar uma ação — não substituir o controlador dos motores. 9
4
A base é um ambiente de execução enxuto em Rust, responsável por gerenciar execução e memória. Interfaces em Python permitem chamar as políticas a partir de código familiar a quem desenvolve aplicações de robótica. Na migração de um modelo para o motor, o fluxo descrito parte de um checkpoint de referência e de entradas de teste fixas: antes de otimizar, compara a implementação adaptada com as saídas e os valores intermediários da referência. A intenção é ganhar velocidade sem perder de vista se o modelo continua produzindo os resultados esperados. 3
5
A aceleração atua em várias camadas. A organização do pipeline procura reduzir esperas ao longo da inferência; a captura do grafo de execução e o reaproveitamento de buffers evitam preparações repetidas; kernels ajustados aceleram operações custosas na GPU; e a quantização em formatos como FP8 e INT8 pode diminuir o volume de cálculo e a movimentação de dados na memória. Essas otimizações buscam tornar a geração de ações mais rápida e previsível em hardware embarcado. 8
5
Na comparação divulgada para o modelo π0.5 em FP8 no Jetson Thor, a latência de inferência de ponta a ponta passou de 278 ms, na configuração não otimizada, para menos de 26 ms com o APXInf: uma redução de aproximadamente 10,7 vezes. A taxa informada é de 38,46 inferências por segundo, contra cerca de 3,6 por segundo correspondentes a 278 ms. Isso mede a inferência, não demonstra que todo o ciclo do robô — da leitura dos sensores ao acionamento dos motores — opere a 38,46 Hz. 8
9
Há uma ressalva para quem pretende usar o número como referência de desempenho: o repositório do projeto apresenta 41,16 ms e 24,3 inferências por segundo para π0.5 em FP8 no Jetson AGX Thor. Portanto, o resultado de menos de 26 ms divulgado no lançamento e o valor da tabela do repositório não devem ser apresentados como se fossem a mesma medição. Algumas reportagens também mencionam 46 Hz, embora os valores reiterados de 26 ms e 38,46 Hz sejam compatíveis entre si. Sem reproduzir as condições de cada teste, não dá para transferir uma dessas taxas diretamente para outra configuração. 5
6
8
A divulgação inicial cita π0.5 e WALL-OSS, além das plataformas RTX 4090, Jetson Orin e Jetson Thor. O repositório destaca especificamente o caminho otimizado da primeira versão para π0.5 em Thor e Orin, com opções de precisão BF16, FP8 e INT8; isso não significa que todas as combinações de modelo, dispositivo e precisão tenham o mesmo grau de otimização. 9
5
O APXInf ocupa a parte de inferência e implantação no ecossistema RLinf. O pacote voltado ao robô também oferece um servidor WebSocket compatível com a interface do OpenPI. Compatibilidade de interface, porém, não quer dizer que todos os checkpoints do OpenPI já tenham sido adaptados para o motor. 5
1
Os planos anunciados incluem ampliar o suporte a modelos de visão-linguagem-ação (VLA), modelos de visão e linguagem (VLM) e modelos de mundo, com Qwen e GR00T em adaptação, além de trabalhar em outros backends e plataformas. São itens de um roteiro de desenvolvimento, não garantias de suporte atual. Para avaliar o APXInf em um robô específico, é preciso repetir os testes com o checkpoint, a precisão, o dispositivo e os limites de potência pretendidos. Latência de inferência, isoladamente, não comprova sucesso da tarefa em malha fechada nem desempenho sustentado sob restrições térmicas e energéticas. 9
5
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
Criado pela Infinigence AI com a Universidade Tsinghua e a Universidade Jiao Tong de Xangai, o APXInf executa modelos de IA incorporada no dispositivo usado pelo robô.
Criado pela Infinigence AI com a Universidade Tsinghua e a Universidade Jiao Tong de Xangai, o APXInf executa modelos de IA incorporada no dispositivo usado pelo robô. Na comparação divulgada para o π0.5 em FP8 no Jetson Thor, a latência de inferência caiu de 278 ms para menos de 26 ms, com taxa informada de 38,46 inferências por segundo.
O repositório publica outro resultado para π0.5 em FP8 no Jetson AGX Thor: 41,16 ms e 24,3 inferências por segundo.