9 月 15 日,无问芯穹联合清华大学、上海交通大学开源了一个具身智能端侧推理引擎,名字叫 APXInf,代码已经放到 GitHub 上(仓库在 RLinf 组织下)。官方给出的核心数字是:在 Jetson Thor 上,PI 0.5 模型用 FP8 精度推理,端到端延迟从 278 毫秒降到 26 毫秒以内。

这条新闻表面上是"某开源项目发布",但真正值得开发者关注的是它指向的那个问题:具身智能落地时,卡住的往往不是模型够不够聪明,而是推理系统能不能在机器人本体上跑得够快、够稳。

一、为什么端侧推理是具身智能的瓶颈

云端聊天机器人的延迟标准,和机器人本体完全不是一个量级。

  • 对对话类应用来说,多几百毫秒只是"感觉有点慢",用户等一下就过去了;
    • 对需要持续感知、连续决策、实时控制的机器人来说,几百毫秒意味着动作迟滞、轨迹不连贯,甚至任务直接失败。
      具身模型(VLA 这类)的完整链路是"眼睛看到 → 大脑决策 → 手脚动起来",这一圈必须在极短时间内闭环。所以把一个在云端跑得好好的具身模型搬到机器人本体,首先要面对的不是模型能力问题,而是推理系统问题:在有限的算力、功耗、散热和成本约束下,同时满足小 Batch、低延迟和持续实时交互。

这里有个细节可以自己算一下,很能说明问题:

# 26ms 的端到端延迟,对应的控制频率上限是多少
latency_ms = 26
hz = 1000 / latency_ms
print(f"理论上限约 {hz:.2f} Hz")
# 输出:理论上限约 38.46 Hz

官方给出的 Jetson Thor 上 PI 0.5 FP8 推理频率 38.46Hz,来源就是这个 26ms 的端到端延迟。频率不是单独优化出来的,它是延迟的倒数——这也是为什么端侧推理优化盯的始终是那一条完整链路,而不是某一个算子。

二、这次开源具体做了什么

按公开信息,APXInf 走的是"多层优化 + 定制运行时"的路子:

  1. 多层优化:从 Pipeline、计算图(Graph)、算子 Kernel 到量化,逐层压低端到端延迟,并用融合算子做极限优化;
    1. 极简运行时:运行时用 Rust 写,接口用 Python 封装。Rust 的价值不只是快,更在于内存安全特性可以从源头降低崩溃和异常概率——机器人长时间运行时,稳定性比峰值性能更重要;
    1. 面向 Agentic Engineering 设计:目标是让新模型、新本体的适配和接入变快,降低接入成本。
      用一句大白话总结:它不是把云端推理框架"搬"到机器人上,而是针对端侧小 Batch、低延迟、长时运行的场景重新设计。

三、支持范围和 Roadmap

已支持的计算平台:

  • NVIDIA RTX 4090(开发/验证)
    • NVIDIA Jetson Orin
    • NVIDIA Jetson Thor(当前性能数据的主平台)
      首发支持的模型包括 PI 0.5、WALL-OSS。官方给出的后续路线图涵盖:VLA、VLM、世界模型等更多模型类型,适配 Qwen、Groot 等;做 nvfp4 精度优化;支持国产芯片算力后端和国产机器人操作系统;适配 AMD 等主流芯片。

需要注意,APXInf 是无问芯穹 RLinf 开源生态里的端侧推理项目。此前(2025 年 9 月)该团队开源过面向具身智能的大规模强化学习训练框架 RLinf,这次相当于把链路从"训练与评测"延伸到了"本体推理与部署"。

四、对普通开发者意味着什么

我的判断是三点:

第一,门槛在转移。 前两年做具身智能,难点在"能不能训出能用的模型";现在模型能力逐渐够用了,难点往工程侧移动——推理延迟、部署稳定性、长时运行的可预测性。这对做系统、做推理优化的开发者是机会。

第二,官方数字要看清适用条件。 278ms → 26ms 是在特定硬件(Jetson Thor)+ 特定模型(PI 0.5)+ 特定精度(FP8)下测出来的。换了机器人本体、换了传感器、换了模型结构,都得重新验证。别把这组数字直接当成自己项目的预期值。

第三,长期稳定性还缺证据。 开源项目给的是能力和数据,真实场景里能不能扛住延迟抖动、算力与内存消耗、多模块并发,只有在物理世界上跑够久才知道。这也是具身智能从 Demo 走向规模化绕不开的一关。

对想上手的同学,务实路线是:先在 RTX 4090 上把链路跑通、验证效果,再看目标本体的算力和功耗预算,最后才谈优化。顺序错了,很容易在错误的目标上做大量无用功。


具身智能这两年从不缺发布,缺的是"能在真实机器人上长期稳定干活"的工程答案。APXInf 补的是其中一环,但答案最终只能在实际部署里得到。你在做端侧推理或者机器人部署吗?遇到的最大瓶颈是延迟、功耗还是稳定性?评论区聊聊。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐