工具教程 · 神机百见-具身解读

开源三天的 APXInf 补上了后半程:从 RLinf 到端侧推理,无问芯穹在抢「具身运行时」的席位

9 月 15 日开源的 APXInf 把 π0.5 在 Jetson Thor 上的端到端推理延迟从 278ms 压到 26ms,三天后 CTO 专访又补上了 37000P、16 种芯片的公司底牌。这篇把「怎么用、能信多少、该问什么」一次讲清。

一分钟速览
  1. 是什么:9 月 15 日,无问芯穹联合清华、上交大开源具身端侧推理引擎 APXInf,专为机器人本体的 Batch=1、多视角、低时延负载设计。
  2. 头条数字:π0.5 在 Jetson AGX Thor 上 FP8 配置延迟 41.16ms / 24.3Hz,加 one-step action generation pruning 后 26.32ms / 38.0Hz;官方披露优化前整体延迟约 278ms。
  3. 成功率不降:LIBERO-10 上 π0.5 参考成功率 92.4%,BF16 版 92.8%、FP8 版 92.2%——量化加速未表现出明显任务损失。
  4. 工程栈:流水线/计算图/算子/量化四层优化 + Rust 轻量运行时 + Python 接口;支持 RTX 4090、Jetson Orin、Jetson Thor;首发适配 π0.5 与 WALL-OSS。
  5. 窗口内增量:9 月 18 日 CTO 李伯勋专访披露平台触达 37000P 算力、16 种芯片,芯片适配时间缩短至 2 天,国产芯片适配成本降低 70% 以上。
数据来源与边界
素材时间窗为 2026-09-18 09:00 → 19:00。事件本体(APXInf 开源)发生于 2026-09-15,属窗口外,量子位当晚 18:43 有完整报道;本窗口内的新增量是 2026-09-18 网易发布的无问芯穹 CTO 李伯勋专访(163.com/dy/article/L74L0R820552OH9Y.html)及其披露的平台侧新数字,本篇按「旧事件+窗口内新增量」规则处理,SRC 特此说明。性能数字取自 APXInf GitHub 官方仓库基准与官方披露口径,测试条件为两视角、224×224、10 flow steps、H=10、batch=1、steady-state CUDA Graph replay P50;「278ms→26ms」与「41.16ms→26.32ms」对应不同实验口径,不可混用。专访中的 37000P、16 种芯片、适配成本降幅为公司自报,未经独立核验。文中部署建议与生态判断为作者判断,已用「判断:」标注。
本文事实信息来自上方标注的公开来源;解读、判断与延伸部分为作者个人见解,写作过程使用了 AI 工具辅助整理,已由作者人工核实,不代表信息来源方立场。如有雷同纯属巧合;如涉及版权或权益问题,请联系 shenjibailian@shenjibailian.com,我们将在核实后及时删除或更正。
为什么几百毫秒对机器人是致命的,对聊天机器人不是

先把问题本身讲清楚。同一个 VLA 模型,在云端跑得好好的,装到机器人本体上,最先崩掉的不是模型能力,是推理系统:端侧算力有限、功耗受限,而机器人需要持续感知、连续决策、实时控制——几百毫秒的延迟意味着机械臂伸过去的时候,传送带上的杯子已经挪走了十几厘米。

APXInf 开源要解的就是这一段。按量子位报道的官方口径,π0.5 在 Jetson AGX Thor 上优化前的前端到端推理延迟约 278ms;APXInf 的 GitHub 基准进一步给出:FP8 标准配置下延迟 41.16ms、吞吐 24.3Hz,加入 one-step action generation pruning 后降至 26.32ms、38.0Hz。注意这两组数字对应的实验口径不同——前者是官方披露的整体优化前后对比,后者是当前公开基准测试里的两种配置,不能串成同一个实验步骤来读。

比延迟更重要的是成功率没掉:LIBERO-10 基准上,π0.5 参考成功率 92.4%,Jetson AGX Thor 上 BF16 版 92.8%、FP8 版 92.2%。量化换速度而没有明显牺牲任务成功率,这是这类引擎能进入量产讨论的前提。

APXInf 公开基准(Jetson AGX Thor + π0.5)GitHub 官方仓库口径
优化前整体延迟(官方披露)
约 278ms
FP8 标准配置
41.16ms / 24.3Hz
FP8 + 动作生成剪枝
26.32ms / 38.0Hz
LIBERO-10 成功率(FP8)
92.2%
延迟条形为相对 278ms 的示意比例;测试条件:两视角、224×224、10 flow steps、H=10、batch=1、P50。
上手三步:克隆、选卡、验成功率

对想真机部署的团队,这件事的工程门槛现在是这样三步:

第一步,确认硬件与模型组合。APXInf 公开版本已支持 RTX 4090、Jetson Orin、Jetson Thor 三档平台,首发适配 Physical Intelligence 的 π0.5 与国内自变量机器人的 WALL-OSS。按预算选卡即可:4090 适合实验室验证,Orin/Thor 面向本体部署。

第二步,克隆仓库跑基准。官方基准的测试条件写得清楚:两视角输入、224×224 分辨率、10 个流匹配步数、动作视野 H=10、batch=1,延迟指标取 steady-state CUDA Graph replay 的 P50。复现时务必对齐这组条件,否则数字没有可比性。

第三步,验成功率而不是验速度。在自己的任务上跑 LIBERO 同款对照:先测 BF16 基线成功率,再测 FP8 版本,两者差值超过 1–2 个百分点就要警惕。官方给出的参考是 BF16 92.8%、FP8 92.2%——如果你手上的任务掉得比这多,先查量化配置再查模型版本。

一个采购侧的提醒(源自海外媒体 RobotAIGeek 的分析,值得逐字记下):FP8 的 26ms 是用一定数值精度换来的速度,供应商演示的 26ms 不等于你产线上的 26ms。验收时固定问三件事——什么精度、什么模型、什么负载;要求厂商在实际所需精度下给出延迟与稳定性数据,而不是把 FP8 最优数字当成全配置保证。
窗口内的新增量:CTO 专访补上的公司底牌

开源三天后的 9 月 18 日,无问芯穹 CTO 李伯勋的专访披露了几个此前未成体系的公司侧数字:Agentic Infra 平台已触达 37000P 算力和 16 种芯片,新推出芯片的适配时间缩短至 2 天,国产芯片适配成本降低 70% 以上;此前公司已完成六种芯片 700 亿参数大模型混合训练,千卡集群算力利用率最高 97.6%,并联合中国电信完成超 4000 公里跨域训练、性能提升 165%。

把这些数字和 APXInf 的路线图拼起来,意图就很清楚了:模型适配上已启动 Qwen、Groot,硬件上要适配国产芯片后端与 AMD,还要支持国产机器人操作系统。一条开源链路已经成型——训练用 RLinf(2025 年 8–9 月开源),部署用 APXInf,无问芯穹在做的不是卖软件,是抢具身智能时代「运行时」的基础设施席位。公司累计融资超 22 亿元(腾讯、百度、联想、小米等参投),烧得起这个长周期。

判断:APXInf 的长期价值不在 26ms 这个头条数字,而在它试图把高度定制化的具身端侧部署沉淀为标准化工程基础设施——这对行业是好事,推理「最后一公里」的成本被开源打到了地板上,三个人的小团队用一个下午就能完成过去需要系统工程团队才能做的事。但有两层要泼冷水:其一,公开验证目前集中于英伟达 GPU/Jetson 平台,国产芯片与 AMD 后端的实际成熟度要等后续版本,路线图上的「芯片无关」目前还是愿景;其二,端侧推理赛道已有 TensorRT、ONNX Runtime 等通用框架和多家场景化方案,APXInf 能否成为事实标准,取决于多少模型、多少芯片被真实社区验证,而不是发布会。对部署团队的实用结论:现在就可以把 APXInf 拉下来做 PoC,但产线选型要等到它的国产芯片后端和更多模型适配经过第三方验证之后再定。
来源:APXInf GitHub 官方仓库基准数据、量子位 2026-09-15 18:43 报道、网易 2026-09-18 无问芯穹 CTO 李伯勋专访(163.com/dy/article/L74L0R820552OH9Y.html);素材时间窗:2026-09-18 09:00 → 19:00,开源事件(9 月 15 日)属窗口外,按「旧事件+窗口内专访新增量」处理;公司经营数字为专访自报口径。