开源三天的 APXInf 补上了后半程:从 RLinf 到端侧推理,无问芯穹在抢「具身运行时」的席位
9 月 15 日开源的 APXInf 把 π0.5 在 Jetson Thor 上的端到端推理延迟从 278ms 压到 26ms,三天后 CTO 专访又补上了 37000P、16 种芯片的公司底牌。这篇把「怎么用、能信多少、该问什么」一次讲清。
- 是什么:9 月 15 日,无问芯穹联合清华、上交大开源具身端侧推理引擎 APXInf,专为机器人本体的 Batch=1、多视角、低时延负载设计。
- 头条数字:π0.5 在 Jetson AGX Thor 上 FP8 配置延迟 41.16ms / 24.3Hz,加 one-step action generation pruning 后 26.32ms / 38.0Hz;官方披露优化前整体延迟约 278ms。
- 成功率不降:LIBERO-10 上 π0.5 参考成功率 92.4%,BF16 版 92.8%、FP8 版 92.2%——量化加速未表现出明显任务损失。
- 工程栈:流水线/计算图/算子/量化四层优化 + Rust 轻量运行时 + Python 接口;支持 RTX 4090、Jetson Orin、Jetson Thor;首发适配 π0.5 与 WALL-OSS。
- 窗口内增量:9 月 18 日 CTO 李伯勋专访披露平台触达 37000P 算力、16 种芯片,芯片适配时间缩短至 2 天,国产芯片适配成本降低 70% 以上。
先把问题本身讲清楚。同一个 VLA 模型,在云端跑得好好的,装到机器人本体上,最先崩掉的不是模型能力,是推理系统:端侧算力有限、功耗受限,而机器人需要持续感知、连续决策、实时控制——几百毫秒的延迟意味着机械臂伸过去的时候,传送带上的杯子已经挪走了十几厘米。
APXInf 开源要解的就是这一段。按量子位报道的官方口径,π0.5 在 Jetson AGX Thor 上优化前的前端到端推理延迟约 278ms;APXInf 的 GitHub 基准进一步给出:FP8 标准配置下延迟 41.16ms、吞吐 24.3Hz,加入 one-step action generation pruning 后降至 26.32ms、38.0Hz。注意这两组数字对应的实验口径不同——前者是官方披露的整体优化前后对比,后者是当前公开基准测试里的两种配置,不能串成同一个实验步骤来读。
比延迟更重要的是成功率没掉:LIBERO-10 基准上,π0.5 参考成功率 92.4%,Jetson AGX Thor 上 BF16 版 92.8%、FP8 版 92.2%。量化换速度而没有明显牺牲任务成功率,这是这类引擎能进入量产讨论的前提。
对想真机部署的团队,这件事的工程门槛现在是这样三步:
第一步,确认硬件与模型组合。APXInf 公开版本已支持 RTX 4090、Jetson Orin、Jetson Thor 三档平台,首发适配 Physical Intelligence 的 π0.5 与国内自变量机器人的 WALL-OSS。按预算选卡即可:4090 适合实验室验证,Orin/Thor 面向本体部署。
第二步,克隆仓库跑基准。官方基准的测试条件写得清楚:两视角输入、224×224 分辨率、10 个流匹配步数、动作视野 H=10、batch=1,延迟指标取 steady-state CUDA Graph replay 的 P50。复现时务必对齐这组条件,否则数字没有可比性。
第三步,验成功率而不是验速度。在自己的任务上跑 LIBERO 同款对照:先测 BF16 基线成功率,再测 FP8 版本,两者差值超过 1–2 个百分点就要警惕。官方给出的参考是 BF16 92.8%、FP8 92.2%——如果你手上的任务掉得比这多,先查量化配置再查模型版本。
开源三天后的 9 月 18 日,无问芯穹 CTO 李伯勋的专访披露了几个此前未成体系的公司侧数字:Agentic Infra 平台已触达 37000P 算力和 16 种芯片,新推出芯片的适配时间缩短至 2 天,国产芯片适配成本降低 70% 以上;此前公司已完成六种芯片 700 亿参数大模型混合训练,千卡集群算力利用率最高 97.6%,并联合中国电信完成超 4000 公里跨域训练、性能提升 165%。
把这些数字和 APXInf 的路线图拼起来,意图就很清楚了:模型适配上已启动 Qwen、Groot,硬件上要适配国产芯片后端与 AMD,还要支持国产机器人操作系统。一条开源链路已经成型——训练用 RLinf(2025 年 8–9 月开源),部署用 APXInf,无问芯穹在做的不是卖软件,是抢具身智能时代「运行时」的基础设施席位。公司累计融资超 22 亿元(腾讯、百度、联想、小米等参投),烧得起这个长周期。