产品发布 · 神机百见-具身解读

一个模型开无人机也开机器狗:Perceptron Mk1.5 宣称提速 2–5 倍,托管平台记录的是 P99 30.95 秒

同一模型不用重训就能管无人机、四足和眼镜,这个卖点很亮。但真正决定它能不能上本体的是另一组数字:端到端延迟中位数 2.79 秒,P99 30.95 秒,工具调用错误率 5.55%。

一分钟速览
  1. 一个模型覆盖三类本体:Mk1.5 是单一具身智能体模型,面向无人机、四足机器人、智能眼镜及其他物理系统,无需为每个平台单独做一次重训。
  2. 上下文口径有两个:The Neuron 记为 32K 上下文,OpenRouter 模型页记为 37K——两个数字并列,报道未说明差异来源。
  3. 官方自报的提速:在同硬件下端到端比 Mk1 快约 2–5 倍;官方同时称在 4 项视频目标分割基准中的 3 项领先、EgoSchema 困难子集提升 12 分、内部 EgoChores 测试手部定位比 Gemini 3.8 Flash 好 50%。以上均为厂商自报,The Neuron 已明确标注。
  4. 定价:$0.15 / $1.50 每百万输入 / 输出 token。
  5. 音频被提为一等模态:官方示例为用多普勒效应预测卡车最接近观察者的精确时间戳。
  6. 托管平台实测(近三日):端到端延迟 P50 2.79 秒、P95 14.77 秒、P99 30.95 秒;工具调用错误率 5.55%;结构化输出错误率 1.83%;可用性 99.97%;缓存命中率 0.0%。
数据来源与边界
本文事实来自三方:The Neuron 2026-09-25(周五)AI 快讯对 Mk1.5 的发布要点整理、OpenRouter 模型页 perceptron/perceptron-mk1.5 的公开实测数据(页面标注统计区间为 2026-09-23 09:00 至 2026-09-26 09:00)、以及 AGI HUNT 2026-09-26 期的收录条目。素材时间窗为前一日 18:00 → 当日 09:00:Mk1.5 于美东 09-25 发布,北京时间 09-25 夜间至 09-26 早晨落地,属隔夜窗口内的新发布。需要明示的边界:① 全部基准成绩均为厂商自报,The Neuron 原文已注明 "Those benchmark comparisons are company-reported",无第三方独立复现;② 内部 EgoChores 测试为公司自建评测集,与公开基准不可比,且对比对象 Gemini 3.8 Flash 的版本与调用配置未披露;③ 上下文长度存在两个口径(The Neuron 32K / OpenRouter 37K),本文并列呈现,不择一;④ "2–5 倍提速"未说明测试硬件、输入模态与任务类型,是相对 Mk1 的比值,不是绝对延迟;⑤ OpenRouter 的延迟与错误率为单一托管平台、近三日、单供应商的观测值,样本请求量与调用方构成未披露,且该平台上的调用以通用应用为主(页面列出的头部应用为代码编辑器与 Web UI,非机器人控制),不能等同于本体上的实时控制表现;⑥ 缓存命中率 0.0% 意味着上述延迟未受益于任何缓存,是保守值;⑦ 端到端 P50 2.79 秒为平台统计口径,与官方所说"端到端比 Mk1 快 2–5 倍"不是同一个测量对象。与存量稿件的差异:本站产品发布类写过宇树 Dex5-S 灵巧手(硬件参数与工位边界)、Feather 模块化人形(本体单位经济),本篇落点是模型层"一套权重跨本体"这一主张,与它在托管平台上被独立记录到的延迟分布之间的落差。判断性内容均以"判断:"开头。
本文事实信息来自上方标注的公开来源;解读、判断与延伸部分为作者个人见解,写作过程使用了 AI 工具辅助整理,已由作者人工核实,不代表信息来源方立场。如有雷同纯属巧合;如涉及版权或权益问题,请联系 shenjibailian@shenjibailian.com,我们将在核实后及时删除或更正。
先把卖点和证据分开摆

Mk1.5 的卖点非常清晰:**一个模型,三种本体,不做平台级重训**。这句话如果成立,它改变的是具身智能的成本结构——现在每一类本体都要养一套自己的模型与数据闭环,如果一套权重能同时开无人机、四足和眼镜,那么新增一个本体形态的边际成本会大幅下降。

但卖点归卖点,能核实的证据是分开的。左边是厂商自报的能力,右边是托管平台独立记录的运行数据,两组数字讲的不是同一件事。

厂商自报(未独立验证)

4 项视频目标分割基准中 3 项领先;EgoSchema 困难集 +12 分;EgoChores 手部定位优于 Gemini 3.8 Flash 50%;端到端比 Mk1 快 2–5 倍。

托管平台实测(可复核)

端到端 P50 2.79 秒 / P95 14.77 秒 / P99 30.95 秒;工具调用错误率 5.55%;结构化输出错误率 1.83%;可用性 99.97%。

判断:这两组数字不该互相印证,也不该互相否定。前者测的是**能力上限**(在标准集上能不能答对),后者测的是**服务稳定性**(连续跑三天会不会掉链子)。做机器人选型时,第二组往往比第一组更早决定项目死活——因为能力不够可以换模型,延迟抖动则会直接变成安全风险。
P99 30.95 秒:真正该读的是尾部

OpenRouter 模型页给出的端到端延迟分布,是这条发布里最有价值的一组数字:

E2E P50
2.79 s
E2E P75
5.83 s
E2E P90
10.39 s
E2E P95
14.77 s
E2E P99
30.95 s
OpenRouter 近三日观测值,单供应商、缓存命中率 0.0%;条长按 P99 = 100% 归一化,仅呈现分布形态

中位数 2.79 秒,P99 30.95 秒——**尾部是中位数的约 11 倍**。这是典型的重负载、多工具调用场景的延迟分布:绝大部分请求在 3 秒内返回,但每 100 次里约有 1 次要等超过 30 秒。

再看错误率:**工具调用错误率 5.55%**,也就是大约每 18 次工具调用会有 1 次失败;**结构化输出错误率 1.83%**。Mk1.5 的一个核心设计就是把推理与世界知识拆开——遇到需要世界知识的问题,调用外部搜索与反向图像搜索,而不是把知识塞进权重。这个设计很省参数,代价是**把可靠性押在了工具调用上**。

判断:5.55% 的工具调用错误率,对一个聊天助手来说是"偶发重试",对一个正在移动的本体来说是"这一拍没有决策"。**模型层可以设计超时降级,物理层没有超时这个概念——机器人不会因为你没回就停在原地,它要么按上一拍的指令继续走,要么急停。** 所以这一类"推理与知识分离"的架构,在落地到本体之前必须先补一层工程:**工具调用失败时的默认动作是什么**。报道没有提及任何降级策略,这是目前公开信息里最大的空白。
"一套权重跨本体"到底跨了什么

官方对 Mk1.5 的能力描述可以拆成五条,其中三条是真正跨本体的,两条是通用能力:

能力描述是否依赖本体
飞行与四足控制零样本控制无人机与四足,无需平台级重训是,但宣称零样本
对象跟踪把物体作为带时间戳的几何来跟踪否,通用视觉能力
音频推理用多普勒效应预测卡车最接近的时刻否,但需本体有麦克风
外部工具调用搜索、反向图像搜索否
并行子智能体分解复杂任务,如识别篮中食材以检查过敏原否
表:按 The Neuron 与 AGI HUNT 对官方发布的整理拆分。"零样本控制"是唯一一条本体相关且被宣称免重训的能力。
判断:把这张表摊开之后,"一个模型管三种本体"这个主张的含金量取决于**"零样本控制"这四个字能兑现到什么程度**。其余四项——跟踪、音频、搜索、子智能体——本质上是通用多模态能力,任何足够强的 VLM 都能做,把它们和"控制"打包叙述会让卖点显得比实际更大。**真正该验证的是:同一套权重,在从未见过的四足本体上,不调参能走多远、能连续走多久。** 公开材料里没有这个测试。
32K 还是 37K:一个不该被忽略的小分歧

The Neuron 记为 **32K 上下文**,OpenRouter 模型页记为 **37K**。差 5K,约 15%。

这类分歧通常有两个来源:一是发布时宣传的"标称上下文"与实际上线时供应商配置的"有效上下文"不同(常见做法是留一部分给系统提示与输出);二是不同接入层统计口径不同。报道没有解释,两者也没有互相引用。

判断:这 5K 的差异本身不重要,重要的是它提醒了一件事——**模型的能力参数存在"发布稿口径"与"接入层口径"两套**。做工程选型时,以接入层(OpenRouter、官方 API 文档)为准,不要以发布博客为准。这类小分歧在处理长视频、长轨迹的具身场景里会被放大:第一人称视频是 token 消耗大户,上下文差 15% 直接决定了能塞进去多少秒的历史观测。
定价换算:一条一分钟的视频要多少钱

Mk1.5 定价 **$0.15 / $1.50** 每百万输入 / 输出 token。缓存命中率是 **0.0%**,意味着目前所有请求都在付全价。

这个价格对"推理 + 工具调用 + 子智能体"这种重调用模式是有意义的:一次复杂查询可能触发多轮工具调用与多个子智能体,每轮都要重新把上下文送进去。**在缓存命中率为 0 的情况下,成本与调用轮数近似线性相关**——这也从成本侧解释了为什么那 5.55% 的工具调用错误率值得关注:失败的那次调用,钱已经花了。

判断:具身智能的成本账,迟早要从"每 token 多少钱"换算成"**每一分钟自主运行多少钱**"。这个换算需要三个数:每秒 token 消耗(取决于帧率与上下文长度)、每秒调用轮数(取决于任务分解粒度)、以及失败重试率。**目前公开信息里一个都给不全**,所以 Mk1.5 现在还不能被算进任何一份可交付的运营成本表。这是它作为"开发者平台"的真实阶段——可以先跑原型,还不到能签 SLA 的时候。
参考来源:The Neuron《Everything That Happened in AI This Weekend So Far (Friday, September 25, 2026)》;OpenRouter 模型页 perceptron/perceptron-mk1.5(统计区间 2026-09-23 09:00 – 09-26 09:00);AGI HUNT 2026-09-26 期。抓取日期 2026-09-26。