工具教程 · 神机百见-具身解读

一句话生成一个「跑得起来」的世界:飞捷科思开源的三段工具链,缺的那段正好是最贵的

开源覆盖了「构建、感知、评测」三段,其中最容易被跳过、也最贵的一段是中间那步——把一个看起来对的三维场景,改造成物理上站得住、能直接被物理引擎接管的仿真环境。飞捷科思把它单独做成了一个项目。

一分钟速览
  1. 开源主体与内容:国内物理 AI 基础设施企业飞捷科思向全球开发者开源三部分技术——Fysiverse-3D 三维世界构建技术体系、OmniFysics 物理感知系列模型、FysicsReason 可验证评测基准,覆盖物理 AI 的「构建、感知、评测」三个环节。
  2. 构建段(Fysiverse-3D):覆盖从自然语言描述到可执行三维世界生成的完整流程。其中的可验证空间文生图方案 SpatialGuard 把一句话里的物体位置与相互关系转成可检查的空间约束,走「规划—渲染—验证—修复」闭环;该成果已被 EMNLP 以长文形式录用。
  3. 重建与落地:Fysiverse-3D-Vision(F3V) 处理二维图像到对象级三维场景重建,分别解决「生成什么物体」与「物体放在哪里」,输出包含独立对象、空间关系和功能信息的结构化环境;Fysiverse-3D-SimReady(F3SR) 在其输出基础上做场景级「接地精修」,分重力一致初始化、输入视角对齐、场景图引导接触修正、智能体目标条件仿真四步。
  4. 感知与评测:OmniFysics 通过视频、图像、声音和文本分析物体运动、接触关系、材料属性,估算质量、摩擦、弹性等物理参数;FysicsReason 引入「世界状态变量」,把模型能力拆成世界感知与推理两个阶段,用于判断模型是「没看懂」还是「理解错了」。
  5. 交叉信源:界面新闻同日稿件提到,拓斯达联合飞捷科思发布的 Fysiverse 工业物理世界模型搭载全栈自研可微分物理仿真引擎,可还原工厂的刚度、形变、摩擦、负载、公差等物理特征。
数据来源与边界
本篇素材主体来自 IT 时报记者贾天荣 2026 年 9 月 30 日的报道(腾讯新闻同日转载,URL 含日期标识 20260930),发布时间约在当日 18:30 前后,落在素材时间窗「当日 09:00 → 19:00」内;技术组件名称、闭环四步、四步接地精修流程、EMNLP 录用信息与各模型能力描述,均为该篇对飞捷科思官方介绍的转述。交叉信源为界面新闻同日刊发的拓斯达稿件,其中提及「拓斯达联合飞捷科思发布的 Fysiverse 工业物理世界模型」及其可微分物理仿真引擎的能力描述。不确定边界:①飞捷科思的具体开源仓库地址、代码许可协议、模型权重开放范围,报道中均未给出,本批未获独立核实;②各组件的能力描述均为厂商口径,报道未给出任何可复现的量化指标(如重建精度、物理稳定性通过率、评测基准的题目数量与模型得分);③「已被 EMNLP 以长文形式录用」出自厂商介绍,未标注论文题目与作者,本批未获会议论文页核实;④界面新闻稿件中的 Fysiverse 描述面向工业场景,与 IT 时报稿件所述的开源范围(三维世界构建 + 物理感知 + 评测基准)是否为同一套组件,报道未明确,本篇并列呈现不合并。因此本篇标注 vendor=1。与既有稿件的差异:本站既往稿件中,170 号稿写过枢途科技与无问智科的数据基建融资(数据生产与评测的商业化侧),本篇写的是同日开源的一套工具链本身(技术组件与使用路径),一篇是资本视角、一篇是工具视角,不重复。事实与判断分开,判断以「判断:」开头。
本文事实信息来自上方标注的公开来源;解读、判断与延伸部分为作者个人见解,写作过程使用了 AI 工具辅助整理,已由作者人工核实,不代表信息来源方立场。如有雷同纯属巧合;如涉及版权或权益问题,请联系 shenjibailian@shenjibailian.com,我们将在核实后及时删除或更正。
三段链条里,中间那段最容易被跳过

飞捷科思这次开源的东西,按它自己的说法覆盖物理 AI 的三个环节:构建、感知、评测。三段分别对应三组组件:

构建
Fysiverse-3D 三维世界构建体系:从一句话生成符合空间关系的图像,再转化为能跑在物理引擎里的三维环境。内含可验证空间文生图方案 SpatialGuard(规划—渲染—验证—修复闭环,成果已被 EMNLP 录用)
重建
Fysiverse-3D-Vision(F3V):二维图像到对象级三维场景重建,分别处理「生成什么物体」和「物体放在哪里」,输出带独立对象、空间关系与功能信息的结构化环境
接地
Fysiverse-3D-SimReady(F3SR):把重建结果转成仿真就绪环境,经重力一致初始化、输入视角对齐、场景图引导接触修正、智能体目标条件仿真四步做「接地精修」
感知
OmniFysics:从视频、图像、声音、文本中分析物体运动、接触关系、材料属性,估算质量、摩擦、弹性等物理参数
评测
FysicsReason:引入「世界状态变量」,把模型能力拆成世界感知与推理两段,用于区分模型是「没看懂」还是「理解错了」

这五段里,真正值得花时间读的是第三段。前面生成一个看起来对的三维场景,现在有不少模型能做;后面把一个场景接进物理引擎去训练策略,是训练场的日常。但两者之间有一道很具体的坎:生成的场景好看,不等于它能用。

判断:这道坎在工程上有个很日常的表现——杯子悬在桌面以上两毫米,看起来和放在桌上没区别,但物理引擎一启动,它会掉下去;两个物体表面看着贴合,实际有穿透,仿真里会爆炸性地弹开。这类问题在视觉上不可见,却让场景无法用于训练。所以 F3SR 的四步里,「重力一致初始化」和「场景图引导接触修正」这两步解决的正是仿真能不能跑起来的问题。这个环节过去是靠人工在编辑器里一个个摆、一个个调,属于典型的「没人愿意做但必须做」的活。把它做成自动化流程,价值不在炫技,在于把人工摆放的时间省下来。
评测这段为什么难得

开源生态里,模型和数据多,评测少。原因不复杂:模型和数据开源能带来引用和生态位,评测开源只带来被质疑的风险——你的判据一旦公开,就会有人拿它去测出难看的结果,然后指出是判据本身的问题。

FysicsReason 的做法是引入「世界状态变量」,把模型能力拆成世界感知和推理两个阶段,目标是回答一个更具体的问题:模型失败时,是没看懂,还是理解错了。这个区分在具身场景里很实用——同一句指令失败,可能是视觉没识别出物体,也可能是识别对了但推理的物理因果关系错了,后者的修复成本远高于前者。

判断:这类「失败归因型」评测,比单一准确率数字有用得多,因为它直接指向上游该改哪里。长期来看,具身智能行业真正缺的不是更高的分数,而是统一的失败分类方式——当所有团队都用同一套失败标签去统计自己的模型时,横向比较才有意义。这也是为什么开源评测基准虽然短期不讨好,却往往比开源模型更有长期价值。
从「一句话」到「可训练环境」,中间的真实工作量

报道里举的例子很好理解:输入「桌子旁边放着一把椅子,桌面上有一个杯子」,系统不仅要生成桌子、椅子、杯子,还要保证三者的位置关系符合描述。SpatialGuard 的作用是把这句话里的空间意图转成可检查的空间约束,再生成视觉观测。

把这条链路完整走一遍,大致是四个动作:先用一句话得到一个几何上成立的场景,再把图像重建成带独立对象的三维场景,然后把场景「接地」到物理引擎,最后在物理引擎里生成训练任务并跑策略。这套流程如果全部自动化,理论上意味着:一个训练场想扩充场景库时,不必再派人去实地扫描或用编辑器建模,改一句话就能生成一批新场景。

环节传统做法这条链路想替代的部分
场景来源多视角实地扫描、人工三维建模用自然语言描述直接生成场景(Fysiverse-3D)
物体组织建模时手工拆分与摆放资产对象级重建,预测每个物体的位置、旋转与尺度(F3V)
物理接地在仿真编辑器里手工摆放、调碰撞体与接触重力初始化 + 视角对齐 + 接触修正 + 条件仿真(F3SR)
物理参数凭经验设定摩擦、质量、弹性等参数从多模态信息估算物理参数(OmniFysics)
效果判断看演示视频是否像、跑几个任务是否成功按世界感知与推理两阶段做失败归因(FysicsReason)
表注:「传统做法」栏为行业通行流程的概括描述,非飞捷科思官方对照表;「这条链路想替代的部分」栏依据 IT 时报报道所述各组件能力整理,均为厂商口径。
判断:这张表里最值钱的一行是第三行。训练场建设的时间成本,长期以来不在算力也不在场地,而在「把场景一个个手工搭进仿真里」这段人力活上——一个复杂场景从扫描到能在引擎里跑起来,往往要工程师花上数天。如果这条链路能把这段时间从「天」压到「分钟」,训练场的经济学才会真正改变:不是能建多少场景,而是每天能重置多少次场景。这也是评估这套工具到底管不管用的唯一硬标准。
怎么验:四条可执行的检查项

开源工具最容易出现的情况是「能跑通 demo,接不进自己的流程」。在动手之前,建议按四条去验,顺序不要颠倒。

一、验仿真里的静态稳定性。把 F3V 重建出的场景直接加载进你常用的物理引擎,不做任何人工调整,看物体在无操作状态下会不会自行位移、下落或互相穿透。这一条不通过,后面都不用测。

二、验参数是否可覆盖。用 OmniFysics 估算出的质量、摩擦、弹性,与你在真机上实测的参数比一次。物理参数估偏会让 sim-to-real 迁移直接失效,而且很难从演示里看出来。

三、验任务生成的多样性。同一个场景能不能自动生成多个变体(移动物体位置、替换同类物体、改变初始姿态)。这一条决定了它到底是「场景生成器」还是「图片美化器」——只有能批量变体的场景,才配得上训练用的语料。

四、验评测结果的可解释性。用 FysicsReason 测一个你已经知道会失败的模型,看它给出的归因是否与你的判断一致。归因不准的评测,比没有评测更危险,因为它会误导下一轮迭代方向。

判断:这四条里,第一和第三条决定能不能用,第二和第四条决定用了之后能不能改进。需要提醒的是,目前公开报道里没有任何一项可复现的量化指标——没有重建精度、没有物理稳定性通过率、没有评测基准的题目数量与模型得分。在拿到这些数字之前,这套工具链应该被当作「值得在自己的场景里做一次小规模实测的候选」,而不是「已经验证过的解决方案」。厂商口径与独立验证之间的距离,恰恰需要第一批接入的团队来填。
对做交付的团队,这条新闻的用法

物理 AI 的基础设施正在快速开源化,这个趋势对中小团队是利好,但用法需要挑。

对做二次开发和场景交付的团队来说,这套工具里性价比最高的可能不是生成部分,而是「接地」和「评测」两段。生成部分替代的是一次性建模成本,省下的是项目前期的时间;而接地与评测替代的是每个项目都要重复做的验证工作,省下的是长期的返工成本。前者省一次,后者省一辈子。

更现实的一点是:这类工具真正的用途往往不在交付本身,而在投标与方案阶段。客户提出的场景如果能在几分钟内生成一版可运行的仿真环境,方案评审的说服力会完全不同——图纸和视频都只能证明想法,能跑起来的仿真才能证明可行。

判断:接下来一年,物理 AI 的工具链竞争会集中在「谁能把仿真就绪这一步做成标准动作」。理由很简单:模型可以各家自研,评测可以各自定义,但把一个场景变成能跑的仿真环境这件事,工程细节高度相似,几乎不存在差异化的空间,最终一定会被开源工具吃掉。真正需要提前准备的是团队能力——谁能更快把这套流程接进自己的项目节奏,谁在同样的报价下就能多做几个场景。工具是免费的,熟练度不是。
来源:IT 时报《一句话生成可运行世界 飞捷科思开源物理 AI「闭环」》(记者贾天荣,2026-09-30),界面新闻同日拓斯达稿件交叉引用;素材时间窗为当天 09:00 → 19:00。