一句话生成一个「跑得起来」的世界:飞捷科思开源的三段工具链,缺的那段正好是最贵的
开源覆盖了「构建、感知、评测」三段,其中最容易被跳过、也最贵的一段是中间那步——把一个看起来对的三维场景,改造成物理上站得住、能直接被物理引擎接管的仿真环境。飞捷科思把它单独做成了一个项目。
- 开源主体与内容:国内物理 AI 基础设施企业飞捷科思向全球开发者开源三部分技术——Fysiverse-3D 三维世界构建技术体系、OmniFysics 物理感知系列模型、FysicsReason 可验证评测基准,覆盖物理 AI 的「构建、感知、评测」三个环节。
- 构建段(Fysiverse-3D):覆盖从自然语言描述到可执行三维世界生成的完整流程。其中的可验证空间文生图方案 SpatialGuard 把一句话里的物体位置与相互关系转成可检查的空间约束,走「规划—渲染—验证—修复」闭环;该成果已被 EMNLP 以长文形式录用。
- 重建与落地:Fysiverse-3D-Vision(F3V) 处理二维图像到对象级三维场景重建,分别解决「生成什么物体」与「物体放在哪里」,输出包含独立对象、空间关系和功能信息的结构化环境;Fysiverse-3D-SimReady(F3SR) 在其输出基础上做场景级「接地精修」,分重力一致初始化、输入视角对齐、场景图引导接触修正、智能体目标条件仿真四步。
- 感知与评测:OmniFysics 通过视频、图像、声音和文本分析物体运动、接触关系、材料属性,估算质量、摩擦、弹性等物理参数;FysicsReason 引入「世界状态变量」,把模型能力拆成世界感知与推理两个阶段,用于判断模型是「没看懂」还是「理解错了」。
- 交叉信源:界面新闻同日稿件提到,拓斯达联合飞捷科思发布的 Fysiverse 工业物理世界模型搭载全栈自研可微分物理仿真引擎,可还原工厂的刚度、形变、摩擦、负载、公差等物理特征。
飞捷科思这次开源的东西,按它自己的说法覆盖物理 AI 的三个环节:构建、感知、评测。三段分别对应三组组件:
这五段里,真正值得花时间读的是第三段。前面生成一个看起来对的三维场景,现在有不少模型能做;后面把一个场景接进物理引擎去训练策略,是训练场的日常。但两者之间有一道很具体的坎:生成的场景好看,不等于它能用。
开源生态里,模型和数据多,评测少。原因不复杂:模型和数据开源能带来引用和生态位,评测开源只带来被质疑的风险——你的判据一旦公开,就会有人拿它去测出难看的结果,然后指出是判据本身的问题。
FysicsReason 的做法是引入「世界状态变量」,把模型能力拆成世界感知和推理两个阶段,目标是回答一个更具体的问题:模型失败时,是没看懂,还是理解错了。这个区分在具身场景里很实用——同一句指令失败,可能是视觉没识别出物体,也可能是识别对了但推理的物理因果关系错了,后者的修复成本远高于前者。
报道里举的例子很好理解:输入「桌子旁边放着一把椅子,桌面上有一个杯子」,系统不仅要生成桌子、椅子、杯子,还要保证三者的位置关系符合描述。SpatialGuard 的作用是把这句话里的空间意图转成可检查的空间约束,再生成视觉观测。
把这条链路完整走一遍,大致是四个动作:先用一句话得到一个几何上成立的场景,再把图像重建成带独立对象的三维场景,然后把场景「接地」到物理引擎,最后在物理引擎里生成训练任务并跑策略。这套流程如果全部自动化,理论上意味着:一个训练场想扩充场景库时,不必再派人去实地扫描或用编辑器建模,改一句话就能生成一批新场景。
| 环节 | 传统做法 | 这条链路想替代的部分 |
|---|---|---|
| 场景来源 | 多视角实地扫描、人工三维建模 | 用自然语言描述直接生成场景(Fysiverse-3D) |
| 物体组织 | 建模时手工拆分与摆放资产 | 对象级重建,预测每个物体的位置、旋转与尺度(F3V) |
| 物理接地 | 在仿真编辑器里手工摆放、调碰撞体与接触 | 重力初始化 + 视角对齐 + 接触修正 + 条件仿真(F3SR) |
| 物理参数 | 凭经验设定摩擦、质量、弹性等参数 | 从多模态信息估算物理参数(OmniFysics) |
| 效果判断 | 看演示视频是否像、跑几个任务是否成功 | 按世界感知与推理两阶段做失败归因(FysicsReason) |
开源工具最容易出现的情况是「能跑通 demo,接不进自己的流程」。在动手之前,建议按四条去验,顺序不要颠倒。
一、验仿真里的静态稳定性。把 F3V 重建出的场景直接加载进你常用的物理引擎,不做任何人工调整,看物体在无操作状态下会不会自行位移、下落或互相穿透。这一条不通过,后面都不用测。
二、验参数是否可覆盖。用 OmniFysics 估算出的质量、摩擦、弹性,与你在真机上实测的参数比一次。物理参数估偏会让 sim-to-real 迁移直接失效,而且很难从演示里看出来。
三、验任务生成的多样性。同一个场景能不能自动生成多个变体(移动物体位置、替换同类物体、改变初始姿态)。这一条决定了它到底是「场景生成器」还是「图片美化器」——只有能批量变体的场景,才配得上训练用的语料。
四、验评测结果的可解释性。用 FysicsReason 测一个你已经知道会失败的模型,看它给出的归因是否与你的判断一致。归因不准的评测,比没有评测更危险,因为它会误导下一轮迭代方向。
物理 AI 的基础设施正在快速开源化,这个趋势对中小团队是利好,但用法需要挑。
对做二次开发和场景交付的团队来说,这套工具里性价比最高的可能不是生成部分,而是「接地」和「评测」两段。生成部分替代的是一次性建模成本,省下的是项目前期的时间;而接地与评测替代的是每个项目都要重复做的验证工作,省下的是长期的返工成本。前者省一次,后者省一辈子。
更现实的一点是:这类工具真正的用途往往不在交付本身,而在投标与方案阶段。客户提出的场景如果能在几分钟内生成一版可运行的仿真环境,方案评审的说服力会完全不同——图纸和视频都只能证明想法,能跑起来的仿真才能证明可行。