ChainSplat 帮助机器人从 RGB 视频中学习柔性物体运动

ChainSplat 帮助机器人从 RGB 视频中学习柔性物体运动

Seungyeon Kim, Noémie Jaquier

1 分钟阅读2026年8月31日

ChainSplat 能将多视角 RGB 视频中的绳状物体转化为紧凑的物理数字孪生体,预测物体如何弯曲、扭转和移动。该系统将基于螺旋理论的刚体力学与 3D Gaussian Splatting 相结合,无需深度传感器,也不依赖数量庞大的粒子表示,为机器人仿真、状态估计、力估计和基于模型的操作提供了实用基础。

目录

研究人员构建了什么?

ChainSplat 是一种用于可变形线性物体(DLO)的学习式动力学模型。DLO 包括绳索、电缆、线材、软管和传送带等细长柔性物体。与刚性箱体或机器人连杆不同,DLO 可以在多个位置发生弯曲,因此其形状难以表示,未来运动也难以预测。

系统将 DLO 表示为一串相互连接的刚性区段。这并不意味着真实物体被视为刚体;相反,这条链为连续弯曲提供了一种紧凑的近似。每个连接处都有运动轴和关节状态,因此模型只需一组相对较少的变量,就能描述物体形状,而不必依赖数千个彼此独立的 3D 粒子。

ChainSplat 还采用 3D Gaussian Splatting。这种计算机视觉技术用大量柔和、带颜色的 3D 高斯基元表示场景,并能高效地从不同视角进行渲染。在 ChainSplat 中,高斯表示负责呈现物体的视觉外观,而基于螺旋理论的链式模型则提供物理结构。

训练过程使用同步的多视角 RGB 视频,无需额外搭建深度感知流程。训练完成后,模型可以模拟物体运动、优化操作轨迹、根据摄像头视频流估计物体状态,并在交互过程中推断外部作用力。

ChainSplat 的几何、动力学、渲染与估计组件

主要成果是什么?

ChainSplat 在两种交互环境中对三种不同的可变形线性物体进行了评估:桌面环境和自由空间。实验考察的不只是被动运动预测,还检验了这一学习式数字孪生体是否能够支持基于模型的操作、状态估计和外部力估计。

一个值得注意的结果是,同一套通用框架既支持多视角训练,也支持单摄像头监测。模型利用多视角 RGB 观测进行训练,随后在测试中使用 RealSense 摄像头提供的单路 RGB 视频,估计人推动或拉动物体时的状态。这一点很重要:多摄像头采集有利于建立模型,但在实际部署中往往不够方便。

研究将 ChainSplat 与构建 DLO 数字孪生体的先进方法进行了比较。评估重点包括学习到的几何结构和动力学质量、复现观测轨迹的能力,以及模型对操作规划的实用价值。实验还选择了那些在运动足够丰富的轨迹上训练的模型,这一点十分关键:如果模型只接触过幅度很小或高度重复的运动,就无法辨识柔性物体的完整行为。

论文所提供的内容报告了三种 DLO、两种物理场景,以及单摄像头下的力和状态估计,但没有给出数值基准成绩。因此,核心证据主要体现在功能层面:同一种紧凑表示被贯穿用于视觉重建、动力学学习、运动预测和交互分析。

ChainSplat 如何工作?

ChainSplat 承担两个相互关联的任务:学习 DLO 的外观,并学习 DLO 的运动方式。

首先,DLO 被描述为串联式开链机构。螺旋理论为描述链上各区段的运动提供了数学语言,使用一种六维运动量,通常称为 twist。Twist 同时包含线位移和旋转。借助指数积(product-of-exponentials)公式,可以根据基座位姿和关节变量计算每个区段的位姿。这样,系统便能直接建立紧凑关节状态与物体完整 3D 构型之间的联系。

其次,3D Gaussian Splatting 将视觉信息附着到这条链上。每个高斯基元在渲染过程中都会贡献颜色、不透明度、位置和空间范围。给定摄像头视角后,系统可以渲染出预测的 DLO 图像,并将其与观测到的 RGB 帧进行比较。因此,视觉表示与运动学结构是共同学习的,而不是先分别完成重建、再进行拼接。

训练过程包含一个运动学感知的几何识别阶段。该阶段从视频中估计 DLO 的关节轨迹和几何表示。随后,动力学辨识阶段接收机器人控制的基座轨迹,对开链动力学进行积分,并不断调整动力学参数,直到模拟出的关节轨迹与视频估计得到的轨迹相匹配。

这种分工具有实际意义。几何阶段解释物体处于什么构型,动力学阶段则估计力、惯性和运动如何随时间变化。最终得到的模型可以用于轨迹优化,不过论文展示的规划策略仍是开环的。开环控制器会预先规划动作,而不是根据新的观测持续修正动作。

ChainSplat 还包含一个面向闭环应用的状态估计框架。单个 RGB 摄像头提供 DLO 的观测,模型则在桌面或自由空间交互过程中估计其构型。随后,外部力估计可以识别人推动或拉动等扰动。完整的闭环操作系统尚未在论文中展示,但该估计器为实现此类系统提供了关键组件。

用于预测可变形物体运动的递归开链动力学

ChainSplat 为什么对机器人学重要?

柔性物体广泛存在于工厂、仓库、实验室和服务场景中,但机器人仍很难可靠地处理它们。机器人抓取电缆、布置软管、插入导线或整理柔性物品时,必须预测物体接触后会如何变形。形状估计中的微小误差,都可能导致抓取失败、碰撞、缠绕或插入位置错误。

ChainSplat 解决了现有 DLO 模型中的一个重要权衡。基于粒子的系统能够描述复杂形状,但庞大的状态空间会让规划和基于模型的控制成本高昂。它们还经常依赖深度测量和中间 3D 粒子跟踪,从而引入额外误差来源。ChainSplat 则采用紧凑的链式状态,并直接从 RGB 观测中学习外观。

这一设计或许尤其适合摄像头比深度传感器更易安装的机器人工作站,也适合反光、细小、颜色较深或部分被遮挡的物体——这些情况都可能导致深度读数质量下降。基于模型的规划组件与在售协作机器人相关,因为协作机器人可能需要在人类附近处理电缆、织物类零件或柔性包装。

类似思路也可以帮助仓储机器人处理捆扎带、充电线、袋装物品和可变形包裹。不过,在这两类场景中,实际价值取决于学习到的模型能否迁移到训练轨迹之外,并以足够快的速度支持实时控制。

利用学习到的可变形物体数字孪生体进行基于模型的操作

ChainSplat 有哪些局限?

ChainSplat 仍然依赖合适的多视角 RGB 训练数据、摄像头标定,以及包含足够运动信息的轨迹,以便揭示 DLO 的动力学。若模型只在有限的弯曲、扭转、速度或接触条件下训练,它并不会自动理解所有构型。

开链近似也会将连续可变形物体压缩为相互连接的区段。这样做提高了效率,却可能损失细粒度行为,尤其是在物体发生拉伸、屈曲、接触模式变化或复杂自接触时。论文展示的操作策略是开环的,因此模型误差和意外扰动尚未由完整的反馈控制器加以修正。

单摄像头状态与力估计很有前景,但遮挡、光照变化、快速运动以及与环境接触,仍然是实际应用中的挑战。在投入生产级机器人系统之前,还需要针对不同材料、长度、摩擦条件和拥挤工作空间开展更广泛的测试。

常见问题

ChainSplat 可以建模哪些物体? 它可以建模绳索、电缆、导线、软管及其他类似的细长柔性物品。

ChainSplat 需要深度摄像头吗? 不需要。模型通过多视角 RGB 视频学习,交互测试中的状态和力估计框架则使用单个 RGB 摄像头。

为什么要在物理模型中使用 Gaussian Splatting? Gaussian Splatting 为 DLO 提供可渲染的视觉表示,而基于螺旋理论的力学则为其运动和动力学提供紧凑描述。

ChainSplat 已经是完整的全自动闭环操作系统了吗? 还不是。研究展示了基于模型的轨迹优化,并提出了可用于未来反馈控制的状态估计方法,但完整的闭环操作系统仍有待实现。

结论

ChainSplat 将紧凑的开链物理模型与 3D Gaussian Splatting 相结合,直接从 RGB 视频中学习可变形物体的动力学。它在多种 DLO、桌面和自由空间交互,以及单摄像头估计任务中的演示,展现了提升电缆、绳索、软管和柔性零件操作能力的一条实用途径。

哪一类柔性物体任务最能从紧凑、基于 RGB 视频训练的动力学模型中受益?

🍪 Cookie 偏好设置

我们使用 Cookie 来衡量性能。 隐私政策