面向文本辅助机器人视频预测的粒子世界建模

面向文本辅助机器人视频预测的粒子世界建模

Yafei Zhang, Nan Wu

1 分钟阅读2026年8月31日

预测场景将如何演化,对于机器人规划、表征学习和数据生成都十分有用。视频预测提供了一种通用接口,因为它保留了下游视觉策略所需的几何结构与外观信息。然而,真实机器人视频往往同时具有几个棘手特征:绝大多数像素保持静止,决定动作成败的却是细小的关节部件;同一条自然语言指令还可能对应视觉上截然不同的运动轨迹。因此,模型即使只是复制最后一帧,也可能在全局图像指标上取得不错的成绩,却根本没有学会真正重要的运动。

引言

AcrossVAM1.0 将不同职责分配给不同表征。语义粒子描述整个机器人、机械臂和夹爪的几何结构;一个紧凑的 Transformer 预测它们的未来状态;独立的因果外观分支则负责恢复细节。语言只通过逐特征调制注入动力学模块,使其对轨迹层面的影响能够被量化。稠密分支可以观察最后一帧上下文,但永远看不到未来帧,因此未来运动不会通过外观路径泄漏。

我们提出了一种以语义为锚点的粒子世界模型,将真实机器人视频动力学归约为紧凑的轨迹预测问题。其动力学核心仅包含 0.28M 个可训练参数,并能显式呈现部件级运动,便于诊断。

我们提出一种因果运动—外观解码器,将预测得到的粒子几何结构与仅来自上下文的稠密外观相结合,并明确控制静态区域清晰度与运动物体保真度之间的权衡。

我们将模型与持续性基线、打乱语言和随机控制、预言粒子、多随机种子实验以及按机器人划分的数据集进行比较。评估结果同时揭示了可靠的运动收益,以及语言 grounding 仍然有限这一事实。

问题定义

以对象为中心的状态,从相关对象及其部件的角度表示场景。

动力学函数预测对象中心状态随时间的变化。

解码器将预测的运动与上下文外观共同渲染出来。

冻结的语义粒子编码器

对于每一帧,冻结的 SAM3-DLP 编码器接收 RGB 图像和 VRS 部件掩码,提取对应于整个机器人、机械臂和夹爪的语义粒子,并生成一个空间背景潜变量。

每个语义粒子代表一个机器人部件或场景组件的编码状态。

无序提议需要建立时间对应关系。对于相邻帧,我们构造对应关系,并通过匈牙利匹配获得相匹配的粒子身份。上划线表示经过尺度归一化的坐标。在我们的离线 VRS 缓存中,固定的语义部件标识符已经确定了排列,因此我们在那里跳过匹配步骤;对于基于提议的推理,则保留该步骤。

复杂视觉条件下的机器人视频预测

文本辅助的粒子动力学

动力学输入由几何信息、一阶速度、深度、存在性,以及学习得到的槽位嵌入和时间嵌入拼接而成。一个因果时空 Transformer 在每个槽位内部交替进行时间推理,并建模机器人部件之间的交互。模型以自回归方式预测残差更新。

残差更新规定每个粒子状态的预测变化量。

文本特征由冻结的 OpenCLIP ConvNeXt-L/320 文本塔生成。

在每个 Transformer 模块中,可训练的 FiLM 映射都会注入指令语义。

逐特征线性调制利用语言条件参数,对中间动力学特征进行缩放和平移。

FiLM 投影以零值初始化,因此优化从无条件动力学开始,而不是从一个受到随机扰动的模型开始。我们将单步转移监督与自回归 rollout 监督结合起来。

训练目标同时包含下一步预测,以及对多步预测轨迹的监督。

表征与动力学

加入残差编码后,重建 PSNR 提升了 7.01 dB,这说明与其强行让对象状态承载纹理,不如采用双流结构。小型动力学模型在不同随机种子下都能稳定超过轨迹持续性基线。诊断结果表明,残差化的边界框坐标和原始外观特征会引入捷径;移除它们并采用步长为三的运动表示后,误差下降幅度从个位数低位提升至 21.0%。

模型是否使用了语言?

多随机种子实验中的正向差距,加上运动学伪文本和随机标签所产生的近乎为零的差距,表明 FiLM 确实捕捉到了真实的语义信号。不过,这一影响仍然很小,低于 10% 的目标值。因此,我们将 AcrossVAM1.0 描述为“文本辅助”,而不是“由指令控制”。自动生成描述中的动词召回率较低,也解释了为什么更大的语言编码器并不会自动带来更强的因果效应。

语言条件粒子模型在 Franka(+21.1%,136 个窗口)、WidowX(+19.0%,68 个窗口)和 UR5(+18.4%,8 个窗口)上取得提升,但在 Mobile ALOHA(60 个窗口)、Google Robot(32 个窗口)及若干较小子集上出现退化。非 Franka 数据的总体结果仍为正向(+10.0%,232 个窗口),但严格的留一机器人 Mobile ALOHA 实验并未超过持续性基线。

结论

我们提出了 AcrossVAM1.0,这是一种紧凑的文本辅助世界模型,将机器人视频预测视为语义粒子动力学与因果外观合成的结合。模型改善了轨迹预测和运动区域预测,而残差传递则恢复了大部分静态视觉保真度。严格的控制实验既展示了有效之处——低维运动建模——也揭示了尚未解决的问题——感知信息传递、语言依赖性以及跨机器人迁移。这样的分离为构建可解释的视频动作模型奠定了基础,也避免让总体图像指标掩盖失败模式。

常见问题

什么是 AcrossVAM1.0? AcrossVAM1.0 是一种用于机器人视频预测的紧凑文本辅助世界模型,基于语义粒子动力学和因果外观合成构建。

语义粒子代表什么? 它们代表整个机器人、机械臂和夹爪的几何结构,以及一个空间背景潜变量。

语言如何融入模型? 语言通过逐特征线性调制注入粒子动力学,所使用的特征来自冻结的 OpenCLIP 文本塔。

模型能否完全根据指令控制机器人的运动? 不能。测得的语言效应为正,但幅度很小,因此我们将该模型称为文本辅助模型,而不是指令控制模型。

🍪 Cookie 偏好设置

我们使用 Cookie 来衡量性能。 隐私政策