新模型教会机器人用不确定的潜在动作预测视觉变化

新模型教会机器人用不确定的潜在动作预测视觉变化

Zuojin Tang, Feifan Luo, Haoyun Liu, Botai Yuan, Dekang Qi +8 更多

1 分钟阅读2026年8月30日

一篇最新论文提出了DLAM(Distributional Latent Actions with Temporal Constraints,带时间约束的分布式潜在动作)方法。该方法不再将机器人的视觉变化建模为单一的确定性数值,而是将其表示为概率高斯分布。这样一来,模型便能捕捉机器人动作改变视觉观测时存在的不确定性,从而在真实世界的控制任务中实现更准确的预测和更出色的下游性能。

目录

研究人员构建了什么

DLAM是一种表示学习框架,能够将视觉变化序列——例如机器人把积木从一个位置推到另一个位置——转换为带对角高斯分布的概率潜向量。此前的研究使用确定性潜在动作,因此会丢失结果中蕴含的歧义和变化信息。DLAM则为每次变化同时学习均值和逐维方差,从而刻画模型对变化各个特征的置信程度。

这项工作的核心创新,是同时对均值和方差施加两类时间约束:组合约束要求两个连续潜在动作之和,与整个合并变化对应的潜在动作一致;逆向约束则要求一个动作的逆操作产生大小相等、方向相反的潜在动作。这些约束作用于由等时间间隔组成、经过归一化的三元组,为模型提供了比确定性方法更丰富的训练信号。在真实机器人控制中,编码器保持冻结,只有均值潜在动作被传入一个同时接收机器人关节指令的流匹配策略,因此无需修改原有策略架构,就能进一步提升表示的控制效果。

示意图:组合约束和逆向约束如何作用于等间隔的潜在动作三元组

主要结果

研究人员在仿真环境和真实机器人任务中,将DLAM与多个基线方法进行了比较。重建质量——即模型根据潜在动作重新生成已观测视觉变化的能力——通过一种常用的尺度归一化探针进行评估。采用完整约束(均值加方差,以及归一化的组合约束和逆向约束)的DLAM,在直接重建和累积重建保真度方面均取得了最高成绩。受控消融实验表明,归一化均值约束是性能提升的主要来源;而学习方差以及考虑相关性的组合约束,则为下游策略性能带来了互补增益。

在策略迁移测试中,冻结的编码器仅向流匹配策略提供后验均值形式的变化序列,作为辅助目标。DLAM始终优于确定性潜在动作模型。完整版本还在关系结构诊断中表现更好,说明与不学习方差或使用未归一化约束的变体相比,其潜在空间更好地保留了时间结构。虽然论文没有公布具体的基准数值,但作者表示,在受控实验设置下,DLAM“在重建质量、关系结构诊断和策略迁移方面均达到最佳”。在需要精确视觉预测的任务中,优势尤其明显,例如堆叠和插销插入。

工作原理

DLAM从机器人工作空间的视频流开始处理。对于每一对连续帧(动作执行前后的观测),模型会将其编码为一个对角高斯潜在动作:一个均值向量和一个对数方差向量。随后,重建解码器以源帧和潜在动作分布为输入,并在训练期间通过重参数化采样,重建目标帧。损失函数同时包含重建项和KL散度项,用于让潜在分布接近标准高斯先验。

为确保时间一致性,DLAM会采样由等时间间隔组成的观测三元组(例如第t帧、第t+k帧和第t+2k帧)。模型计算三个潜在动作:从t到t+k、从t+k到t+2k,以及从t到t+2k。组合约束要求前两个潜在动作之和(在均值域和方差域中)与第三个一致。逆向约束则要求,从t到t+k的潜在动作,在相同视觉状态下,应当是从t+k返回t的潜在动作的相反数。两类约束都会按时间间隔长度进行归一化,使其不受尺度影响。

训练过程中,方差与均值通过这些约束联合学习;但在下游策略中,仅使用均值向量。该策略是一个流匹配模型,根据当前观测和目标图像生成动作序列。冻结的编码器提供一串均值潜在动作,这些动作与机器人本体感觉数据拼接后,作为辅助条件输入。这样既能注入预训练表示中的丰富时间信息,又无需改变策略架构。

这对机器人技术为何重要

在开放环境中运行的机器人需要预测自身动作将如何改变周围世界,而这种变化往往具有不确定性。DLAM以分布形式明确表达这种不确定性,有望提升机器人在操作、装配和移动导航等任务中的安全性与鲁棒性。通过施加组合约束和逆向约束,模型能够学习出一个可以进行代数运算的潜在空间,让动作能够像物理学中的力或速度一样相互组合。

对于部署待售二手协作机器人二手工业机器人的企业而言,集成这类学习型动力学模型,有望减少机器人切换任务时所需的真实世界微调量。DLAM能够配合冻结的编码器和标准策略后端运行,因此可以较为实际地接入现有控制系统。该方法也与机器人基础模型这一更广泛的发展趋势相呼应:借助从视觉数据中预训练的表示,无需从头训练,就能加速人形机器人仓储机器人的学习。

局限性与未决问题

DLAM只对等时间间隔的三元组施加约束,因此对长时域泛化能力的研究仍然不足。方差目标可能随时间退化为近似恒定的数值,从而抵消学习不确定性的意义。由于下游迁移会舍弃方差,只使用后验均值,所学习的不确定性主要充当辅助训练信号,并不能为决策提供经过校准的置信度。此外,按维度独立的对角方差假设,可能无法捕捉完整协方差所能表达的、依赖上下文或维度之间的关系。未来的研究可以将约束扩展到可变时间间隔,在策略执行中引入不确定性,并探索结构化协方差模型。

真实世界机器人操作场景,展示DLAM评估中使用的工作空间和任务示例

常见问题

DLAM是一种基于模型的强化学习方法吗? 不是。DLAM是一种表示学习技术,用于通过时间约束对视觉编码器进行预训练。之后,学习到的表示会作为辅助输入,提供给独立的策略学习过程,例如基于流匹配的模仿学习。

哪些类型的机器人能够从DLAM中受益? 任何配备摄像头、能够观察动作所引起变化的机器人都可以使用DLAM。该方法已在仿真环境和真实世界的操作平台上得到验证,因此适用于协作机器人、工业机械臂和移动操作机器人。

DLAM需要真实动作标签吗? 需要。在预训练阶段,潜在动作序列来自已知的机器人指令或状态差异。约束还依赖帧的时间顺序,但不需要明确的目标标签。

DLAM与确定性潜在动作模型相比表现如何? 在重建质量、时间一致性诊断和下游策略成功率方面,DLAM始终优于确定性基线,尤其适合存在视觉不确定性的任务。

结论

DLAM提出了一种有原则的方法:通过对均值和方差同时施加组合约束与逆向约束,从视觉观测中学习分布式潜在动作。由此得到的表示提高了重建保真度和下游控制性能,同时不会让策略学习流程变得复杂。这项工作为构建更稳健的机器人视觉动力学模型开辟了道路,使机器人能够更好地应对真实世界中的各种变化。

如果机器人的视觉预测能够表达不确定性,你会如何在闭环控制中利用这些信息?

🍪 Cookie 偏好设置

我们使用 Cookie 来衡量性能。 隐私政策