Zero-WAM:面向开放式机器人任务泛化的人类视频指令

Zero-WAM:面向开放式机器人任务泛化的人类视频指令

Jiaming Zhou, Qihang Zhang, Gangwei Xu, Cunxin Fan, Yujie Zhao +7 更多

1 分钟阅读2026年8月27日

上下文人类Gen数据集

HumanGen是一个人—机器人上下文学习对数据集,由上下文人类视频生成流水线生成。每个数据对都包含一段生成的人类视频指令,以及与之对应、包含可执行动作的机器人轨迹。

HumanGen按照数据来源分为预训练ICL(外部)、预训练ICL(内部)、仿真ICL和真实世界ICL。与用于构建任务多样性VA数据的采样原则相同,源机器人视频按任务而非原始轨迹频次进行采样,从而避免ICL数据被少数任务的大量重复执行所主导。

预训练ICL(内部)

为进一步扩大任务覆盖范围,我们从内部机器人数据集中按任务采样机器人轨迹。该子集覆盖多种机器人本体,包括双臂Franka和Galaxea R1 Pro,共包含3,522个任务和30,247组人—机器人ICL数据对。

使用上下文人类视频生成流水线为该子集生成对应的人类视频时,我们降低了第三人称视角的比例,也减少了场景、物体和物体摆放位置发生变化的频率。这样既能保持任务多样性,又能生成视觉上更加对齐的ICL样本。

HumanGen中的人—机器人数据组合

仿真ICL

为支持仿真环境中的跨任务评测,我们针对50个RoboTwin任务生成了ICL数据。该子集包含2,500个ICL样本,每个任务50个样本。

其中43个任务用于后训练,共包含2,150个训练样本;其余7个任务作为未见任务保留,用于零样本跨任务评测。

真实世界ICL

真实世界ICL包含在双臂Franka评测机器人本体上采集的人—机器人数据对。该数据集覆盖评测中使用的三个真实世界任务族,共包含252组人—机器人ICL数据对:

  • 来自30种“物体放入容器”训练任务组合的120组数据对。
  • 来自16种“三物体顺序操作”训练任务组合的96组数据对。
  • 用于双桌腿插入任务的36组数据对。

该子集用于后训练,使模型能够拟合评测机器人本体的运动学特性,以支持跨任务评测。

Zero-WAM:上下文世界—动作建模

在零样本跨任务操作中,机器人必须在不进行微调的情况下执行全新的任务。为实现这一能力,我们使用大规模人—机器人ICL数据对以及任务均衡的机器人视频—动作数据,对世界动作模型进行预训练。

部署时,Zero-WAM既可以使用语言指令,也可以使用人类视频演示作为任务说明,从而驱动机器人执行未见任务。

RoboTwin中的零样本跨任务评测

实现

推理细节

预训练的Zero-WAM支持两种推理模式。

仅语言模式下,模型以语言指令为条件,不使用ICL人类视频,视频无分类器引导的引导系数设为5。

ICL模式下,模型以ICL人类视频为条件,并禁用语言指令。此时使用ICL无分类器引导,引导系数设为5。

两种模式的推理分块大小均固定为2,动作无分类器引导系数设为1.0。

结论与讨论

讨论

零样本跨任务泛化对于将通用机器人策略部署到开放式真实世界环境至关重要。要实现这一目标,既需要机器人基础策略具备更强的可迁移先验,也需要更加丰富的任务接口,以便通过多种模态传达任务意图。

人类演示是传递这类任务说明的自然来源,因此持续扩大其规模和多样性十分重要。尽管本文实验主要聚焦于静态桌面操作,未来工作应将这一范式拓展到更加复杂、动态且非结构化的环境,包括移动操作和时间跨度显著更长的任务。

在现有的可迁移经验来源中,以第一视角拍摄的人类视频尤其具有潜力,因为其采集规模远大于机器人演示。然而,由于人类与机器人在本体、观测和动作之间存在差异,如何利用这类数据仍然颇具挑战。

本文引入的语义对齐人—机器人数据,或许能够在海量第一视角人类视频与相对稀缺的机器人轨迹之间搭建桥梁。该数据形式在任务语义层面建立对应关系,而不要求动作层面精确对齐,因此有望让机器人策略从人类经验中获得广泛的任务知识,同时仅依赖少量机器人数据提供可执行动作监督。

真实世界Zero-WAM操作演示

跨任务机器人操作

跨任务机器人操作用于评估:对于某项任务,机器人是否能够在未为该任务采集机器人演示的情况下执行未见的操作任务。

与视觉泛化不同——例如在已见任务周围改变场景或物体属性——跨任务泛化更具挑战性,因为模型必须根据指令和当前观测,推断此前未见的、受任务条件约束的动力学规律。

世界动作模型

为使世界动作模型在测试时执行未见任务,近期研究开始探索测试时训练。

WAM-TTT在部署时利用原始人类视频更新轻量级记忆,从而引导冻结的世界动作模型。RoboTTT则采用快速权重测试时训练,将较长的执行历史压缩进策略状态中。

这些方法能够让模型在测试时执行未见任务,但仍需要通过记忆更新或快速权重更新进行测试时适应。相比之下,Zero-WAM采取了不同路径:它在预训练和后训练阶段引入人—机器人ICL数据以及任务均衡的视频—动作数据,使策略能够在测试时直接遵循上下文人类视频指令,实现零样本跨任务泛化。

用于机器人操作的人类视频数据

Zero-WAM正是针对这一缺失的数据范式而设计。HumanGen并不是逐任务采集人类演示,而是从按任务采样的机器人视频—动作数据中自动生成数据。

由于每段生成的人类视频都与一条保留可执行动作的机器人轨迹配对,HumanGen能够将人类视频指令与多样化任务的机器人动力学同步扩展。这使人类视频任务说明成为世界动作模型训练中可规模化的一环,并服务于零样本跨任务泛化。

常见问题

什么是Zero-WAM?

Zero-WAM是一种世界动作模型,能够利用语言指令或人类视频演示,在无需微调的情况下执行未见的机器人任务。

HumanGen数据集包含哪些内容?

HumanGen包含生成的人类视频指令,以及与之配对、保留可执行动作的对应机器人轨迹。

为什么要使用任务均衡的机器人视频—动作数据?

按任务采样可以避免上下文学习数据被少数任务的大量重复执行所主导。

主要局限与未来方向是什么?

实验主要聚焦于静态桌面操作;未来工作应进一步研究动态和非结构化环境、移动操作,以及时间跨度显著更长的任务。

🍪 Cookie 偏好设置

我们使用 Cookie 来衡量性能。 隐私政策