用于语言落地机器人控制、学习与迁移的持久化程序

用于语言落地机器人控制、学习与迁移的持久化程序

Weiqi Wang, Zhi Li, Yudong Lei, David Martinez, Xiaofeng Gao +5 更多

1 分钟阅读2026年9月1日

相关工作

自主机器人数据生成

数据生成器通过在不同场景配置之间重新定位以物体为参照的示范片段,并将行为分解为由规划运动连接的可复用技能,从而扩展机器人的经验。这些方法能将稀疏示范转化为多样化的模仿学习数据,但任务语义仍然受原始任务束缚,缺少独立且接地的监控器来验证学习策略的执行结果。

用于语言落地机器人控制、学习与策略生成的 SUN 流程

表述可靠性

C 行报告了语言交互的开销。Kuafu 每个任务使用 110.5k 个 token,而 Eureka 的一次性奖励搜索使用 234.4k 个 token。相比之下,VoxPoser 每次 rollout 使用 16.99 次调用和 31.6k 个 token。

按报告的平均速率计算,以调用次数衡量时,VoxPoser 的累计交互开销仅执行两次后就超过 Kuafu;以 token 数量衡量时,则在四次 rollout 后超过。因此,构建持久化程序可以将语言交互从反复产生的执行成本转化为任务级成本。

视觉学习与零样本迁移

在实际部署中,每个仿真设置都会复现与工作空间对应的两台或三台 RGB-D 相机的标定配置,并采用受限随机化。

数据集规模扩大为每个任务 1,000 条轨迹,所得策略无需现实世界微调即可部署。DP3 在六个任务、三种机器人—夹爪配置的 106 次试验中成功 36 次,且未进行现实世界微调。这带来了 34.72% 的任务宏平均成功率,并在所有测试任务上均取得了非零成功率。

合并后的成功率为 33.96%,95% Wilson 区间为 25.6–43.4%。规模最小的任务取得 2/6 次成功,其区间为 9.7–70.0%。

对失败试验的检查表明,精准获取抓取是当前剩余的主要挑战。T1 的成功率最低,仅为 15%;在 T7 中,抓取是观察到的最常见失败模式。

这些结果表明,利用持久化 SUN 程序生成的数据集,可以实现零样本 sim-to-real 迁移。

用于评估视觉学习与零样本迁移的任务测试集

结论

适用范围与局限性

SUN 程序依赖于已注册的场景接口,该接口需要提供信息充分的物体坐标系与轴向,同时还依赖有限的类型化算子库。因此,如果不定义新的算子,Kuafu 无法处理可变形物体或流体。

评估未涵盖保留指令、算子、场景语义或任务组合,因此无法据此对开放世界泛化能力作出强有力的结论。

在方法层面,阶段监控器只能单调推进,发生物理回归后无法回滚。此外,Q95 指标相对于模型预测控制进行定义,用于衡量相对于特定规划器的效率,而不是轨迹的绝对质量。

最后,在六个任务和 106 次试验上的验证证明了所测试机器人—夹爪配置具备零样本可行性,但并不能保证其在非结构化环境中具有广泛可靠的 sim-to-real 性能。

常见问题

持久化 SUN 程序的主要用途是什么? 它们将语言交互从反复产生的执行成本转化为任务级成本,同时支持对学习策略执行结果进行验证。

Kuafu 每个任务使用多少 token? Kuafu 每个任务使用 110.5k 个 token。

DP3 在实际部署中的表现如何? DP3 在六个任务、三种机器人—夹爪配置的 106 次试验中成功 36 次,且未进行现实世界微调。

失败试验揭示的主要剩余挑战是什么? 精准获取抓取是当前剩余的主要挑战;在 T7 中,抓取是观察到的最常见失败模式。

🍪 Cookie 偏好设置

我们使用 Cookie 来衡量性能。 隐私政策