相关工作
我们并未声称提出了根本性全新的课程学习原则。相反,我们展示了一种简单改进的基于成功的采样方法,结合多样化重置和大规模强化学习,能够解决具有挑战性的运动与装配任务,而先前的采样方法难以学会这些任务。
强化学习训练中的算法选择
除了采样器本身,SGS 还采用了两项经过审慎考虑、相互配合的算法选择,以支持在广泛的任务配置空间中使用 PPO 进行训练。
各任务领域内共享奖励
我们为所有运动任务使用一个简单的奖励函数,为所有操作任务使用另一个。两者都将回合结束时获得的布尔型任务成功奖励,与相对较小的机器人专属逐步正则化项结合起来。
共享奖励设计无需为每种地形或装配任务分别指定奖励函数。附录 A.3 列出了各领域使用的奖励项及其权重。
实验结果
通过一系列大规模扩展研究,我们探讨以下问题:
- 扩展性: 随着并行训练环境增多,SGS 是否比均匀采样和 PLR 更具扩展性?
- 能力: 即使在较小规模下,SGS 是否能解锁先前方法无法解决的机器人任务?
- 迁移: 使用 SGS 学到的灵巧操作行为能否零样本迁移到真实硬件?
操作
所有操作任务均使用同一个简单的奖励函数,并采用多样化的模拟器重置。我们的主要操作扩展实验使用了重力课程,之后我们发现该课程并无必要;附录 B.4 介绍了其实现方法并通过消融实验评估其影响。

运动
以往工作中的地形通常具有线性结构,其难度由坡度或台阶高度等参数决定,这些参数从简单到困难线性插值。对于我们程序生成的地形,可能不存在明确的难度顺序,因此难度轴可以理解为不同的随机种子。
本文使用的地形展示在图 3 的中间行和底部行;受篇幅限制,我们未展示 Inverted Slope。
观测、动作与奖励
我们将介绍每种机器人形态对应的观测空间和动作空间,随后说明奖励定义及其权重。
运动策略观测机身线速度和角速度、投影重力、关节位置和速度、上一个动作、目标指令,以及局部地形高度扫描。其 12 维动作指定相对于机器人标称姿态的关节位置偏移量,由关节控制器跟踪这些偏移量。
与可学习性采样方法的比较
正文中的表 1 比较了 SFL 和 SGS 在运动任务上的表现。我们使用 SFL 的默认超参数,并报告 3 个训练随机种子上的均值和 95% 置信区间。
在两种规模下,SFL 的最终表现都低于 SGS。在 32K 规模下,SFL 的最佳检查点表现接近 SGS,但仍逊于 SGS。值得注意的是,随着训练继续进行,SFL 的表现显著下降,在更大规模下尤为明显;而 SGS 在训练过程中持续提升。
SGS 超参数与配置密度
对于每种任务配置,我们使用循环缓冲区,保存最新的固定长度历史记录中的布尔结果。采样时,我们先为核权重设置下限,再据此构造 logits,并将温度下限设为 1。
硬件与控制设置
我们使用 UR5e 机械臂和 Robotiq 2F-85 夹爪,并采用 OmniReset 的相对笛卡尔操作空间控制接口。我们的相机配置为一个第三人称相机和一个腕部相机,而非 OmniReset 的三个相机。点云教师策略和 RGB 学生策略详见附录 C.3。
NIST 板由抛光亚克力制成。当腕部相机正对板面时,机器人会看到自己的倒影,这属于分布外情况。较低的表面摩擦力也会影响那些利用板面重新定向物体的策略。基于这些原因,我们在评估期间用胶带覆盖了板面。

仿真建模与领域随机化
我们沿用 OmniReset 的领域随机化设置,在点云观测中加入小幅高斯噪声,并围绕实测的真实质量对物体质量进行随机化。
教师—学生蒸馏
每次迭代都会在所有环境中各采集一步,将学生策略向教师策略的动作更新,并丢弃这些数据。这样可以限制 GPU 内存占用;当仿真和渲染与训练同时运行时,GPU 内存会成为瓶颈。
然而,训练成功可能具有误导性:来自紧接着的前一步的更新,可能引导学生的下一步动作靠近教师策略,从而帮助学生解决一个在没有这些更新时尚无法完成的任务。因此,我们将 6.67% 的环境留作评估,并将其中的数据排除在梯度更新之外。这些留出环境中的成功率落后于训练成功率,表明蒸馏需要持续更长时间。
迁移观察与策略行为
各项任务中一个一致的经验是:坚定地完成稳定抓取并直接插入的策略,比利用仿真器接触动力学的策略更容易迁移。
对于杆插孔任务,在点云观测中加入每步 1 mm 的高斯噪声也有帮助:这会促使策略在错过目标后重新瞄准,并在杆未完全插入时轻轻摆动杆件。
在螺母与螺栓装配任务中,策略反复将螺母落到螺栓上,而不是将其套入,每次还会翻转螺母。我们推测,这是因为教师奖励只将螺母的一种正向朝向计为成功,尽管螺母本身是对称的。移除这一限制,并对 6-DOF 末端执行器控制空间采用经过适当调优的动作缩放后,得到的策略成功完成了任务。
真实世界评估流程
图 4 展示了硬件运行轨迹,表 2 报告了任务级结果。我们沿用 OmniReset 的评估流程和指标定义,报告总体成功率、首次尝试成功率和吞吐量,差异之处如下所述。
我们通过在 NIST 板上对物体位置进行均匀随机化来采样初始物体配置。板面用粘贴条固定在桌面上。在仿真中,容纳件是静止的,策略学习相对于固定参照重新定向插入件。如果板面未固定,容纳件可能在接触过程中移位,从而导致失败。
常见问题
论文展示了 SGS 的哪些效果? 一种简单改进的基于成功的采样方法,结合多样化重置和大规模强化学习,能够解决具有挑战性的运动与装配任务,而先前的采样方法难以学会这些任务。
不同任务中的奖励如何设计? 该方法为运动任务使用一个奖励函数,为操作任务使用另一个。每个奖励函数都将回合结束时的布尔型任务成功奖励,与较小的机器人专属逐步正则化项结合起来。
为什么教师—学生蒸馏中要留出一些环境? 留出的环境可以检验学生是否能在没有紧接着的前一步更新所提供的引导时取得成功。这些环境中的成功率落后于训练成功率,表明蒸馏需要持续更长时间。
哪些因素有助于策略迁移到真实世界的插入任务? 坚定地完成稳定抓取并直接插入的策略,比利用仿真器接触动力学的策略更容易迁移。对于杆插孔任务,点云噪声也促使策略在错过目标后重新瞄准。
