总体而言,大多数自主获取机器人技能的方法都着眼于获得单一的高性能解决方案。由于操作任务空间具有很高的维度,这类方法部署到现实世界时可能表现得十分脆弱;同时,基于这些方法构建的课程也需要经过精心设计。相比之下,质量多样性流程生成的运动原语具有多样性,因此非常适合直接集成使用;但要设计有用且针对特定任务的多样性指标与适应度信号,仍然需要专家参与,这与自主化要求并不相容。基于语言模型的奖励塑形技术可以适配操作任务中的质量多样性算法,在兼容自由形式指令的同时,生成包含多种解决方案的档案。
机器人轨迹数据集
总体而言,大多数自主获取机器人技能的方法都着眼于获得单一的高性能解决方案。由于操作任务空间具有很高的维度,这类方法部署到现实世界时可能表现得十分脆弱;同时,基于这些方法构建的课程也需要经过精心设计。
相比之下,质量多样性流程生成的运动原原语具有多样性,因此非常适合直接集成使用;但要设计有用且针对特定任务的多样性指标与适应度信号,仍然需要专家参与,这与自主化要求并不相容。
基于语言模型的奖励塑形技术可以适配操作任务中的质量多样性算法,在兼容自由形式指令的同时,生成包含多种解决方案的档案。
方法
本节首先对机器人技能档案的设计问题进行形式化,并介绍用于机器人技能获取的 MAP-Elites-Success 算法参数化方法。随后提出一种序贯技术,利用语言模型探索行为描述符空间与适应度空间,无需专家输入,也无需针对任务进行适配。最后,生成的行为描述符样本网格可以与多行为描述符 MAP-Elites-Success 算法结合,为给定任务生成包含多种运动原语的档案。
机器人轨迹数据集生成
给定一个已知任务和未知的任务实例分布,机器人质量多样性设计问题可表述如下:
在未知的任务实例分布上,寻找一个能够满足任务要求的运动原语档案。
这里,运动原语档案是一组候选机器人行为,而运动原语空间则是所有可能运动原语构成的空间。

用于多 BD MAP-Elites-Success 的 LLM 推理
本节介绍一种利用语言模型对质量多样性算法进行参数化的策略。
尽管获得正确的成功判据对档案质量至关重要,但成功判据相对容易设计。因此,对于给定任务只推断一个成功条件,从而降低计算负担。
实验
本节详细介绍实验中所采用的算法实现,并描述用于验证该方法的实验设置。

实现:感知 API
语言模型可以获得以下信息:
- 物体基座的位置与姿态。选择欧拉角,是因为对于语言模型这类非专家系统而言,欧拉角更易于理解。
- 桌面与机器人之间,以及桌面与物体之间的接触信息。
- 机器人夹爪与物体各个连杆之间的接触信息;对于非关节式物体,则提供夹爪与物体基座之间的接触信息。
- 机器人夹爪的位置与姿态。
- 对于关节式物体,还包括每个关节的位置,以关节角或棱柱关节位移表示。
环境与任务
专家定义的成功条件: 物体必须接触夹爪,且不得接触桌面。
真实行为描述符: 物体首次接触夹爪时,夹爪的 XYZ 位置。

指标
成功档案规模
每次运行输出的成功个体数量,成功与否依据专家编写的成功条件判定。
真实行为描述符覆盖率
对于每个任务,将各基线方法输出的档案投影到手工设计基线所使用的真实行为描述符空间中。该真实行为描述符空间经过人工设计,用于捕捉任务执行方式中有意义的多样性,从而衡量实际解决方案的多样性。
常见问题
语言驱动的质量多样性解决什么问题? 它解决了在无需专家设计、针对特定任务的多样性指标和适应度信号的情况下,自主获取多种机器人操作技能的问题。
为什么多样化的运动原语对机器人操作很有用? 运动原语的多样性使其非常适合直接集成使用,并能够降低高维操作任务空间中的脆弱性。
向语言模型提供哪些信息? 语言模型会接收物体姿态、接触信息、夹爪姿态,以及关节式物体的关节位置。
如何衡量真实行为描述符覆盖率? 将输出档案投影到手工设计的真实行为描述符空间中;该空间能够捕捉任务执行方式中有意义的多样性。
