CoFiT是一种针对运行时安全过滤器微调人形机器人跟踪策略的方法。根据 Arxiv 首次报道,该方法在多种约束场景和 Unitree G1 硬件上均缩短了违规时长。它将过滤器对实际执行动作及策略诱导状态分布的影响纳入考量;测试结果显示,违规时长更短,安全过滤器所需的修正幅度也更小。
安全的全身运动对于在人类环境中部署人形机器人至关重要。人形机器人控制通常将参考指令的制定与执行分开:规划器、远程操作员或运动生成器提供参考指令,强化学习策略则通过满足动力学约束的全身控制来跟踪该指令。
运行时安全过滤器可以介入跟踪器的输出,以强制执行新引入的约束。这些介入会改变实际执行的动作和策略诱导的状态分布;若将跟踪策略与过滤器割裂开来,就会造成动力学、目标和信息方面的不匹配。
案例研究分别剖析了这三类不匹配,并考察其根本原因。CoFiT是 Constrained Filter-aware Tuning(约束感知过滤器调优)的简称,它在微调预训练跟踪器时将策略与过滤器之间的相互作用纳入考量。
在多种约束场景中,与仅使用过滤器的训练相比,CoFiT使 TWIST2 的违规时长缩短了 91%,使 SONIC 的违规时长缩短了 21%,同时所需的安全过滤器修正幅度更小。报告结果涵盖违规时长、过滤器修正幅度和操作员介入情况。
在 Unitree G1 硬件上,CoFiT使 TWIST2 的违规时长缩短了 83%,且所有试验均无需操作员介入。基线组有 50% 的试验需要操作员停止运行。