相关工作
STEP的灵感来自共享自主和利用大语言模型进行长期动作预测的研究。针对现有方法的部分局限,STEP在跟踪环境状态表示、开展长期动作预测的基础上进行了扩展。

评估指标
可执行性
可执行性用于确保预测动作遵循合理的逻辑顺序,并满足执行约束,例如物体姿态正确以及动作前置条件得到满足。系统会对动作序列进行可执行性检查,并在首次检查失败的动作处截断预测序列。
可执行性以通过全部检查的预测动作占比表示。
最终状态误差
最终状态误差衡量任务完成时的真实状态与执行预测动作后能够成功达到的最终状态之间的差异。
对于最终可达状态,系统选取预测序列中最后一个能够成功执行的动作所产生的状态。该指标衡量这一结果与预期目标之间的差异。
任务正确性
任务正确性用于衡量任务估计的准确率。在推理阶段,如果预测任务与所有可能任务中的任意一个相匹配,则记为1;否则记为0。
当前状态误差
当前状态误差比较状态表示生成模块输出的当前状态与推理时真实状态之间的距离。

结果与讨论
主要实验采用通过OpenAI API提供的GPT-4o模型。每次向多模态大语言模型发送提示时,都会采样多个输出,并选择模型返回的对数概率最高的输出。
与基线方法的比较
为模拟用户向STEP发出不同阶段任务委派的情况,实验分别在任务完成度为30%、50%、70%和90%时进行。任务完成度为某一给定百分比,表示将记录动作序列开头对应百分比的动作作为评估输入。
随着任务完成度提高,两种方法的最终误差均有所降低。这是因为随着操作员完成更多装配工作,机器人开始执行任务时所处的状态更加接近目标状态。
随着任务完成度提高,任务正确性先因较长输入动作序列中的噪声增加,以及图像中方块结构受到更多遮挡而下降;随后,随着正在搭建的结构变得更加清晰可辨,任务正确性又有所提升。
当前状态误差似乎会随着任务推进而增大,因为结构变得更加复杂,且方块在图像中的间距越来越小。

结论
STEP被提出用于通过显式建模状态转移,借助多模态大语言模型提升长期动作预测能力。这使其能够在协作式工业任务中生成更加准确且可执行的机器人动作规划。
该方法采用多阶段流程。首先,它估计机器人操作员试图完成的整体任务,并生成机器人工作站当前状态的结构化表示。随后,这些信息会传递至后续阶段,用于预测完成任务所需的动作,并传播状态表示,从而获得成功执行预测动作、完成目标任务所需的辅助参数。
STEP还会跟踪传播状态与目标状态之间的距离,并引导预测动作朝目标状态推进。
在实际应用之前,还需要进一步工作,使STEP能够实时运行。为了传播状态并引导动作规划生成过程朝目标状态推进,STEP调用多模态大语言模型的次数比基线方法多出数倍。因此,STEP以运行速度为代价换取了更高的性能准确性。
在实验中,基线方法的运行时间更短,平均为18.24秒,标准差为4.23秒;STEP的平均运行时间则为148.07秒,标准差为55.03秒。
未来研究可以探索在本地部署多模态大语言模型,或对更小的模型进行微调,以降低每次查询的延迟。这项工作推动了对多模态大语言模型在人机协作中进行长时程推理潜力的进一步研究。
常见问题
STEP旨在改进什么?
STEP旨在借助多模态大语言模型,提升协作式工业任务中的长期动作预测能力。
STEP如何表示机器人的当前情境?
STEP会估计操作员要完成的整体任务,并生成机器人工作站当前状态的结构化表示。
随着任务完成度提高,任务正确性会发生什么变化?
任务正确性会先因噪声和图像遮挡而下降,随后随着正在搭建的结构变得更加清晰可辨而上升。
STEP的运行时间与基线方法相比如何?
基线方法的平均运行时间为18.24秒,而STEP的平均运行时间为148.07秒。
