관련 연구
STEP은 공유 자율성과 대규모 언어 모델을 활용한 장기 행동 예측 연구에서 영감을 얻었다. STEP은 장기 행동을 예측하는 동안 환경의 상태 표현을 추적하는 기존 방법을 확장해, 선행 연구의 일부 한계를 해결한다.

평가 지표
실행 가능성
실행 가능성은 예측된 행동이 논리적인 순서를 따르고, 올바른 물체 자세와 행동 전제 조건 등 실행 제약을 충족하는지를 나타낸다. 실행 가능성 검사를 수행하며, 검사에 실패한 첫 번째 행동에서 예측 행동 시퀀스를 중단한다.
실행 가능성은 모든 검사를 통과한 예측 행동의 비율로 보고한다.
최종 상태 오차
최종 상태 오차는 실제 작업 완료 상태와 예측된 행동을 실행해 성공적으로 도달할 수 있는 최종 상태 사이의 오차를 측정한다.
최종 도달 가능 상태는 예측된 행동 중 성공적으로 실행할 수 있는 마지막 행동의 결과 상태로 정한다. 이 지표는 해당 결과와 목표 상태 사이의 차이를 측정한다.
작업 정확성
작업 정확성은 작업 추정의 정확도를 측정한다. 추론 시점에 예측한 작업이 가능한 작업 중 하나와 일치하면 1, 그렇지 않으면 0을 부여한다.
현재 상태 오차
현재 상태 오차는 상태 표현 생성 단계에서 출력된 현재 상태와 추론 시점의 실제 상태 사이의 거리를 비교한다.

결과 및 논의
주요 결과를 도출하는 데 OpenAI API를 통해 제공되는 GPT-4o 모델을 사용했다. 멀티모달 대규모 언어 모델에 프롬프트를 입력할 때마다 여러 개의 출력을 샘플링했으며, 모델이 반환한 출력 중 로그 확률이 가장 높은 결과를 선택했다.
베이스라인과의 비교
STEP에 전달되는 사용자 위임의 차이를 모델링하기 위해 작업 완료율을 30%, 50%, 70%, 90%로 설정해 실험을 진행했다. 작업 완료율이 특정 비율이라는 것은 기록된 행동 시퀀스에서 이에 해당하는 비율만큼의 초기 행동을 평가 입력으로 사용했다는 뜻이다.
작업 완료율이 높아질수록 두 방법 모두 최종 오차가 감소했다. 조작자가 조립을 더 많이 완료할수록 로봇이 목표 상태에 가까운 상태에서 시작하기 때문이다.
작업 완료율이 높아지는 동안 작업 정확성은 처음에는 낮아졌다. 입력 행동 시퀀스가 길어지면서 노이즈가 증가하고, 이미지에서 블록 구조가 더 많이 가려졌기 때문이다. 그러나 구축 중인 구조가 더욱 뚜렷하게 식별되기 시작하면서 작업 정확성은 다시 높아졌다.
작업이 진행될수록 현재 상태 오차는 증가하는 경향을 보였다. 구조가 더 복잡해지고 이미지에서 블록 사이의 간격이 좁아졌기 때문이다.

결론
STEP은 상태 전이를 명시적으로 모델링해 멀티모달 대규모 언어 모델의 장기 행동 예측 성능을 향상하는 방법으로 제안되었다. 이를 통해 협업형 산업 작업에서 더욱 정확하고 실행 가능한 로봇 행동 계획을 생성할 수 있다.
이 방법은 여러 단계로 구성된 파이프라인을 사용한다. 먼저 로봇 조작자가 수행하려는 전체 작업과 로봇 작업 공간의 현재 상태를 구조화한 표현을 추정한다. 그런 다음 이 정보를 후속 단계에 전달해 작업을 완료하는 데 필요한 행동을 예측하고, 상태 표현을 전파한다. 이를 통해 해당 작업을 성공적으로 수행하는 데 필요한 지원 파라미터를 얻는다.
STEP은 전파된 상태와 목표 상태 사이의 거리도 추적하며, 예측된 행동이 목표를 향하도록 유도한다.
STEP을 실제 환경에 적용하려면 실시간으로 작동할 수 있도록 추가적인 개선이 필요하다. 상태를 전파하고 행동 계획 생성을 목표 상태로 유도하기 위해 STEP은 베이스라인보다 멀티모달 대규모 언어 모델을 여러 차례 더 질의한다. 그 결과 STEP은 성능 정확도를 높이는 대신 속도를 희생한다.
실험에서 베이스라인의 실행 시간은 평균 18.24초, 표준편차 4.23초로 STEP보다 짧았다. STEP의 실행 시간은 평균 148.07초, 표준편차 55.03초였다.
향후 연구에서는 각 질의의 지연 시간을 줄이기 위해 멀티모달 대규모 언어 모델을 로컬 환경에서 호스팅하거나 더 작은 모델을 미세 조정하는 방안을 살펴볼 수 있다. 이 연구는 인간-로봇 협업에서 장기 추론을 수행하는 멀티모달 대규모 언어 모델의 가능성을 더욱 탐구할 필요성을 제시한다.
자주 묻는 질문
STEP은 무엇을 향상하기 위해 설계되었나요?
STEP은 협업형 산업 작업에서 멀티모달 대규모 언어 모델을 활용한 장기 행동 예측을 향상하기 위해 설계되었다.
STEP은 로봇의 상황을 어떻게 표현하나요?
STEP은 조작자가 수행하려는 전체 작업을 추정하고 로봇 작업 공간의 현재 상태를 구조화한 표현을 생성한다.
작업 완료율이 높아지면 작업 정확성은 어떻게 되나요?
작업 정확성은 노이즈와 이미지 가림 현상 때문에 처음에는 낮아지지만, 구축 중인 구조가 더욱 뚜렷하게 식별되면서 다시 높아진다.
STEP의 실행 시간은 베이스라인과 비교해 어떤가요?
베이스라인의 평균 실행 시간은 18.24초였으며, STEP의 평균 실행 시간은 148.07초였다.
