언어 기반 로봇 제어·학습·전이를 위한 지속형 프로그램

언어 기반 로봇 제어·학습·전이를 위한 지속형 프로그램

Weiqi Wang, Zhi Li, Yudong Lei, David Martinez, Xiaofeng Gao +5명 더

3 분 읽기2026년 9월 1일

관련 연구

자율 로봇 데이터 생성

데이터 생성기는 장면 구성을 바꿔 가며 객체 기준 시연 구간을 재타기팅하고, 행동을 계획된 동작으로 연결된 재사용 가능 스킬로 분해해 로봇 경험을 확장한다. 이러한 방법은 소수의 시연을 다양한 모방 학습 데이터로 변환하지만, 과제 의미가 원래 시연에 묶여 있어 학습 정책의 롤아웃을 검증할 독립적이고 환경에 기반한 모니터가 부족하다.

언어 기반 로봇 제어·학습·정책 생성을 위한 SUN 파이프라인

형식화의 신뢰성

C행은 언어 상호작용을 보고한다. Kuafu는 과제당 110.5k 토큰을 사용하는 반면, Eureka는 일회성 보상 탐색에 234.4k 토큰을 사용한다. VoxPoser는 롤아웃당 16.99회의 호출과 31.6k 토큰을 사용한다.

보고된 평균 비율을 기준으로 하면, 누적 상호작용량은 호출 횟수 기준으로는 두 번의 실행만에, 토큰 수 기준으로는 네 번의 롤아웃만에 VoxPoser가 Kuafu를 넘어선다. 따라서 지속형 프로그램을 구성하면 언어 상호작용이 반복적인 실행 비용에서 과제 단위 비용으로 바뀐다.

시각 학습 및 제로샷 전이

실제 환경에 배치하기 위해 각 시뮬레이션 설정은 작업 공간을 촬영하는 2대 또는 3대의 RGB-D 카메라를 보정된 구성 그대로 재현하며, 무작위화 범위는 제한한다.

데이터셋은 과제당 1,000개 궤적으로 두 배 확장되었고, 이렇게 얻은 정책은 실제 환경에서 추가 미세 조정 없이 배치되었다. DP3는 6개 과제와 3가지 로봇-그리퍼 구성에 걸친 106회 시도에서 36회의 성공을 기록했으며, 실제 환경에서 미세 조정을 거치지 않았다. 이에 따른 과제별 매크로 평균 성공률은 34.72%였고, 평가한 모든 과제에서 0이 아닌 성공률을 보였다.

전체 통합 성공률은 33.96%이며, 95% Wilson 구간은 25.6–43.4%이다. 가장 작은 과제에서는 6회 중 2회 성공했으며, 구간은 9.7–70.0%였다.

실패 사례를 분석한 결과, 남은 가장 큰 과제는 정밀한 파지 획득으로 나타났다. T1의 성공률이 15%로 가장 낮았고, T7에서는 파지가 관찰된 실패 유형 중 가장 빈번했다.

이 결과는 지속형 SUN 프로그램으로 생성한 데이터셋을 활용하면 제로샷 sim-to-real 전이가 가능함을 보여준다.

시각 학습과 제로샷 전이를 평가하는 데 사용한 과제 스윕

결론

범위와 한계

SUN 프로그램은 유의미한 객체 프레임과 축을 제공하는 등록된 장면 인터페이스와 유한한 타입 지정 연산자 라이브러리에 의존한다. 따라서 새로운 연산자를 정의하지 않으면 Kuafu는 변형 가능한 객체나 유체를 처리할 수 없다.

이번 평가는 학습에서 제외한 지시문, 연산자, 장면 의미론 또는 과제 조합을 다루지 않았으므로, 개방형 환경에서의 일반화에 대해 강한 주장을 하기는 어렵다.

방법론 측면에서 단계 모니터는 단조롭게 진행되며 물리적 퇴행이 발생한 뒤 되돌릴 수 없다. 또한 Q95 지표는 모델 예측 제어를 기준으로 삼으므로, 절대적인 궤적 품질이 아니라 특정 플래너에 대한 효율을 측정한다.

마지막으로 6개 과제와 106회 시도를 통한 검증은 평가한 로봇-그리퍼 구성에서 제로샷 실행 가능성을 보여주지만, 비구조화된 환경에서 폭넓은 sim-to-real 신뢰성을 보장하지는 않는다.

자주 묻는 질문

지속형 SUN 프로그램의 주요 목적은 무엇인가? 언어 상호작용을 반복적인 실행 비용에서 과제 단위 비용으로 바꾸면서, 학습 정책 롤아웃의 검증을 지원하는 것이다.

Kuafu는 과제당 몇 개의 토큰을 사용하는가? Kuafu는 과제당 110.5k 토큰을 사용한다.

실제 환경 배치에서 DP3는 어떤 성능을 보였는가? DP3는 실제 환경에서 미세 조정 없이 6개 과제와 3가지 로봇-그리퍼 구성에 걸친 106회 시도에서 36회 성공했다.

실패 사례에서 확인된 가장 큰 과제는 무엇인가? 정밀한 파지 획득이 가장 큰 과제였으며, T7에서는 파지가 관찰된 실패 유형 중 가장 빈번했다.

🍪 쿠키 환경설정

성능 측정을 위해 쿠키를 사용합니다. 개인정보 처리방침