서로 다른 로봇 형태를 아우르는 비디오 월드 모델, 제로샷 물리 시뮬레이션을 가능하게 하다

서로 다른 로봇 형태를 아우르는 비디오 월드 모델, 제로샷 물리 시뮬레이션을 가능하게 하다

Kechen Liu, Ola Shorinwa

4 분 읽기2026년 8월 28일

서론

대규모 언어 모델의 판도를 바꾼 결정적 돌파구는 다양한 텍스트 데이터셋을 웹 규모로 학습한 데서 비롯되었다. 방대한 데이터를 통해 인간 언어를 통합적으로 표현하는 능력을 학습하면서 기존 성능의 한계를 무너뜨린 것이다. 오늘날 행동 조건부 비디오 월드 모델이 여전히 물리적으로 일관된 예측을 내놓는 데 어려움을 겪는 가운데, 로보틱스와 컴퓨터 비전 분야는 중요한 질문에 직면해 있다. 생성형 비디오 모델은 서로 다른 로봇 형태를 아우르는 데이터 확장을 통해 일반화 가능한 물리적 사전지식을 학습할 수 있을까? 아니면 로봇 형태마다 특성이 크게 다른 만큼 에이전트별 아키텍처가 필요한 것일까? 본 연구는 비디오 월드 모델이 다양한 로봇 형태 사이의 간극을 어떻게 메울 수 있는지 살펴보고, 이를 위해 극복해야 할 구조적 병목을 분석한다.

제로샷을 넘어: 대상 로봇 형태에 대한 데이터 효율적 적응

다양한 로봇의 비디오 데이터를 폭넓게 학습한 CLAP 모델은 고정확도 동역학 예측을 가능하게 하는 일반화 가능한 사전지식을 습득한다. 그럼에도 학습 과정에서 이미 접한 사전학습 로봇 형태와 새로운 로봇 형태를 포함해, 대상 로봇 형태에 맞춰 파인튜닝하면 제로샷 예측 정확도를 더 높일 수 있다. 파인튜닝을 통해 모델은 학습한 사전지식을 대상 로봇 형태에 더욱 잘 맞도록 정교화할 수 있다.

CLAP cross-embodiment video world model architecture

새로운 로봇 형태

CLAP은 사전학습에 사용된 로봇 형태를 넘어, 학습 데이터에서 본 형태와 현저히 다른 새로운 로봇 형태에도 서로 다른 로봇 형태를 아우르는 모델을 데이터 효율적으로 적응시킬 수 있다. 대표적으로 양팔 로봇과 휴머노이드가 있으며, 이들은 대체로 더 높은 차원의 행동 공간을 갖는다.

이처럼 행동 공간이 서로 다르기 때문에 모델을 파인튜닝하려면 대상 로봇 형태와 호환되는 새로운 행동 헤드로 기존 행동 헤드를 교체해야 한다. 중요한 점은 CLAP이 서로 다른 로봇 형태를 아우르는 비디오 모델의 나머지 구성 요소를 모두 유지해 풍부한 시공간 사전지식을 보존한다는 것이다. 파인튜닝 과정에서 CLAP은 이러한 기반 사전지식을 대상 형태에 맞게 정렬하고, 이를 통해 행동 조건부 미래 예측의 높은 충실도를 확보한다.

제로샷을 넘어: CLAP은 대상 로봇 형태에 대한 데이터 효율적 적응을 가능하게 하는가?

본 연구에서는 비디오 월드 모델을 대상 로봇 형태에 few-shot 방식으로 적응시키기 위한 기반으로서 CLAP의 효과를 평가한다. 평가는 사전학습된 로봇 형태와 새로운 로봇 형태라는 두 가지 주요 축을 중심으로 구성했다. 각 설정에서는 대상 로봇 형태의 고유한 말단장치 행동 공간에 맞지 않는 행동 헤드 구성 요소를 제거하고, 나머지 모든 파라미터는 유지했다.

Cross-embodiment and single-embodiment evaluation metrics

사전 지식

비디오 월드 모델은 초기 카메라 관측을 바탕으로 프레임별 행동이 주어졌을 때의 미래 결과를 예측한다. 또한 미래의 변화를 결정하는 로봇의 속도와 같은 시간적 맥락을 포착하기 위해, 과거 관측 기록을 함께 입력으로 사용하는 경우가 많다.

생략된 수식은 모델에서 사용하는 과거 이력 구간과 예측 구간을 정의한다.

잠재 행동 모델에 대한 추가 결과

본 연구에서는 서로 다른 로봇 형태를 아우르는 데이터셋과 Bridge, DROID를 포함한 개별 단일 로봇 형태 하위 데이터셋으로 잠재 행동 모델을 학습하고, 실제 궤적에 대한 대리 행동의 일관성을 평가한다.

잠재 행동 모델을 역동역학 모델로 활용해 보지 않은 궤적에서 잠재 행동을 추출한 뒤, 계산된 잠재 행동으로 실제 궤적을 재구성한다. 또한 Bridge, DROID, OXE-Mix를 포함한 도메인 내 데이터셋의 검증 및 테스트 분할에서 이 모델들을 DreamDojo 역동역학 모델 기준선과 비교한다.

아울러 다음의 홀드아웃 데이터셋에서도 모델을 평가한다. 이 데이터셋들은 학습 과정에서 보지 못한 데이터를 나타낸다.

  • austin_sailor
  • utaustin_mutex
  • berkeley_ur5
  • stanford_hydra

이 데이터셋에는 학습 중 관측하지 않은 UR5 로봇 팔과 같은 로봇 형태가 포함되어 있다.

세부적인 요약

이 절에서는 CLAP의 독창성, 더 넓은 잠재적 영향, 그리고 연구에서 제시하는 주장의 범위를 둘러싼 세부적인 쟁점을 논의한다.

결론, 한계 및 향후 연구

궁극적으로 본 연구는 서로 다른 로봇 형태를 아우르는 학습이 비디오 월드 모델링의 돌파구를 여는 촉매임을 보인다. 이는 대규모 언어 모델에서 관찰된 패러다임 전환을 연상시킨다.

안전성, 데이터 프라이버시 및 동의

본 논문은 로보틱스 인공지능의 기반을 발전시키는 연구를 다룬다. 연구가 주로 계산적·이론적 성격을 띠므로 인간 참가자, 실제 사용자 연구, 개인 식별 정보는 포함하지 않는다. 따라서 기관생명윤리위원회(IRB)의 승인은 필요하지 않았다.

모든 실험은 각 라이선스를 준수하며 공개적으로 이용 가능한 벤치마크와 오픈소스 데이터셋을 사용해 수행했다. 로보틱스 분야 인공지능의 광범위한 활용에는 잠재적인 안전 및 사회적 영향이 따를 수 있지만, 저자들은 이 기초 알고리즘 연구에 고유하게 연결된 직접적이거나 악의적인, 또는 고위험의 부정적 사회적 결과는 예상하지 않는다.

감사의 글

저자들은 인내심을 갖고 통찰력 있는 논의와 지원을 아끼지 않은 Anirudha Majumdar 교수, Mingtong Zhang, 그리고 Princeton IRoM 연구실 구성원들에게 감사를 전한다.

자주 묻는 질문

CLAP이란 무엇인가? CLAP은 다양한 로봇 비디오 데이터에서 일반화 가능한 물리적 사전지식을 학습하는, 서로 다른 로봇 형태를 아우르는 비디오 월드 모델 프레임워크다.

비디오 월드 모델은 무엇을 예측하는가? 초기 카메라 관측과 프레임별 행동을 조건으로 미래 결과를 예측하며, 시간적 맥락을 포착하기 위해 과거 관측 기록을 함께 사용하는 경우가 많다.

CLAP은 새로운 로봇 형태에 어떻게 적응하는가? 대상 로봇 형태와 호환되는 행동 헤드로 기존 행동 헤드를 교체하고, 사전학습된 비디오 모델의 나머지 구성 요소는 그대로 유지한다.

잠재 행동 모델 평가에는 어떤 데이터셋이 사용되는가? Bridge, DROID, OXE-Mix와 함께 austin_sailor, utaustin_mutex, berkeley_ur5, stanford_hydra 등의 홀드아웃 데이터셋이 평가에 사용된다.

🍪 쿠키 환경설정

성능 측정을 위해 쿠키를 사용합니다. 개인정보 처리방침