월드 액션 모델을 확장하려면 로봇 궤적만 늘리는 것이 아니라 체화된 경험 자체를 확장해야 한다. 그러나 체화된 경험은 1인칭 인간 영상, 손으로 조작하는 그리퍼 시연, 로봇 궤적 등 본질적으로 이질적인 형태로 존재한다. 각 데이터 소스는 관측 양식, 액션 표현, 시간 해상도, 감독 신호의 정확도가 크게 달라, 이를 하나로 통합한 대규모 사전학습은 근본적으로 어려운 과제다.
이 문제를 해결하기 위해 우리는 이질적인 체화 경험을 공통의 액션 수준 비디오–상태–액션 표현으로 자동 변환하는 통합 체화 데이터 인프라를 구축했다. 이 인프라는 긴밀하게 연결된 세 가지 요소로 구성된다. 다중 소스 체화 경험 수집, 통합 체화 데이터 엔진, 그리고 다중 소스 데이터 균형 조정과 점진적 감독이다. 이 세 요소를 통해 수천 개의 상호작용 기술을 아우르는 수천 시간 이상의 체화 경험으로 구성된 확장 가능한 사전학습 코퍼스를 구축했으며, 이는 월드 액션 모델링을 위한 데이터 기반이 된다.
데이터 인프라
월드 액션 모델을 확장하려면 로봇 궤적만 늘리는 것이 아니라 체화된 경험 자체를 확장해야 한다. 그러나 체화된 경험은 1인칭 인간 영상, 손으로 조작하는 그리퍼 시연, 로봇 궤적 등 본질적으로 이질적인 형태로 존재한다. 각 데이터 소스는 관측 양식, 액션 표현, 시간 해상도, 감독 신호의 정확도가 크게 달라, 이를 하나로 통합한 대규모 사전학습은 근본적으로 어려운 과제다.
이 문제를 해결하기 위해 우리는 이질적인 체화 경험을 공통의 액션 수준 비디오–상태–액션 표현으로 자동 변환하는 통합 체화 데이터 인프라를 구축했다. 이 인프라는 긴밀하게 연결된 세 가지 요소로 구성된다.
- 다중 소스 체화 경험 수집
- 통합 체화 데이터 엔진
- 다중 소스 데이터 균형 조정과 점진적 감독
이 세 요소를 통해 수천 개의 상호작용 기술을 아우르는 수천 시간 이상의 체화 경험으로 구성된 확장 가능한 사전학습 코퍼스를 구축했으며, 이는 월드 액션 모델링을 위한 데이터 기반이 된다.
다중 소스 체화 경험
세 가지 데이터 소스는 서로 보완적인 감독 신호를 제공한다. 1인칭 인간 영상은 실제 상호작용, 객체 중심 조작 기술, 장기 과제 구성의 폭넓은 다양성을 제공한다. 손으로 조작하는 그리퍼와 웨어러블 장치를 활용한 시연은 인간의 상호작용과 로봇 호환 제어를 자연스럽게 연결하는 구조화된 엔드 이펙터 궤적을 제공한다. 로봇 궤적은 정밀한 로봇별 상태와 후속 정책 학습에 직접 실행할 수 있는 액션을 제공한다.
이 데이터 소스들은 중복되는 것이 아니라 서로를 보완한다.
- 인간 영상은 확장 가능한 상호작용 지식을 제공한다.
- 손으로 조작하는 그리퍼 시연은 인간과 로봇 사이의 체화 격차를 줄인다.
- 로봇 궤적은 실행 가능한 제어 감독 신호를 제공한다.
이들은 함께 점진적 체화 사전학습을 위한 자연스러운 감독 계층을 형성한다.

통합 체화 데이터 엔진
세 가지 데이터 소스는 서로 보완적인 감독 신호를 제공하지만, 원래의 데이터 형식은 근본적으로 다르다. 1인칭 인간 영상은 언어 감독이 제한적인 시각 관측을 제공하고, 손으로 조작하는 그리퍼 시연은 구조화된 엔드 이펙터 궤적과 그리퍼 상태를 제공한다. 한편 로봇 데이터셋은 로봇별 상태, 액션 공간, 좌표계, 제어 주파수가 크게 다르다. 이러한 이질적인 소스를 직접 결합하면 감독 신호가 일관되지 않고 최적화가 불안정해진다.
이질적인 체화 경험을 통합하기 위해 우리는 모든 데이터를 다음 요소로 구성된 공통의 액션 수준 궤적 표현으로 변환하는 통합 체화 데이터 엔진을 구축했다.
- 언어 지시
- 로봇 형태 식별 정보
- 시각 관측
- 상태
- 액션
- 의미론적 메타데이터
각 로봇 형태에 대해 상태와 액션 스트림은 시간적으로 정렬되고 정규화되며, 로봇 형태별 표준 정의에 따라 구성된다. 가변 차원의 액션은 유효성 마스크로 처리해 서로 다른 로봇 형태를 하나의 물리적 액션 공간에 억지로 맞추지 않는다. 이 통합 표현은 이질적인 체화 데이터와 월드 액션 모델링 목표를 연결하는 표준 인터페이스 역할을 한다.
1인칭 인간 영상과 달리 손으로 조작하는 그리퍼 시연과 로봇 궤적은 이미 구조화된 제어 감독 신호를 제공한다. 따라서 이 데이터의 처리는 주로 시간 정렬, 액션 정규화, 궤적 품질 필터링에 집중된다. 그리퍼 상태의 전이는 액션 경계를 정교하게 다듬는 데 사용되며, 카메라 흔들림 필터링, 정지 상태 엔드 이펙터 제거, 비정상 제어 필터링을 통해 데이터 품질을 더욱 높인다.
처리가 끝나면 모든 데이터 소스는 통합된 의미론적 분류 체계 아래 시간적으로 정렬된 액션 수준 비디오–상태–액션 궤적으로 변환된다. 이를 통해 서로 다른 로봇 형태에 걸쳐 월드 액션 모델링을 확장할 수 있다.
점진적 감독과 데이터 균형 조정
처리된 코퍼스는 단순히 라벨 데이터와 비라벨 데이터로 나뉘는 것이 아니라, 액션의 정확도가 점차 높아지는 연속적인 감독 체계를 이룬다. 대규모 1인칭 인간 영상은 먼저 동결된 Latent Action Model이 생성한 의사 액션을 통해 폭넓은 상호작용 동역학과 약한 액션 감독을 제공한다. 이후 3D 손 궤적이 복원된 인간 영상, 손으로 조작하는 그리퍼 시연, 다양한 로봇 궤적이 시각과 액션의 정렬을 위한 연속적인 실제 액션 감독을 제공한다. 마지막으로 고품질 로봇 궤적은 로봇별 액션 예측과 폐루프 정책 실행에 맞게 모델을 특화한다.
이 감독 계층은 Riemann-1.0의 3단계 학습 커리큘럼과 자연스럽게 맞물리며, 모델이 개방형 세계의 상호작용 지식에서 실행 가능한 로봇 제어로 점진적으로 전이하도록 한다.
원시 코퍼스는 데이터 소스, 장면, 과제, 기술, 객체, 로봇 형태 전반에 걸쳐 심각한 롱테일 분포를 보인다. 우리는 원시 데이터의 양을 단순히 균형 맞추는 대신, 통합된 의미론적 분류 체계를 구축하고 여러 의미 차원에 걸쳐 의미 인지 샘플링을 수행한다. 이 전략은 대규모 인간 데이터셋의 규모상 이점을 유지하면서도 롱테일 조작 기술과 데이터가 부족한 로봇 형태에 충분히 노출되도록 한다.
종합하면, 우리의 데이터 인프라는 이질적인 체화 경험을 월드 액션 모델링을 위한 확장 가능한 감독 소스로 변환한다. 이를 통해 월드 액션 모델은 로봇 궤적만이 아니라 체화된 경험을 확장함으로써 지속적으로 성능을 향상할 수 있다.

학습 방법
Rima-WAM은 비디오만으로 생성한 의사 액션에서 실제 액션 궤적으로 감독을 점진적으로 전환하는 3단계 커리큘럼으로 학습된다. 이 설계는 실용적인 데이터 불균형에 기반한다. 비디오만 있는 데이터는 규모가 훨씬 크고 시각적으로 다양하지만 실행 가능한 로봇 액션이 부족하다. 반면 실제 액션 데이터셋은 규모가 작지만 로봇 행동을 직접 감독한다.
세 단계는 다음과 같다.
- 첫 번째 단계에서는 동결된 Latent Action Model을 사용해 의사 액션 감독으로 대규모 비라벨 영상을 학습한다.
- 두 번째 단계에서는 UMI 시연, 로봇 궤적, 3D 손 주석이 포함된 인간 영상으로 구성된 혼합 코퍼스를 통해 모델을 실제 환경에 기반시킨다.
- 세 번째 단계에서는 고품질 로봇 전용 데이터로 학습을 이어가 실행 가능한 제어 능력을 정교하게 다듬는다.
모든 단계에서 모델은 동일한 액션-비디오 목표 함수를 최적화한다.
사전학습
첫 번째 단계에서는 라벨이 없는 인간 조작 영상만 사용한다. 이 영상은 풍부한 시각적 상호작용을 제공하지만 실행 가능한 액션 라벨이 없으므로, 먼저 Latent Action Model을 학습한 뒤 이를 동결해 의사 액션 주석기로 사용한다.
이 단계의 목표는 실제 로봇 액션 라벨을 사용할 수 있게 되기 전에 WAM이 방대한 조작 동역학을 학습하도록 하는 것이다. Latent Action Model은 두 프레임 사이의 움직임이 압축된 잠재 병목을 거치도록 만들어 이 연결 고리를 제공한다. 그 결과 추론된 잠재 코드는 액션이 유발했을 시각적 전이를 포착하며, WAM 학습을 위한 의사 액션 감독 신호로 활용된다.
KL 항의 가중치는 의도적으로 낮게 설정한다. 잠재 분포를 정규화하되 전이 코드가 지나치게 일반적인 사전분포로 붕괴하지 않도록 하는 것이 목적이다. 학습이 끝난 뒤에는 샘플링한 잠재 벡터 대신 모델이 예측한 평균 잠재 표현인 사후 평균을 결정론적 의사 액션으로 사용한다. 이를 통해 대규모 영상 코퍼스에 주석을 달 때 발생하는 샘플링 잡음을 제거한다.
실제 환경 실험
대규모 사전학습 이후, 실제 로봇을 활용한 후속 학습을 통해 Riemann-1.0을 실제 환경 배포에 맞게 추가 적응시켰다. Tianji Marvin 듀얼암 로봇에서 네 가지 대표 조작 시나리오를 구성했다.
- 순서가 지정된 큐브 쌓기
- 옷 개기
- 책상 정리
- 주방 정리
이 과제들은 순서 제약이 있는 강체 객체 쌓기, 변형 객체 조작, 장기 테이블 위 재배치, 복잡한 주방 수납을 포함한다. 따라서 가정용 로봇 배포를 위한 작지만 까다로운 평가 과제를 이룬다. 각 과제에 대해 인간 원격 조작으로 15개의 시연을 수집했다.
순서가 지정된 큐브 쌓기
순서가 지정된 큐브 쌓기에서 로봇은 언어 지시에 따라 색깔 있는 큐브를 식별하고, 지정된 색상 순서에 맞춰 4층 구조물을 조립한다. 4층 쌓기는 난도를 크게 높인다. 아래층의 작은 정렬 오차가 이후 배치에서 증폭되며, 한 층만 어긋나도 전체 구조물이 불안정해질 수 있기 때문이다.
따라서 이 과제에는 객체의 색상과 자세를 정확히 인식하고, 파지 순서를 계획하며, 정밀하게 집고 놓는 실행 능력이 필요하다.
옷 개기
옷 개기에서 로봇은 강체 객체가 아닌 변형 가능한 의류를 조작한다. 옷은 접촉 중 구겨지고 늘어나며 자세가 변할 수 있으므로, 로봇은 관측된 상태에 따라 액션 전략을 지속적으로 조정해야 한다.
이 과제는 변형 객체 인식, 양팔 협응, 세밀한 접촉 제어 능력을 시험한다.
책상 정리
책상 정리에서 로봇은 흩어진 여러 책상 위 물체를 식별하고 지정된 위치로 재배치해야 한다. 특히 펜과 같은 가느다란 물체를 펜꽂이에 넣는 일이 핵심 난제다.
이를 위해서는 펜의 자세와 펜꽂이 입구를 정확히 인식하고, 펜꽂이의 테두리를 활용해 펜을 수직 자세로 재정렬한 뒤, 그리퍼를 제어해 정밀하게 삽입해야 한다.
주방 정리
주방 정리에서 로봇은 주방 장면 전체를 정돈하는 종단 간 과제를 수행해야 한다. 먼저 포크와 숟가락 같은 식기를 찾아 집은 다음 목표 수납 공간에 되돌려 놓는다.
또한 노란색과 빨간색 접시를 집어 건조대에 수직으로 꽂고, 그릇을 쌓은 뒤 그릇 더미를 건조대 상단에 올려야 한다. 이 과정에는 복잡한 환경에서의 장기 순서 계획과 안정적인 배치가 필요하다.
동일한 실제 환경 조작 조건에서 Riemann-1.0을 DreamZero, 월드 모델 기준선, LingBot-VLA, 추가 비교 모델, LingBot-VA, G0.5를 포함한 대표적인 오픈소스 VLA 및 WAM 기준선과 비교했다.
DreamZero의 경우 공식 오픈소스 구현을 사용해 모델을 재현했으며, 우리가 수집한 대규모 조작 데이터셋으로 5B 규모 모델을 학습했다. 이 모델을 DreamZero*로 표기한다.

다중 로봇 형태 시뮬레이터로서의 액션 조건부 시각 롤아웃
Riemann-1.0은 액션 조건부 시각 시뮬레이터로도 활용할 수 있다. 이 모드에서 모델은 실행 가능한 액션만 출력하지 않는다. 현재의 시각 관측, 과제 프롬프트, 로봇 상태, 후보 미래 액션 궤적을 입력받아 해당 궤적을 실행했을 때 나타날 시각적 결과를 예측한다.
액션 궤적은 정책 학습에 사용한 것과 동일한 로봇 형태별 액션 인터페이스로 표현한 뒤 액션 토큰으로 임베딩되어 인과적 액션-비디오 시퀀스에 삽입된다. 이 액션 토큰은 시각 잠재 표현의 디노이징 과정을 조건화하므로, 생성되는 프레임은 무조건적인 미래 영상이 아니라 로봇의 움직임과 연결된다.
추론 시에는 먼저 현재 관측을 VAE 잠재 공간으로 인코딩하고 이를 정제된 시각 컨텍스트로 사용한다. 미래 액션 청크는 정책 헤드가 제공하거나 후보 계획에서 샘플링하거나, 분석을 위해 기록된 궤적에서 가져올 수 있다.
프롬프트, 상태, 정제된 시각 컨텍스트, 액션 토큰을 조건으로 잠재 헤드가 미래 시각 잠재 표현을 롤아웃하고, 이를 다시 RGB 영상으로 디코딩한다. 더 긴 시간 범위가 필요한 경우 생성된 시각 출력이나 관측된 시각 출력을 컨텍스트에 다시 붙인 뒤 같은 절차를 자기회귀적으로 반복할 수 있다.
이로써 Riemann-1.0은 데이터 기반 시뮬레이터 인터페이스를 제공한다. 액션은 제어 가능한 입력으로 취급되고, 미래 카메라 관측은 그 액션의 시뮬레이션 결과로 생성된다.
자주 묻는 질문
Riemann-1.0의 체화 데이터 인프라는 어떤 목적을 갖나요? 이질적인 체화 경험을 월드 액션 모델링을 위한 공통의 액션 수준 비디오–상태–액션 표현으로 변환합니다.
체화 사전학습에는 어떤 데이터 소스가 사용되나요? 1인칭 인간 영상, 손으로 조작하는 그리퍼 및 웨어러블 시연, 로봇 궤적을 사용합니다.
Rima-WAM의 학습 커리큘럼은 어떻게 구성되나요? 세 단계로 진행되며, 비디오만을 이용한 의사 액션 감독에서 혼합 실제 액션 데이터로, 마지막에는 고품질 로봇 전용 데이터로 이어집니다.
Riemann-1.0은 시각 시뮬레이터로 어떻게 활용되나요? 시각 관측, 과제 프롬프트, 로봇 상태, 후보 액션 궤적을 입력받고 해당 액션을 실행했을 때의 시각적 결과를 예측합니다.
