문맥 내 인간 비디오 데이터셋 HumanGen
HumanGen은 문맥 내 인간 비디오 생성 파이프라인으로 만든 인간–로봇 문맥 내 학습 쌍 모음이다. 각 쌍은 생성된 인간 비디오 지시와 이에 대응하는, 실행 가능한 동작이 담긴 로봇 궤적으로 구성된다.
HumanGen은 데이터 출처에 따라 사전 학습 ICL(외부), 사전 학습 ICL(내부), 시뮬레이션 ICL, 실제 환경 ICL로 나뉜다. Task-diverse VA 데이터셋을 구성할 때 사용한 것과 같은 과제 다양성 중심 샘플링 원칙에 따라, 원천 로봇 비디오는 전체 궤적 빈도가 아니라 과제별로 샘플링한다. 따라서 ICL 데이터가 소수 과제의 반복 실행으로 편중되지 않는다.
사전 학습 ICL(내부)
과제 범위를 더욱 넓히기 위해 사내 로봇 데이터셋에서 과제별로 로봇 궤적을 샘플링했다. 이 하위 데이터셋에는 양팔 Franka와 Galaxea R1 Pro 등 여러 로봇 구현체가 포함되며, 3,522개 과제와 30,247개의 인간–로봇 ICL 쌍으로 구성된다.
문맥 내 인간 비디오 생성 파이프라인으로 이 데이터에 대응하는 인간 비디오를 생성할 때는 제3자 시점의 비율과 장면·물체·물체 배치가 바뀌는 빈도를 낮췄다. 그 결과 과제 다양성은 유지하면서 시각적으로 더욱 잘 정렬된 ICL 샘플을 얻을 수 있다.

시뮬레이션 ICL
시뮬레이션에서 과제 간 평가를 지원하기 위해 50개 RoboTwin 과제의 ICL 데이터를 생성했다. 이 하위 데이터셋은 과제당 50개씩, 총 2,500개의 ICL 샘플로 구성된다.
이 가운데 43개 과제는 후속 학습에 사용하며, 학습 샘플은 2,150개다. 나머지 7개 과제는 제로샷 과제 간 평가를 위한 미관측 과제로 남겨 둔다.
실제 환경 ICL
실제 환경 ICL은 양팔 Franka 평가 로봇에서 수집한 인간–로봇 쌍으로 구성된다. 평가에 사용된 세 가지 실제 환경 과제군에 걸쳐 총 252개의 인간–로봇 ICL 쌍을 포함한다.
- 물체를 용기에 배치하는 학습 과제 조합 30개에서 120쌍.
- 세 물체를 순차적으로 조작하는 학습 과제 조합 16개에서 96쌍.
- 두 개의 테이블 다리 삽입 과제에서 36쌍.
이 하위 데이터셋은 후속 학습에 사용되어, 과제 간 평가에서 모델이 평가 로봇의 운동학에 맞춰질 수 있도록 한다.
Zero-WAM: 문맥 내 월드-액션 모델링
제로샷 과제 간 조작에서는 로봇이 미세 조정 없이 새로운 과제를 수행해야 한다. Zero-WAM은 대규모 인간–로봇 ICL 쌍과 과제 균형이 맞춰진 로봇 비디오–액션 데이터로 사전 학습한 월드-액션 모델을 통해 이 능력을 구현한다.
배포 시 Zero-WAM은 언어 지시 또는 인간 비디오 시연을 과제 명세로 사용해 미관측 과제의 실행을 유도한다.

구현
추론 세부 사항
사전 학습된 Zero-WAM은 두 가지 추론 모드를 지원한다.
언어 전용 모드에서는 ICL 인간 비디오 없이 언어 지시만을 조건으로 사용하며, 비디오 classifier-free guidance 스케일은 5로 설정한다.
ICL 모드에서는 ICL 인간 비디오를 조건으로 사용하고 언어 지시는 비활성화한다. ICL classifier-free guidance를 적용하며 guidance 스케일은 5다.
두 모드 모두 추론 청크 크기는 2로 고정하고, 액션 classifier-free guidance 스케일은 1.0으로 설정한다.
결론 및 논의
논의
제로샷 과제 간 일반화는 개방형 실제 환경에 범용 로봇 정책을 배치하는 데 필수적이다. 이를 향해 나아가려면 로봇 기반 정책이 더 강력하고 전이 가능한 사전 지식을 갖춰야 하며, 여러 양식으로 의도를 전달할 수 있는 더욱 풍부한 과제 인터페이스도 필요하다.
인간 시연은 이러한 과제 명세의 자연스러운 원천이므로, 규모와 다양성을 계속 확장하는 일이 중요하다. 이번 실험은 주로 고정된 탁상 조작에 초점을 맞췄지만, 향후에는 이동 조작과 훨씬 긴 시간 범위의 과제를 비롯해 더 복잡하고 동적이며 비정형적인 환경으로 이 패러다임을 확장해야 한다.
전이 가능한 경험의 여러 원천 가운데 인간의 1인칭 비디오는 로봇 시연보다 훨씬 큰 규모로 수집할 수 있다는 점에서 특히 유망하다. 그러나 인간과 로봇 사이의 구현체·관측·행동 차이 때문에 이를 활용하는 일은 여전히 쉽지 않다.
이 연구에서 제시한 의미적으로 정렬된 인간–로봇 데이터는 풍부한 1인칭 인간 비디오와 상대적으로 부족한 로봇 궤적을 연결하는 다리가 될 수 있다. 정확한 동작 수준의 정렬을 요구하지 않고 과제 의미 수준에서 대응 관계를 설정함으로써, 이 데이터 구성은 로봇 정책이 인간 경험으로부터 폭넓은 과제 지식을 습득하는 동시에 실행 가능한 행동 감독에 필요한 로봇 데이터를 크게 줄여 줄 가능성이 있다.

과제 간 로봇 조작
과제 간 로봇 조작은 특정 과제에 대한 로봇 시연을 수집하지 않고도 정책이 미관측 조작 과제를 수행할 수 있는지를 평가한다.
이미 본 과제 주변의 장면이나 물체 속성만 바꾸는 시각적 일반화와 비교하면, 과제 간 일반화는 더 어렵다. 모델이 지시와 현재 관측을 바탕으로 이전에 보지 못한 과제 조건부 동역학을 추론해야 하기 때문이다.
월드-액션 모델
월드-액션 모델이 테스트 시점에 미관측 과제를 수행하도록 하기 위해, 최근 연구에서는 테스트 시점 학습을 탐구하고 있다.
WAM-TTT는 배포 중 수집한 원시 인간 비디오를 바탕으로 경량 메모리를 갱신해 고정된 월드-액션 모델의 동작을 유도한다. RoboTTT는 빠른 가중치 테스트 시점 학습을 사용해 긴 실행 이력을 정책 상태로 압축한다.
이러한 방법은 테스트 시점에 미관측 과제를 실행할 수 있게 하지만, 메모리 갱신이나 빠른 가중치 갱신을 통한 테스트 시점 적응이 여전히 필요하다. 반면 Zero-WAM은 다른 경로를 택한다. 인간–로봇 ICL 데이터와 과제 균형 비디오–액션 데이터를 사전 학습 및 후속 학습에 통합해, 테스트 시점에 정책이 문맥 내 인간 비디오 지시를 직접 따르고 제로샷 과제 간 일반화를 수행할 수 있도록 한다.
로봇 조작을 위한 인간 비디오 데이터
Zero-WAM은 이러한 데이터 공백을 해소하는 것을 목표로 한다. 과제별로 인간 시연을 수집하는 대신, HumanGen 데이터는 과제별로 샘플링한 로봇 비디오–액션 데이터에서 자동으로 생성된다.
생성된 각 인간 비디오가 실행 가능한 동작을 보존한 로봇 궤적과 짝을 이루므로, HumanGen은 과제별로 다양한 로봇 동역학과 함께 인간 비디오 지시를 확장한다. 이를 통해 인간 비디오를 통한 과제 명세는 제로샷 과제 간 일반화를 위한 월드-액션 모델 학습에서 확장 가능한 구성 요소가 된다.
자주 묻는 질문
Zero-WAM이란 무엇인가?
Zero-WAM은 언어 지시 또는 인간 비디오 시연을 사용해 미세 조정 없이 미관측 로봇 과제를 수행하는 월드-액션 모델이다.
HumanGen 데이터셋에는 무엇이 포함되는가?
HumanGen에는 실행 가능한 동작을 보존한 대응 로봇 궤적과 짝을 이룬 생성 인간 비디오 지시가 포함된다.
과제 균형 로봇 비디오–액션 데이터를 사용하는 이유는 무엇인가?
과제별 샘플링을 적용하면 문맥 내 학습 데이터가 소수 과제의 반복 실행으로 편중되는 것을 막을 수 있다.
주요 한계와 향후 방향은 무엇인가?
실험은 주로 고정된 탁상 조작에 초점을 맞췄다. 향후에는 동적·비정형 환경, 이동 조작, 훨씬 긴 시간 범위의 과제를 다뤄야 한다.
