관련 연구
근본적으로 새로운 커리큘럼 원리를 제시한다고 주장하지는 않습니다. 대신 성공 기반 샘플링의 간단한 변형을 다양한 초기화 및 대규모 강화 학습과 결합하면, 기존 샘플링 방법으로는 학습하기 어려운 까다로운 보행 및 조립 과제를 해결할 수 있음을 보입니다.
강화 학습 학습을 위한 알고리즘 설계
샘플러 자체 외에도 SGS는 PPO를 사용해 폭넓은 작업 구성에서 학습을 지원하는 두 가지 알고리즘 설계를 의도적으로 선택했습니다.
도메인별 공통 보상
모든 보행 과제에 하나의 간단한 보상 함수를, 모든 조작 과제에 또 다른 보상 함수를 사용합니다. 각 보상 함수는 에피소드 종료 시 얻는 불리언 형식의 과제 성공 보상과 로봇별로 설정된 비교적 작은 스텝별 정규화 항을 결합합니다.
공통 보상 설계를 사용하면 지형이나 조립 과제마다 별도의 보상 함수를 지정할 필요가 없습니다. 각 도메인의 항목과 가중치는 부록 A.3에 제시합니다.
실험 결과
일련의 대규모 스케일링 연구를 통해 다음을 살펴봅니다.
- 스케일링: 병렬 학습 환경이 늘어날 때 SGS는 균일 샘플링 및 PLR보다 더 잘 확장될까요?
- 역량: SGS는 더 작은 규모에서도 기존 방법으로는 해결할 수 없었던 로봇 과제를 가능하게 할까요?
- 전이: SGS로 학습한 손재주 조작 행동을 실제 하드웨어에 제로샷으로 전이할 수 있을까요?
조작
모든 조작 과제에서 동일한 간단한 보상 함수와 다양한 시뮬레이터 초기화를 사용합니다. 주요 조작 스케일링 실험에서는 중력 커리큘럼을 사용했지만, 이후 불필요한 것으로 확인했습니다. 구현 방식과 효과에 대한 제거 실험은 부록 B.4에 설명되어 있습니다.

보행
이전 연구의 지형은 일반적으로 선형 구조를 가지며, 경사나 계단 높이 같은 매개변수를 쉬운 조건에서 어려운 조건까지 선형으로 보간해 난이도를 정합니다. 절차적으로 생성한 지형은 난이도에 따른 명확한 순서가 없을 수 있으므로, 난이도 축은 서로 다른 시드로 해석할 수 있습니다.
이 논문에서 사용한 지형은 그림 3의 가운데 행과 아래 행에 나와 있습니다. 다만 지면 제약으로 제외한 Inverted Slope는 포함하지 않았습니다.
관측, 행동 및 보상
각 로봇 형태의 관측 공간과 행동 공간을 설명한 다음, 보상 정의와 가중치를 제시합니다.
보행 정책은 베이스의 선속도와 각속도, 투영 중력, 관절 위치와 속도, 이전 행동, 목표 명령, 국소 지형 높이 스캔을 관측합니다. 12차원 행동은 로봇의 기준 자세를 기준으로 한 관절 위치 오프셋을 지정하며, 관절 제어기가 이를 추종합니다.
학습 가능성 샘플링과의 비교
본문의 표 1은 보행 과제에서 SFL과 SGS를 비교합니다. SFL의 기본 하이퍼파라미터를 사용하고, 세 개의 학습 시드에 대한 평균과 95% 신뢰 구간을 보고합니다.
두 규모 모두에서 SFL의 최종 성능은 SGS보다 낮습니다. 32K에서는 SFL의 최고 체크포인트가 근접하지만, 여전히 SGS보다 성능이 떨어집니다. 특히 큰 규모에서 학습을 계속할수록 성능이 크게 저하되는 반면, SGS는 학습 중 꾸준히 향상됩니다.
SGS 하이퍼파라미터 및 구성 밀도
각 작업 구성에 대해 원형 버퍼에 고정 길이 이력에서 가장 최근의 불리언 결과를 저장합니다. 로짓을 구성하기 전에 커널 가중치에 하한을 적용하고, 최소 온도를 1로 설정합니다.
하드웨어 및 제어 설정
Robotiq 2F-85 그리퍼가 장착된 UR5e 암을 사용하고 OmniReset의 상대적 데카르트 작업공간 제어 인터페이스를 따릅니다. 카메라 구성은 OmniReset의 카메라 3대 대신 외부 시점 카메라 1대와 손목 장착 카메라 1대를 사용합니다. 포인트 클라우드 교사 모델과 RGB 학생 모델은 부록 C.3에 설명합니다.
NIST 보드는 광택 아크릴로 만들어졌습니다. 손목 카메라가 보드를 정면으로 향하면 로봇이 자기 모습을 반사해 관측하게 되는데, 이는 분포 외 데이터입니다. 표면 마찰이 낮아 보드를 이용해 물체의 방향을 바꾸는 정책의 성능도 저하됩니다. 이러한 이유로 평가 중에는 보드를 테이프로 덮었습니다.

시뮬레이션 모델링 및 도메인 무작위화
OmniReset의 도메인 무작위화 설정을 따르되, 포인트 클라우드 관측에 작은 가우시안 노이즈를 추가하고 측정된 실제 물체 질량을 중심으로 물체 질량을 무작위화합니다.
교사–학생 증류
각 반복에서는 모든 환경에서 한 스텝씩 수집하고, 학생이 교사의 행동을 따르도록 업데이트한 뒤 데이터를 버립니다. 시뮬레이션과 렌더링을 학습과 병행할 때 병목이 되는 GPU 메모리 사용량을 줄이는 방식입니다.
하지만 학습 성공률은 오해를 불러일으킬 수 있습니다. 바로 앞 스텝에서 이루어진 업데이트가 학생의 다음 행동을 교사 쪽으로 유도해, 아직 업데이트의 도움 없이 수행할 수 없는 과제를 해결하도록 도울 수 있기 때문입니다. 이에 평가용으로 환경의 6.67%를 따로 두고 해당 데이터는 그래디언트 업데이트에서 제외합니다. 이 평가 환경의 성공률은 학습 성공률보다 뒤처져, 더 오랜 증류가 필요함을 보여줍니다.
전이 관찰 및 정책 행동
여러 과제에서 일관되게 확인한 점은, 시뮬레이터의 접촉 역학을 활용하는 정책보다 안정적으로 잡은 뒤 곧바로 삽입하는 정책이 더 잘 전이된다는 것입니다.
막대-구멍 삽입 과제에서는 포인트 클라우드 관측에 스텝마다 1 mm의 가우시안 노이즈를 추가해 성능을 더 높였습니다. 이 노이즈는 삽입에 실패한 뒤 정책이 다시 조준하고, 막대가 완전히 들어가지 않았을 때 흔들어 넣도록 유도했습니다.
너트와 볼트 조립 과제에서는 정책이 너트를 안착시키는 대신 볼트 위에 반복해서 떨어뜨리며 매번 너트를 뒤집었습니다. 너트가 대칭인데도 교사 보상은 너트가 한 방향으로 똑바로 놓인 경우만 성공으로 처리했기 때문이라고 추측합니다. 이 제약을 없애고 6-DOF 엔드 이펙터 제어 공간에 적절히 조정된 행동 스케일링을 적용하자 과제를 완료하는 정책을 얻었습니다.
실제 환경 평가 프로토콜
그림 4는 하드웨어 궤적을 보여주며, 표 2는 과제별 결과를 보고합니다. 아래에 언급한 차이를 제외하고 OmniReset의 평가 프로토콜과 지표 정의를 따르며, 전체 성공률, 첫 시도 성공률, 처리량을 보고합니다.
NIST 보드 위에서 물체 위치를 균일하게 무작위화해 초기 물체 구성을 샘플링합니다. 보드는 접착 스트립으로 테이블에 고정합니다. 시뮬레이션에서 수용 물체는 고정되어 있으며, 정책은 고정된 기준에 맞춰 삽입 물체의 방향을 바꾸는 법을 학습합니다. 보드를 고정하지 않으면 접촉 중 수용 물체가 움직일 수 있어 실패로 이어집니다.
자주 묻는 질문
SGS에 관한 논문의 핵심 결과는 무엇인가요? 성공 기반 샘플링의 간단한 변형을 다양한 초기화 및 대규모 강화 학습과 결합하면, 기존 샘플링 방법으로는 학습하기 어려운 까다로운 보행 및 조립 과제를 해결할 수 있습니다.
과제 전반에 걸쳐 보상은 어떻게 구성되나요? 이 방법은 보행에 하나의 보상 함수를, 조작에 또 다른 보상 함수를 사용합니다. 각 보상 함수는 에피소드 종료 시의 불리언 형식 과제 성공 보상과 로봇별로 설정된 작은 스텝별 정규화 항을 결합합니다.
교사–학생 증류에서 일부 환경을 평가용으로 분리하는 이유는 무엇인가요? 평가용 환경을 통해 학생이 바로 앞 스텝의 데이터를 기반으로 한 업데이트의 도움 없이 성공할 수 있는지 확인합니다. 해당 환경의 성공률이 학습 성공률보다 낮아, 더 오랜 증류가 필요함을 알 수 있었습니다.
실제 삽입 과제로 정책을 전이하는 데 무엇이 도움이 되었나요? 시뮬레이터의 접촉 역학을 활용하는 정책보다 안정적으로 잡은 뒤 곧바로 삽입하는 정책이 더 잘 전이되었습니다. 막대-구멍 삽입에서는 포인트 클라우드 노이즈도 실패 후 다시 조준하도록 유도했습니다.
