5회 시연으로 불변 보상 학습: 실제 로봇을 위한 제로샷 일반화

5회 시연으로 불변 보상 학습: 실제 로봇을 위한 제로샷 일반화

7분 읽기•2026년 5월 22일•
Marco Ferrari
Marco Ferrari

로봇에 새로운 조작 기술을 가르치려면 일반적으로 수백 시간의 작업별 데이터가 필요합니다. 연구진이 개발한 새로운 프레임워크는 로봇이 단 5회의 시연만으로 재사용 가능한 보상 함수를 학습하고, 재훈련 없이도 완전히 새로운 위치, 물체, 시점으로 일반화할 수 있음을 보여줍니다. 이 혁신은 로봇 강화 학습의 주요 병목을 제거함으로써 공장과 창고에서의 실제 로봇 배치를 획기적으로 가속화할 수 있습니다.

실제 환경에서 로봇 보상 함수가 실패하는 이유는?

보상 함수는 강화 학습에서 로봇이 달성해야 할 목표를 정의하지만, 기존의 비전 기반 보상은 작업의 근본적인 목표가 아닌 특정 픽셀 패턴을 암기합니다. 카메라 각도가 바뀌거나, 물체가 변경되거나, 조명이 달라지면 이러한 보상은 작동하지 않아 엔지니어가 각 환경에 맞게 수동으로 재설계해야 합니다.

연구진은 arXiv에 공개한 사전 출판본에서 "최근의 비전 기반 보상 모델은 특정 픽셀 분포를 암기하는 경향이 있어 훈련 조건을 벗어나면 일반화하지 못한다"고 밝혔습니다. 이러한 과적합은 다양한 물체 인스턴스, 위치, 카메라 시점을 통해 단일 작업이 여러 변형으로 나타날 수 있는 개방형 조작 문제의 근본적인 도전 과제입니다. 흰 테이블 위의 빨간 컵을 인식하도록 훈련된 보상은 컵이 파란색이거나, 테이블이 나무 재질이거나, 로봇이 반대쪽에서 접근하면 실패합니다. 이러한 취약성의 비용은 높습니다. 새 배포 환경마다 사실상 새로운 보상 설계 주기가 필요하므로 확장성이 제한됩니다.

불변 보상 프레임워크는 어떻게 작동하나?

이 프레임워크는 시각적 특징을 학습하는 대신 행동 불변량, 즉 다양한 시각적 구현에서 일정하게 유지되는 작업 수준 속성을 발견합니다. 두 가지 결합 구성 요소, 즉 작업 전략과 물리적 제약 조건을 인코딩하면서 최적 정책 불변성을 유지하는 구조적 보상 공식화와, 온라인 상호 작용 없이 시연에서 이러한 불변량을 추출하는 하이브리드 기호-수치 절차를 사용합니다.

이는 로봇에게 퍼즐 조각의 특정 색상이 아니라 퍼즐의 논리를 가르치는 것과 같습니다. 그러면 로봇은 모든 변형을 해결할 수 있습니다. 픽셀과 성공 사이의 상관 관계를 학습하는 엔드-투-엔드 신경 보상 모델과 달리, 이 접근 방식은 시각적 변환 전반에 걸쳐 유지되는 기호 규칙을 명시적으로 검색합니다. 하이브리드 절차는 먼저 시연에서 후보 기호 술어를 추출한 다음 물리적 일관성 제약 조건에 대해 검증합니다. 그 결과는 원시 이미지 특징이 아닌 객체 관계와 기하학으로 표현된 보상 함수입니다. 비유가 완벽하지 않은 점은 이 프레임워크가 세밀한 제어를 위해 수치 구성 요소를 유지한다는 것입니다. 순수하게 기호적이지 않으며, 기호를 사용하여 수치 보상 계산을 안내합니다.

다양한 객체 위치와 카메라 각도에서 집기-놓기 작업을 수행하는 로봇 매니퓰레이터

실험 결과는 무엇을 보여주었나?

이 방법은 8가지 Meta-World 조작 작업과 3가지 Franka 실제 로봇 작업에서 테스트되었습니다. 기준 방법보다 더 강력한 프로세스 정렬 및 정책 롤아웃 순위를 달성했습니다. 실제 세계의 분포 외 테스트에서 동일하게 학습된 보상은 위치, 시점 및 객체 외관의 변화에 제로샷으로 일반화되었습니다. 저자들은 이 결과가 "실제로 다양한 작업 변형 전반에 걸쳐 단일 보상 표현을 재사용할 수 있게 한다"고 설명합니다.

접근 방식필요 데이터일반화실제 OOD
전통적인 보상 학습100회 이상 시연낮음입증되지 않음
불변 보상 프레임워크5회 시연제로샷 위치/시점/객체3가지 실험에서 입증
기준 비전 모델50회 이상 시연제한적(약간의 시점 이동)OOD에서 실패

제로샷 능력은 특히 중요합니다. 단일 객체 인스턴스로 실험실 설정에서 학습된 보상이 시스템이 한 번도 접하지 않은 새로운 객체 모양, 다른 테이블 높이, 조명 조건으로 직접 전송되었습니다. 저자들은 "동일하게 학습된 보상이 위치, 시점 및 객체 변형에 제로샷으로 일반화된다"고 언급하며, 이는 생산 환경에서 RL을 배포하는 가장 큰 장벽 중 하나를 직접 해결합니다.

이것이 다운스트림 정책 학습을 어떻게 가속화하나?

안정적이고 일반화 가능한 보상 신호를 제공함으로써 이 프레임워크는 다운스트림 RL 정책이 더 빠르게 학습되고 작업 간에 전송될 수 있도록 합니다. 불변 보상은 정책의 탐색 공간을 줄여 각 변형에 대한 작업 목표를 다시 학습하는 대신 모터 제어에 집중할 수 있게 합니다.

전통적인 설정에서는 로봇이 새로운 객체 위치나 카메라 배치마다 처음부터 다시 훈련되어야 합니다. 각 변형은 사실상 새로운 작업이 됩니다. 불변 보상을 사용하면 정책을 한 번 훈련한 다음 동일한 보상 함수를 사용하여 특정 환경에 맞게 미세 조정할 수 있습니다. 실험은 더 강력한 프로세스 정렬을 보여주었으며, 이는 정책이 목표에 도달할 뿐만 아니라 시연된 행동을 반영하는 전략을 통해 이를 수행함을 의미합니다. 로봇 통합 업체의 경우 이는 엔지니어링 시간을 줄이는 것으로 이어집니다. 작업장당 수 주일의 보상 튜닝 대신 몇 번의 인간 시연으로 일반 보상을 학습한 다음 전체 공장 라인에 적용할 수 있습니다.

다양한 보상 학습 방법 간의 정책 롤아웃 성공률 비교 차트

제로샷 일반화가 로봇 공학에 의미하는 바는?

제로샷 일반화는 로봇이 단 5번의 초기 시연에서 학습된 동일한 보상 함수를 사용하여 본 적 없는 물체, 도달한 적 없는 위치, 경험하지 못한 조명 조건에서 물체를 집을 수 있음을 의미합니다. 이는 모든 환경이 고유한 개방형 조작에 필수적인 능력입니다.

창고 자동화의 경우, 이는 단일 로봇 암이 사전 보정 없이 임의의 크기와 위치의 들어오는 소포를 처리할 수 있음을 의미할 수 있습니다. 제조에서는 협동 로봇이 5번의 작업자 시연에서 새로운 조립 단계를 학습한 다음 모든 작업대 레이아웃에서 실행할 수 있습니다. 연구진은 이를 정확히 시연했습니다. 실제 세계 분포 외 실험에는 작업 공간 전체에 걸친 대상 객체 이동, 카메라를 완전히 새로운 각도로 회전, 객체를 다른 모양과 색상으로 교체하는 것이 포함되었으며, 모두 동일하게 학습된 보상으로 처리되었습니다. 배치 비용에 대한 시사점은 상당합니다. 시스템 통합 업체에게 현장별 보상 엔지니어링 비용을 지불하는 대신 최종 사용자가 즉시 적응하는 사전 훈련된 보상을 받을 수 있습니다.

로봇 공학에 미치는 영향

조작을 위한 강화 학습을 평가하는 로봇 공학 팀의 경우, 이 프레임워크는 대부분의 상업적 배치에서 RL 기반 자동화를 막아온 데이터 효율성 및 일반화 문제를 직접 해결합니다. 5회 시연에서 학습할 수 있는 능력은 중소기업의 진입 장벽을 낮춥니다. 또한 제로샷 일반화는 단일 보상을 여러 작업 셀에서 공유할 수 있어 총 소유 비용을 줄입니다.

Robot Overflow에서 중고 협동 로봇 또는 중고 산업용 로봇을 찾는 구매자에게 이 연구는 로봇이 값비싼 맞춤형 프로그래밍 없이도 더 적응력이 높아지는 미래를 가리킵니다. 이 프레임워크는 아직 연구 단계이지만, 최소 데이터 요구 사항과 입증된 실제 OOD 성능을 고려할 때 유사한 아이디어를 통합한 상용 툴킷이 1~2년 내에 등장할 수 있음을 시사합니다. 로보티시스트는 순수 신경 보상 모델의 잠재적 대안으로 하이브리드 기호-수치 접근 방식을 주시해야 합니다.

자주 묻는 질문

몇 번의 시연이 필요한가? 프레임워크는 5회 시연만으로 작동합니다. 실험에서는 5번의 인간 시연을 사용하여 제로샷으로 일반화되는 불변 보상 함수를 학습했습니다.

시뮬레이터가 필요한가? 보상 학습 단계에는 온라인 상호 작용이나 시뮬레이터가 필요하지 않습니다. 하이브리드 기호-수치 절차는 제공된 시연에서만 불변량을 추출합니다. 다운스트림 정책 학습은 시뮬레이터 또는 실제 롤아웃을 사용할 수 있습니다.

어떤 유형의 작업이 테스트되었나? 이 방법은 8가지 Meta-World 벤치마크 작업(밀기, 집기, 조립 포함)과 3가지 Franka Emika 실제 로봇 조작 작업(집기-놓기 및 핀 삽입)에서 평가되었습니다.

다른 로봇 암에서도 작동하나? 프레임워크는 암에 구애받지 않습니다. 로봇의 기구학과 무관하게 작업 수준 불변량을 학습하므로 작업 목표가 동일하게 유지되는 한 동일한 보상을 다른 매니퓰레이터 간에 전송할 수 있습니다.

상업적 배치에 사용할 수 있나? 프레임워크는 실제 세계 분포 외 실험에서 검증되었지만 여전히 학술 연구 기여입니다. 상업적 채택을 위해서는 표준 RL 스택에 통합되고 더 넓은 범위의 작업에서 검증되어야 합니다.

모방 학습과 어떻게 비교되나? 모방 학습은 시연된 행동을 복사하지만 새로운 상태에서는 어려움을 겪습니다. 이 프레임워크는 정책이 아닌 작업 목표(보상)를 학습하므로 새로운 상태 분포로의 제로샷 전송을 가능하게 하면서도 다운스트림 정책이 최적의 행동을 발견할 수 있도록 합니다.

결론

단 5회의 시연으로 불변 보상을 학습하는 것은 로봇 공학에서 배포 가능한 강화 학습을 위한 실용적인 단계입니다. 픽셀 맞춤에서 행동 불변량으로 전환함으로써 이 프레임워크는 비전 기반 보상의 실제 채택을 제한해 온 일반화 문제를 해결합니다. 로보티시스트가 자동화의 데이터 및 엔지니어링 비용을 줄이기 위해 노력함에 따라, 이 접근 방식은 로봇이 가르쳐진 특정 시각적 조건뿐만 아니라 작업을 진정으로 이해하는 길을 제시합니다.

Boston Dynamics, 전 Amazon AI 임원 Rohit Prasad를 CEO로 선임

Boston Dynamics는 전 Amazon 임원 Rohit Prasad를 내일부터 CEO로 선임한다고 밝혔다. 전 CEO Robert Playter가 물러난 지 거의 9개월 만의 인사로, Therobotreport가 처음 보도했다. Prasad는 임시 CEO Amanda McMaster의 뒤를 잇는다. Boston Dynamics는 그의 선임으로 로봇공학과 첨단 AI를 결합해 지능형 기계를 대규모로 상용화하려는 피지컬 AI 전략에 속도가 붙을 것이라고 밝혔다.

McMaster는 Playter가 2월에 회사를 떠난 뒤 CEO 직무를 맡았다. Prasad는 회사의 세 번째 CEO다. 창업자 Marc Raibert는 1992년 회사 설립부터 2020년까지 회사를 이끌었다.

Boston Dynamics에 합류하기 전 Prasad는 Amazon에서 Alexa 및 인공 일반 지능 부문 수석 부사장 겸 수석 과학자를 맡았다. Amazon에서 12년간 근무하며 Alexa의 초기 개발에 참여했고, 이후 기업용 Amazon Nova 파운데이션 모델 제품군 개발을 이끌었다. Amazon에 입사하기 전에는 Raytheon BBN Technologies에서 거의 14년간 근무하면서 머신러닝 연구와 미국 정부 및 기업을 위한 실제 적용을 주도했다.

Prasad는 산업 및 상업 환경 전반의 안전성, 생산성, 운영 효율성을 높이기 위해 지능형 로봇 시스템을 제품화할 계획이라고 밝혔다. 그는 소비자용 AI와 기업용 파운데이션 모델 분야에서 경험을 쌓았으며, Boston Dynamics는 첨단 AI와 로봇공학을 결합해 지능형 기계를 상용화하는 전략을 추진하고 있다.

Hyundai 부회장이자 Boston Dynamics 이사회 의장인 Jaehoon Chang은 회사의 로봇공학 역량과 Prasad의 AI 제품화 경험, Hyundai Motor Group의 제조·물류·모빌리티 역량을 바탕으로 피지컬 AI를 구축하고 확장할 수 있다고 말했다. Hyundai는 2021년 SoftBank Group으로부터 Boston Dynamics의 지배 지분을 인수했다.

관련 승인 절차를 거쳐 Prasad는 회사 이사회에도 합류할 것으로 예상된다.