불완전한 인간 동작 데이터만으로 경쟁 수준의 테니스를 학습한 휴머노이드 로봇이 이번 주 로보틱스 업계의 가장 큰 화제다. 이는 더 큰 변화를 보여준다. 이제 Physical AI 시스템은 정제된 참조 데이터 없이도 역동적인 운동 기술을 학습하고 있다. 사과를 깎는 손재주 좋은 로봇부터 실제 환경에서 테스트를 마친 KAIST 휴머노이드까지, Embodied AI의 발전 속도가 눈에 띄게 빨라지고 있다.
목차
- LATENT란 무엇이며, 인간에게서 테니스를 어떻게 학습하는가?
- Sharpa의 정교한 사과 깎기 로봇과 MoDE-VLA
- 이번 주의 다른 휴머노이드 및 보행 로봇 성과
- 주목할 만한 조작·인지 기술과 예외 상황
- 이번 주 영상들이 휴머노이드 로보틱스에 의미하는 것
LATENT란 무엇이며, 인간에게서 테니스를 어떻게 학습하는가?
LATENT(Learns Athletic humanoid TEnnis skills from imperfect human motioN daTa)는 잡음이 많고 불완전한 인간 동작 데이터만으로 휴머노이드 로봇이 실제 경기 수준의 테니스 랠리를 수행하도록 학습시키는 시스템이다. 로봇에 맞춘 정밀한 운동학 참조 데이터가 없어도 된다. 그 결과, 인간 선수와 실시간으로 경기하며 빠르게 날아오는 테니스공을 추적하고 받아치는 휴머노이드가 탄생했다.
LATENT가 해결하려는 문제는 겉보기보다 훨씬 어렵다. 인간의 테니스 동작은 빠르고 역동적이며 상황 의존성이 높다. 시속 80km로 날아오는 포핸드 드라이브를 구사하려면 전신 자세의 정교한 협응, 예측 기반의 발놀림, 밀리초 단위의 스윙 타이밍이 모두 필요하다. 이를 로봇 모방 학습에 활용할 만큼 정확하게 수집하려면, 지금까지는 값비싼 모션 캡처 장비나 로봇의 형태에 맞게 변환한 완벽한 인간 운동학 데이터가 필요했다. LATENT는 이 병목을 통째로 우회한다.
LATENT 프로젝트 페이지에 따르면, 이 시스템은 잡음이 많고 불완전한 인간 시연 데이터도 견뎌내며, 실물 크기 휴머노이드에서 안정적이고 역동적인 정책 실행을 만들어낸다. 여기서 주목할 Physical AI의 핵심은 다음과 같다. 모방 학습이 데이터 품질에 취약하다는 문제가 체계적으로 약화되고 있다. 가공되지 않은 실제 인간 데이터와 로봇 학습에 쓸 수 있는 신호 사이의 간극이 줄어들수록, 휴머노이드에 이전할 수 있는 운동 및 정교한 조작 기술의 범위는 크게 넓어진다.
테니스는 우연히 선택된 벤치마크가 아니다. 공의 궤적을 추적하는 고속 인지, 발놀림과 스윙 동작 및 체중 이동을 아우르는 반응형 전신 제어, 라켓이라는 확장형 말단장치의 사용이 모두 필요하다. 휴머노이드가 불완전한 데이터만으로 이를 학습할 수 있다면, 빠른 피킹·플레이스먼트나 동적 조립처럼 비슷한 역학을 요구하는 공장 작업도 한층 현실적인 과제가 된다. 중요한 것은 운동 능력 자체가 아니다. 핵심은 일반화 능력이다.
Sharpa의 정교한 사과 깎기 로봇과 MoDE-VLA
Sharpa는 양손형 인간형 정교한 손을 사용해 사과를 깎는 로봇을 시연한 최초의 로보틱스 기업이라고 주장한다. 이는 기존 산업용 그리퍼의 능력을 크게 넘어서는 양손·접촉 중심 조작 작업이다. 기반 시스템인 MoDE-VLA(Mixture of Dexterous Experts — Vision-Language-Action)는 여러 전문 AI ‘전문가’가 시각·언어·힘·촉각 데이터를 결합하도록 해, 고차원 행동 공간에서 제어를 안정화한다.
다만 이 시연을 정확히 평가하려면 제약이 있는 데모라는 점도 짚어야 한다. 사과 깎기는 상당히 비정형적인 작업이다. 과일의 모양은 제각각이고 껍질의 저항도 달라지며, 손안에서 사과를 회전시키려면 여러 손가락의 지속적인 협응이 필요하다. 원격 조작만으로도 쉽게 구현하기 어렵다. Sharpa가 택한 해법은 공유 자율성 아키텍처다. 조작자가 손가락 하나하나를 직접 제어하는 대신 키보드나 풋 페달로 ‘물체 회전’ 같은 사전 학습된 기술 프리미티브를 실행하면, 로봇이 낮은 수준의 협응을 담당한다.
이 설계 선택은 중요하다. 자유도가 높은 로봇 손을 손가락 단위로 원격 조작하는 방식은 대규모 데이터 수집에 사실상 적합하지 않다. Sharpa는 조작자의 입력을 기술 단위 명령으로 추상화함으로써 강화학습(RL)을 대규모로 수행할 수 있는 기반을 마련했다. 이후 MoDE-VLA 프레임워크가 실제 손안 조작을 담당한다. 전문가 혼합 구조를 통해 촉각 피드백과 시각 데이터를 결합하고, 연속적인 조작 과정에서 안정적인 접촉을 유지한다.
정밀 조립이나 식품 취급을 위해 휴머노이드 로봇을 검토하는 구매자라면 이 아키텍처를 눈여겨볼 만하다. 접촉이 많은 양손 조작은 상용 로보틱스에서 가장 해결하기 어려운 역량 격차 중 하나였다. Sharpa의 접근법은 이를 메울 수 있는 현실적인 경로를 제시한다. 다만 시연대에서 사과 한 개를 깎는 것과 생산 라인에서 하루에 만 개를 처리하는 것 사이에는 여전히 큰 간극이 있다.
이번 주의 다른 휴머노이드 및 보행 로봇 성과
이번 주 라운드업에서 소개된 다음 시연들도 하나의 흐름으로 살펴볼 만하다.
| 시스템 | 조직 | 핵심 역량 | 학습 방식 |
|---|---|---|---|
| KAIST Humanoid v0.7 | KAIST DRCD Lab | 현장 테스트 및 인간과의 상호작용 | Deep RL + 인간 시연 |
| UMV (Unmanned Mobile Vehicle) | Robotics and AI Institute | 주행, 점프, 공중제비 | NVIDIA Isaac Lab RL |
| LimX Dynamics Oli | LimX Dynamics | 유리문 감지 및 내비게이션 | 컴퓨터 비전 |
| Tesollo Finger-Tip Changer | Tesollo / Hanyang University | 모듈형 손끝 교체 | 산학 협력 하드웨어 설계 |
| KAIST Humanoid v0.7 | KAIST DRCD Lab | 자체 액추에이터, 현장 보행 | Deep RL |
KAIST Humanoid v0.7이 주목받는 이유는 자체 개발 액추에이터를 사용하기 때문이다. 이는 하드웨어부터 정책까지 전체 스택을 직접 통제하려는 연구팀의 의지를 보여준다. 대부분의 학술용 휴머노이드 플랫폼은 상용 액추에이터 시스템에 의존한다. 반면 관절 수준의 수직 통합은 토크 대역폭과 컴플라이언스 조정을 더 세밀하게 제어할 수 있게 하며, 이는 보행 안정성에 직접적인 영향을 미친다.
Robotics and AI Institute의 UMV는 NVIDIA GTC 기조연설에서 ‘AI Native’ 기업의 사례로 소개됐다. 이는 Isaac Lab의 시뮬레이션-현실(sim-to-real) 전이가 뒤집기와 도약 같은 동작을 수행할 수 있는 범용 보행 정책을 만들어내고 있음을 보여준다. 시뮬레이션과 현실의 간극을 줄이는 일은 로보틱스 상용화에서 가장 중요한 과제 중 하나다. 전이에 성공할 때마다 정책 학습에 필요한 데이터 수집 부담도 줄어든다.
LimX Dynamics의 유리문 인지는 단독으로 보면 작은 뉴스일 수 있지만, 역량 측면에서는 의미 있는 성과다. 투명한 표면은 라이다나 구조광처럼 일반적인 깊이 센서가 쏜 신호를 반사하거나 통과시켜, 유효한 반환 신호를 만들지 못하게 한다. 보행 로봇의 실시간 내비게이션 스택에서 이를 해결하면 상업용 건물에 보행 로봇을 배치할 때 발생하는 실질적인 장애물이 하나 줄어든다.
주목할 만한 조작·인지 기술과 예외 상황
휴머노이드 외에도 이번 주 두 가지 시연은 공장 현장에 직접 서보기 전에는 쉽게 예상하기 어려운 문제를 로보틱스 엔지니어들이 어떻게 해결하는지 보여준다.
Nomagic의 신발 상자 조작 로봇은 매우 구체적이면서도 실제로는 상당히 어려운 문제를 다룬다. 뚜껑이 있는 골판지 상자는 뚜껑을 잡고 들어 올릴 수 없다. 그립력이 상자를 들어 올리는 대신 상자를 열어버리기 때문이다. Nomagic은 이를 처리하기 위한 특수 하드웨어를 개발했으며, 시스템은 이미 상용 환경에 배치됐다. Zalando는 물류 운영 전반에 Nomagic 로봇을 최대 50대 설치하고 있다. 이는 실험실 데모가 아니라, 실제 가동 중인 창고에서 발생한 생산 제약을 대규모로 해결한 사례다.
Strandbeest 연결 메커니즘에서 영감을 받은 Cranfield University의 풍력 로봇은 또 다른 시사점을 준다. 적대적인 환경을 장기간 탐사하도록 설계된 이 로봇은 배터리나 충전 인프라 없이 바람 에너지로 작동한다. 외딴 지역의 점검 및 환경 모니터링에서는 속도나 정밀도보다 에너지 자립성이 더 중요할 수 있다.
한편 Stanford BDML의 나무 포옹형 착륙 드론은 구조화된 착륙 메커니즘을 이용한 순응형 공중 파지를 보여준다. 적용 분야는 환경 센싱이지만, 불규칙한 자연 표면에 스스로 고정해 정지 상태를 유지하는 비행 로봇이라는 핵심 역량은 인프라 점검에도 직접 연결된다. 전선이나 교량 교각을 점검할 때 계속 호버링하는 데 드는 에너지를 아낄 수 있기 때문이다.
이번 주 영상들이 휴머노이드 로보틱스에 의미하는 것
이번 주 시연 사례들을 종합하면 구매자와 엔지니어가 주목해야 할 세 가지 흐름이 나타난다.
불완전한 데이터로 학습하는 방식이 표준이 되어가고 있다. LATENT와 KAIST v0.7은 모두 잡음이 있거나 인간 시연에서 얻은 학습 데이터를 명시적으로 활용한다. 과거에는 값비싼 모션 캡처 장비나 전문 데이터 파이프라인이 필요했던 정제 데이터 병목이 점차 힘을 잃고 있다. 이는 휴머노이드에 새로운 작업을 가르치는 데 걸리는 시간을 단축한다.
정교한 조작은 하드웨어만이 아니라 아키텍처로도 해결되고 있다. Sharpa의 MoDE-VLA는 전문 서브모델을 사용해 시각·촉각·힘·언어 등 여러 감각 양식을 결합한다. 이는 대규모 언어 모델에서 사용되는 전문가 혼합 패턴을 물리적 조작에 적용한 것이다. 단일 제어 정책에서 벗어나는 진정한 아키텍처 변화라고 할 수 있다.
배치를 가로막는 예외 상황이 하나씩 해결되고 있다. 유리문, 신발 상자 뚜껑, 모듈형 손끝이 그 사례다. 테니스를 치는 휴머노이드에 비하면 덜 화려해 보이지만, 상용 배치는 바로 이런 예외 상황에 의해 좌우된다. 특정 실패 모드에 맞춘 해결책이 등장하는 속도 자체가 업계의 성숙도를 보여주는 신호다.
신흥 휴머노이드 플랫폼과 함께 중고 산업용 로봇을 검토하는 구매자라면, 실질적인 시사점은 분명하다. 12개월 전만 해도 구조적인 문제처럼 보였던 역량 격차가 대부분의 조달 일정이 예상하는 것보다 빠르게 줄어들고 있다. 특히 조작과 자율 내비게이션 분야에서는 역량 변화가 빠르다는 점을 반영해 검토 주기를 설계해야 한다.
자주 묻는 질문
로보틱스에서 LATENT란 무엇인가?
LATENT는 Learns Athletic humanoid TEnnis skills from imperfect human motioN daTa의 약자다. 깨끗하게 정제된 로봇 전용 운동학 참조 데이터나 전문가 원격 조작 시연 없이, 잡음이 많고 불완전한 인간 모션 캡처 데이터로 실물 크기 휴머노이드가 실제 경기 수준의 테니스 랠리를 수행하도록 학습시키는 시스템이다.
현재 휴머노이드 로봇이 인간과 테니스를 칠 수 있는가?
LATENT 시스템은 인간 상대와 랠리를 이어가며 빠른 테니스공을 추적하고 받아치는 휴머노이드를 시연했다. 다만 이는 상용 제품이 아닌 연구 시연이다. Physical AI 벤치마크로서는 의미가 크지만, 2025년 중반 기준으로 이 정도의 전신 동적 제어 능력을 갖춘 상용 휴머노이드는 여전히 연구 단계이거나 초기 양산 전 단계에 있다.
로보틱스에서 MoDE-VLA는 어디에 사용되는가?
MoDE-VLA(Mixture of Dexterous Experts — Vision-Language-Action)는 Sharpa가 개발한 AI 제어 아키텍처다. 전문 서브모델을 이용해 시각·언어·힘·촉각 데이터를 결합하고, 고자유도 로봇 손으로 손안에서 물체를 회전시키거나 사과를 깎는 등 접촉 중심 조작 작업을 수행한다. 단일 정책으로는 제어하기 어려운 고차원 행동 공간을 안정화하도록 설계됐다.
유리문 감지가 보행 로봇의 성과로 평가받는 이유는 무엇인가?
유리 같은 투명한 표면은 일반적인 깊이 센서의 신호를 반사하거나 통과시킨다. 그 결과 센서가 이를 보이지 않는 공간으로 인식하거나 열린 공간으로 잘못 판단할 수 있다. LimX Dynamics가 보행 로봇의 내비게이션 스택에서 실시간 유리문 감지를 시연한 것은 사무실이나 상업 시설에서 흔히 볼 수 있는 유리문과 유리 칸막이라는 실제 배치 장애물을 제거했다는 의미가 있다.
휴머노이드 로봇 학습에서 시뮬레이션-현실 전이는 어떻게 작동하는가?
시뮬레이션-현실 전이(sim-to-real transfer)는 NVIDIA Isaac Lab 같은 물리 시뮬레이션에서 로봇 제어 정책을 학습한 뒤 실제 하드웨어에 배치하는 과정이다. 문제는 시뮬레이션의 물리가 현실과 완전히 일치할 수 없다는 데 있다. 이 ‘시뮬레이션-현실 간극’ 때문에 실제 로봇에서는 정책이 다르게 작동한다. 간극을 줄이는 방법으로는 도메인 무작위화가 있다. 시뮬레이션의 매개변수를 다양하게 바꿔 현실의 변동에도 강건한 정책을 만드는 방식이다.
단 일주일 동안 공개된 연구 시연만으로도 Physical AI의 발전 속도는 놀라울 정도다. 그러나 실험실 시연과 생산 현장에 투입할 수 있는 시스템 사이의 거리를 줄이는 일은 휴머노이드 보급의 다음 단계에서도 여전히 가장 큰 과제로 남아 있다.
이번 주 시연 중 테니스 기술, 사과 깎기, 유리문 내비게이션 가운데 상업적으로 가장 중요한 역량 격차를 줄인 것은 무엇이라고 생각하는가?
최종 업데이트: 2025년
