DARPA Robotics Challenge를 설계했고 현재 Toyota Research Institute의 CEO를 맡고 있는 Gill Pratt는 오랫동안 기대를 모아온 휴머노이드 로봇의 돌파구가 마침내 열렸다고 말한다. 원동력은 더 강력한 모터나 튼튼한 관절이 아니다. AI다. 특히 로봇의 행동을 일일이 코드로 작성하는 방식에서 벗어나, 시연을 보고 학습할 수 있게 한 모방 학습과 diffusion policy 모델로의 전환이 핵심이다.
목차
- 휴머노이드 로봇의 두뇌와 신체 문제
- System 1 AI만으로는 부족한 이유와 다음 단계
- TRI의 diffusion policy가 학습 병목을 뚫은 방법
- 과대광고의 문제: 평평한 공장에 휴머노이드가 어울리지 않는 이유
- 로봇 구매자에게 의미하는 것
- 자주 묻는 질문
휴머노이드 로봇의 두뇌와 신체 문제
하드웨어는 애초에 병목이 아니었다. 인상적인 신체 능력을 갖춘 휴머노이드 메커니즘은 10년 전부터 존재했다. Boston Dynamics의 Atlas는 2013년에 처음 공개됐고, 연구용 휴머노이드는 그보다도 훨씬 전부터 개발돼 왔다. 신체에 비해 처참할 정도로 뒤처져 있던 것은 두뇌였다. 로봇의 몸을 실제로 유용하게 만들 소프트웨어와 학습 구조, 추론 시스템이 부족했던 것이다.
Pratt는 최근 IEEE Spectrum 인터뷰에서 이렇게 분명히 말했다. “지금 달라진 것은 몸이 아니라 두뇌입니다. 로봇 분야에서는 우리가 만든 메커니즘이 놀라울 만큼 뛰어난데도, 로봇의 실제 활용도가 그 잠재력에 걸맞은 수준에 이르도록 만들 방법이 없었던 불균형이 늘 존재했습니다.”
이제 그 간극이 좁혀지고 있다. 액추에이터가 저렴해졌기 때문만은 아니다(물론 가격도 내려갔다). AI 연구가 로봇을 프로그래밍하는 근본적으로 새로운 방식을 내놓았기 때문이다. 엔지니어가 모든 작업을 일일이 코드로 작성하는 대신, 로봇은 이제 사람이 작업하는 모습을 보고 배울 수 있다. 여러 작업을 동시에 학습한 대규모 행동 모델(LBM)과 결합된 이 모방 학습 패러다임이 Pratt가 말하는 현재의 돌파구를 이루는 핵심이다.
자율주행과 비교하면 이해하기 쉽다. 2004년 DARPA Grand Challenge와 2007년 Urban Challenge는 상용 자율주행차를 만들어내지는 못했다. 하지만 개념을 입증하고, 인재가 모이는 기반을 마련했으며, 기술이 나아갈 방향을 정했다. Pratt는 휴머노이드 로봇을 위해 2012~2015년 DARPA Robotics Challenge를 설계할 때 바로 이런 효과를 염두에 뒀다. 10년이 지난 지금, 그는 당시의 기초 작업이 축적된 데다 현대 AI가 여기에 강력한 추진력을 더하면서 마침내 성과가 나타나고 있다고 본다.
System 1 AI만으로는 부족한 이유와 다음 단계
오늘날 로봇의 두뇌에 사용되는 가장 뛰어난 대규모 언어 모델을 포함해 현재의 AI는 심리학에서 말하는 System 1 사고에 거의 전적으로 의존한다. 빠르고, 패턴을 찾아내며, 반사적으로 반응하는 방식이다. 이런 입력 패턴이 들어오면 저런 행동을 출력한다. 놀라울 만큼 잘 작동하지만, 언제나 그런 것은 아니다.
빠진 것은 System 2 사고다. 내부 세계 모델을 만들고, 가상의 상황을 머릿속으로 시뮬레이션하며, 목표를 향해 여러 행동의 순서를 계획하는 느리고 신중한 추론이다. Pratt의 비유는 직설적이다. System 1 AI를 억지로 System 2처럼 만들려는 것은 “물로 가득 찬 풍선을 한쪽에서 눌러 다른 쪽으로 물이 불룩 튀어나오게 하는 것과 같다.” 한 가지 실패 유형을 고치면 다른 곳에서 또 문제가 생긴다. 결과적으로 성능 향상은 미미하다.
이는 AI 연구계를 갈라놓고 있는 논쟁과도 정확히 맞닿아 있다. 스케일링을 지지하는 진영은 현재의 트랜스포머 기반 아키텍처를 발전시키면 범용 추론 시스템으로 만들 수 있다고 본다. 반면 Meta의 수석 AI 과학자 Yann LeCun이 대표하는 진영은 자기회귀 예측, 즉 과거 토큰을 바탕으로 다음 토큰을 맞히는 방식이 규모와 무관하게 진정한 추론을 수행하기에는 구조적으로 한계가 있다고 주장한다. Pratt는 LeCun의 견해에 가깝다. 로봇에 궁극적으로 필요한 것은 더 큰 패턴 인식기가 아니라 세계 모델이라는 것이다.
이 차이는 현재 휴머노이드 로봇에 중대한 실질적 영향을 미친다. 지난 2년 동안 본 인상적인 로봇 시연, 즉 물체 조작과 집안일, 창고의 피킹·적재 작업은 모두 System 1 기반의 diffusion policy 위에 구축됐다. 이 로봇들은 추론하는 것이 아니라 반응한다. 학습 데이터에서 유사한 사례를 본 적은 있어도 그 상황을 실제로 상상해본 적은 없기 때문에, 새로운 예외 상황에서 실패한다.
TRI의 diffusion policy가 학습 병목을 뚫은 방법
2년 전 Toyota Research Institute는 diffusion policy에 관한 연구를 발표했다. AI 이미지 생성에 사용되는 생성 메커니즘인 diffusion model을 로봇의 행동 생성에 적용한 방식이다. 픽셀을 생성하는 대신 모델이 모터 명령을 생성한다. 결과는 매우 인상적이었고, Pratt의 표현을 빌리면 “우리가 본 모든 로봇 시연이 어떤 형태로든 diffusion policy를 사용하고 있다”고 할 정도였다.
이후 TRI는 이를 대규모 행동 모델(LBM)로 확장했다. 작업마다 모델 하나를 따로 만드는 대신, 하나의 모델을 여러 작업에 걸쳐 동시에 학습시키는 방식이다. 핵심 발견은 긍정적 전이였다. 학습 데이터에 새로운 작업을 추가하자 기존 작업의 성능까지 향상됐고, 일정 수준의 능력에 도달하는 데 필요한 전체 데이터양도 줄었다. 이는 그동안 로봇 학습을 상업적 규모에서 어렵게 만들었던 데이터 병목을 직접 겨냥한다.
다만 데이터 문제는 여전히 현실적인 장벽이다. 인터넷의 텍스트 대부분을 학습한 LLM과 달리, 로봇은 실제 세계에서 물리적 상호작용 데이터를 수집해야 한다. 시연, 동작 궤적, 센서 기록 등이 그것이다. 이 과정은 느리고 비용도 많이 든다. LBM은 작업별 데이터 요구량을 줄여주지만, 안정적인 실세계 배포에 데이터가 얼마나 필요한지는 업계 전체가 아직 답을 찾지 못한 질문이다.
Pratt가 제시하는 당장의 해법은 자율주행차가 상용화되는 과정에서 활용한 전략과 닮았다. 바로 감독형 자율성이다. 대부분의 시간 동안 로봇은 System 1 추론을 활용해 작업을 독립적으로 수행한다. 그러다 정말 새로운 상황, 예를 들어 로보택시의 진로를 이중 주차 차량이 막아선 경우와 비슷한 상황을 만나면 원격 인간 운영자에게 도움을 요청한다. 사람이 System 2에 해당하는 판단을 내리면 로봇이 이를 실행한다. 이 하이브리드 방식은 아직 해결되지 않은 세계 모델 문제를 우회하면서도 지금 당장 상업적 가치를 제공한다.
과대광고의 문제: 평평한 공장에 휴머노이드가 어울리지 않는 이유
Pratt의 평가가 전부 낙관적인 것은 아니다. 그는 현재 휴머노이드 투자가 집중되는 분야, 즉 공장 현장을 날카롭게 비판한다.
휴머노이드 형태가 필요한 핵심 이유는 인간이 만든 세계가 인간의 신체에 맞춰 설계됐기 때문이다. 문손잡이, 계단, 차량 내부, 병실 같은 환경에서는 두 발 보행과 정교한 조작 능력이 유리하다. 복잡하고 고르지 않으며 장애물이 많은 공간에서는 두 다리가 바퀴보다 실제로 뛰어난 경우가 많다. 두 발 로봇은 장애물을 피해 돌아가는 대신 넘어갈 수 있기 때문이다.
하지만 현대의 공장은 평평하고 장애물이 적으며 자동화를 전제로 설계돼 있다. 이런 환경에서는 바퀴가 다리보다 구조가 단순하고 저렴하며 에너지 효율과 신뢰성도 높다. 지게차와 AGV(무인운반차)를 위해 설계된 창고 바닥에서 휴머노이드에 추가되는 복잡성, 비용, 기계적 고장 위험은 아무런 이점으로 이어지지 않는다.
Pratt는 “바퀴에 완벽하게 적합한 평평한 환경인 공장에 다리 달린 로봇이 이렇게 큰 관심을 받는 것은 매우 이상한 일”이라고 직접 말했다.
이는 현재 쏟아지는 휴머노이드 제품을 평가하는 구매자에게 중요한 시사점을 준다. 형태에 따른 비용과 복잡성의 프리미엄은 실제로 존재한다. 하지만 가장 요란한 상용화 발표가 겨냥하는 환경 중 상당수에서는 실제 운영 요건만 놓고 보면 그 프리미엄을 정당화하기 어렵다. TRI에서 Pratt가 집중하는 분야는 휴머노이드의 복잡성이 제대로 가치를 발휘하는 환경이다. 노인 돌봄, 가정 보조, 그리고 형태 자체의 장점이 분명한 비정형 인간 공간이 여기에 해당한다.
로봇 구매자에게 의미하는 것
Pratt의 주장은 로봇 구매에 직접적인 영향을 미친다. 이제 휴머노이드 플랫폼의 기계 사양보다 AI 역량 등급이 더 중요하다. 업계 표준 diffusion policy 통합과 LBM 기반 학습을 지원하는 로봇은, 두 로봇의 물리적 사양이 서류상 비슷하더라도 전통적인 수작업 행동 트리에 의존하는 로봇보다 본질적으로 더 뛰어난 능력을 갖춘다.
현재 휴머노이드 및 협동로봇 플랫폼을 AI 역량 등급별로 비교하면 다음과 같다.
| 플랫폼 | AI 등급 | 학습 방식 | 원격조작 대체 수단 | 최적의 활용 환경 |
|---|---|---|---|---|
| Boston Dynamics Spot (AI 애드온 포함) | System 1+ | Diffusion policy / 행동 복제 | 지원 | 산업 검사, 비정형 야외 환경 |
| Figure 02 / 1X NEO | System 1 | 모방 학습, LLM 통합 | 부분 지원 | 정형화된 제조 환경(제한적) |
| Unitree H1 / G1 | System 1 | Diffusion policy 변형 | 제한적 지원 | 연구, 개념검증 |
| Agility Robotics Digit | System 1 | 행동 복제 | 지원(창고 운영) | 평평한 창고 — 바퀴가 더 나을 가능성이 높음 |
| 기존 협동로봇(UR, Fanuc) | Pre-AI | 프로그래밍 / 티치 펜던트 | 해당 없음 | 정형화되고 반복적인 산업 작업 |
구매자를 위한 핵심 조언:
- 몸체가 아니라 학습 스택을 구매하라. 어떤 학습 데이터 파이프라인이 제공되는지, 로봇이 새 작업을 얼마나 빠르게 익히는지, 공급업체가 감독형 자율성에 따른 원격 지원을 제공하는지 평가해야 한다.
- 환경에 맞는 형태인지 냉정하게 판단하라. 다리 달린 휴머노이드는 비정형적인 인간 공간에서 의미가 있다. 평평하고 정형화된 환경이라면 휴머노이드 프리미엄을 지불하기 전에 판매 중인 중고 협동로봇이나 바퀴 달린 플랫폼을 먼저 검토하라.
- 데이터 우위는 실재한다. 가장 많은 시연 데이터를 보유한 업체, 특히 TRI, Figure, 1X는 시간이 지날수록 커지는 구조적 우위를 갖는다. 현재 시연 성능만이 아니라 공급업체의 데이터 전략을 평가해야 한다.
- 감독형 자율성이 현재의 모범 사례다. 원격 운영자에게 작업을 넘길 수 있는 플랫폼이, 예외 상황에서 실패할 완전 자율 시스템보다 현재 배포하기에 더 적합하다.
이용 가능한 플랫폼 전반을 살펴보고 싶다면 Robot Overflow에서 휴머노이드 로봇을 둘러보며 역량 등급별 최신 시장 제품을 비교해보자.
자주 묻는 질문
10년 전에는 불가능했던 휴머노이드 로봇이 지금 상용화 가능한 이유는 무엇인가?
하드웨어가 근본적으로 달라진 것은 아니다. 인상적인 물리 작업을 수행할 수 있는 두 발 로봇 메커니즘은 2015년 DARPA Robotics Challenge 결승전 이전부터 존재했다. 달라진 것은 AI 학습 스택이다. 이제 diffusion policy와 대규모 행동 모델을 활용하면 로봇이 사람이 시연한 데이터를 통해 새로운 기술을 습득할 수 있다. 작업별로 지시 사항을 일일이 코드로 작성할 필요가 줄어들면서 엔지니어링 부담이 크게 낮아졌고, 비정형 입력에 대한 실세계 성능도 향상됐다.
Diffusion policy란 무엇이며 로봇공학에서 중요한 이유는 무엇인가?
Diffusion policy는 AI 이미지 생성에 사용되는 생성 메커니즘을 로봇의 행동 생성에 적용한 기술이다. 픽셀을 만드는 대신 모델이 모터 명령의 시퀀스를 출력한다. Toyota Research Institute가 2022~2023년에 발표한 diffusion policy 연구는 이 방식이 조작 벤치마크에서 기존 모방 학습 방법보다 뛰어난 성능을 보인다는 사실을 입증했다. 이후 거의 모든 주요 상용 휴머노이드 개발업체가 다양한 형태로 이 기술을 채택했다.
창고나 공장에 다리 달린 휴머노이드 로봇을 구매해야 할까?
대부분의 경우 그렇지 않다. Gill Pratt는 평평하고 정형화된 공장 환경이 “바퀴에 완벽하게 적합하다”고 명시적으로 지적한다. 다리 보행의 기계적 복잡성은 이런 환경에서 운영상의 이점 없이 비용과 고장 위험만 높인다. 바퀴 달린 협동로봇이나 바퀴 기반 이동 매니퓰레이터가 정형화된 산업 애플리케이션에서는 대체로 더 비용 효율적이고 안정적이다. 휴머노이드의 다리가 프리미엄을 정당화하는 곳은 계단과 장애물, 인간 신체에 맞춰진 설비가 있는 비정형 환경, 즉 가정과 병원, 야외 공간이다.
로봇공학에서 System 1 AI와 System 2 AI의 차이는 무엇인가?
System 1 AI는 빠르게 패턴을 인식하며, 현재 로봇이 수행하는 대부분의 작업을 담당한다. 학습 데이터에 기반해 감각 입력을 행동으로 변환하는 방식이다. System 2 AI는 느리고 신중한 추론을 수행하며, 내부 세계 모델을 만들고 여러 단계의 행동을 계획하며 행동하기 전에 새로운 상황을 머릿속으로 시뮬레이션하는 능력을 뜻한다. 현재의 휴머노이드 로봇은 거의 전적으로 System 1에서 작동한다. 어떤 상용 로봇 플랫폼도 안정적인 System 2 추론을 달성하지 못했으며, 이는 여전히 이 분야의 핵심 미해결 과제다.
로봇 배포에서 감독형 자율성이란 무엇인가?
감독형 자율성은 로봇이 대부분의 작업을 독립적으로 처리하다가 학습 분포를 벗어난 상황을 만나면 원격 인간 운영자에게 판단을 넘기는 하이브리드 운영 모델이다. 상용 로보택시 서비스가 도로에서 예외적인 상황을 만났을 때 사용하는 방식과 같다. 구매자 입장에서는 현재 세대의 로봇도 안정적으로 배포할 수 있다는 의미지만, 원격 운영 인프라와 인간 감독 인력에 드는 비용은 반드시 고려해야 한다.
현재의 휴머노이드 투자 거품이 유용한 제품으로 이어질까?
Pratt의 견해는 조심스럽게 긍정적이다. 실제로 이전과는 다른 변화가 일어났고, AI의 발전은 현실이며, 투자가 역량 개발을 가속하고 있다는 것이다. 그가 지적하는 위험은 투자가 잘못된 애플리케이션에 배분되는 경우다. 특히 더 단순한 플랫폼이 우수한 환경인 평평한 공장에 휴머노이드 형태를 투입하는 것이 문제다. 지속적인 가치를 만들어낼 가능성이 가장 높은 투자는 휴머노이드 형태가 대체할 수 없는 장점을 갖는 비정형 환경, 즉 노인 돌봄과 가정 보조, 재난 대응을 겨냥한 투자다.
휴머노이드 로봇의 두뇌와 신체 사이의 간극은 좁혀지고 있다. 하지만 역량과 적절한 배포 사이의 간극은 그만큼 빠르게 벌어지고 있다. 지금 자금을 지원받는 플랫폼이 향후 10년간 구현 AI 스택을 누가 지배할지 결정하게 될 것이다.
여러분은 어떤 휴머노이드 플랫폼의 AI 학습 스택이 가장 방어 가능한 경쟁력을 갖췄다고 보는가? 감독형 자율성은 상용화 문제를 해결할까, 아니면 단지 미루는 것에 불과할까?
최종 업데이트: 2025년
