새로 개발된 프레임워크는 로봇이 복잡한 자연어 명령을 정밀한 3차원 동작으로 변환할 수 있게 해주며, 물리적 AI의 오랜 난제를 해결합니다. “왼쪽에 있는 작은 파란 컵을 나에게 건네줘”와 같은 모호한 문구를 실행 가능한 동작 프리미티브로 매핑함으로써, 시스템의 작업 성공률을 약 62%에서 89% 이상으로 끌어올려 산업용 협동로봇을 진정한 무프로그래밍 운영에 한 걸음 더 가깝게 만듭니다.
- 이 새로운 언어-동작 프레임워크란 무엇인가?
- 복잡한 명령을 정밀한 동작으로 변환하는 방법은?
- 기존 접근 방식과의 비교는?
- 이 프레임워크를 사용할 수 있는 로봇은?
- 창고 자동화 및 제조업에 미치는 영향
- 구매자를 위한 의미
- 자주 묻는 질문
이 새로운 언어-동작 프레임워크란 무엇인가?
이 프레임워크는 한 선도적 로봇 연구실의 연구진이 개발한 것으로, 사용자의 자연어 명령과 로봇의 저수준 제어 시스템 사이의 중간 계층 역할을 합니다. 먼저 명령을 의미 구성 요소(객체, 위치, 속성, 동작)로 구문 분석한 다음, 이러한 구성 요소를 27개의 사전 정의된 동작 프리미티브(예: “집기”, “놓기”, “왼쪽으로 밀기”, “90° 회전”) 라이브러리에 매칭합니다. 각 프리미티브는 로봇이 카메라와 힘-토크 센서의 실시간 센서 데이터로 채우는 3D 공간 템플릿을 포함합니다. 142개의 고유한 객체 조작 작업에 걸친 벤치마크 테스트에서 시스템은 첫 시도에 89.3%의 시행을 완료했으며, 이는 기준 LLM 전용 파이프라인의 61.7%에서 향상된 수치입니다.
복잡한 명령을 정밀한 동작으로 변환하는 방법은?

파이프라인은 네 단계로 작동합니다. 첫째, 미세 조정된 언어 모델(7B 파라미터, 더 큰 기반 모델에서 증류)이 사용자 명령에서 명사구, 공간 전치사, 동작 동사를 추출합니다. 둘째, 작업 공간의 NeRF(Neural Radiance Field)에 기반한 비전-언어 모듈이 모호성을 해결합니다. “선반 위 가장 왼쪽 빨간 상자”는 로봇 베이스 기준 좌표(x=0.23m, y=0.87m, z=0.42m)가 됩니다. 셋째, 모션 플래닝 단계가 목표 좌표와 동작 프리미티브를 관절 공간 궤적으로 변환하며, 30Hz로 업데이트되는 실시간 점유 그리드를 사용해 충돌을 확인합니다. 마지막으로, 힘 제어 루프가 그리퍼가 객체에 접촉할 때 궤적을 조정하여 무게와 마찰 변화를 보상합니다.
이 프레임워크의 핵심 혁신은 학습된 그라운딩 모델로, 고정된 카메라 시점 없이 언어를 3D에 매핑합니다. 단일 천장 카메라에 의존하는 대신, 두 개의 손목 장착 RGB-D 카메라와 하나의 정적 깊이 카메라의 데이터를 융합하여 객체가 부분적으로 가려진 복잡한 장면을 처리할 수 있습니다. 8가지 다양한 주방 및 산업용 객체(컵, 렌치, 커넥터)를 무작위로 배치한 테스트에서 시스템은 사용자가 동의어나 “반짝이는 것” 같은 모호한 속성으로 설명한 경우에도 94.2%의 시행에서 대상 객체를 올바르게 식별했습니다.
기존 접근 방식과의 비교는?
| 특징 | 이 프레임워크 | RT-2 (Google) | SayCan (Google) | RoboFlamingo (OpenAI) |
|---|---|---|---|---|
| 입력 방식 | 자연어 + 비전 | 텍스트 + 이미지 | 언어 전용 | 텍스트 + 비디오 |
| 3D 그라운딩 | NeRF + 다중 시점 | 2D 바운딩 박스 | 제한적 (사전 매핑) | 2D + 깊이 추정 |
| 프리미티브 라이브러리 | 27개 폐집합 | 강화학습으로 학습 | 551개 스킬 (고정) | 12개 스킬 (개방집합) |
| 평균 계획 지연 시간 | 120ms | 450ms | 210ms | 320ms |
| 첫 시도 성공률 | 89.3% | 68.1% | 82.4% | 74.6% |
| 오픈소스? | 부분 (모델만) | 아니오 | 아니오 | 예 |
비교 결과, 새로운 프레임워크는 개방형 스킬 일반화(RT-2의 강점)보다 신뢰성과 속도에 중점을 두며, 이는 반복성이 중요한 산업 현장에 더 적합합니다. 120ms의 계획 지연 시간은 RT-2보다 약 2.6배 빠른 속도로, 로봇이 명령 중간에 인간의 수정에도 눈에 띄는 지연 없이 반응할 수 있게 합니다.

이 프레임워크를 사용할 수 있는 로봇은?
이 프레임워크는 로봇에 구애받지 않도록 설계되었습니다. 표준 URDF 모델과 관절 상태 피드백을 제공하는 모든 매니퓰레이터가 사용할 수 있는 ROS 2 액션 인터페이스를 노출합니다. 연구진은 다음 로봇에서 검증했습니다.
- Universal Robots UR5e (6-DOF, 5kg 페이로드)
- FANUC LR Mate 200iD (Ethernet/IP 어댑터를 통해 통합)
- Franka Emika Panda (7-DOF, 토크 감지 관절)
- KUKA LBR iiwa 14 (7-DOF, 임피던스 제어기)
배포에는 NVIDIA RTX 3060 이상의 PC(NeRF 및 LLM 추론용), 최소 두 대의 RGB-D 카메라(Intel RealSense D435 또는 유사 제품), ROS 2-foxy 배포판이 필요합니다. 권장 하드웨어에서 인식 모듈은 15FPS로 실행됩니다. 기존 로봇 셀의 경우, 카메라와 컴퓨팅을 위한 개조 비용은 스테이션당 $4,500~$6,000으로 추산됩니다. 호환 플랫폼을 평가 중이라면 Robot Overflow에서 중고 협동로봇을 살펴보세요.
창고 자동화 및 제조업에 미치는 영향
창고 피킹과 경량 조립의 경우, 이 프레임워크는 가장 큰 운영상의痛点인 제품 라인 변경 시 로봇 재교육 문제를 해결합니다. 현재, 빈 피킹 셀을 새 부품에 맞게 전환하려면 수동 재프로그래밍에 2~8시간이 소요됩니다. 이 언어-동작 계층을 사용하면 관리자가 간단히 “A 빈에서 새 은색 브래킷을 집어 90도 회전시킨 컨베이어 B에 놓아”라고 입력하면 로봇이 10초 이내에 자율적으로 재조정됩니다.
소량 배치 제조에 미치는 영향은 상당합니다. 87개 미국 제조업체를 대상으로 한 설문조사에 따르면 62%가 협동로봇 도입의 가장 큰 장벽으로 프로그래밍 복잡성을 꼽았습니다. 자연어로 프로그래밍 장벽을 낮춤으로써, 이 프레임워크는 고부가가치 응용을 넘어 협동로봇의 시장을 확장할 수 있습니다. 유연한 생산 라인을 위해 중고 산업용 로봇을 평가 중이라면, 이 기술은 기존 협동로봇이 이전에는 처리할 수 없었던 혼합 SKU 작업에 적합하게 만듭니다.

구매자를 위한 의미
동적 환경에서 협동로봇을 평가하는 최종 사용자에게 이 프레임워크는 총소유비용 방정식을 바꿉니다. 전담 로봇 프로그래머(연봉 $7만~$10만)를 고용하는 대신, 기본적인 읽기 능력을 갖춘 셀 운영자가 재구성을 처리할 수 있습니다. ROI 손익분기점은 일반적인 $4만 협동로봇 설치의 경우 약 18개월에서 11개월로 단축됩니다.
구매자를 위한 주요 권장사항: - 토크 감지 관절이 있는 로봇 팔을 찾으세요. 프레임워크의 힘 루프 적응은 로봇이 접촉 힘을 느낄 수 있을 때 가장 잘 작동합니다(Franka Panda와 KUKA LBR iiwa가 훌륭한 선택입니다). - 공장 네트워크가 정책 컴퓨터와 로봇 컨트롤러 사이에 50ms 미만의 지연 시간을 지원하는지 확인하세요. 계획 이점은 높은 지터에서 사라집니다. - 이미 UR5e 또는 유사 제품을 소유하고 있다면, 업그레이드 비용은 하드웨어 약 $5,000에 라이선스 비용 없음(프레임워크는 연구 및 내부용 오픈소스)입니다.
자주 묻는 질문
공식 지원되는 로봇 팔은? 프레임워크는 Universal Robots UR5e, FANUC LR Mate 200iD, Franka Emika Panda, KUKA LBR iiwa 14에서 테스트되었습니다. 표준 ROS 2 인터페이스와 관절 상태 피드백이 있는 모든 6축 또는 7축 로봇은 약간의 설정으로 작동해야 합니다.
모호한 지시에 대한 언어 이해 능력은? 그라운딩 모델은 동의어와 부분적 설명이 있는 94.2%의 시행에서 모호성을 해결합니다. 예를 들어 “반짝이는 금속 물체”는 반사 기반 주의 헤드가 활성화되면 올바른 객체로 매핑되지만, 깊이 카메라 융합이 없으면 성능이 82%로 떨어집니다.
다단계 명령을 처리할 수 있나요? 예, 프레임워크는 단일 문장에서 최대 다섯 개의 순차적 프리미티브를 연결합니다. 예를 들어 “트레이 3에서 빨간 볼트를 집어 구멍 B에 삽입하고 5Nm로 조여”와 같습니다. 3단계 체인의 성공률은 83.6%, 5단계 체인은 71.0%입니다.
인터넷 연결이 필요한가요? 모든 추론은 온프레미스에서 수행됩니다. 언어 모델은 로컬에서 실행되며(7B 파라미터, 4비트 양자화), NeRF도 동일한 머신에서 계산됩니다. 오프라인 작동은 공장 바닥 신뢰성을 위한 설계 요구사항입니다.
언어 모델의 훈련 데이터는? 연구진은 사전 훈련된 LLM을 142개 객체에 걸친 27개 동작 프리미티브를 포함하는 12,500개의 작업 명세 커스텀 데이터셋으로 미세 조정했습니다. 또한 부정(“빨간 컵 말고”), 복합 형용사 같은 가장자리 사례를 다루기 위해 GPT-4 기반 시뮬레이터로 생성된 합성 데이터도 사용했습니다.
비용은 전통적 프로그래밍과 어떻게 비교되나요? 15분 작업 변경을 위한 전통적인 티치 펜던트 프로그래밍은 변경당 1~2시간이 소요됩니다. 이 프레임워크는 이를 10초 미만의 자연어 입력으로 줄입니다. 50회의 작업 변경이 있는 12개월 기간 동안 스테이션당 약 $6,500의 인건비를 절약합니다(프로그래머 시간당 $50 기준).
