ChainSplat, RGB 영상으로 로봇이 유연한 물체의 움직임을 학습하도록 돕다

ChainSplat, RGB 영상으로 로봇이 유연한 물체의 움직임을 학습하도록 돕다

Seungyeon Kim, Noémie Jaquier

7 분 읽기2026년 8월 31일

ChainSplat은 로프처럼 생긴 물체를 여러 시점에서 촬영한 RGB 영상을 바탕으로, 물체가 어떻게 휘고 비틀리며 움직이는지 예측하는 간결한 물리 기반 디지털 트윈을 만든다. 나선 이론에 기반한 강체 역학과 3D Gaussian splatting을 결합함으로써 별도의 깊이 센서나 수많은 입자를 사용하는 표현을 피하고, 로봇이 시뮬레이션, 상태 추정, 힘 추정, 모델 기반 조작을 수행할 수 있는 실용적인 기반을 제공한다.

목차

연구진은 무엇을 개발했나?

ChainSplat은 변형 가능한 선형 물체, 즉 DLO를 위한 학습 기반 동역학 모델이다. DLO는 로프, 케이블, 코드, 전선, 튜브, 벨트처럼 길고 유연한 물체를 뜻한다. 단단한 상자나 로봇 링크와 달리 DLO는 여러 지점에서 휘어질 수 있어 형태를 표현하기도, 앞으로의 움직임을 예측하기도 어렵다.

이 시스템은 DLO를 서로 연결된 강체 구간의 개방형 체인으로 표현한다. 그렇다고 실제 물체가 강체가 되는 것은 아니다. 이 체인은 연속적으로 휘는 물체를 간결하게 근사하는 역할을 한다. 각 연결부에는 운동축과 관절 상태가 있어, 수천 개의 독립적인 3D 입자 대신 비교적 적은 수의 변수로 물체의 형태를 설명할 수 있다.

ChainSplat은 3D Gaussian splatting도 사용한다. 이는 여러 개의 부드럽고 색을 지닌 3D 가우시안 프리미티브로 장면을 표현하고, 이를 다양한 시점에서 효율적으로 렌더링하는 컴퓨터 비전 기법이다. ChainSplat에서 가우시안 표현은 물체의 시각적 외관을 담당하고, 나선 이론 기반 체인은 물리적 구조를 담당한다.

학습에는 별도의 깊이 처리 파이프라인이 필요한 대신, 동기화된 다중 시점 RGB 영상이 사용된다. 학습이 끝난 모델은 물체의 움직임을 시뮬레이션하고, 조작 궤적을 최적화하며, 카메라 스트림에서 물체의 상태를 추정하고, 상호작용 중 발생하는 외력을 추론할 수 있다.

ChainSplat의 기하, 동역학, 렌더링, 추정 구성 요소

핵심 결과는 무엇인가?

ChainSplat은 두 가지 상호작용 환경, 즉 테이블 위와 자유 공간에서 세 종류의 변형 가능한 선형 물체를 대상으로 평가됐다. 실험은 수동적인 움직임 예측에만 머물지 않는다. 학습된 디지털 트윈이 모델 기반 조작, 상태 추정, 외력 추정까지 지원할 수 있는지도 함께 살펴본다.

특히 주목할 만한 점은 하나의 일반적인 프레임워크가 다중 시점 학습과 단일 카메라 모니터링을 모두 지원한다는 것이다. 모델은 다중 시점 RGB 관측으로 학습한 뒤, RealSense 카메라의 단일 RGB 스트림을 이용해 사람이 물체를 밀거나 당길 때 물체 상태를 추정한다. 다중 카메라 촬영은 모델을 구축할 때는 유용하지만 실제 배치 환경에서는 불편한 경우가 많기 때문에 이는 중요한 특성이다.

이 연구는 DLO 디지털 트윈 구축을 위한 최신 기법들과 ChainSplat을 비교한다. 평가는 학습된 기하와 동역학의 품질, 관측된 궤적을 재현하는 능력, 그리고 조작 계획에 모델을 활용할 수 있는지를 중심으로 진행된다. 또한 충분히 풍부한 움직임을 포함한 궤적으로 학습된 모델을 선택한다. 작거나 반복적인 움직임만 경험한 모델로는 유연한 물체의 전체적인 거동을 식별할 수 없기 때문이다.

제공된 논문 본문에는 세 종류의 DLO, 두 가지 물리적 시나리오, 단일 카메라 기반 힘 및 상태 추정이 보고되어 있지만, 수치로 된 벤치마크 점수는 포함되어 있지 않다. 따라서 핵심 근거는 기능적인 측면에 있다. 하나의 간결한 표현을 시각적 재구성, 동역학 학습, 예측, 상호작용 분석 전반에 활용한다는 점이다.

ChainSplat은 어떻게 작동하나?

ChainSplat은 두 가지 역할을 서로 연결해 수행한다. 하나는 DLO가 어떻게 생겼는지를 학습하는 것이고, 다른 하나는 DLO가 어떻게 움직이는지를 학습하는 것이다.

먼저 DLO를 직렬 개방형 체인 메커니즘으로 표현한다. 나선 이론은 각 체인 구간의 움직임을 6차원 운동량, 흔히 트위스트라고 부르는 양으로 기술하는 수학적 언어를 제공한다. 트위스트는 선형 운동과 회전을 함께 나타낸다. 지수곱 정식화를 사용하면 기준 자세와 관절 변수로부터 각 구간의 자세를 계산할 수 있다. 이를 통해 간결한 관절 상태와 물체 전체의 3D 구성 사이에 직접적인 관계를 만든다.

다음으로 3D Gaussian splatting을 체인에 시각 정보로 결합한다. 각 가우시안 프리미티브는 렌더링 과정에서 색상, 불투명도, 위치, 공간적 퍼짐을 제공한다. 카메라 시점이 주어지면 시스템은 예측된 DLO 영상을 렌더링하고 이를 관측된 RGB 프레임과 비교할 수 있다. 따라서 시각적 표현은 별도의 재구성 단계로 분리되는 대신 운동학적 구조와 함께 학습된다.

학습 과정에는 운동학을 고려한 기하 인식 단계가 포함된다. 이 단계에서는 영상으로부터 DLO의 관절 궤적과 기하학적 표현을 추정한다. 이후 동역학 식별 단계가 로봇이 제어한 기저부 궤적을 입력으로 받아 개방형 체인의 동역학을 적분하고, 시뮬레이션된 관절 궤적이 영상에서 추정된 궤적과 일치할 때까지 동역학 파라미터를 조정한다.

이러한 분리는 실제 운용 측면에서 유용하다. 기하 단계는 물체의 구성을 설명하고, 동역학 단계는 힘과 관성, 운동이 시간에 따라 어떻게 변하는지를 추정한다. 완성된 모델은 궤적 최적화에 활용할 수 있지만, 시연된 계획 전략은 오픈 루프 방식이다. 오픈 루프 제어에서는 새로운 관측에 따라 움직임을 계속 수정하는 대신 로봇이 사전에 움직임을 계획한다.

ChainSplat은 폐루프 사용을 위한 상태 추정 프레임워크도 포함한다. 단일 RGB 카메라가 DLO를 관측하면, 모델은 테이블 위 또는 자유 공간 상호작용 중 물체의 구성을 추정한다. 이후 외력 추정을 통해 사람이 밀거나 당기는 것과 같은 외란을 식별할 수 있다. 완전한 폐루프 조작 시스템은 아직 시연 범위에 포함되지 않았지만, 이 추정기는 그러한 시스템을 구성하는 핵심 요소를 제공한다.

변형 가능한 물체의 움직임을 예측하는 재귀적 개방형 체인 동역학

ChainSplat이 로보틱스에서 중요한 이유는?

유연한 물체는 공장, 창고, 실험실, 서비스 환경에서 흔히 사용되지만, 로봇이 안정적으로 다루기는 여전히 어렵다. 케이블을 집어 들고 배치하거나, 호스를 통과시키거나, 전선을 삽입하거나, 부드러운 물품을 분류하는 로봇은 접촉 이후 물체가 어떻게 변형될지 예측해야 한다. 형태를 조금만 잘못 추정해도 그립 실패, 충돌, 엉킴, 잘못된 삽입으로 이어질 수 있다.

ChainSplat은 기존 DLO 모델이 안고 있던 중요한 절충 문제를 다룬다. 입자 기반 시스템은 복잡한 형태를 표현할 수 있지만, 상태 공간이 커서 계획과 모델 기반 제어에 많은 계산 비용이 든다. 또한 깊이 측정과 중간 단계의 3D 입자 추적에 의존하는 경우가 많아 추가적인 오차 요인이 생긴다. ChainSplat은 대신 간결한 체인 상태를 사용하고 RGB 관측에서 외관을 직접 학습한다.

이러한 설계는 깊이 센서보다 카메라를 설치하기 쉬운 로봇 셀이나, 반사성이 강하거나 가늘고 어두운 물체 또는 일부가 가려진 물체 때문에 깊이 측정이 불안정해지는 환경에서 도움이 될 수 있다. 모델 기반 계획 기능은 중고 협동로봇 판매와 관련성이 있다. 협동로봇이 사람 가까이에서 케이블, 직물과 유사한 부품, 유연한 포장재를 다뤄야 할 수 있기 때문이다.

같은 아이디어는 창고 로봇이 끈, 충전 케이블, 가방, 변형 가능한 소포를 처리하는 데에도 활용될 수 있다. 두 환경 모두에서 실제 가치는 학습 궤적을 넘어 일반화할 수 있는지, 그리고 실시간 제어에 충분히 빠르게 작동하는지에 달려 있다.

학습된 변형 물체 디지털 트윈을 이용한 모델 기반 조작

ChainSplat의 한계는 무엇인가?

ChainSplat은 적절한 다중 시점 RGB 학습 데이터, 카메라 보정, 그리고 DLO의 동역학을 드러낼 만큼 충분한 움직임이 담긴 궤적에 여전히 의존한다. 제한적인 굽힘, 비틀림, 속도, 접촉 조건만으로 학습된 모델이 모든 구성을 자동으로 이해하는 것은 아니다.

개방형 체인 근사 역시 연속적인 변형체를 연결된 구간들로 압축한다. 이는 효율성을 높이지만 물체가 늘어나거나 좌굴하거나 접촉 방식을 바꾸거나 복잡한 자기 접촉을 일으킬 때처럼 세밀한 거동을 놓칠 수 있다. 시연된 조작 전략은 오픈 루프이므로, 모델 오차와 예상하지 못한 외란을 완전한 피드백 제어기로 즉시 보정하지는 못한다.

단일 카메라 기반 상태 및 힘 추정은 유망하지만, 가림, 조명 변화, 빠른 움직임, 환경과의 접촉은 여전히 현실적인 과제다. 실제 로봇 시스템에 배치하려면 다양한 재질, 길이, 마찰 조건, 복잡하게 뒤섞인 작업 공간에서 더 폭넓은 검증이 필요하다.

자주 묻는 질문

ChainSplat은 어떤 종류의 물체를 모델링하나? 로프, 케이블, 전선, 튜브와 같은 변형 가능한 선형 물체 및 이와 유사한 길고 유연한 물체를 모델링한다.

ChainSplat을 사용하려면 깊이 카메라가 필요한가? 아니다. 모델은 다중 시점 RGB 영상으로 학습되며, 상호작용 실험에서 상태와 힘을 추정할 때는 단일 RGB 카메라를 사용한다.

물리 모델에 Gaussian splatting을 사용하는 이유는 무엇인가? Gaussian splatting은 DLO를 렌더링 가능한 시각적 표현으로 만들어 주고, 나선 이론 기반 역학은 물체의 움직임과 동역학을 간결하게 표현한다.

ChainSplat은 이미 완전한 자율 폐루프 조작 시스템인가? 아니다. 이 연구는 모델 기반 궤적 최적화와 향후 피드백 제어를 위한 상태 추정을 제시하지만, 완전한 폐루프 조작 시스템은 아직 개발되지 않았다.

결론

ChainSplat은 간결한 개방형 체인 물리 모델과 3D Gaussian splatting을 결합해 RGB 영상만으로 변형 가능한 물체의 동역학을 학습한다. 여러 DLO와 테이블 위 및 자유 공간 상호작용, 단일 카메라 추정에 걸친 시연은 케이블, 로프, 호스, 유연한 부품을 더욱 능숙하게 조작하는 로봇을 위한 실용적인 방향을 보여준다.

🍪 쿠키 환경설정

성능 측정을 위해 쿠키를 사용합니다. 개인정보 처리방침