서로 다른 로봇 팔에 장착된 두 개의 손목 장착형 카메라가 이제 보정된 3D 작업 공간을 공유하며, 테이블 위 물체를 대상으로 동기화된 RGB, 깊이, 적외선, 로봇 동작 데이터를 수집한다. DARP 데이터셋은 고정 카메라나 합성 장면, 추정에 의존한 카메라 포즈가 아니라 실제 로봇 운동학과 서로 보완적인 시점을 활용해 다중 시점 인식을 검증할 방법을 연구자와 로보틱스 엔지니어에게 제공한다.
목차
연구진은 무엇을 구축했나?
연구진은 로봇이 동일한 물체를 여러 카메라 시점에서 관측하고 결합하는 방법을 연구하기 위한 양팔 데이터셋 DARP를 구축했다. 이 플랫폼은 고정형 베이스를 사용하는 Unitree Z1 Pro 매니퓰레이터 두 대로 구성되며, 각 로봇은 6자유도와 손목 장착형 RGB-D-IR 카메라를 갖춘다. 하나는 공유 테이블 작업 공간의 왼쪽, 다른 하나는 오른쪽에 배치되고, 두 로봇 베이스 사이의 거리는 약 1.3986m다.
각 카메라는 자기 쪽에서 물체 주변을 이동하며 컬러 영상, 깊이, 적외선 데이터, 카메라 설정, 로봇 관절 상태, 보정 정보를 기록한다. 카메라가 움직이는 손목에 부착되어 있으므로 모든 관측에는 대응하는 로봇 포즈가 존재한다. 따라서 각 깊이 프레임을 공통의 미터 단위 세계 좌표계로 변환할 수 있다.
수집 과정에는 회전대, 표시된 물체 배치 구역, 사람이 직접 측정한 물체 위치가 필요하지 않다. 작업자가 테이블 위 물체 하나를 공유 작업 공간 안에 놓으면, 시스템이 물체를 탐색하고 두 팔에서 위치를 확인한 뒤 시점을 계획하고 동기화된 데이터를 기록하며 스캔이 유효한지 점검한다.
현재 공개 버전에는 서로 다른 테이블 위 물체 10개가 포함되어 있다. DARP의 핵심 기여는 단순히 이미지 수를 늘린 데 있지 않다. 하나의 양팔 수집 시스템 안에서 센서 데이터와 로봇 동작, 보정 정보를 연결했다는 점이 핵심이다.

핵심 결과는 무엇인가?
DARP의 기하학적 평가 결과, 두 카메라는 모든 프레임을 시각적으로 다시 정합하지 않고도 서로 정렬될 수 있었다. 각 팔은 물체의 서로 다른 부분을 관측했으며, 로봇 포즈와 보정 변환을 이용해 두 데이터 스트림을 동일한 세계 좌표계에 배치한 뒤에도 겹치는 영역은 대체로 일관된 모습을 보였다.
연구진은 재구성에 의도적으로 사용하지 않은 RGB-D 프레임으로 융합된 표면을 평가했다. 224개의 보류 키프레임에서 총 1,563,466개의 3차원 질의점을 검사했다. 점-메시 거리의 중앙값은 2.13mm, 제곱평균제곱근 오차(RMSE)는 4.04mm였다.
| 보류 데이터 평가 지표 | 결과 |
|---|---|
| RGB-D 키프레임 | 224 |
| 3D 질의점 | 1,563,466 |
| 점-메시 거리 중앙값 | 2.13mm |
| 제곱평균제곱근 오차 | 4.04mm |
| 90백분위 거리 | 6.38mm |
| 5mm 이내 점 비율 | 83.82% |
| 10mm 이내 점 비율 | 96.56% |
이 수치는 정밀 스캐너를 기준으로 한 절대 정확도가 아니라, 기록된 관측값과의 일치도를 나타낸다. 그럼에도 결과는 로봇에서 얻은 카메라 포즈가 미터 단위의 데이터 융합과 보류 표면 검증을 뒷받침할 만큼 일관적임을 보여준다.
정성적 재구성 결과에서도 두 번째 팔의 실질적인 이점이 확인됐다. 한쪽 팔만 사용하면 물체의 반대편과 자기 가림 영역이 비어 버리지만, 두 번째 시점이 서로 보완적인 표면 측정값을 추가한다.

보정된 양팔 시스템은 어떻게 작동하나?
이 시스템은 각 카메라를 로봇 손목에 연결하고 두 로봇 베이스를 공통 세계 좌표계에 연결하는 보정 체계를 사용한다. ChArUco 보정 보드는 코드화된 마커 검출값과 체스보드 코너를 제공해 카메라 내부 파라미터와 강체 변환을 추정한다. 이후 핸드-아이 보정을 통해 각 카메라와 손목 사이의 고정된 관계를 추정한다.
기록 과정에서는 동기화된 관절 상태를 순기구학과 결합한다. 순기구학은 로봇 관절에서 측정한 각도를 손목의 위치와 방향으로 변환한다. 여기에 손목-카메라 변환을 적용하면 모든 관측에 대한 카메라 포즈를 얻을 수 있다. 따라서 이 시스템은 프레임마다 시각적 특징을 추적하기보다 로봇 보정 및 동작 데이터를 바탕으로 센서 포즈를 산출한다.
물체 수집은 다음 단계로 진행된다.
- 물체 탐색: 손목 장착형 카메라가 테이블 위를 체계적으로 좌우 주사하며, 깊이 데이터로 물체 위치를 추정할 수 있을 때까지 탐색한다.
- 팔 간 확인: 두 팔이 추정된 물체 중심과 작업 공간 내 유효성을 각각 독립적으로 확인한다.
- 탐색 범위 설정: 유효한 중심 추정값을 결합하고 보수적인 물체 반경을 유지해 테이블과 배경 점을 제거한다.
- 적응형 시점 계획: 각 팔이 접근 가능한 쪽에서 시점을 바꿔 가며 이동해, 동일한 관측이 아니라 서로 보완적인 관측을 생성한다.
- 동기화 기록: RGB, 깊이, 적외선, 카메라 메타데이터, 관절 상태, 보정 관련 로봇 정보를 함께 보존한다.
- 세계 좌표계 융합: 미터 단위 깊이 데이터를 3D로 역투영하고 공통 좌표계로 변환한 뒤 필터링하여 두 팔의 데이터를 누적한다.
- 표면 생성: 통계적 이상치 제거와 국소 깊이 검사를 거쳐 포인트 클라우드를 정제한 다음, 다중 스케일 볼 피보팅으로 측정된 표면 메시를 생성한다.
볼 피보팅은 포인트 클라우드가 측정값을 충분히 제공하는 영역에서만 삼각형을 생성한다. 이 파이프라인은 보이지 않는 아래쪽 면을 채우거나 숨겨진 기하를 상상해 만들어내지 않는다. 따라서 DARP는 실제 부분 시점 재구성을 연구하는 데 유용하다. 보이지 않는 영역이 합성 완성으로 감춰지는 오류가 아니라 문제의 일부로 남기 때문이다.

이 연구가 로보틱스에 중요한 이유는 무엇인가?
많은 로봇 비전 데이터셋이 영상과 깊이 정보를 제공하지만, 움직이는 센서와 로봇 동작 사이의 완전한 관계까지 보존하는 경우는 드물다. DARP는 인식 시스템이 서로 독립적으로 움직이는 매니퓰레이터의 관측을 결합할 수 있는지, 그리고 다른 알고리즘에 활용할 수 있는 원시 멀티모달 증거를 유지하는지를 검증할 수 있는 통제된 환경을 제공한다.
이는 빈 피킹, 협업 조작, 검사, 물체 모델링, 로봇 파지 계획에 중요하다. 한쪽에서 물체에 접근하는 로봇은 표면의 일부만 볼 수 있다. 두 번째 팔이나 이동형 카메라가 다른 시점을 제공할 수 있지만, 기하 정보와 분할, 파지 계획에 사용할 만큼 정확하게 측정값을 정렬할 수 있어야 한다.
이 데이터셋은 기하학적 융합을 넘어선 연구도 지원한다. RGB-D-IR 스트림은 물체 인식, 깊이 완성, 센서 융합 모델, 시점 선택, 특징 수준의 협력 인식에 활용할 수 있다. 로봇 상태도 함께 보존되므로 향후 시스템은 카메라 관측을 도달 가능성, 팔 구성, 시점 품질과 연결하는 방법을 학습할 수 있다.
자동화를 평가하는 운영팀에게 이 연구는 카메라 배치와 보정이 모델 선택만큼 중요하다는 점을 보여준다. 실제 작업 공간에서 로봇 장착형 센서의 동작을 반복적으로 측정하려는 시설이라면 중고 협동로봇 판매 또는 중고 산업용 로봇 도입을 검토할 때 이러한 평가 방법이 필요하다.
한계와 남은 과제는 무엇인가?
이 데이터셋은 단일 실험실 환경에서 수집한 서로 다른 테이블 위 물체 10개로 구성되어 있어, 산업 부품의 다양한 형태와 재질, 복잡한 적재 상태, 조명, 작업 공간 배치를 충분히 대변하지 못한다. 재구성된 메시에는 적어도 한 대의 카메라가 관측한 표면만 포함되며, 물체의 아랫면과 심하게 가려진 영역은 불완전한 상태로 남는다.
성능은 보정의 안정성에도 좌우된다. 카메라 브래킷을 움직이거나, 로봇 베이스 위치를 바꾸거나, 센서 장착 상태를 변경하거나, 관절 영점 오차가 생기면 정렬 품질이 떨어지고 재보정이 필요할 수 있다. 점-메시 결과는 보류 RGB-D 관측값에 대한 반복성을 측정한 것이지, 독립적인 고정밀 모델을 기준으로 한 정확도가 아니다.
반사성 또는 투명한 물체, 복잡하게 뒤섞인 장면, 더 넓은 작업 공간, 더 빠른 팔 동작, 실제 생산 환경으로 이 접근법이 얼마나 잘 확장되는지는 앞으로 풀어야 할 과제다. 향후 학습 시스템은 DARP를 형상 완성에 활용할 수도 있지만, 그러한 예측은 데이터셋이 실제로 측정한 기하 정보와 명확히 구분되어야 한다.
자주 묻는 질문
DARP란 무엇인가?
DARP는 다중 시점 로봇 인식을 위한 보정된 양팔 RGB-D-IR 데이터셋이다. 서로 보완적인 카메라 관측을 로봇 포즈, 관절 상태, 보정 데이터와 연결한다.
어떤 로봇과 센서를 사용했나?
플랫폼은 6자유도 Unitree Z1 Pro 팔 두 대와 손목 장착형 RGB-D-IR 카메라로 구성된다. 고정형 베이스는 공유 테이블 작업 공간을 사이에 두고 서로 마주 본다.
융합 재구성의 정확도는 어느 정도인가?
보류 키프레임 224개에서 점-메시 거리 중앙값은 2.13mm, RMSE는 4.04mm였다. 평가한 점의 96.56%는 측정된 표면에서 10mm 이내에 위치했다.
DARP는 가려진 물체 표면도 재구성하나?
아니다. 기하학 파이프라인은 형상 완성으로 보이지 않는 기하를 만들어내지 않고, 누락되거나 가려진 영역을 그대로 보존한다.
결론
DARP는 양팔 로봇의 동작, 보정된 손목 장착형 카메라, 동기화된 RGB-D-IR 관측을 하나의 공통 미터 좌표계로 연결한다. 보류 데이터 평가에서 서로 보완적인 시점들이 밀리미터 수준의 관측 일치도로 융합될 수 있음이 확인되었으며, 이는 다중 시점 로봇 인식 연구를 위한 실용적인 기반을 제공한다.
