如今,分别安装在两条机械臂上的两台腕载摄像头,共享一个经过标定的三维工作空间,能够围绕桌面物体同步采集 RGB、深度、红外和机器人运动数据。DARP 数据集为研究人员和机器人技术工程师提供了一种测试多视角感知的方法:使用真实的机器人运动学和互补视角,而不是仅依赖固定摄像头、合成场景或估算出的摄像头位姿。
目录
研究人员构建了什么?
研究人员构建了 DARP,这是一个用于研究机器人如何融合同一物体多个摄像头视角的双臂数据集。该平台使用两台固定基座的 Unitree Z1 Pro 机械臂,每台机械臂拥有 6 个自由度,并搭载一台腕载 RGB-D-IR 摄像头。一条机械臂位于共享桌面工作空间的左侧,另一条位于右侧,两座机器人基座之间的距离约为 1.3986 米。
每台摄像头从各自一侧围绕物体移动,同时记录彩色图像、深度、红外数据、摄像头设置、机器人关节状态和标定信息。由于摄像头固定在运动中的机械腕部,每次观测都有对应的机器人位姿。因此,每一帧深度数据都可以转换到统一的度量世界坐标系中。
采集过程不需要转台、带标记的放置区域,也不要求人工测量物体位置。操作员只需将一个桌面物体放在共享工作空间内,系统便会搜索物体、由两条机械臂确认其位置、规划观测视角、记录同步数据,并检查此次采集是否有效。
当前版本包含 10 个独特的桌面物体。它的主要贡献并不只是图像数量更多,而是将传感器数据、机器人运动和标定信息整合到同一个双臂采集系统中。

主要结果是什么?
DARP 的几何评估表明,两台独立运动的摄像头无需对每一帧进行视觉重新配准,也能实现对齐。每条机械臂看到的物体区域各不相同,但在利用机器人位姿和标定变换将两路数据放入同一世界坐标系后,重叠区域仍能保持较好的一致性。
研究人员使用有意排除在重建过程之外的 RGB-D 帧,对融合后的表面进行了测试。在 224 个留出的关键帧上,评估共覆盖 1,563,466 个三维查询点。点到网格距离的中位数为 2.13 毫米,均方根误差为 4.04 毫米。
| 留出数据评估指标 | 结果 |
|---|---|
| RGB-D 关键帧 | 224 |
| 三维查询点 | 1,563,466 |
| 点到网格距离中位数 | 2.13 mm |
| 均方根误差 | 4.04 mm |
| 第 90 百分位距离 | 6.38 mm |
| 误差不超过 5 mm 的点 | 83.82% |
| 误差不超过 10 mm 的点 | 96.56% |
这些数值衡量的是与记录观测的一致程度,而不是相对于高精度扫描仪的绝对准确度。即便如此,结果仍说明:由机器人运动数据推导出的摄像头位姿具有足够的一致性,能够支持度量级融合和留出表面检验。
定性重建同样展现了第二条机械臂的实际价值。单条机械臂会遗漏物体背向摄像头的一面以及被自身遮挡的区域,而第二个视角则能补充不同的表面测量结果。

经过标定的双臂系统如何工作?
该系统依靠一条完整的标定链路:将每台摄像头与对应的机器人腕部连接起来,再将两台机器人的基座连接到共享世界坐标系。ChArUco 标定板提供编码标记检测结果和棋盘格角点,用于估计摄像头内参及刚体变换。随后,通过手眼标定估计每台摄像头与其腕部之间的固定关系。
记录过程中,系统将同步采集的关节状态与正向运动学结合起来。正向运动学根据机器人各关节的测量角度,计算腕部的位置和姿态。再应用腕部到摄像头的变换,即可为每次观测生成摄像头位姿。因此,系统主要依靠机器人标定和运动数据获取传感器位姿,而不是通过逐帧跟踪视觉特征来估计位姿。
物体采集分为以下几个阶段:
- 物体搜索: 腕载摄像头在桌面上进行结构化扫描,直到深度数据足以支持物体估计。
- 双臂确认: 两条机械臂分别检查估计出的物体中心,并确认其是否位于有效工作空间内。
- 包络区域创建: 系统合并有效的中心估计结果,并保留一个保守的物体半径,以剔除桌面和背景点。
- 自适应视角规划: 两条机械臂在各自可达的一侧改变观测视角,生成互补而非重复的观测结果。
- 同步记录: RGB、深度、红外、摄像头元数据、关节状态以及与标定相关的机器人信息会被一并保存。
- 世界坐标系融合: 将度量深度反投影为三维点,转换到共享坐标系中,经过滤波后融合两条机械臂的数据。
- 表面生成: 通过统计离群点移除和局部深度检查清理点云,再利用多尺度滚球算法生成实测表面网格。
滚球算法只会在点云提供足够支撑测量的区域生成三角形。该流程不会填补未观测到的底面,也不会凭空臆测被遮挡的几何结构。这一区别使 DARP 特别适合研究真实的部分视角重建:在这里,缺失数据是问题本身的一部分,而不是被合成补全悄悄掩盖的误差。

这对机器人技术为何重要?
许多机器人视觉数据集提供图像和深度信息,但能够完整保留运动传感器与机器人运动关系的数据集相对较少。DARP 为感知工程师提供了一个受控环境,用于测试系统能否融合由独立运动的机械臂采集的观测,同时保留开展其他算法研究所需的原始多模态证据。
这对料箱拣选、协作操作、检测、物体建模和机器人抓取规划都很重要。机器人从物体一侧接近时,通常只能看到部分表面。第二条机械臂或移动摄像头可以提供不同视角,但前提是这些测量结果必须足够准确地对齐,才能用于几何处理、分割或抓取规划。
该数据集的价值也不止于几何融合。其 RGB-D-IR 数据流可用于物体识别、深度补全、传感器融合模型、视角选择和特征级协同感知。由于机器人状态也被保存下来,未来的系统可以学习将摄像头观测与可达性、机械臂构型和视角质量联系起来。
对于评估自动化方案的运营团队而言,这项工作也凸显了摄像头布局和标定与模型选择同等重要。考虑购买二手协作机器人或二手工业机器人的工厂,需要采用可重复的方法,衡量机器人搭载的传感器在实际工作空间中的表现。
有哪些局限和待解问题?
该数据集仅包含来自单一实验室设置的 10 个独特桌面物体,因此无法代表工业零件、杂乱环境、不同材料、光照条件或工作空间布局的全部变化。重建网格只包含至少被一台摄像头观测到的表面;物体底面和严重遮挡区域仍然是不完整的。
性能也取决于标定的稳定性。移动摄像头支架、改变机器人基座位置、调整传感器安装方式,或引入关节零位误差,都可能降低对齐质量,并需要重新标定。点到网格的结果衡量的是相对于留出 RGB-D 观测的重复性,而不是相对于独立高精度模型的准确度。
尚待回答的问题包括:该方法能否良好迁移到反光或透明物体、杂乱场景、更大工作空间、更快的机械臂运动以及生产环境中。未来的学习系统也可以利用 DARP 进行形状补全,但这类预测必须与数据集中的实测几何结构明确区分开来。
常见问题
DARP 是什么?
DARP 是一个经过标定的双臂 RGB-D-IR 数据集,用于多视角机器人感知。它将互补的摄像头观测与机器人位姿、关节状态和标定数据关联起来。
使用了哪些机器人和传感器?
该平台使用两台拥有 6 个自由度的 Unitree Z1 Pro 机械臂,并配备腕载 RGB-D-IR 摄像头。两台固定基座彼此相对,分列共享桌面工作空间两侧。
融合重建的准确度如何?
在 224 个留出的关键帧上,点到网格距离的中位数为 2.13 mm,RMSE 为 4.04 mm。评估点中共有 96.56% 位于实测表面 10 mm 范围内。
DARP 会重建物体被遮挡的表面吗?
不会。它的几何处理流程会保留缺失或被遮挡的区域,而不会通过形状补全虚构未观测到的几何结构。
结论
DARP 在共享度量坐标系中,将双臂机器人运动、经过标定的腕载摄像头以及同步 RGB-D-IR 观测连接起来。留出数据评估表明,互补视角能够以毫米级观测一致性完成融合,为多视角机器人感知研究提供了实用基础。
双臂数据集应如何改变机器人视觉系统的评测方式?
