Dos cámaras montadas en la muñeca de brazos robóticos distintos comparten ahora un espacio de trabajo 3D calibrado y producen datos sincronizados de RGB, profundidad, infrarrojos y movimiento robótico alrededor de objetos colocados sobre una mesa. El conjunto de datos DARP ofrece a investigadores e ingenieros de robótica una forma de evaluar la percepción multivista con cinemática real y puntos de vista complementarios, en lugar de depender únicamente de cámaras fijas, escenas sintéticas o poses de cámara estimadas.
Tabla de contenidos
- ¿Qué construyeron los investigadores?
- ¿Cuáles fueron los resultados principales?
- ¿Cómo funciona el sistema calibrado de dos brazos?
- ¿Por qué es importante para la robótica?
- ¿Cuáles son las limitaciones y las preguntas abiertas?
- Preguntas frecuentes
- Conclusión
¿Qué construyeron los investigadores?
Los investigadores construyeron DARP, un conjunto de datos de dos brazos para estudiar cómo combinan los robots varias vistas de una misma pieza. La plataforma utiliza dos manipuladores Unitree Z1 Pro de base fija, cada uno con seis grados de libertad y una cámara RGB-D-IR montada en la muñeca. Un brazo se sitúa a la izquierda de un espacio de trabajo compartido sobre una mesa y el otro a la derecha; las bases de ambos están separadas aproximadamente 1,3986 metros.
Cada cámara se desplaza alrededor de un objeto desde su propio lado mientras registra imágenes en color, profundidad, datos infrarrojos, ajustes de la cámara, estados articulares del robot e información de calibración. Como las cámaras están unidas a muñecas móviles, cada observación tiene una pose robótica correspondiente. Esto permite transformar cada fotograma de profundidad a un sistema de coordenadas mundial métrico común.
El proceso de captura no requiere un plato giratorio, una zona de colocación señalizada ni medir manualmente la ubicación del objeto. Un operador coloca un objeto sobre la mesa en cualquier punto del espacio de trabajo compartido. Después, el sistema lo busca, confirma su ubicación desde ambos brazos, planifica los puntos de vista, registra los datos sincronizados y comprueba que el levantamiento sea válido.
La versión actual contiene diez objetos únicos de sobremesa. Su principal aportación no es simplemente reunir más imágenes, sino conectar los datos de los sensores, el movimiento robótico y la calibración en un único sistema de captura de dos brazos.

¿Cuáles fueron los resultados principales?
La evaluación geométrica de DARP muestra que las dos cámaras, que se mueven de forma independiente, pueden alinearse sin volver a registrar visualmente cada fotograma. Cada brazo observa partes diferentes del objeto, mientras que las regiones superpuestas mantienen una coherencia razonable una vez que las poses robóticas y las transformaciones de calibración sitúan ambas secuencias en el mismo sistema de referencia mundial.
Los investigadores probaron la superficie fusionada usando fotogramas RGB-D excluidos deliberadamente de la reconstrucción. En 224 fotogramas clave reservados para evaluación, el análisis abarcó 1.563.466 puntos de consulta tridimensionales. La distancia mediana punto-malla fue de 2,13 milímetros y el error cuadrático medio fue de 4,04 milímetros.
| Métrica de evaluación reservada | Resultado |
|---|---|
| Fotogramas clave RGB-D | 224 |
| Puntos de consulta 3D | 1.563.466 |
| Distancia mediana punto-malla | 2,13 mm |
| Error cuadrático medio | 4,04 mm |
| Distancia en el percentil 90 | 6,38 mm |
| Puntos a menos de 5 mm | 83,82 % |
| Puntos a menos de 10 mm | 96,56 % |
Estas cifras miden la concordancia con las observaciones registradas, no la exactitud absoluta frente a un escáner de precisión. Aun así, los resultados demuestran que las poses de cámara derivadas del robot son lo bastante coherentes como para permitir la fusión métrica y la comprobación de superficies con datos reservados.
Las reconstrucciones cualitativas también muestran la utilidad práctica del segundo brazo. Un solo brazo deja sin registrar las zonas orientadas en sentido contrario y las regiones ocultas por la propia geometría, mientras que el segundo punto de vista aporta mediciones complementarias de la superficie.

¿Cómo funciona el sistema calibrado de dos brazos?
El sistema se basa en una cadena de calibración que conecta cada cámara con la muñeca de su robot y conecta las dos bases robóticas con un sistema de referencia mundial común. Los tableros de calibración ChArUco proporcionan detecciones de marcadores codificados y esquinas de tablero de ajedrez para estimar los parámetros intrínsecos de las cámaras y las transformaciones rígidas. La calibración mano-ojo estima después la relación fija entre cada cámara y su muñeca.
Durante la grabación, los estados articulares sincronizados se combinan con la cinemática directa. Esta transforma los ángulos medidos de las articulaciones de un robot en la posición y orientación de su muñeca. Al aplicar la transformación muñeca-cámara se obtiene una pose de cámara para cada observación. Por tanto, el sistema obtiene las poses de los sensores principalmente a partir de la calibración y los datos de movimiento del robot, en lugar de rastrear características visuales de un fotograma al siguiente.
La captura de objetos se desarrolla en varias etapas:
- Búsqueda del objeto: Una cámara montada en la muñeca realiza un barrido panorámico estructurado de la mesa hasta que los datos de profundidad permiten estimar un objeto.
- Confirmación entre brazos: Ambos brazos comprueban de forma independiente el centro estimado del objeto y la validez del espacio de trabajo.
- Creación del envolvente: El sistema combina las estimaciones válidas del centro y conserva un radio de objeto conservador para rechazar puntos de la mesa y del fondo.
- Planificación adaptativa de puntos de vista: Cada brazo recorre distintos puntos de vista en el lado que puede alcanzar, generando observaciones complementarias en lugar de idénticas.
- Grabación sincronizada: Se conservan conjuntamente los datos RGB, de profundidad e infrarrojos, los metadatos de las cámaras, los estados articulares y la información robótica relacionada con la calibración.
- Fusión en el sistema mundial: La profundidad métrica se reproyecta en 3D, se transforma al sistema de referencia común, se filtra y se acumula a partir de ambos brazos.
- Generación de la superficie: La eliminación estadística de valores atípicos y las comprobaciones locales de profundidad limpian la nube antes de que el método de pivoteo de bolas a varias escalas cree una malla de superficie medida.
El pivoteo de bolas genera triángulos únicamente donde la nube de puntos ofrece mediciones de apoyo. El proceso no rellena las caras inferiores no observadas ni inventa geometría oculta. Esta diferencia hace que DARP sea útil para estudiar la reconstrucción real a partir de vistas parciales, donde los datos ausentes forman parte del problema en vez de quedar ocultos mediante una completación sintética.

¿Por qué es importante para la robótica?
Muchos conjuntos de datos de visión robótica ofrecen imágenes y profundidad, pero son menos los que conservan la relación completa entre los sensores móviles y el movimiento del robot. DARP proporciona a los ingenieros de percepción una forma controlada de comprobar si un sistema puede combinar observaciones de manipuladores que se mueven de manera independiente, conservando al mismo tiempo la evidencia multimodal sin procesar necesaria para aplicar algoritmos alternativos.
Esto es importante para la recogida de piezas en contenedores, la manipulación colaborativa, la inspección, el modelado de objetos y la planificación de agarres robóticos. Un robot que se aproxima a un objeto por un lado a menudo solo ve una parte de su superficie. Un segundo brazo o una cámara móvil puede aportar una vista diferente, pero solo si las mediciones se alinean con suficiente precisión para la geometría, la segmentación o la planificación del agarre.
El conjunto de datos también permite investigar más allá de la fusión geométrica. Sus secuencias RGB-D-IR pueden utilizarse en reconocimiento de objetos, completación de profundidad, modelos de fusión sensorial, selección de puntos de vista y percepción colaborativa a nivel de características. Como se conservan los estados del robot, los sistemas futuros podrán aprender a relacionar las observaciones de la cámara con la alcanzabilidad, la configuración del brazo y la calidad del punto de vista.
Para los equipos de operaciones que evalúan la automatización, este trabajo pone de relieve por qué la colocación y la calibración de las cámaras son tan importantes como la elección del modelo. Una instalación que esté considerando cobots usados en venta o robots industriales usados necesita métodos repetibles para medir cómo se comportan los sensores montados en robots en el espacio de trabajo real.
¿Cuáles son las limitaciones y las preguntas abiertas?
El conjunto de datos contiene diez objetos únicos de sobremesa capturados en una sola configuración de laboratorio, por lo que no representa toda la variedad de piezas industriales, desorden, materiales, iluminación o distribuciones del espacio de trabajo. Las mallas reconstruidas solo contienen superficies observadas por al menos una cámara; las caras inferiores y las regiones fuertemente ocluidas siguen incompletas.
El rendimiento también depende de la estabilidad de la calibración. Mover un soporte de cámara, cambiar la posición de una base robótica, modificar el montaje del sensor o introducir errores en el cero articular puede reducir la calidad de la alineación y exigir una nueva calibración. Los resultados de distancia punto-malla miden la repetibilidad frente a observaciones RGB-D reservadas, no la exactitud frente a un modelo independiente de alta precisión.
Entre las preguntas abiertas están hasta qué punto se transfiere el enfoque a objetos reflectantes o transparentes, escenas desordenadas, espacios de trabajo más grandes, movimientos de brazos más rápidos y entornos de producción. Los futuros sistemas de aprendizaje también podrían utilizar DARP para completar formas, pero esas predicciones tendrían que mantenerse claramente separadas de la geometría medida por el conjunto de datos.
Preguntas frecuentes
¿Qué es DARP?
DARP es un conjunto de datos RGB-D-IR calibrado y capturado con dos brazos para la percepción robótica multivista. Vincula observaciones complementarias de las cámaras con poses robóticas, estados articulares y datos de calibración.
¿Qué robots y sensores se utilizaron?
La plataforma utiliza dos brazos Unitree Z1 Pro de seis grados de libertad con cámaras RGB-D-IR montadas en las muñecas. Las bases fijas están enfrentadas a ambos lados de un espacio de trabajo compartido sobre una mesa.
¿Qué precisión tiene la reconstrucción fusionada?
En 224 fotogramas clave reservados, la distancia mediana punto-malla fue de 2,13 mm y el RMSE de 4,04 mm. En total, el 96,56 % de los puntos evaluados quedó a menos de 10 mm de la superficie medida.
¿DARP reconstruye las superficies ocultas de los objetos?
No. Su proceso geométrico conserva las regiones ausentes u ocultas en lugar de inventar geometría no observada mediante completación de formas.
Conclusión
DARP conecta el movimiento de dos brazos robóticos, cámaras calibradas montadas en la muñeca y observaciones RGB-D-IR sincronizadas dentro de un sistema de referencia métrico común. Su evaluación con datos reservados muestra que las vistas complementarias pueden fusionarse con una concordancia de las observaciones del orden de milímetros, creando una base práctica para investigar la percepción robótica multivista.
