ChainSplat ayuda a los robots a aprender el movimiento flexible de los objetos a partir de vídeo RGB

ChainSplat ayuda a los robots a aprender el movimiento flexible de los objetos a partir de vídeo RGB

Seungyeon Kim, Noémie Jaquier

10 min de lectura31 ago 2026

ChainSplat convierte vídeos RGB desde múltiples puntos de vista de un objeto similar a una cuerda en un gemelo digital compacto basado en la física, capaz de predecir cómo se dobla, gira y desplaza el objeto. Al combinar la mecánica de cuerpos rígidos basada en la teoría de tornillos con la técnica de Gaussian splatting en 3D, el sistema prescinde de la captación de profundidad y de representaciones con un gran número de partículas, y ofrece a los robots una base práctica para la simulación, la estimación del estado y de fuerzas, y la manipulación basada en modelos.

Tabla de contenidos

¿Qué construyeron los investigadores?

ChainSplat es un modelo aprendido de dinámica para objetos lineales deformables, o DLO. Los DLO son objetos largos y flexibles, como cuerdas, cables, cordones, alambres, tubos y correas. A diferencia de una caja rígida o de un eslabón robótico, un DLO puede doblarse en numerosos puntos, lo que dificulta representar su forma y predecir su movimiento futuro.

El sistema representa un DLO como una cadena abierta formada por secciones rígidas conectadas. Esto no significa que el objeto real se vuelva rígido; la cadena es una aproximación compacta de la flexión continua. Cada conexión tiene un eje de movimiento y un estado articular, de modo que el modelo puede describir la forma del objeto con un conjunto relativamente pequeño de variables, en lugar de miles de partículas 3D independientes.

ChainSplat también utiliza Gaussian splatting en 3D. Esta técnica de visión por computador representa una escena mediante numerosos elementos gaussianos tridimensionales, suaves y coloreados, que pueden renderizarse eficazmente desde distintos puntos de vista. En ChainSplat, la representación gaussiana proporciona el aspecto visual del objeto, mientras que la cadena basada en la teoría de tornillos aporta su estructura física.

El entrenamiento utiliza vídeos RGB sincronizados desde múltiples puntos de vista, sin necesidad de una canalización adicional de profundidad. Después, el modelo aprendido puede simular el movimiento del objeto, optimizar trayectorias de manipulación, estimar el estado del objeto a partir de un flujo de cámara e inferir fuerzas externas durante la interacción.

Componentes geométricos, dinámicos, de renderizado y de estimación de ChainSplat

¿Cuáles son los resultados principales?

ChainSplat se evalúa con tres objetos lineales deformables en dos entornos de interacción: sobre una mesa y en el espacio libre. Los experimentos no se limitan a probar la predicción pasiva del movimiento. También analizan si el gemelo digital aprendido permite realizar manipulación basada en modelos, estimar el estado e inferir fuerzas externas.

Un resultado destacable es que el mismo marco general admite tanto el entrenamiento con múltiples vistas como la supervisión mediante una sola cámara. El modelo se entrena con observaciones RGB desde varios puntos de vista y después estima los estados del objeto mientras una persona lo empuja o tira de él usando un único flujo RGB procedente de una cámara RealSense. Esto es importante porque la captura con varias cámaras resulta útil para construir el modelo, pero suele ser poco práctica durante el despliegue.

La investigación compara ChainSplat con métodos de vanguardia para construir gemelos digitales de DLO. La evaluación se centra en la calidad de la geometría y la dinámica aprendidas, la capacidad de reproducir las trayectorias observadas y la utilidad del modelo para planificar manipulaciones. Los experimentos también seleccionan modelos entrenados con trayectorias que contienen un movimiento suficientemente rico, algo importante porque un modelo expuesto únicamente a movimientos pequeños o repetitivos no puede identificar el comportamiento completo de un objeto flexible.

El texto proporcionado del artículo informa de tres DLO, dos escenarios físicos y estimación del estado y de fuerzas mediante una sola cámara, pero no incluye puntuaciones numéricas de referencia. Por tanto, la principal evidencia es funcional: una única representación compacta se utiliza para la reconstrucción visual, el aprendizaje de la dinámica, la predicción y el análisis de la interacción.

¿Cómo funciona ChainSplat?

ChainSplat desempeña dos funciones conectadas: aprende cómo es el DLO y aprende cómo se mueve.

En primer lugar, el DLO se describe como un mecanismo serial de cadena abierta. La teoría de tornillos proporciona un lenguaje matemático para describir el movimiento de cada sección de la cadena mediante una magnitud de movimiento de seis dimensiones, conocida habitualmente como twist. El twist combina el movimiento lineal y la rotación. Con la formulación del producto de exponenciales, la pose de cada sección puede calcularse a partir de la pose de la base y de las variables articulares. Así, el sistema establece una relación directa entre un estado articular compacto y la configuración 3D completa del objeto.

En segundo lugar, Gaussian splatting en 3D incorpora la información visual a la cadena. Cada elemento gaussiano contribuye al color, la opacidad, la posición y la extensión espacial durante el renderizado. A partir de las vistas de las cámaras, el sistema puede renderizar una imagen prevista del DLO y compararla con los fotogramas RGB observados. De este modo, la representación visual se aprende junto con la estructura cinemática, en lugar de tratarse como una etapa de reconstrucción independiente.

El proceso de entrenamiento incluye una etapa de reconocimiento geométrico consciente de la cinemática. Esta etapa estima las trayectorias articulares y la representación geométrica del DLO a partir del vídeo. Después, una etapa de identificación de la dinámica toma la trayectoria de la base controlada por el robot, integra la dinámica de la cadena abierta y ajusta los parámetros dinámicos hasta que las trayectorias articulares simuladas coinciden con las estimadas a partir del vídeo.

Esta separación resulta útil en la práctica. La etapa geométrica explica la configuración del objeto, mientras que la etapa dinámica estima cómo evolucionan las fuerzas, la inercia y el movimiento con el tiempo. El modelo resultante puede emplearse para optimizar trayectorias, aunque la estrategia de planificación demostrada es de lazo abierto. En un controlador de lazo abierto, el robot planifica el movimiento de antemano en lugar de corregirlo continuamente a partir de nuevas observaciones.

ChainSplat también incluye un marco de estimación del estado para su uso en lazo cerrado. Una sola cámara RGB proporciona observaciones del DLO y el modelo estima su configuración durante interacciones sobre una mesa o en el espacio libre. A continuación, la estimación de fuerzas externas puede identificar perturbaciones como el empujón o el tirón de una persona. Un sistema completo de manipulación en lazo cerrado queda fuera del alcance de lo demostrado, pero el estimador proporciona un componente esencial para desarrollarlo.

Dinámica recursiva de cadena abierta utilizada para predecir el movimiento de objetos deformables

¿Por qué es importante ChainSplat para la robótica?

Los objetos flexibles son habituales en fábricas, almacenes, laboratorios y entornos de servicios, pero siguen siendo difíciles de manipular de forma fiable para los robots. Un robot que recoge un cable, guía una manguera, inserta un alambre o clasifica un objeto blando debe predecir cómo se deformará el objeto después del contacto. Pequeños errores en la estimación de la forma pueden provocar agarres fallidos, colisiones, enredos o inserciones incorrectas.

ChainSplat aborda una de las principales disyuntivas de los modelos existentes de DLO. Los sistemas basados en partículas pueden describir formas complejas, pero sus grandes espacios de estados hacen que la planificación y el control basado en modelos resulten costosos. Además, suelen depender de mediciones de profundidad y del seguimiento 3D intermedio de partículas, lo que introduce fuentes adicionales de error. ChainSplat utiliza, en cambio, un estado compacto de cadena y aprende el aspecto directamente a partir de observaciones RGB.

Este diseño podría beneficiar a las células robóticas donde resulta más sencillo instalar cámaras que sensores de profundidad, o donde las lecturas de profundidad se degradan debido a objetos reflectantes, delgados, oscuros o parcialmente ocultos. El componente de planificación basada en modelos es relevante para los cobots usados a la venta, ya que los robots colaborativos pueden necesitar manipular cables, piezas similares a tejidos o embalajes flexibles cerca de personas.

Las mismas ideas podrían aplicarse a los robots de almacén que manipulan correas, cables de carga, bolsas y paquetes deformables. En ambos casos, el valor práctico depende de que el modelo aprendido pueda generalizar más allá de las trayectorias de entrenamiento y funcionar con la suficiente rapidez para el control en tiempo real.

Manipulación basada en modelos mediante un gemelo digital aprendido de un objeto deformable

¿Cuáles son las limitaciones de ChainSplat?

ChainSplat sigue dependiendo de datos de entrenamiento RGB adecuados desde múltiples puntos de vista, de una calibración correcta de las cámaras y de trayectorias que contengan movimiento suficiente para revelar la dinámica del DLO. Un modelo entrenado con pocas flexiones, torsiones, velocidades o condiciones de contacto no comprenderá automáticamente todas las configuraciones posibles.

La aproximación de cadena abierta también comprime un cuerpo deformable continuo en secciones conectadas. Esto mejora la eficiencia, pero puede perder comportamientos a pequeña escala, especialmente cuando el objeto se estira, se pandea, cambia de modo de contacto o desarrolla un contacto propio complejo. La estrategia de manipulación demostrada es de lazo abierto, por lo que los errores del modelo y las perturbaciones inesperadas todavía no se corrigen mediante un controlador de realimentación completo.

La estimación del estado y de las fuerzas con una sola cámara resulta prometedora, pero la oclusión, los cambios de iluminación, los movimientos rápidos y el contacto con el entorno siguen planteando desafíos prácticos. Antes de desplegarlo en sistemas robóticos de producción, será necesario realizar pruebas más amplias con distintos materiales, longitudes, condiciones de fricción y espacios de trabajo desordenados.

Preguntas frecuentes

¿Qué tipo de objetos modela ChainSplat? Modela objetos lineales deformables, como cuerdas, cables, alambres, tubos y otros elementos flexibles y alargados similares.

¿Necesita ChainSplat una cámara de profundidad? No. El modelo se aprende a partir de vídeos RGB desde múltiples puntos de vista, y su marco de estimación del estado y de las fuerzas utiliza una sola cámara RGB durante las pruebas de interacción.

¿Por qué utilizar Gaussian splatting en un modelo físico? Gaussian splatting proporciona al DLO una representación visual que puede renderizarse, mientras que la mecánica basada en la teoría de tornillos ofrece una descripción compacta de su movimiento y dinámica.

¿Es ChainSplat ya un sistema autónomo completo de manipulación en lazo cerrado? No. La investigación demuestra la optimización de trayectorias basada en modelos y propone la estimación del estado para futuros controles mediante realimentación, pero todavía no existe un sistema completo de manipulación en lazo cerrado.

Conclusión

ChainSplat combina un modelo físico compacto de cadena abierta con Gaussian splatting en 3D para aprender la dinámica de objetos deformables directamente a partir de vídeo RGB. Sus demostraciones con varios DLO, interacciones sobre una mesa y en el espacio libre, y estimación mediante una sola cámara muestran una vía práctica hacia una manipulación más capaz de cables, cuerdas, mangueras y piezas flexibles.

🍪 Preferencias de cookies

Usamos cookies para medir el rendimiento. Política de privacidad