Modelado del mundo basado en partículas para la predicción de vídeos robóticos asistida por texto

Modelado del mundo basado en partículas para la predicción de vídeos robóticos asistida por texto

Yafei Zhang, Nan Wu

7 min de lectura31 ago 2026

Un modelo predictivo de la evolución de una escena resulta útil para la planificación robótica, el aprendizaje de representaciones y la generación de datos. La predicción de vídeo ofrece una interfaz general porque conserva la geometría y la apariencia que necesitan las políticas visuales posteriores. Sin embargo, los vídeos de robots reales presentan una combinación incómoda: la mayoría de los píxeles son estáticos, las pequeñas piezas articuladas determinan la acción y una misma instrucción en lenguaje natural puede dar lugar a trayectorias visualmente distintas. Por eso, un modelo puede obtener métricas globales de imagen competitivas copiando el último fotograma, sin aprender el movimiento relevante.

Introducción

AcrossVAM1.0 asigna responsabilidades distintas a representaciones diferentes. Las partículas semánticas describen la geometría del robot completo, el brazo y la pinza; un Transformer compacto predice sus estados futuros; y un flujo causal de apariencia independiente restaura los detalles. El lenguaje se incorpora únicamente a la dinámica mediante modulación específica por características, lo que permite medir su efecto a nivel de trayectoria. La rama densa observa el último fotograma del contexto, pero nunca un fotograma futuro, de modo que el movimiento futuro no puede filtrarse por la vía de apariencia.

Presentamos un modelo del mundo basado en partículas con anclaje semántico que reduce la dinámica de los vídeos robóticos reales a un problema compacto de trayectorias. Su núcleo dinámico tiene solo 0,28 M de parámetros entrenables y expone el movimiento por partes para facilitar el diagnóstico.

Proponemos un decodificador causal de movimiento y apariencia que combina la geometría predicha de las partículas con una apariencia densa limitada al contexto, y que controla explícitamente el equilibrio entre la nitidez de las regiones estáticas y la fidelidad de los objetos en movimiento.

Evaluamos el modelo frente a controles de persistencia, lenguaje barajado y etiquetas aleatorias, así como frente a partículas oráculo, múltiples semillas y particiones por robot. La evaluación identifica tanto una mejora fiable en el movimiento como el grado todavía limitado de fundamentación lingüística.

Formulación del problema

Un estado centrado en objetos representa la escena en función de sus objetos y partes relevantes.

La función dinámica predice cómo cambia el estado centrado en objetos con el paso del tiempo.

El decodificador representa el movimiento predicho junto con la apariencia del contexto.

Códec de partículas semánticas congelado

Para cada fotograma, un codificador SAM3-DLP congelado recibe RGB y máscaras de partes VRS, y extrae partículas semánticas correspondientes al robot completo, el brazo y la pinza, además de un latente espacial del fondo.

Cada partícula semántica representa el estado codificado de una pieza del robot o de un componente de la escena.

Las propuestas desordenadas requieren correspondencia temporal. Para fotogramas adyacentes, establecemos correspondencias y obtenemos identidades de partículas emparejadas mediante el algoritmo húngaro. La barra indica coordenadas normalizadas por escala. En nuestra caché VRS sin conexión, los identificadores fijos de las partes semánticas ya determinan la permutación; allí omitimos el emparejamiento y lo conservamos para la inferencia basada en propuestas.

Predicción de vídeo robótico en condiciones visuales exigentes

Dinámica de partículas asistida por texto

La entrada de la dinámica concatena la geometría, las velocidades de primer orden, la profundidad, la presencia y embeddings aprendidos de posición y tiempo. Un Transformer espaciotemporal causal alterna el razonamiento temporal dentro de cada ranura con las interacciones entre las partes del robot. Predice actualizaciones residuales de forma autorregresiva.

La actualización residual especifica el cambio predicho para el estado de cada partícula.

La característica textual la produce una torre de texto ConvNeXt-L/320 de OpenCLIP congelada.

En cada bloque del Transformer, FiLM entrenable inyecta la semántica de la instrucción.

La modulación lineal específica por características escala y desplaza las características dinámicas intermedias mediante parámetros condicionados por el lenguaje.

Las proyecciones de FiLM se inicializan a cero, de modo que la optimización comienza con una dinámica no condicionada, en lugar de partir de un modelo perturbado al azar. Combinamos la supervisión de la transición de un paso con la de despliegues autorregresivos.

El objetivo de entrenamiento combina la predicción del siguiente paso con la supervisión de trayectorias predichas de varios pasos.

Representación y dinámica

Añadir un código residual eleva el PSNR de reconstrucción en 7,01 dB, lo que motiva una doble corriente en lugar de obligar al estado del objeto a transportar la textura. El pequeño modelo dinámico supera de forma fiable la persistencia de trayectorias en distintas semillas. Los diagnósticos muestran que las coordenadas residuales de las cajas y las características de apariencia sin procesar introducen atajos; al eliminarlas y utilizar un movimiento con paso de tres, la reducción del error aumenta desde cifras bajas de un solo dígito hasta el 21,0 %.

¿Utiliza el modelo el lenguaje?

La diferencia positiva observada con múltiples semillas, junto con diferencias cercanas a cero para el pseudotexto cinemático y las etiquetas aleatorias, sugiere que FiLM captura una señal semántica real. No obstante, el efecto es pequeño y se encuentra por debajo del objetivo del 10 %. Por ello, describimos AcrossVAM1.0 como asistido por texto, no controlado por instrucciones. La menor recuperación de verbos en los pies de imagen generados automáticamente también explica por qué un codificador lingüístico más grande no produce automáticamente un efecto causal mayor.

El modelo de partículas condicionado por lenguaje mejora los resultados en Franka (+21,1 %, 136 ventanas), WidowX (+19,0 %, 68) y UR5 (+18,4 %, 8), pero empeora en Mobile ALOHA (60 ventanas), Google Robot (32 ventanas) y varios subconjuntos pequeños. El agregado no correspondiente a Franka sigue siendo positivo (+10,0 %, 232 ventanas), pero los experimentos estrictos de Mobile ALOHA dejando un robot fuera no superan la persistencia.

Conclusión

Hemos presentado AcrossVAM1.0, un modelo del mundo compacto y asistido por texto que aborda la predicción de vídeos robóticos como una combinación de dinámica de partículas semánticas y síntesis causal de apariencia. El modelo mejora las trayectorias y la predicción de las regiones en movimiento, mientras que la aportación residual recupera buena parte de la fidelidad visual estática. Los controles rigurosos muestran tanto lo que funciona —el modelado del movimiento de baja dimensionalidad— como lo que sigue sin resolverse: la representación perceptual, la dependencia del lenguaje y la transferencia entre robots. Esta separación ofrece una base para modelos interpretables de acción en vídeo sin ocultar los fallos tras métricas agregadas de imagen.

Preguntas frecuentes

¿Qué es AcrossVAM1.0? AcrossVAM1.0 es un modelo del mundo compacto y asistido por texto para la predicción de vídeos robóticos, basado en dinámica de partículas semánticas y síntesis causal de apariencia.

¿Qué representan las partículas semánticas? Representan la geometría del robot completo, el brazo y la pinza, junto con un latente espacial del fondo.

¿Cómo se incorpora el lenguaje al modelo? El lenguaje se inyecta en la dinámica de partículas mediante modulación lineal específica por características, utilizando características de una torre de texto OpenCLIP congelada.

¿Controla el modelo por completo el movimiento del robot a partir de instrucciones? No. El efecto medido del lenguaje es positivo, pero pequeño, por lo que el modelo se describe como asistido por texto y no como controlado por instrucciones.

🍪 Preferencias de cookies

Usamos cookies para medir el rendimiento. Política de privacidad