Un nuevo modelo enseña a los robots a predecir cambios visuales mediante acciones latentes inciertas

Un nuevo modelo enseña a los robots a predecir cambios visuales mediante acciones latentes inciertas

Zuojin Tang, Feifan Luo, Haoyun Liu, Botai Yuan, Dekang Qi +8 más

8 min de lectura30 ago 2026

Un artículo reciente presenta DLAM (Distributional Latent Actions with Temporal Constraints), un método que modela las transiciones visuales de los robots como distribuciones gaussianas probabilísticas en lugar de valores únicos y deterministas. Esto permite al modelo captar la incertidumbre sobre cómo las acciones de un robot modifican lo que ve, lo que se traduce en predicciones más precisas y un mejor rendimiento posterior en tareas de control del mundo real.

Tabla de contenidos

Qué han desarrollado los investigadores

DLAM es un marco de aprendizaje de representaciones que convierte secuencias de transiciones visuales —por ejemplo, un robot empujando un bloque de un lugar a otro— en vectores latentes probabilísticos con una distribución gaussiana diagonal. Los trabajos anteriores utilizaban acciones latentes deterministas y perdían información sobre la ambigüedad o la variabilidad del resultado. DLAM, en cambio, aprende tanto una media como una varianza por dimensión para cada transición, capturando el grado de confianza del modelo en cada característica del cambio.

La principal innovación consiste en aplicar dos tipos de restricciones temporales tanto a la media como a la varianza: restricciones de composición (que obligan a que la suma de dos acciones latentes consecutivas coincida con la acción latente de la transición combinada) y restricciones de inversión (que hacen que la inversa de una acción produzca una latente igual y opuesta). Estas restricciones se aplican a tríos normalizados con intervalos temporales idénticos, lo que proporciona una señal de entrenamiento más rica que los métodos deterministas. Para el control de robots reales, el codificador permanece congelado y solo las acciones latentes medias se proporcionan a una política de flow matching que también recibe las órdenes de las articulaciones del robot. Así, la representación puede mejorar el rendimiento sin modificar la arquitectura subyacente de la política.

Diagrama que ilustra las restricciones de composición e inversión aplicadas a tríos de acciones latentes con intervalos temporales idénticos

Resultados principales

Los experimentos compararon DLAM con varias líneas base en tareas robóticas simuladas y del mundo real. La calidad de reconstrucción —es decir, la capacidad del modelo para regenerar los cambios visuales observados a partir de acciones latentes— se midió mediante una prueba común con normalización de escala. DLAM con todas las restricciones (media + varianza, composición e inversión normalizadas) obtuvo la mayor fidelidad de reconstrucción directa y acumulada. Las ablaciones controladas mostraron que las restricciones normalizadas sobre la media eran el principal motor de la mejora, mientras que la varianza aprendida y la composición sensible a las correlaciones aportaban beneficios complementarios al rendimiento de la política posterior.

En las pruebas de transferencia de políticas, en las que el codificador congelado proporciona únicamente secuencias de transiciones correspondientes a la media posterior como objetivos auxiliares de flow matching, DLAM superó sistemáticamente a los modelos deterministas de acciones latentes. La formulación completa también obtuvo mejores diagnósticos relacionales, lo que indica que el espacio latente conservaba mejor la estructura temporal que las variantes sin aprendizaje de la varianza o con restricciones no normalizadas. Aunque el artículo no publica cifras concretas de referencia, afirma que DLAM ofrece el «mejor rendimiento en calidad de reconstrucción, diagnósticos relacionales y transferencia de políticas» en su configuración controlada. Las mejoras fueron especialmente notables en tareas que requieren predicciones visuales precisas, como apilar objetos e insertar piezas en un pasador.

Cómo funciona

DLAM parte de una secuencia de vídeo del espacio de trabajo del robot. Para cada par de fotogramas consecutivos (la observación anterior y posterior a una acción), el modelo los codifica en una acción latente gaussiana diagonal: un vector de medias y otro de log-varianzas. A continuación, el decodificador de reconstrucción recibe el fotograma de origen y la distribución de la acción latente —mediante una muestra reparametrizada durante el entrenamiento— y reconstruye el fotograma objetivo. La función de pérdida incluye un término de reconstrucción y una divergencia KL que mantiene la distribución latente próxima a una distribución gaussiana estándar a priori.

Para imponer coherencia temporal, DLAM toma tríos de observaciones con intervalos idénticos (por ejemplo, los fotogramas t, t+k y t+2k). Calcula tres acciones latentes: de t a t+k, de t+k a t+2k y de t a t+2k. La restricción de composición obliga a que la suma de las dos primeras latentes (en el dominio de la media y la varianza) coincida con la tercera. La restricción de inversión obliga a que la latente de t a t+k sea la negativa de la latente de t+k a t cuando ambas se aplican al mismo estado visual. Las dos restricciones se normalizan según la duración del intervalo para que sean invariantes a la escala.

Durante el entrenamiento, las varianzas se aprenden conjuntamente con las medias mediante estas restricciones, pero la política posterior solo utiliza los vectores de media. La política es un modelo de flow matching que genera secuencias de acciones condicionadas por la observación actual y una imagen objetivo. El codificador congelado proporciona una secuencia de acciones latentes medias que se concatena con datos propioceptivos del robot como condicionamiento auxiliar. De este modo, la arquitectura de la política permanece intacta mientras incorpora información temporal rica procedente de la representación preentrenada.

Por qué es importante para la robótica

Los robots que operan en entornos abiertos necesitan predecir cómo sus acciones modificarán el mundo, a menudo en condiciones de incertidumbre. El enfoque distribucional de DLAM captura explícitamente esa incertidumbre, lo que puede mejorar la seguridad y la robustez en tareas de manipulación, ensamblaje o navegación móvil. Al utilizar restricciones que imponen composición e inversión, el modelo aprende un espacio latente en el que las acciones pueden combinarse algebraicamente, de forma parecida a como funcionan las fuerzas o las velocidades en física.

Para las empresas que incorporan cobots usados a la venta o robots industriales usados, integrar modelos de dinámica aprendida de este tipo podría reducir la cantidad de ajuste fino en el mundo real necesaria al cambiar de tarea. El hecho de que DLAM funcione con un codificador congelado y sistemas de política estándar facilita su integración en pilas de control existentes. El enfoque también conecta con la tendencia más amplia de los modelos fundacionales para robótica, en la que las representaciones preentrenadas a partir de datos visuales pueden acelerar el aprendizaje en robots humanoides o robots de almacén sin necesidad de reentrenarlos desde cero.

Limitaciones y preguntas abiertas

DLAM impone restricciones únicamente sobre tríos con intervalos idénticos, por lo que aún no se ha explorado su generalización a horizontes temporales largos. El objetivo asociado a la varianza podría degenerar en valores casi constantes a lo largo del tiempo, anulando así el beneficio de aprender la incertidumbre. Como la transferencia posterior descarta la varianza y utiliza únicamente las medias posteriores, la incertidumbre aprendida funciona principalmente como una señal auxiliar de entrenamiento, en lugar de proporcionar una confianza calibrada para la toma de decisiones. Además, el supuesto de una varianza diagonal —independiente por dimensión— podría pasar por alto dependencias condicionadas por el contexto o entre dimensiones que una covarianza completa sí captaría. En el futuro, sería posible ampliar las restricciones a intervalos temporales variables, incorporar la incertidumbre a la ejecución de la política y estudiar modelos de covarianza estructurada.

Configuración de manipulación robótica en el mundo real, con el espacio de trabajo y ejemplos de las tareas utilizadas para evaluar DLAM

Preguntas frecuentes

¿Es DLAM un método de aprendizaje por refuerzo basado en modelos? No. DLAM es una técnica de aprendizaje de representaciones que preentrena un codificador visual con restricciones temporales. Después, la representación aprendida se utiliza como entrada auxiliar para un proceso independiente de aprendizaje de políticas, como el aprendizaje por imitación mediante flow matching.

¿Qué tipos de robots pueden beneficiarse de DLAM? DLAM funciona con cualquier robot que disponga de una cámara capaz de observar los cambios provocados por sus acciones. Se ha demostrado en plataformas de manipulación simuladas y reales, por lo que resulta relevante para cobots, brazos industriales y manipuladores móviles.

¿DLAM necesita etiquetas de acciones reales? Sí, durante el preentrenamiento la secuencia de acciones latentes se obtiene a partir de órdenes conocidas del robot o de diferencias entre estados. Las restricciones también dependen del orden temporal de los fotogramas, pero no de etiquetas explícitas de objetivos.

¿Cómo se compara DLAM con los modelos deterministas de acciones latentes? DLAM supera sistemáticamente a las líneas base deterministas en calidad de reconstrucción, diagnósticos de coherencia temporal y tasas de éxito de la política posterior, especialmente en tareas con incertidumbre visual.

Conclusión

DLAM presenta una forma fundamentada de aprender acciones latentes distribucionales a partir de observaciones visuales mediante restricciones de composición e inversión aplicadas tanto a la media como a la varianza. La representación resultante mejora la fidelidad de reconstrucción y el control posterior sin complicar el flujo de aprendizaje de la política. Este trabajo abre el camino hacia modelos de dinámica visual más robustos para robots que operan bajo la variabilidad del mundo real.

🍪 Preferencias de cookies

Usamos cookies para medir el rendimiento. Política de privacidad