Los modelos de mundo de vídeo entre encarnaciones permiten simulación física sin ejemplos previos

Los modelos de mundo de vídeo entre encarnaciones permiten simulación física sin ejemplos previos

Kechen Liu, Ola Shorinwa

6 min de lectura28 ago 2026

Introducción

Los avances decisivos en los modelos de lenguaje de gran escala fueron propiciados por el entrenamiento a escala web con conjuntos de datos textuales diversos, lo que derribó las barreras de rendimiento al aprender una representación unificada del lenguaje humano. Hoy, mientras los modelos de mundo de vídeo condicionados por acciones siguen teniendo dificultades para mantener la coherencia física, las comunidades de robótica y visión se enfrentan a una pregunta fundamental: ¿pueden los modelos generativos de vídeo aprender priors físicos generalizables mediante el escalado de datos entre distintas encarnaciones, o la naturaleza heterogénea de las morfologías robóticas exige arquitecturas específicas para cada agente? Este trabajo analiza cómo los modelos de mundo de vídeo pueden tender puentes entre distintas encarnaciones e identifica los cuellos de botella estructurales que deben superarse.

Más allá del zero-shot: adaptación eficiente en datos a las morfologías objetivo

Mediante un entrenamiento a gran escala con datos diversos de vídeo robótico, los modelos de CLAP aprenden priors generalizables que permiten predecir con gran precisión la dinámica. No obstante, la exactitud de sus predicciones zero-shot puede mejorar si se ajustan con datos de las encarnaciones objetivo, tanto encarnaciones preentrenadas que aparecieron durante el entrenamiento como encarnaciones nuevas. Mediante el ajuste fino, estos modelos pueden perfeccionar los priors aprendidos para alinearlos mejor con las encarnaciones objetivo.

Arquitectura del modelo de mundo de vídeo entre encarnaciones CLAP

Encarnaciones nuevas

Más allá de las encarnaciones preentrenadas, CLAP permite adaptar de forma eficiente en datos los modelos entre encarnaciones a morfologías robóticas nuevas y muy distintas de las observadas durante el entrenamiento, como los robots bímanos y los humanoides, que suelen contar con espacios de acciones de mayor dimensionalidad.

Debido a esta disparidad entre espacios de acciones, el ajuste fino del modelo requiere sustituir su cabeza de acciones por otra compatible con la encarnación objetivo. Es crucial que CLAP conserve todos los demás componentes del modelo de vídeo entre encarnaciones para preservar sus ricos priors espaciotemporales. Durante el ajuste fino, CLAP alinea estos priors subyacentes con la morfología objetivo, lo que permite predecir con gran fidelidad los estados futuros condicionados por acciones.

Más allá del zero-shot: ¿facilita CLAP la adaptación eficiente en datos a encarnaciones objetivo?

Evaluamos la eficacia de CLAP como base para adaptar con pocos ejemplos modelos de mundo de vídeo a encarnaciones objetivo. Organizamos las evaluaciones en torno a dos ejes principales: encarnaciones preentrenadas y encarnaciones nuevas. En cada caso, eliminamos de la cabeza de acciones los componentes incompatibles para ajustarla al espacio nativo de acciones del efector final de la encarnación objetivo, pero conservamos todos los demás parámetros.

Métricas de evaluación entre encarnaciones y de una sola encarnación

Preliminares

Los modelos de mundo de vídeo predicen resultados futuros condicionados por acciones en cada fotograma, a partir de una observación inicial de la cámara. Además, para capturar el contexto temporal —como las velocidades del robot, que determinan su evolución futura—, estos modelos suelen condicionarse por un historial de observaciones anteriores.

La fórmula omitida define los horizontes de historial y predicción utilizados por el modelo.

Resultados adicionales sobre modelos de acciones latentes

Entrenamos modelos de acciones latentes con nuestro conjunto de datos entre encarnaciones y con subconjuntos individuales de una sola encarnación, incluidos Bridge y DROID, y evaluamos la coherencia de las acciones proxy con respecto a la trayectoria real.

Utilizando modelos de acciones latentes como modelos de dinámica inversa, extraemos acciones latentes de trayectorias no observadas y reconstruimos las trayectorias reales mediante las acciones latentes calculadas. Comparamos estos modelos con la línea base del modelo de dinámica inversa DreamDojo en las particiones de validación y prueba de los conjuntos de datos del dominio, incluidos Bridge, DROID y OXE-Mix.

También evaluamos los modelos con los siguientes conjuntos de datos reservados, que representan datos no observados:

  • austin_sailor
  • utaustin_mutex
  • berkeley_ur5
  • stanford_hydra

Estos conjuntos incluyen morfologías robóticas, como el brazo UR5, que no se habían visto durante el entrenamiento.

Resumen matizado

Esta sección analiza los matices relacionados con la novedad de CLAP, su posible impacto más amplio y el alcance de sus afirmaciones.

Conclusión, limitaciones y trabajo futuro

En última instancia, este trabajo establece el aprendizaje entre encarnaciones como catalizador de avances en los modelos de mundo de vídeo, en paralelo con los cambios de paradigma observados en los modelos de lenguaje de gran escala.

Seguridad, privacidad de los datos y consentimiento

Este artículo presenta un trabajo que impulsa los fundamentos de la inteligencia artificial aplicada a la robótica. Dado que se trata principalmente de un trabajo computacional y teórico, no involucra participantes humanos, estudios de usuario en vivo ni información personal identificable; por consiguiente, no fue necesaria la aprobación de un comité institucional de revisión.

Todos los experimentos se realizaron utilizando benchmarks disponibles públicamente y conjuntos de datos de código abierto, de conformidad con sus respectivas licencias. Aunque las aplicaciones más amplias de la inteligencia artificial en robótica conllevan posibles implicaciones para la seguridad y la sociedad, los autores no prevén consecuencias sociales negativas directas, maliciosas o de alto riesgo vinculadas específicamente a esta investigación algorítmica fundamental.

Agradecimientos

Los autores desean agradecer al profesor Anirudha Majumdar, a Mingtong Zhang y a los miembros del laboratorio IRoM de Princeton su paciencia, sus valiosas conversaciones y su apoyo.

Preguntas frecuentes

¿Qué es CLAP? CLAP es un marco de modelo de mundo de vídeo entre encarnaciones que aprende priors físicos generalizables a partir de datos diversos de vídeo robótico.

¿Qué predicen los modelos de mundo de vídeo? Predicen resultados futuros condicionados por acciones en cada fotograma y por una observación inicial de la cámara; a menudo utilizan un historial de observaciones anteriores para capturar el contexto temporal.

¿Cómo se adapta CLAP a encarnaciones robóticas nuevas? CLAP sustituye la cabeza de acciones por otra compatible con la encarnación objetivo, al tiempo que conserva los demás componentes del modelo de vídeo preentrenado.

¿Qué conjuntos de datos se utilizan para evaluar los modelos de acciones latentes? La evaluación incluye Bridge, DROID, OXE-Mix y conjuntos de datos reservados como austin_sailor, utaustin_mutex, berkeley_ur5 y stanford_hydra.

🍪 Preferencias de cookies

Usamos cookies para medir el rendimiento. Política de privacidad