Riemann-1.0 desarrolla modelos de acción del mundo corporeizados para la IA física

Riemann-1.0 desarrolla modelos de acción del mundo corporeizados para la IA física

Haofeng Sun, Jiangbo Pei, Fei Kang, Zexiang Liu, Yaokun Li +11 más

13 min de lectura30 ago 2026

Escalar los modelos de acción del mundo depende fundamentalmente de ampliar la experiencia corporeizada, no solo las trayectorias robóticas. Sin embargo, la experiencia corporeizada es intrínsecamente heterogénea: abarca vídeos humanos en primera persona, demostraciones con pinzas portátiles y trayectorias robóticas. Estas fuentes difieren considerablemente en las modalidades de observación, las representaciones de acción, la granularidad temporal y la calidad de la supervisión, lo que hace especialmente difícil el preentrenamiento unificado a gran escala.

Para abordar este reto, construimos una infraestructura unificada de datos corporeizados que transforma automáticamente experiencias heterogéneas en una representación común de vídeo–estado–acción a nivel de acción. La infraestructura propuesta consta de tres componentes estrechamente integrados: recopilación de experiencias corporeizadas de múltiples fuentes, un motor unificado de datos corporeizados y supervisión progresiva con equilibrado de datos entre fuentes. En conjunto, producen un corpus de preentrenamiento escalable con más de miles de horas de experiencia corporeizada, que abarca miles de habilidades de interacción y proporciona la base de datos para el modelado de acciones del mundo.

Infraestructura de datos

Escalar los modelos de acción del mundo depende fundamentalmente de ampliar la experiencia corporeizada, no solo las trayectorias robóticas. Sin embargo, la experiencia corporeizada es intrínsecamente heterogénea: abarca vídeos humanos en primera persona, demostraciones con pinzas portátiles y trayectorias robóticas. Estas fuentes difieren considerablemente en las modalidades de observación, las representaciones de acción, la granularidad temporal y la calidad de la supervisión, lo que hace especialmente difícil el preentrenamiento unificado a gran escala.

Para abordar este reto, construimos una infraestructura unificada de datos corporeizados que transforma automáticamente experiencias heterogéneas en una representación común de vídeo–estado–acción a nivel de acción. La infraestructura propuesta consta de tres componentes estrechamente integrados:

  • Recopilación de experiencias corporeizadas de múltiples fuentes
  • Un motor unificado de datos corporeizados
  • Supervisión progresiva con equilibrado de datos entre fuentes

En conjunto, producen un corpus de preentrenamiento escalable con más de miles de horas de experiencia corporeizada, que abarca miles de habilidades de interacción y proporciona la base de datos para el modelado de acciones del mundo.

Experiencia corporeizada de múltiples fuentes

Las tres fuentes de datos proporcionan una supervisión complementaria. Los vídeos humanos en primera persona ofrecen la mayor diversidad de interacciones del mundo real, habilidades de manipulación centradas en objetos y composiciones de tareas de horizonte largo. Las demostraciones con pinzas portátiles y dispositivos vestibles proporcionan trayectorias estructuradas del efector final que conectan de forma natural las interacciones humanas con el control compatible con robots. Las trayectorias robóticas proporcionan estados precisos y específicos de cada configuración física, además de acciones directamente ejecutables para el aprendizaje posterior de políticas.

Lejos de ser redundantes, estas fuentes se complementan entre sí:

  • Los vídeos humanos aportan conocimiento escalable sobre la interacción.
  • Las demostraciones con pinzas portátiles reducen la brecha entre la corporeidad humana y la robótica.
  • Las trayectorias robóticas proporcionan supervisión de control ejecutable.

En conjunto, establecen una jerarquía de supervisión natural para el preentrenamiento corporeizado progresivo.

Canal unificado de datos corporeizados para alinear vídeo, estado y acción

Motor unificado de datos corporeizados

Aunque las tres fuentes de datos proporcionan una supervisión complementaria, sus formatos nativos son fundamentalmente distintos. Los vídeos humanos en primera persona ofrecen observaciones visuales con una supervisión lingüística débil; las demostraciones con pinzas portátiles proporcionan trayectorias estructuradas del efector final y estados de la pinza; y los conjuntos de datos robóticos difieren considerablemente en los estados específicos de cada configuración, los espacios de acción, los sistemas de coordenadas y las frecuencias de control. Combinar directamente estas fuentes heterogéneas produciría una supervisión inconsistente y una optimización inestable.

Para unificar la experiencia corporeizada heterogénea, construimos un motor unificado de datos corporeizados que convierte todos los datos en una representación común de trayectoria a nivel de acción compuesta por:

  • Instrucciones lingüísticas
  • Identidades de la configuración física
  • Observaciones visuales
  • Estados
  • Acciones
  • Metadatos semánticos

Para cada configuración física, los flujos de estados y acciones se alinean temporalmente, se normalizan y se organizan según definiciones canónicas específicas, mientras que las máscaras de validez gestionan acciones de dimensionalidad variable sin obligar a configuraciones heterogéneas a compartir un mismo espacio físico de acción. Esta representación unificada actúa como interfaz estandarizada entre los datos corporeizados heterogéneos y el objetivo de modelado de acciones del mundo.

A diferencia de los vídeos humanos en primera persona, las demostraciones con pinzas portátiles y las trayectorias robóticas ya proporcionan una supervisión de control estructurada. Por tanto, su procesamiento se centra principalmente en la alineación temporal, la normalización de acciones y el filtrado de la calidad de las trayectorias. Las transiciones del estado de la pinza se utilizan para refinar los límites de las acciones, mientras que el filtrado de las vibraciones de la cámara, el rechazo de efectores finales inmóviles y el filtrado de controles anómalos mejoran aún más la calidad de los datos.

Tras el procesamiento, todas las fuentes de datos se convierten en trayectorias de vídeo–estado–acción a nivel de acción y alineadas temporalmente, dentro de una taxonomía semántica unificada, lo que permite escalar el modelado de acciones del mundo entre configuraciones físicas heterogéneas.

Supervisión progresiva y equilibrado de datos

El corpus procesado forma un continuo de supervisión con una fidelidad de acción progresivamente mayor, en lugar de una simple división entre datos etiquetados y no etiquetados. En primer lugar, los vídeos humanos en primera persona a gran escala proporcionan una amplia comprensión de la dinámica de interacción y una supervisión débil de las acciones mediante pseudoacciones generadas por un Latent Action Model congelado. Posteriormente, los vídeos humanos con trayectorias de manos 3D reconstruidas, las demostraciones con pinzas portátiles y las trayectorias robóticas heterogéneas proporcionan supervisión continua basada en acciones reales para alinear lo visual con la acción. Por último, las trayectorias robóticas de alta calidad especializan el modelo en la predicción de acciones específicas de cada configuración y en la ejecución de políticas en lazo cerrado.

Esta jerarquía de supervisión encaja de forma natural con el currículo de entrenamiento en tres etapas de Riemann-1.0 y permite que el modelo transfiera progresivamente conocimientos de interacción en entornos abiertos al control robótico ejecutable.

El corpus sin procesar presenta distribuciones de cola larga muy pronunciadas entre fuentes de datos, escenas, tareas, habilidades, objetos y configuraciones robóticas. En lugar de equilibrar el volumen bruto de datos, construimos una taxonomía semántica unificada y aplicamos un muestreo consciente de la semántica en múltiples dimensiones. Esta estrategia conserva la ventaja de escala de los grandes conjuntos de datos humanos y, al mismo tiempo, garantiza una exposición suficiente a habilidades de manipulación poco frecuentes y a configuraciones robóticas con pocos datos.

En conjunto, nuestra infraestructura de datos transforma la experiencia corporeizada heterogénea en una fuente de supervisión escalable para el modelado de acciones del mundo, lo que permite que los modelos de acción del mundo mejoren continuamente al ampliar la experiencia corporeizada, no solo las trayectorias robóticas.

Comparación de enfoques de modelos de acción del mundo según sus fuentes de datos corporeizados

Receta de entrenamiento

Rima-WAM se entrena mediante un currículo en tres etapas que desplaza progresivamente la supervisión desde las pseudoacciones obtenidas solo de vídeo hacia trayectorias de acciones reales. Este diseño responde a un desequilibrio práctico en los datos: los datos exclusivamente visuales son mucho más abundantes y diversos, pero carecen de acciones robóticas ejecutables, mientras que los conjuntos de datos con acciones reales son más pequeños, aunque proporcionan supervisión directa sobre el comportamiento robótico.

Las tres etapas son:

  1. La primera etapa utiliza un Latent Action Model congelado para entrenar vídeos no etiquetados a gran escala con supervisión de pseudoacciones.
  2. La segunda etapa fundamenta el modelo en un corpus mixto de demostraciones UMI, trayectorias robóticas y vídeos humanos con anotaciones de manos 3D.
  3. La tercera etapa continúa únicamente con datos robóticos de alta calidad para perfeccionar el control ejecutable.

En todas las etapas, el modelo optimiza el mismo objetivo de acción-vídeo.

Preentrenamiento

La primera etapa utiliza exclusivamente vídeos no etiquetados de manipulación humana. Como estos vídeos ofrecen una rica información visual sobre la interacción, pero carecen de etiquetas de acciones ejecutables, primero entrenamos un Latent Action Model y después lo congelamos para usarlo como anotador de pseudoacciones.

Esta etapa pretende exponer WAM a una gran cantidad de dinámica de manipulación antes de disponer de etiquetas de acciones robóticas reales. El Latent Action Model proporciona ese puente al obligar a que el movimiento entre dos fotogramas pase por un cuello de botella latente compacto, de modo que el código latente inferido capture la transición visual subyacente que habría inducido una acción y pueda servir como supervisión de pseudoacciones durante el entrenamiento de WAM.

El término KL es deliberadamente débil: su función es regularizar la distribución latente sin colapsar el código de transición en una distribución previa excesivamente genérica. Tras el entrenamiento, utilizamos la media posterior la representación latente media predicha por el modelo, en lugar de una muestra latente, como pseudoacción determinista, eliminando el ruido del muestreo al anotar corpus de vídeo a gran escala.

Experimentos en el mundo real

Tras el preentrenamiento a gran escala, adaptamos Riemann-1.0 a su despliegue en el mundo real mediante un entrenamiento posterior con robots reales. Construimos cuatro escenarios representativos de manipulación sobre el robot de doble brazo Tianji Marvin:

  • Apilado ordenado de cubos
  • Doblado de ropa
  • Organización de un escritorio
  • Organización de una cocina

Estas tareas abarcan el apilado de objetos rígidos condicionado por el orden, la manipulación de objetos deformables, la reorganización de superficies en horizontes largos y el almacenamiento de objetos en cocinas durante secuencias prolongadas. Juntas forman un conjunto compacto pero exigente para el despliegue de robots domésticos. Recopilamos 15 demostraciones de cada tarea mediante teleoperación humana.

Apilado ordenado de cubos

En el apilado ordenado de cubos, el robot sigue una instrucción lingüística para identificar cubos de colores y construir una pila de cuatro niveles siguiendo un orden cromático específico. Apilar cuatro niveles aumenta notablemente la dificultad: los pequeños errores de alineación en los niveles inferiores se amplifican con las colocaciones posteriores, y un solo nivel desalineado puede desestabilizar toda la pila.

Por tanto, esta tarea exige reconocer con precisión el color y la pose de los objetos, planificar la secuencia de agarres y ejecutar con exactitud las acciones de recoger y colocar.

Doblado de ropa

En el doblado de ropa, el robot manipula una prenda deformable en lugar de un objeto rígido. La ropa puede arrugarse, estirarse y cambiar de pose durante el contacto, por lo que el robot debe adaptar continuamente su estrategia de acción al estado observado.

Esta tarea pone a prueba la percepción de objetos deformables, la coordinación bimanual y el control de contacto de grano fino.

Organización de un escritorio

En la organización de un escritorio, el robot debe identificar y recolocar varios objetos dispersos en sus ubicaciones designadas. Un reto clave consiste en insertar objetos delgados, como bolígrafos, en un portalápices.

Esto requiere percibir con precisión la pose del bolígrafo y la abertura del portalápices, aprovechar el borde del recipiente para reorientar el bolígrafo hasta una posición vertical y controlar después la pinza para completar una inserción precisa.

Organización de una cocina

En la organización de una cocina, el robot debe completar una tarea integral de orden en una escena de cocina. Primero localiza y agarra utensilios como tenedores y cucharas, y después los devuelve a la zona de almacenamiento correspondiente.

También debe agarrar platos amarillos y rojos e insertarlos verticalmente en un escurridor, apilar cuencos y colocar la pila de cuencos en el nivel superior del escurridor. Todo ello exige secuencias de horizonte largo y colocaciones estables en condiciones de desorden.

Comparamos Riemann-1.0 con modelos VLA y WAM representativos de código abierto, incluidos DreamZero, un modelo de referencia de World Model, LingBot-VLA, un modelo adicional de comparación, LingBot-VA y G0.5, bajo la misma configuración de manipulación en el mundo real.

Para DreamZero, reproducimos el modelo utilizando la implementación oficial de código abierto y entrenamos un modelo de escala 5B con nuestro conjunto de datos de manipulación a gran escala recopilado, denominado DreamZero*.

Experimentos de manipulación en el mundo real con el robot de doble brazo Tianji Marvin

Despliegue visual condicionado por acciones como simulador multimorfología

Riemann-1.0 también puede utilizarse como simulador visual condicionado por acciones. En este modo, no se le pide únicamente que produzca una acción ejecutable. En su lugar, recibe la observación visual actual, la instrucción de la tarea, el estado del robot y una trayectoria de acciones futuras candidata, y predice las consecuencias visuales de ejecutar dicha trayectoria.

La trayectoria de acciones se representa mediante la misma interfaz de acciones específica de cada configuración utilizada durante el entrenamiento de la política. Después se codifica como tokens de acción y se inserta en la secuencia causal de acción-vídeo. Estos tokens condicionan el proceso de eliminación de ruido de los latentes visuales, de modo que los fotogramas generados quedan vinculados al movimiento del robot, en lugar de muestrearse como un vídeo futuro no condicionado.

Durante la inferencia, primero codificamos la observación actual en el espacio latente del VAE y la utilizamos como contexto visual limpio. El bloque de acciones futuras puede proceder de la cabeza de política, muestrearse a partir de un plan candidato o tomarse de una trayectoria registrada para su análisis.

Condicionada por la instrucción, el estado, el contexto visual limpio y los tokens de acción, la cabeza latente despliega los latentes visuales futuros; estos se decodifican después para recuperar un vídeo RGB. Para horizontes más largos, la salida visual generada u observada puede volver a incorporarse al contexto y el mismo procedimiento puede repetirse de forma autorregresiva.

Esto proporciona a Riemann-1.0 una interfaz de simulador basada en datos: las acciones se tratan como entradas controlables, mientras que las observaciones futuras de la cámara se generan como consecuencias simuladas.

Preguntas frecuentes

¿Cuál es el objetivo de la infraestructura de datos corporeizados de Riemann-1.0? Transforma experiencias corporeizadas heterogéneas en una representación común de vídeo–estado–acción a nivel de acción para el modelado de acciones del mundo.

¿Qué fuentes de datos se utilizan para el preentrenamiento corporeizado? La infraestructura utiliza vídeos humanos en primera persona, demostraciones con pinzas portátiles y dispositivos vestibles, y trayectorias robóticas.

¿Cuál es el currículo de entrenamiento de Rima-WAM? Las tres etapas progresan desde la supervisión de pseudoacciones obtenida solo de vídeo hasta datos mixtos con acciones reales y, finalmente, datos exclusivamente robóticos de alta calidad.

¿Cómo se utiliza Riemann-1.0 como simulador visual? Recibe observaciones visuales, instrucciones de tareas, estados del robot y trayectorias de acciones candidatas, y predice las consecuencias visuales de ejecutar dichas acciones.

🍪 Preferencias de cookies

Usamos cookies para medir el rendimiento. Política de privacidad