Conjunto de datos HumanGen en contexto
HumanGen es una colección de pares de aprendizaje en contexto humano-robot generados mediante el proceso de generación de vídeos humanos en contexto. Cada par contiene una instrucción en vídeo humano generada y la trayectoria robótica correspondiente, con acciones ejecutables.
HumanGen se organiza según la fuente de datos en ICL de preentrenamiento (externo), ICL de preentrenamiento (interno), ICL de simulación e ICL del mundo real. Siguiendo el mismo principio de muestreo diverso por tareas empleado para recopilar datos de vídeo-acción diversos por tareas, los vídeos robóticos de origen se muestrean por tarea y no según la frecuencia bruta de las trayectorias, de modo que los datos ICL no queden dominados por ejecuciones repetidas de un conjunto reducido de tareas.
ICL de preentrenamiento (interno)
Para ampliar aún más la cobertura de tareas, las trayectorias robóticas se muestrean por tarea a partir de conjuntos de datos robóticos internos. Este subconjunto abarca varias configuraciones robóticas, como Franka bimanual y Galaxea R1 Pro, y contiene 3.522 tareas y 30.247 pares ICL humano-robot.
Al utilizar el proceso de generación de vídeos humanos en contexto para producir los vídeos humanos correspondientes a este subconjunto, se reduce la proporción de perspectivas en tercera persona, así como la frecuencia de los cambios de escena, de objetos y de colocación de objetos. El resultado son muestras ICL más alineadas visualmente, sin sacrificar la diversidad de tareas.

ICL de simulación
Para permitir la evaluación entre tareas en simulación, se generan datos ICL para 50 tareas de RoboTwin. Este subconjunto contiene 2.500 muestras ICL, 50 por tarea.
De ellas, 43 tareas se utilizan para el posentrenamiento, con 2.150 muestras de entrenamiento, mientras que las 7 tareas restantes se reservan como tareas no vistas para la evaluación entre tareas en régimen de zero-shot.
ICL del mundo real
El ICL del mundo real contiene pares humano-robot recopilados con la configuración robótica de evaluación Franka bimanual. Incluye 252 pares humano-robot correspondientes a las tres familias de tareas del mundo real utilizadas en la evaluación:
- 120 pares de 30 combinaciones de tareas de entrenamiento de colocación de objetos en recipientes.
- 96 pares de 16 combinaciones de tareas de entrenamiento de manipulación secuencial de tres objetos.
- 36 pares para la inserción de dos patas de mesa.
Este subconjunto se utiliza para el posentrenamiento, de modo que el modelo pueda adaptarse a la cinemática del robot de evaluación para la evaluación entre tareas.
Zero-WAM: modelado mundo-acción en contexto
En la manipulación entre tareas en régimen de zero-shot, el robot debe ejecutar una tarea nueva sin ajuste fino. Esta capacidad se aborda mediante un modelo mundo-acción preentrenado con pares ICL humano-robot a gran escala y datos robóticos de vídeo-acción equilibrados por tarea.
Durante el despliegue, Zero-WAM utiliza una instrucción lingüística o una demostración en vídeo humano como especificación de la tarea para ejecutar tareas no vistas.

Implementación
Detalles de inferencia
El Zero-WAM preentrenado admite dos modos de inferencia.
En el modo solo lenguaje, el modelo se condiciona en la instrucción lingüística sin utilizar el vídeo humano ICL, y la escala de guía sin clasificador del vídeo se fija en 5.
En el modo ICL, el modelo se condiciona en el vídeo humano ICL y desactiva la instrucción lingüística. Se utiliza guía ICL sin clasificador con una escala de guía de 5.
En ambos modos, el tamaño del fragmento de inferencia se fija en 2 y la escala de guía sin clasificador de la acción se establece en 1,0.
Conclusiones y debate
Debate
La generalización entre tareas en régimen de zero-shot es esencial para desplegar políticas robóticas de propósito general en entornos reales abiertos. Avanzar hacia este objetivo exige tanto priors transferibles más sólidos en las políticas robóticas fundacionales como interfaces de tareas más ricas, capaces de transmitir la intención mediante múltiples modalidades.
Las demostraciones humanas son una fuente natural de este tipo de especificaciones de tareas, por lo que resulta importante seguir ampliando su escala y diversidad. Aunque los experimentos se centran principalmente en la manipulación de objetos sobre mesas estáticas, los trabajos futuros deberían extender este paradigma a entornos más complejos, dinámicos y no estructurados, incluida la manipulación móvil y las tareas con horizontes temporales considerablemente más largos.
Entre las fuentes disponibles de experiencia transferible, el vídeo humano egocéntrico resulta especialmente prometedor porque puede recopilarse a una escala mucho mayor que las demostraciones robóticas. Sin embargo, su uso sigue siendo complicado debido a las diferencias de configuración robótica, observación y acción entre humanos y robots.
Los datos humano-robot semánticamente alineados que se presentan en este trabajo podrían servir de puente entre el abundante vídeo humano egocéntrico y las relativamente escasas trayectorias robóticas. Al establecer la correspondencia en el nivel de la semántica de la tarea, en lugar de exigir una alineación exacta a nivel de movimiento, esta formulación de datos podría permitir que las políticas robóticas adquiriesen conocimientos amplios sobre las tareas a partir de la experiencia humana, utilizando a la vez muchos menos datos robóticos para supervisar acciones ejecutables.

Manipulación robótica entre tareas
La manipulación robótica entre tareas evalúa si una política puede ejecutar una tarea de manipulación no vista sin recopilar demostraciones robóticas específicas para esa tarea.
Frente a la generalización visual, como cambiar las escenas o los atributos de los objetos en torno a una tarea conocida, la generalización entre tareas es más difícil porque el modelo debe inferir dinámicas condicionadas por la tarea que no había visto previamente a partir de la instrucción y de la observación actual.
Modelos mundo-acción
Para que los modelos mundo-acción ejecuten tareas no vistas durante la prueba, trabajos recientes exploran el entrenamiento en tiempo de prueba.
WAM-TTT guía un modelo mundo-acción congelado actualizando una memoria ligera a partir de vídeos humanos sin procesar durante el despliegue. RoboTTT utiliza entrenamiento en tiempo de prueba con pesos rápidos para comprimir largos historiales de ejecución en el estado de la política.
Estos métodos permiten ejecutar tareas no vistas durante la prueba, pero siguen requiriendo adaptación en tiempo de prueba mediante actualizaciones de memoria o de pesos rápidos. Zero-WAM sigue un camino distinto: incorpora datos ICL humano-robot y datos de vídeo-acción equilibrados por tarea durante el preentrenamiento y el posentrenamiento, de modo que la política pueda seguir directamente instrucciones en vídeo humano en contexto para lograr una generalización entre tareas en régimen de zero-shot durante la prueba.
Datos de vídeo humano para la manipulación robótica
Zero-WAM aborda este régimen de datos aún poco cubierto. En lugar de recopilar demostraciones humanas tarea por tarea, los datos HumanGen se generan automáticamente a partir de datos robóticos de vídeo-acción muestreados por tarea.
Como cada vídeo humano generado se empareja con una trayectoria robótica que conserva acciones ejecutables, HumanGen amplía las instrucciones de tareas en vídeo humano junto con dinámicas robóticas diversas por tarea. Esto convierte la especificación de tareas mediante vídeo humano en un componente escalable del entrenamiento de modelos mundo-acción para la generalización entre tareas en régimen de zero-shot.
Preguntas frecuentes
¿Qué es Zero-WAM?
Zero-WAM es un modelo mundo-acción que utiliza instrucciones lingüísticas o demostraciones en vídeo humano para ejecutar tareas robóticas no vistas sin ajuste fino.
¿Qué incluye el conjunto de datos HumanGen?
HumanGen contiene instrucciones en vídeo humano generadas, emparejadas con las trayectorias robóticas correspondientes, que conservan acciones ejecutables.
¿Por qué se utilizan datos robóticos de vídeo-acción equilibrados por tarea?
El muestreo por tarea evita que los datos de aprendizaje en contexto queden dominados por ejecuciones repetidas de un número reducido de tareas.
¿Cuáles son las principales limitaciones y líneas futuras?
Los experimentos se centran principalmente en la manipulación de objetos sobre mesas estáticas, mientras que los trabajos futuros deberían abordar entornos dinámicos y no estructurados, la manipulación móvil y tareas con horizontes temporales considerablemente más largos.
