Trabajos relacionados
No afirmamos que propongamos un principio curricular fundamentalmente nuevo. En cambio, mostramos que una variante sencilla del muestreo basado en el éxito, combinada con reinicios diversos y aprendizaje por refuerzo a gran escala, puede resolver tareas exigentes de locomoción y ensamblaje que los métodos de muestreo anteriores tienen dificultades para aprender.
Decisiones algorítmicas para el entrenamiento con aprendizaje por refuerzo
Más allá del propio muestreador, SGS adopta dos decisiones algorítmicas deliberadas que, en conjunto, permiten entrenar con PPO en un amplio espacio de configuraciones de tareas.
Recompensas compartidas dentro de cada dominio
Usamos una función de recompensa sencilla para todas las tareas de locomoción y otra para todas las tareas de manipulación. Cada una combina una recompensa booleana por el éxito en la tarea, obtenida al final del episodio, con términos de regularización relativamente pequeños, específicos del robot y por paso.
El diseño de recompensas compartidas evita especificar una función de recompensa distinta para cada terreno o tarea de ensamblaje. El apéndice A.3 presenta los términos y las ponderaciones de cada dominio.
Resultados experimentales
Mediante una serie de estudios de escalabilidad a gran escala, planteamos las siguientes preguntas:
- Escalabilidad: ¿SGS escala mejor que el muestreo uniforme y PLR a medida que aumenta el número de entornos de entrenamiento en paralelo?
- Capacidad: ¿SGS permite abordar tareas de robótica que los métodos anteriores no podían resolver, incluso a menor escala?
- Transferencia: ¿Pueden transferirse sin ajuste a hardware real los comportamientos de manipulación diestra aprendidos con SGS?
Manipulación
Usamos la misma función de recompensa sencilla y reinicios diversos del simulador para todas las tareas de manipulación. En los principales experimentos de escalabilidad en manipulación utilizamos un currículo de gravedad que luego descubrimos que no era necesario; el apéndice B.4 describe su implementación y evalúa su efecto mediante una ablación.

Locomoción
Los terrenos de trabajos anteriores suelen tener una estructura lineal, en la que la dificultad viene determinada por parámetros como la pendiente o la altura de los escalones, interpolados linealmente de fácil a difícil. En nuestros terrenos generados procedimentalmente quizá no exista un orden claro de dificultad, por lo que el eje de dificultad puede interpretarse como un conjunto de semillas distintas.
Los terrenos utilizados en este artículo se muestran en las filas central e inferior de la Figura 3, con la excepción de Inverted Slope, que omitimos por limitaciones de espacio.
Observaciones, acciones y recompensas
Describimos los espacios de observación y acción de cada configuración física del robot, seguidos de las definiciones y ponderaciones de las recompensas.
La política de locomoción observa la velocidad lineal y angular de la base, la gravedad proyectada, las posiciones y velocidades de las articulaciones, la acción anterior, el comando objetivo y un escaneo local de la altura del terreno. Su acción de 12 dimensiones especifica desplazamientos de las posiciones articulares respecto a la postura nominal del robot, que siguen los controladores articulares.
Comparación con el muestreo para facilitar el aprendizaje
La Tabla 1 del texto principal compara SFL con SGS en locomoción. Usamos los hiperparámetros predeterminados de SFL e informamos las medias y los intervalos de confianza del 95% de tres semillas de entrenamiento.
El rendimiento final de SFL es inferior al de SGS en ambas escalas. En 32K, su mejor punto de control se acerca, pero sigue rindiendo peor que SGS. Cabe destacar que el rendimiento se deteriora significativamente a medida que continúa el entrenamiento, sobre todo a escalas mayores, mientras que SGS mejora de forma monótona durante el entrenamiento.
Hiperparámetros de SGS y densidad de configuraciones
Para cada configuración de tarea, almacenamos en un búfer circular una ventana de los resultados booleanos más recientes, en un historial de longitud fija. Nuestro muestreo establece un límite inferior para el peso del kernel antes de calcular los logits y fija la temperatura mínima en uno.
Configuración del hardware y el control
Usamos un brazo UR5e con una pinza Robotiq 2F-85 y seguimos la interfaz de control en el espacio operacional cartesiano relativo de OmniReset. Nuestra configuración de cámaras utiliza una cámara en tercera persona y otra montada en la muñeca, en lugar de las tres cámaras de OmniReset. En el apéndice C.3 describimos el profesor basado en nubes de puntos y el estudiante basado en RGB.
La placa NIST está hecha de acrílico pulido. Cuando la cámara de la muñeca apunta directamente a la placa, el robot observa su propio reflejo, que está fuera de distribución. La baja fricción de la superficie también perjudica a las políticas que utilizan la placa para reorientar el objeto. Por estos motivos, cubrimos la placa con cinta durante la evaluación.

Modelado de la simulación y aleatorización del dominio
Seguimos la configuración de aleatorización del dominio de OmniReset, añadimos ruido gaussiano pequeño a las observaciones de nubes de puntos y aleatorizamos las masas de los objetos en torno a sus valores medidos en el mundo real.
Destilación de profesor a estudiante
En cada iteración se recopila un paso en todos los entornos, se actualiza al estudiante para acercar sus acciones a las del profesor y se descartan los datos. Esto limita el uso de memoria de la GPU, un cuello de botella cuando la simulación y el renderizado se ejecutan junto con el entrenamiento.
Sin embargo, el éxito durante el entrenamiento puede ser engañoso: las actualizaciones basadas en el paso inmediatamente anterior pueden guiar la siguiente acción del estudiante hacia la del profesor y ayudarle a resolver una tarea que aún no puede realizar sin esas actualizaciones. Por ello, reservamos el 6.67% de los entornos para la evaluación y excluimos sus datos de las actualizaciones del gradiente. El éxito en estos entornos reservados va por detrás del éxito de entrenamiento, lo que revela la necesidad de una destilación más prolongada.
Observaciones sobre la transferencia y comportamientos de las políticas
Una lección constante en todas las tareas fue que las políticas que aseguran un agarre limpio e insertan directamente se transfieren mejor que las que aprovechan las dinámicas de contacto del simulador.
En la inserción de una varilla en un orificio, añadir ruido gaussiano de 1 mm por paso a la observación de la nube de puntos ayudó aún más: animó a la política a volver a apuntar tras fallar y a mover la varilla si no estaba completamente encajada.
En el ensamblaje de tuerca y perno, la política dejaba caer repetidamente la tuerca sobre el perno en lugar de encajarla, y la volteaba cada vez. Especulamos que esto se debía a la recompensa del profesor, que solo consideraba exitosa una orientación vertical de la tuerca, pese a que esta es simétrica. Al eliminar esta restricción y ajustar adecuadamente la escala de las acciones en el espacio de control del efector final de 6-DOF, se obtuvo una política que completaba la tarea.
Protocolo de evaluación en el mundo real
La Figura 4 muestra las trayectorias del hardware y la Tabla 2 presenta los resultados por tarea. Seguimos el protocolo de evaluación y las definiciones de métricas de OmniReset, e informamos la tasa de éxito global, la tasa de éxito al primer intento y el rendimiento, con las diferencias indicadas a continuación.
Muestreamos las configuraciones iniciales de los objetos aleatorizando uniformemente sus posiciones sobre la placa NIST. La placa se fija a la mesa con tiras adhesivas. En la simulación, los objetos receptores permanecen estáticos y la política aprende a reorientar el objeto insertable con respecto a una referencia fija. Si la placa no está asegurada, los objetos receptores pueden desplazarse durante el contacto, lo que provoca fallos.
Preguntas frecuentes
¿Qué muestra el artículo sobre SGS? Una variante sencilla del muestreo basado en el éxito, combinada con reinicios diversos y aprendizaje por refuerzo a gran escala, puede resolver tareas exigentes de locomoción y ensamblaje que los métodos de muestreo anteriores tienen dificultades para aprender.
¿Cómo se estructuran las recompensas entre las distintas tareas? El método utiliza una función de recompensa para la locomoción y otra para la manipulación. Cada una combina una recompensa booleana por el éxito en la tarea al final del episodio con pequeños términos de regularización específicos del robot y por paso.
¿Por qué se reservan algunos entornos durante la destilación de profesor a estudiante? Los entornos reservados muestran si el estudiante puede tener éxito sin la guía de las actualizaciones basadas en los pasos inmediatamente anteriores. Su éxito quedó por detrás del éxito de entrenamiento, lo que indica la necesidad de una destilación más prolongada.
¿Qué ayudó a las políticas a transferirse a tareas de inserción en el mundo real? Las políticas que aseguran un agarre limpio e insertan directamente se transfirieron mejor que las que aprovechan las dinámicas de contacto del simulador. En la inserción de una varilla en un orificio, el ruido en la nube de puntos también fomentó que se volviera a apuntar tras fallar.
