Trabajos relacionados
STEP se inspira en investigaciones sobre autonomía compartida y anticipación de acciones a largo plazo mediante modelos de lenguaje de gran escala. Aborda algunas limitaciones de trabajos anteriores al ampliar los métodos que hacen un seguimiento de la representación del estado del entorno para anticipar acciones a largo plazo.

Métricas
Ejecutabilidad
La ejecutabilidad garantiza que las acciones predichas sigan un orden lógico y cumplan las restricciones de ejecución, como las poses adecuadas de los objetos y las precondiciones de cada acción. Se realizan comprobaciones de ejecutabilidad y la secuencia de acciones predicha se trunca en la primera acción que no las supera.
La ejecutabilidad se expresa como el porcentaje de acciones predichas que superan todas las comprobaciones.
Error del estado final
El error del estado final mide la diferencia entre el estado real de finalización de la tarea y el estado final que puede alcanzarse correctamente al ejecutar las acciones predichas.
Para determinar el estado final alcanzable, se selecciona el estado resultante de la última acción predicha que puede ejecutarse correctamente. Esta métrica mide la diferencia entre dicho resultado y el objetivo esperado.
Corrección de la tarea
La corrección de la tarea mide la precisión de la estimación de la tarea. Se asigna 1 si la tarea predicha coincide con alguna de las tareas posibles durante la inferencia, y 0 en caso contrario.
Error del estado actual
El error del estado actual compara la distancia entre el estado actual generado por la representación del estado y el estado real en el momento de la inferencia.

Resultados y discusión
Para obtener los resultados principales se utilizó el modelo GPT-4o ofrecido a través de la API de OpenAI. Cada vez que se solicitó una respuesta al modelo de lenguaje multimodal de gran escala, se generaron varias salidas y se seleccionó la salida con la máxima log-probabilidad devuelta por el modelo.
Comparación con la línea base
Para modelar las variaciones en las delegaciones del usuario a STEP, se realizaron experimentos con porcentajes de finalización de la tarea del 30 %, 50 %, 70 % y 90 %. Un porcentaje de finalización de un valor determinado significa que, como entrada para la evaluación, se utilizó el porcentaje correspondiente inicial de las acciones de la secuencia registrada.
A medida que aumentó el porcentaje de finalización de la tarea, ambos métodos lograron un menor error final, ya que el robot partía de un estado más próximo al objetivo al haber completado el operador una mayor parte del ensamblaje.
Con el avance de la tarea, la corrección de la tarea disminuyó inicialmente debido al aumento del ruido en las secuencias de acciones más largas y a una mayor oclusión de las estructuras de bloques en las imágenes. Después aumentó, conforme la estructura en construcción se volvía más discernible.
El error del estado actual pareció aumentar a medida que avanzaba la tarea, porque la estructura se volvía más compleja y los bloques aparecían cada vez más juntos en la imagen.

Conclusión
STEP se presenta como un método para mejorar la anticipación de acciones a largo plazo con modelos de lenguaje multimodales de gran escala mediante la representación explícita de las transiciones de estado. Esto se traduce en planes de acción robótica más precisos y ejecutables para tareas industriales colaborativas.
El método utiliza una canalización de varias etapas. Primero estima la tarea general que el operador del robot intenta realizar, junto con una representación estructurada del estado actual del puesto de trabajo del robot. Posteriormente, esta información se transmite a las etapas siguientes para predecir las acciones necesarias para completar la tarea y propagar la representación del estado, con el fin de obtener los parámetros de asistencia necesarios para ejecutar correctamente las acciones predichas y alcanzar la tarea deseada.
STEP también sigue la distancia entre los estados propagados y el estado objetivo, y orienta las acciones predichas hacia dicho objetivo.
Se necesita trabajo adicional para que STEP funcione en tiempo real antes de que pueda adoptarse en aplicaciones prácticas. Para propagar los estados y guiar la generación de planes de acción hacia el objetivo, STEP consulta varias veces más un modelo de lenguaje multimodal de gran escala que la línea base. Esto obliga a STEP a sacrificar velocidad a cambio de un mejor rendimiento y precisión.
En los experimentos, la línea base tuvo un tiempo de ejecución menor, con una media de 18.24 segundos y una desviación estándar de 4.23 segundos, frente a STEP, cuya media fue de 148.07 segundos y su desviación estándar, de 55.03 segundos.
En futuras investigaciones podría estudiarse la ejecución local de un modelo de lenguaje multimodal de gran escala o el ajuste fino de un modelo más pequeño para reducir la latencia de cada consulta. Este trabajo anima a seguir investigando el potencial de los modelos de lenguaje multimodales de gran escala para el razonamiento a largo horizonte en la colaboración entre humanos y robots.
Preguntas frecuentes
¿Qué pretende mejorar STEP?
STEP está diseñado para mejorar la anticipación de acciones a largo plazo mediante modelos de lenguaje multimodales de gran escala en tareas industriales colaborativas.
¿Cómo representa STEP la situación del robot?
STEP estima la tarea general del operador y genera una representación estructurada del estado actual del puesto de trabajo del robot.
¿Qué ocurre con la corrección de la tarea cuando aumenta el porcentaje de finalización?
La corrección de la tarea disminuye inicialmente debido al ruido y la oclusión de las imágenes, y después aumenta a medida que la estructura en construcción se vuelve más discernible.
¿Cómo se compara el tiempo de ejecución de STEP con el de la línea base?
La línea base tuvo un tiempo de ejecución medio de 18.24 segundos, mientras que el de STEP fue de 148.07 segundos.
