Habilidades autónomas de manipulación robótica mediante calidad-diversidad guiada por lenguaje

Habilidades autónomas de manipulación robótica mediante calidad-diversidad guiada por lenguaje

Émiland Garrabé, Mahdi Khoramshahi, Stéphane Doncieux

6 min de lectura1 sept 2026

En general, la mayoría de los métodos para adquirir habilidades robóticas de forma autónoma se centran en obtener soluciones únicas de alto rendimiento. Esto puede provocar fragilidad al desplegarlos en el mundo real, debido a la elevada dimensionalidad de los espacios de tareas de manipulación, y los currículos basados en estas técnicas deben diseñarse con sumo cuidado. En cambio, aunque los primitivas de movimiento obtenidas mediante procesos de calidad-diversidad son adecuadas para su integración directa gracias a su diversidad, el diseño de métricas de diversidad y señales de aptitud útiles y específicas de cada tarea sigue requiriendo la intervención de expertos, lo que resulta incompatible con los requisitos de autonomía. Las técnicas de configuración de recompensas basadas en modelos de lenguaje pueden adaptarse a algoritmos de calidad-diversidad en el contexto de tareas de manipulación, dando lugar a archivos de soluciones diversas y siendo compatibles con instrucciones de formato libre.

Conjuntos de datos de trayectorias en robótica

En general, la mayoría de los métodos para adquirir habilidades robóticas de forma autónoma se centran en obtener soluciones únicas de alto rendimiento. Esto puede provocar fragilidad al desplegarlos en el mundo real, debido a la elevada dimensionalidad de los espacios de tareas de manipulación, y los currículos basados en estas técnicas deben diseñarse con sumo cuidado.

En cambio, aunque los primitivas de movimiento obtenidas mediante procesos de calidad-diversidad son adecuadas para su integración directa gracias a su diversidad, el diseño de métricas de diversidad y señales de aptitud útiles y específicas de cada tarea sigue requiriendo la intervención de expertos, lo que resulta incompatible con los requisitos de autonomía.

Las técnicas de configuración de recompensas basadas en modelos de lenguaje pueden adaptarse a algoritmos de calidad-diversidad en el contexto de tareas de manipulación, dando lugar a archivos de soluciones diversas y siendo compatibles con instrucciones de formato libre.

Método

Esta sección comienza formalizando el problema de diseño de un archivo de habilidades robóticas y la parametrización de un algoritmo MAP-Elites-Success para la adquisición de habilidades robóticas. A continuación, propone una técnica secuencial para explorar los espacios del descriptor de comportamiento y de la aptitud mediante modelos de lenguaje, sin intervención experta ni adaptación basada en la tarea. Por último, la malla generada de muestras de descriptores de comportamiento puede utilizarse con un algoritmo MAP-Elites-Success multid descriptor de comportamiento para generar un archivo de primitivas de movimiento diversas para una tarea determinada.

Generación de conjuntos de datos de trayectorias para robótica

Dada una tarea conocida y una distribución desconocida de instancias de tarea, el problema de diseño de calidad-diversidad robótica se formula del siguiente modo:

Encontrar un archivo de primitivas de movimiento que satisfaga los requisitos de la tarea en toda la distribución desconocida de instancias de tarea.

Aquí, el archivo de primitivas de movimiento es una colección de comportamientos robóticos candidatos, y el espacio de primitivas de movimiento es el espacio de primitivas de movimiento posibles.

Proceso de exploración de calidad-diversidad guiada por lenguaje

Inferencia de LLM para MAP-Elites-Success multi-BD

Esta sección presenta una estrategia para parametrizar algoritmos de calidad-diversidad mediante modelos de lenguaje.

Aunque obtener un criterio de éxito correcto es crucial para la calidad del archivo resultante, su diseño es relativamente sencillo. Por ello, para cada tarea se infiere una sola condición de éxito, lo que reduce la carga computacional.

Experimentos

Esta sección detalla la implementación del algoritmo propuesto utilizada en los experimentos y describe la configuración experimental empleada para validar el método.

Primitiva de movimiento de agarre robótico

Implementación: API de percepción

El modelo de lenguaje dispone de la siguiente información:

  1. La posición y orientación de la base del objeto. Se eligen ángulos de Euler porque son más fáciles de interpretar para un sistema no experto, como un modelo de lenguaje.
  2. Los contactos entre la mesa y el robot y, respectivamente, entre la mesa y el objeto.
  3. Los contactos entre la pinza del robot y cada eslabón del objeto, o con la base del objeto en el caso de objetos no articulados.
  4. La posición y orientación de la pinza del robot.
  5. En el caso de objetos articulados, la posición de cada articulación, representada mediante su ángulo o desplazamiento prismático.

Entorno y tareas

Condición de éxito definida por expertos: El objeto debe tocar la pinza y no la mesa.

Descriptor de comportamiento de referencia: La posición XYZ de la pinza en el primer contacto con el objeto.

Interacción robótica con un cajón articulado

Métricas

Tamaño del archivo de éxitos

El número de individuos exitosos, medido mediante una condición de éxito escrita por expertos, que produce cada ejecución.

Cobertura del descriptor de comportamiento de referencia

Para cada tarea, el archivo de salida de cada línea base se proyecta en el espacio del descriptor de comportamiento de referencia utilizado por la línea base diseñada manualmente. Este espacio de descriptores de comportamiento de referencia se diseña manualmente para capturar una diversidad significativa en los enfoques empleados para resolver la tarea, proporcionando una medida de la diversidad real de las soluciones.

Preguntas frecuentes

¿Qué problema aborda la calidad-diversidad guiada por lenguaje? Aborda la adquisición autónoma de habilidades diversas de manipulación robótica sin necesidad de métricas de diversidad ni señales de aptitud específicas de la tarea diseñadas por expertos.

¿Por qué son útiles las primitivas de movimiento diversas para la manipulación robótica? Su diversidad las hace adecuadas para la integración directa y puede reducir la fragilidad en espacios de tareas de manipulación de alta dimensionalidad.

¿Qué información se proporciona al modelo de lenguaje? El modelo de lenguaje recibe la pose del objeto, información de contacto, la pose de la pinza y las posiciones de las articulaciones de los objetos articulados.

¿Cómo se mide la cobertura del descriptor de comportamiento de referencia? Los archivos de salida se proyectan en un espacio de descriptores de comportamiento de referencia diseñado manualmente, que captura la diversidad significativa de los enfoques empleados para resolver la tarea.

🍪 Preferencias de cookies

Usamos cookies para medir el rendimiento. Política de privacidad