Trabajos relacionados
Generación autónoma de datos robóticos
Los generadores de datos amplían la experiencia robótica al reajustar segmentos de demostraciones relativos a los objetos en distintas configuraciones de escena y descomponer el comportamiento en habilidades reutilizables conectadas mediante movimientos planificados. Estos métodos convierten demostraciones escasas en datos diversos para la imitación; sin embargo, la semántica de las tareas sigue vinculada a las demostraciones originales y carece de un monitor independiente y fundamentado que valide las ejecuciones de las políticas aprendidas.

Fiabilidad de la formulación
Las filas C muestran la interacción lingüística. Kuafu utiliza 110,5 mil tokens por tarea, frente a los 234,4 mil de Eureka en su búsqueda de recompensas de una sola vez. VoxPoser, en cambio, utiliza 16,99 llamadas y 31,6 mil tokens por ejecución.
Con las tasas medias indicadas, la interacción acumulada de VoxPoser supera a la de Kuafu después de solo dos ejecuciones, si se mide en llamadas, y de cuatro ejecuciones, si se mide en tokens. Por tanto, crear un programa persistente transforma la interacción lingüística de un coste recurrente de ejecución en un coste asociado a la tarea.
Aprendizaje visual y transferencia sin ejemplos
Para el despliegue físico, cada configuración simulada reproduce la configuración calibrada de dos o tres cámaras RGB-D correspondientes al espacio de trabajo, con una aleatorización restringida.
El conjunto de datos se duplica hasta alcanzar 1.000 trayectorias por tarea, y las políticas resultantes se despliegan sin ajuste fino en el mundo real. DP3 logra 36 éxitos en 106 pruebas repartidas entre seis tareas y tres configuraciones de robot y pinza, sin ajuste fino en el mundo real. Esto se traduce en una tasa de éxito macro por tarea del 34,72 % y en al menos un éxito en todas las tareas evaluadas.
La tasa de éxito conjunta es del 33,96 %, con un intervalo de Wilson del 95 % de 25,6–43,4 %. La tarea con menos muestras presenta 2/6 éxitos, con un intervalo de 9,7–70,0 %.
El análisis de las pruebas fallidas identifica la adquisición precisa del agarre como el principal desafío pendiente. T1 presenta la tasa de éxito más baja, del 15 %, y el agarre es el modo de fallo observado con mayor frecuencia en T7.
Estos resultados demuestran la viabilidad de la transferencia sim-to-real sin ejemplos mediante conjuntos de datos generados por programas persistentes de SUN.

Conclusiones
Alcance y limitaciones
Los programas SUN dependen de una interfaz de escena registrada, con marcos y ejes informativos para los objetos, así como de una biblioteca finita de operadores tipados. Por consiguiente, Kuafu no puede trabajar con objetos deformables ni fluidos sin definir nuevos operadores.
La evaluación no incluye instrucciones, operadores, semántica de escena ni composiciones de tareas reservados para prueba, lo que limita las afirmaciones contundentes sobre la generalización en entornos abiertos.
Desde el punto de vista metodológico, el monitor de etapas avanza de forma monótona y no puede retroceder después de una regresión física. Además, la métrica Q95 es relativa al control predictivo por modelo: mide la eficiencia frente a un planificador concreto, no la calidad absoluta de la trayectoria.
Por último, la validación en seis tareas y 106 pruebas establece la viabilidad de la transferencia sin ejemplos en las configuraciones de robot y pinza evaluadas, pero no garantiza una fiabilidad amplia de la transferencia sim-to-real en entornos no estructurados.
Preguntas frecuentes
¿Cuál es el objetivo principal de los programas persistentes de SUN? Transforman la interacción lingüística de un coste recurrente de ejecución en un coste asociado a la tarea, al tiempo que permiten validar las ejecuciones de las políticas aprendidas.
¿Cuántos tokens utiliza Kuafu por tarea? Kuafu utiliza 110,5 mil tokens por tarea.
¿Cómo funcionó DP3 durante el despliegue físico? DP3 logró 36 éxitos en 106 pruebas repartidas entre seis tareas y tres configuraciones de robot y pinza, sin ajuste fino en el mundo real.
¿Cuál es el principal desafío pendiente identificado en las pruebas fallidas? La adquisición precisa del agarre es el principal desafío pendiente; el agarre fue el modo de fallo observado con mayor frecuencia en T7.
