Ajuste fino conjunto con múltiples búferes
Los modelos preentrenados de visión-lenguaje-acción se entrenan para eliminar el ruido de cada bloque desde cero y de forma aislada; nunca han trabajado con un búfer parcialmente lleno ni con un patrón de atención causal por bloques. FlashVLA los adapta al paradigma de streaming durante la etapa habitual de ajuste fino posterior al preentrenamiento.
El objetivo de entrenamiento es la pérdida estándar de flow matching, sumada para todas las configuraciones del búfer.
El modelo minimiza la pérdida de flow matching en cada combinación válida de contenido del búfer y niveles de ruido.
Este objetivo único cubre tanto el arranque en frío como el funcionamiento en streaming estable: el modelo aprende a eliminar el ruido de los bloques con cualquier nivel de ruido, condicionados por cualquier prefijo válido del búfer.

Implementación en el mundo real
FlashVLA se implementa en un brazo Franka de 7 grados de libertad con una única GPU RTX A4000. La implementación evalúa si las ventajas de latencia simuladas y de continuidad asíncrona se trasladan a un robot real que funciona con una frecuencia de control de 30 Hz.

Conclusión
FlashVLA adapta modelos preentrenados de visión-lenguaje-acción mediante un ajuste fino conjunto con múltiples búferes. Esto lo convierte en una modificación directa de incorporar, aunque hereda el objetivo de entrenamiento del modelo preentrenado, basado en bloques independientes.
Preentrenar desde cero un modelo de visión-lenguaje-acción bajo la formulación causal por bloques es el siguiente paso natural y probablemente permitirá obtener mejoras adicionales.
El búfer de streaming también requiere un arranque en frío único de un número fijo de pasos de calentamiento por episodio. Este coste se amortiza rápidamente en ejecuciones de varios segundos, pero resulta más apreciable en tareas muy cortas.
Agradecimientos
Los autores agradecen sinceramente al laboratorio del profesor Xiaolong Wang por proporcionar un brazo robótico Franka.
Configuración de los experimentos en el mundo real
El modelo ajustado se ejecuta en una RTX A4000 con una frecuencia de control de 30 Hz. Todos los métodos utilizan las mismas optimizaciones del sistema basadas en CUDA Graph y fusión de kernels.
El horizonte de ejecución se fija en 16 y el retraso asíncrono, en dos pasos para todos los métodos asíncronos. La puntuación de cada tarea se promedia sobre 15 ejecuciones, mientras que el tiempo de finalización se calcula únicamente a partir de las ejecuciones satisfactorias.
Preguntas frecuentes
¿Qué es FlashVLA? FlashVLA es un enfoque de decodificación de acciones en streaming para lograr una inferencia de visión-lenguaje-acción más rápida y asíncrona.
¿Cómo se adapta FlashVLA a los modelos preentrenados? Utiliza un ajuste fino conjunto con múltiples búferes durante la etapa habitual de ajuste fino posterior al preentrenamiento.
¿Qué hardware robótico se utiliza para la implementación en el mundo real? El sistema se implementa en un brazo Franka de 7 grados de libertad, con una única GPU RTX A4000 y una frecuencia de control de 30 Hz.
¿Qué limitación introduce el búfer de streaming? El búfer de streaming requiere un calentamiento inicial único al comienzo de cada episodio, algo más apreciable en tareas muy cortas.
