多缓冲区联合微调
预训练视觉-语言-动作模型在训练时,会将每个动作块视为彼此独立的对象,从零开始逐块去噪;它们从未接触过部分填充的缓冲区,也不了解按动作块组织的因果注意力模式。FlashVLA 在标准的下游微调阶段,将这类模型适配到流式处理范式中。
训练目标是标准的流匹配损失,并对所有缓冲区配置求和。
模型会针对每一种有效的缓冲区内容组合和噪声水平,最小化流匹配损失。
这一单一目标同时覆盖冷启动和稳定流式运行:模型学会在任意噪声水平下,根据任意有效的缓冲区前缀完成动作块去噪。

真实世界部署
FlashVLA 部署在一台配备单块 RTX A4000 GPU 的 7 自由度 Franka 机械臂上。此次部署旨在评估:在仿真中观察到的延迟优势和异步连续性收益,能否迁移到以 30 Hz 控制频率运行的真实机器人上。

结论
FlashVLA 通过多缓冲区联合微调来适配预训练视觉-语言-动作模型。这种方式可以直接改造现有模型,但也继承了预训练模型以独立动作块为单位进行训练的目标设定。
下一步自然是按照分块因果的形式,从头预训练视觉-语言-动作模型;这种方式有望带来进一步的性能提升。
流式缓冲区还需要在每个回合开始时执行一次冷启动,即完成固定数量的预热步数。在持续数秒的完整运行过程中,这部分成本很快就能摊薄;但对于极短任务,其影响会更加明显。
致谢
作者衷心感谢 Xiaolong Wang 教授的实验室提供 Franka 机械臂。
真实世界实验设置
微调后的模型部署在 RTX A4000 上,控制频率为 30 Hz。所有方法均采用相同的 CUDA Graph 和内核融合系统优化。
执行时域设为 16;对于所有异步方法,异步延迟均设为 2 步。每项任务的得分取 15 次运行的平均值,而完成时间仅在成功运行中取平均。
常见问题
什么是 FlashVLA? FlashVLA 是一种流式动作解码方法,用于实现更快速的异步视觉-语言-动作推理。
FlashVLA 如何适配预训练模型? 它在标准下游微调阶段采用多缓冲区联合微调。
真实世界部署使用了什么机器人硬件? 系统部署在一台 7 自由度 Franka 机械臂上,配备单块 RTX A4000 GPU,控制频率为 30 Hz。
流式缓冲区会带来什么限制? 流式缓冲区要求每个回合开始时进行一次冷启动预热;对于极短任务,这一开销会更加明显。
