FlashVLA 流式生成机器人动作,加速异步 VLA 控制

FlashVLA 流式生成机器人动作,加速异步 VLA 控制

Zekai Li, Jiaming Tang, Zhijian Liu

1 分钟阅读2026年8月28日

多缓冲区联合微调

预训练视觉-语言-动作模型在训练时,会将每个动作块视为彼此独立的对象,从零开始逐块去噪;它们从未接触过部分填充的缓冲区,也不了解按动作块组织的因果注意力模式。FlashVLA 在标准的下游微调阶段,将这类模型适配到流式处理范式中。

训练目标是标准的流匹配损失,并对所有缓冲区配置求和。

模型会针对每一种有效的缓冲区内容组合和噪声水平,最小化流匹配损失。

这一单一目标同时覆盖冷启动和稳定流式运行:模型学会在任意噪声水平下,根据任意有效的缓冲区前缀完成动作块去噪。

FlashVLA 多缓冲区训练流程

真实世界部署

FlashVLA 部署在一台配备单块 RTX A4000 GPU 的 7 自由度 Franka 机械臂上。此次部署旨在评估:在仿真中观察到的延迟优势和异步连续性收益,能否迁移到以 30 Hz 控制频率运行的真实机器人上。

FlashVLA 异步推理流程

结论

FlashVLA 通过多缓冲区联合微调来适配预训练视觉-语言-动作模型。这种方式可以直接改造现有模型,但也继承了预训练模型以独立动作块为单位进行训练的目标设定。

下一步自然是按照分块因果的形式,从头预训练视觉-语言-动作模型;这种方式有望带来进一步的性能提升。

流式缓冲区还需要在每个回合开始时执行一次冷启动,即完成固定数量的预热步数。在持续数秒的完整运行过程中,这部分成本很快就能摊薄;但对于极短任务,其影响会更加明显。

致谢

作者衷心感谢 Xiaolong Wang 教授的实验室提供 Franka 机械臂。

真实世界实验设置

微调后的模型部署在 RTX A4000 上,控制频率为 30 Hz。所有方法均采用相同的 CUDA Graph 和内核融合系统优化。

执行时域设为 16;对于所有异步方法,异步延迟均设为 2 步。每项任务的得分取 15 次运行的平均值,而完成时间仅在成功运行中取平均。

常见问题

什么是 FlashVLA? FlashVLA 是一种流式动作解码方法,用于实现更快速的异步视觉-语言-动作推理。

FlashVLA 如何适配预训练模型? 它在标准下游微调阶段采用多缓冲区联合微调。

真实世界部署使用了什么机器人硬件? 系统部署在一台 7 自由度 Franka 机械臂上,配备单块 RTX A4000 GPU,控制频率为 30 Hz。

流式缓冲区会带来什么限制? 流式缓冲区要求每个回合开始时进行一次冷启动预热;对于极短任务,这一开销会更加明显。

🍪 Cookie 偏好设置

我们使用 Cookie 来衡量性能。 隐私政策