더 빠른 비동기 VLA 제어를 위한 로봇 동작 스트리밍, FlashVLA

더 빠른 비동기 VLA 제어를 위한 로봇 동작 스트리밍, FlashVLA

Zekai Li, Jiaming Tang, Zhijian Liu

2 분 읽기2026년 8월 28일

멀티 버퍼 공동 파인튜닝

사전 학습된 비전-언어-행동 모델은 각 청크를 서로 독립적으로, 매번 처음부터 노이즈 제거하도록 학습된다. 따라서 일부만 채워진 버퍼나 청크 단위의 인과적 어텐션 패턴을 접해 본 적이 없다. FlashVLA는 일반적인 다운스트림 파인튜닝 단계에서 이러한 모델을 스트리밍 방식에 맞게 조정한다.

학습 목표는 모든 버퍼 구성에 대해 합산한 표준 플로 매칭 손실이다.

모델은 버퍼 내용과 노이즈 수준의 가능한 모든 조합에서 플로 매칭 손실을 최소화한다.

이 하나의 목적 함수로 콜드 스타트와 안정적인 스트리밍 동작을 모두 다룰 수 있다. 즉, 모델은 유효한 버퍼 프리픽스라면 무엇이든 조건으로 삼아 어떤 노이즈 수준의 청크도 디노이즈하도록 학습한다.

FlashVLA 멀티 버퍼 학습 과정

실제 환경 배포

FlashVLA는 단일 RTX A4000 GPU와 7자유도 Franka 로봇 팔에 배포했다. 시뮬레이션에서 확인한 지연 시간 단축과 비동기 연속성의 이점이 30Hz 제어 주기로 작동하는 실제 로봇에서도 재현되는지 평가했다.

FlashVLA 비동기 추론 파이프라인

결론

FlashVLA는 멀티 버퍼 공동 파인튜닝을 통해 사전 학습된 비전-언어-행동 모델을 조정한다. 따라서 기존 모델에 바로 적용할 수 있지만, 사전 학습 모델이 가진 청크별 독립 학습 목표 역시 그대로 물려받는다.

비전-언어-행동 모델을 처음부터 청크 단위 인과적 구조로 사전 학습하는 것은 자연스러운 다음 단계이며, 추가적인 성능 향상으로 이어질 가능성이 크다.

또한 스트리밍 버퍼는 각 에피소드마다 고정된 수의 워밍업 스텝을 한 번 콜드 스타트해야 한다. 수 초 길이의 롤아웃에서는 이 비용이 빠르게 상쇄되지만, 매우 짧은 작업에서는 더 두드러진다.

감사의 글

Franka 로봇 팔을 제공해 주신 Xiaolong Wang 교수 연구실에 진심으로 감사드린다.

실제 환경 실험 설정

파인튜닝한 모델은 RTX A4000에서 30Hz 제어 주기로 실행했다. 모든 방법에 동일한 CUDA Graph 및 커널 퓨전 시스템 최적화를 적용했다.

실행 호라이즌은 16으로 설정했으며, 모든 비동기 방법의 비동기 지연은 2스텝으로 설정했다. 각 작업의 점수는 15회 롤아웃의 평균으로 계산했고, 완료 시간은 성공한 롤아웃만 대상으로 평균을 냈다.

자주 묻는 질문

FlashVLA란 무엇인가? FlashVLA는 더 빠른 비동기 비전-언어-행동 추론을 위한 스트리밍 동작 디코딩 방식이다.

FlashVLA는 사전 학습 모델에 어떻게 적용되는가? 일반적인 다운스트림 파인튜닝 단계에서 멀티 버퍼 공동 파인튜닝을 수행한다.

실제 환경 배포에는 어떤 로봇 하드웨어를 사용했는가? 30Hz 제어 주기로 작동하는 7자유도 Franka 로봇 팔과 단일 RTX A4000 GPU에 시스템을 배포했다.

스트리밍 버퍼에는 어떤 한계가 있는가? 스트리밍 버퍼는 에피소드마다 한 번 콜드 스타트 워밍업을 거쳐야 하므로, 매우 짧은 작업에서는 그 비용이 더 크게 느껴진다.

🍪 쿠키 환경설정

성능 측정을 위해 쿠키를 사용합니다. 개인정보 처리방침