FlashVLA: Streaming Action Decoding for Fast and Asynchronous VLA Inference
- 발행일
- 출처
- arXiv
- 논문 번호
- 1032
- 분야
- Robotics
- arXiv 번호
- 2608.27384
로봇 VLA 모델의 동작 디코딩을 스트리밍 방식으로 바꿔 매번 추론마다 실행 가능한 동작을 계속 뽑아내게 한 기법. 단일 GPU에서 30Hz 제어를 달성했다.
이 논문은 한마디로 로봇 제어 모델(VLA)의 느린 동작 생성을 스트리밍 디코딩으로 바꿔 속도와 부드러움을 동시에 잡은 FlashVLA다. 기존 flow-matching VLA는 동작 덩어리 하나를 만들 때마다 순차 디노이징(잡음 제거) 10번을 반복해 추론 시간의 75%를 여기에 쓴다. FlashVLA는 서로 다른 잡음 단계의 동작 덩어리 여러 개를 버퍼에 두고 한 번의 순전파로 모두 한 단계씩 진행시켜, 매 스텝 실행 가능한 덩어리 하나를 뱉는다. 덩어리 간 인과 어텐션으로 미래 동작이 현재 궤적에 암묵적으로 맞춰져 비동기 실행도 매끄럽다. π0.5 대비 최대 2.43배 빠르고 30Hz 이상 제어를 유지하며 과제 성공률은 유지·향상됐다.
핵심 요약
- π0.5 프로파일링으로 동작 디코딩이 스텝당 추론 시간의 75%를 잡아먹는다는 사실부터 확인했다.
- 잡음 단계가 엇갈린 동작 덩어리 버퍼를 두고 한 번의 순전파로 전부 한 단계씩 디노이징하는 스트리밍 구조를 만들었다.
- 스텝당 동작 디코딩 지연이 최대 20배 줄었고 전체 파이프라인은 최대 2.43배 빨라졌다.
- 덩어리 간 인과 어텐션 덕에 별도 미래상태 예측기 없이도 비동기 실행의 시간 불일치가 사라졌다.
- LIBERO·RoboTwin 2.0·실제 Franka 실험에서 π0.5 성능을 유지·향상하며 단일 GPU 30Hz 이상 제어를 달성했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.