FlashVLA: Streaming Action Decoding for Fast and Asynchronous VLA Inference

발행일
출처
arXiv
논문 번호
1032
분야
Robotics
arXiv 번호
2608.27384

로봇 VLA 모델의 동작 디코딩을 스트리밍 방식으로 바꿔 매번 추론마다 실행 가능한 동작을 계속 뽑아내게 한 기법. 단일 GPU에서 30Hz 제어를 달성했다.

이 논문은 한마디로 로봇 제어 모델(VLA)의 느린 동작 생성을 스트리밍 디코딩으로 바꿔 속도와 부드러움을 동시에 잡은 FlashVLA다. 기존 flow-matching VLA는 동작 덩어리 하나를 만들 때마다 순차 디노이징(잡음 제거) 10번을 반복해 추론 시간의 75%를 여기에 쓴다. FlashVLA는 서로 다른 잡음 단계의 동작 덩어리 여러 개를 버퍼에 두고 한 번의 순전파로 모두 한 단계씩 진행시켜, 매 스텝 실행 가능한 덩어리 하나를 뱉는다. 덩어리 간 인과 어텐션으로 미래 동작이 현재 궤적에 암묵적으로 맞춰져 비동기 실행도 매끄럽다. π0.5 대비 최대 2.43배 빠르고 30Hz 이상 제어를 유지하며 과제 성공률은 유지·향상됐다.

핵심 요약

  • π0.5 프로파일링으로 동작 디코딩이 스텝당 추론 시간의 75%를 잡아먹는다는 사실부터 확인했다.
  • 잡음 단계가 엇갈린 동작 덩어리 버퍼를 두고 한 번의 순전파로 전부 한 단계씩 디노이징하는 스트리밍 구조를 만들었다.
  • 스텝당 동작 디코딩 지연이 최대 20배 줄었고 전체 파이프라인은 최대 2.43배 빨라졌다.
  • 덩어리 간 인과 어텐션 덕에 별도 미래상태 예측기 없이도 비동기 실행의 시간 불일치가 사라졌다.
  • LIBERO·RoboTwin 2.0·실제 Franka 실험에서 π0.5 성능을 유지·향상하며 단일 GPU 30Hz 이상 제어를 달성했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)