Flash-WAM: Modality-Aware Distillation for World Action Models
- 발행일
- 출처
- arXiv
- 논문 번호
- 355
- 분야
- Machine Learning
- arXiv 번호
- 2606.05254
World-Action Model의 추론을 비디오·액션 각각 1스텝으로 압축하는 모달리티 인식 증류 프레임워크로, 8.1초 지연을 348ms로 단축하여 실시간 로봇 제어를 가능하게 한다.
World-Action Model(WAM)은 비디오와 로봇 액션을 동시에 생성하지만, 수십 단계의 디노이징으로 인해 8.1초의 청크 지연이 발생해 실시간 제어가 불가능하다. 기존 consistency distillation을 WAM에 적용하면 비디오와 액션 스트림의 서로 다른 SNR 노이즈 분포로 인해 액션 정확도가 급격히 붕괴한다(23.9%). Flash-WAM은 각 모달리티의 노이즈 regime에 맞춰 서로 다른 consistency function을 선택하는 모달리티 인식 증류를 제안한다. LingBot-VA에 적용 시 1스텝 디노이징으로 RoboTwin 2.0 85.5%, LIBERO 95.7% 성능을 유지하며 23× 속도 향상을 달성했다.
핵심 요약
- 비디오-액션 joint diffusion에서 기존 consistency distillation이 실패하는 구조적 원인 규명: 비대칭 노이즈 스케줄로 인한 gradient signal 소멸
- 모달리티별 consistency function 선택: 액션용 linear-gradient-scaling + 비디오용 variance-preserving parametrization
- 23× 속도 향상으로 per-chunk 지연을 8.1초에서 348ms로 단충, 실시간 제어 가능
- RoboTwin 2.0에서 85.5% 성공률 유지, LIBERO에서 95.7% 유지 (1v/2a 기준)
- Unitree G1 휴머노이드 실제 환경에서 60% 성공률 달성, naive LCM 24% 대비 대폭 개선
- consistency function family의 구조적 분석으로 gradient scaling의 한계를 이론적으로 규명
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.