ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?
- 발행일
- 출처
- arXiv
- 논문 번호
- 455
- 분야
- Computer Vision
- arXiv 번호
- 2606.19531
비디오 생성 대신 이미지 편집 모델을 WAM 백본으로 사용하는 로봇 정책 프레임워크. FLOPs 1/6, 지연시간 1/4로 효율성을 크게 개선한다.
ImageWAM은 이미지 편집 모델의 사전학습이 언어-지시적 시각 변환에 최적화되어 있어 로봇 정책 백본으로 비디오 생성보다 더 적합함을 보인다. 추론 시 편집 백본의 KV 캐시를 flow-matching 액션 전문가에 전달하여 실제 이미지를 디코딩하지 않고도 액션을 예측한다. LIBERO에서 98.4% 성공률을 달성하고, 실제 로봇에서 84.5% 성공률(π0 대비 +28.7pp)을 기록하면서 FLOPs는 1/6, 지연시간은 1/4(263ms vs 1081ms)로 감소시켰다.
핵심 요약
- 비디오 생성 WAM의 3가지 한계(비용, 무관한 디테일, 오류 누적) 지적 및 이미지 편집 대안 제시
- 편집 백본의 KV 캐시를 flow-matching action expert에 전달하여 이미지 디코딩 없이 액션 예측
- LIBERO 98.4% 성공률, 실제 로봇 84.5% 성공률 (π0 55.8%, FastWAM 79.0% 대비 우수)
- FLOPs 63.65→9.72 (1/6), 지연시간 1081ms→263ms (1/4) 달성
- FLUX.2, OmniGen2, Ovis-U1 등 다양한 편집 백본 적용 가능 → 특정 모델 의존 아님
- 어텐션 분석에서 편집 캐시가 과제 관련 변경 영역에 집중함을 확인
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.