ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?

발행일
출처
arXiv
논문 번호
455
분야
Computer Vision
arXiv 번호
2606.19531

비디오 생성 대신 이미지 편집 모델을 WAM 백본으로 사용하는 로봇 정책 프레임워크. FLOPs 1/6, 지연시간 1/4로 효율성을 크게 개선한다.

ImageWAM은 이미지 편집 모델의 사전학습이 언어-지시적 시각 변환에 최적화되어 있어 로봇 정책 백본으로 비디오 생성보다 더 적합함을 보인다. 추론 시 편집 백본의 KV 캐시를 flow-matching 액션 전문가에 전달하여 실제 이미지를 디코딩하지 않고도 액션을 예측한다. LIBERO에서 98.4% 성공률을 달성하고, 실제 로봇에서 84.5% 성공률(π0 대비 +28.7pp)을 기록하면서 FLOPs는 1/6, 지연시간은 1/4(263ms vs 1081ms)로 감소시켰다.

핵심 요약

  • 비디오 생성 WAM의 3가지 한계(비용, 무관한 디테일, 오류 누적) 지적 및 이미지 편집 대안 제시
  • 편집 백본의 KV 캐시를 flow-matching action expert에 전달하여 이미지 디코딩 없이 액션 예측
  • LIBERO 98.4% 성공률, 실제 로봇 84.5% 성공률 (π0 55.8%, FastWAM 79.0% 대비 우수)
  • FLOPs 63.65→9.72 (1/6), 지연시간 1081ms→263ms (1/4) 달성
  • FLUX.2, OmniGen2, Ovis-U1 등 다양한 편집 백본 적용 가능 → 특정 모델 의존 아님
  • 어텐션 분석에서 편집 캐시가 과제 관련 변경 영역에 집중함을 확인

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)