FlowWAM: Optical Flow as a Unified Action Representation for World Action Models

발행일
출처
arXiv
논문 번호
619
분야
Robotics
arXiv 번호
2607.13017

광학 흐름(optical flow)을 World Action Model의 통합 액션 표현으로 사용, 로봇 조작 92.94% 달성.

FlowWAM은 optical flow를 HSV 인코딩하여 RGB와 동일 포맷의 비디오로 변환한 뒤, 공유 DiT 백본에서 RGB와 flow를 이중 스트림으로 jointly 모델링한다. Policy 모드에서는 flow를 생성하여 action expert가 실행 가능한 로봇 action으로 디코딩하고, world-model 모드에서는 target flow로 비디오 생성을 가이드한다. RoboTwin Clean 92.94%, Random 92.14% 성공률을 기록했으며 WorldArena EWMScore 63.71로 최고 성능을 달성했다. 실제 로봇 7개 과제 평균 75.7%로 pi0.5(61.4%)와 Motus(57.1%)를 능가했다. Flow 예측 품질과 성공률 간 Pearson r=-0.81의 강한 상관을 보였다.

핵심 요약

  • 광학 흐름을 RGB 영상과 같은 형식의 행동 표현으로 만들고 공유 비디오 생성기 안에서 RGB와 흐름을 함께 확산 모델링했다.
  • 정책 모드에서는 흐름으로 행동을 예측하고 월드 모델 모드에서는 목표 흐름으로 미래 영상을 안내하며, 행동 라벨 없는 영상도 사전학습에 쓴다.
  • RoboTwin 성공률은 Clean 92.94%와 Random 92.14%였고 WorldArena의 EWMScore는 63.71을 기록했다.
  • 하나의 영상 친화적 표현으로 로봇 정책과 미래 장면 예측을 연결해 대규모 일반 영상의 움직임 정보를 제어 학습에 이용할 수 있다.
  • 보고된 수치는 RoboTwin, WorldArena와 제한된 실제 로봇 과제에서 얻었으므로 다른 로봇 형태와 접촉 중심 작업의 일반성은 추가 검증이 필요하다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)