Latent Action as Intention Enables Efficient Future Imagination for World Action Models

발행일
출처
arXiv
논문 번호
1008
분야
Robotics
arXiv 번호
2608.24882

이 논문은 로봇 세계행동모델이 미래 영상을 직접 그리는 대신 압축된 잠재 행동으로 의도만 떠올리게 바꿔, 성능은 지키면서 추론 시간을 크게 줄였다.

이 논문은 한마디로 '미래를 영상 대신 압축된 신호로 상상하는 로봇 정책'이다. 미래 관측을 생성하는 방식은 일반화에 도움이 되지만 매번 영상을 만들어야 해서 느리고, 이를 생략한 방식은 빠르지만 일반화가 떨어졌다. LAWA는 영상의 변화를 이산 토큰으로 압축한 잠재 행동을 미래 의도로 삼고, 이 잠재 상태와 실행할 행동 묶음을 함께 잡음 제거하면서 추론 때는 미래 영상 가지를 떼어낸다. RoboCasa에서 학습 궤적의 10%만 쓴 조건에서 평균 성공률 65.6%, 전체 데이터에서 80.8%를 기록해 같은 조건의 Fast-WAM보다 각각 9.6점과 4.5점 높았다. 행동 묶음 하나를 만드는 시간은 338.5ms로, 미래 영상을 그리는 Joint-WAM의 593.1ms보다 42.9% 짧았다.

핵심 요약

  • SAM 2가 자동으로 만든 마스크로 손과 조작기 주변을 강조하도록 학습시킨 이산 잠재 행동 토크나이저가 영상의 변화를 압축해 미래 의도를 만든다.
  • 학습할 때는 영상과 잠재 행동과 행동 전문가를 함께 학습시키되, 추론할 때는 미래 영상 가지를 빼고 잠재 의도와 행동 묶음만 함께 잡음 제거한다.
  • RoboCasa 평균 성공률이 소량 데이터에서 65.6%, 전체 데이터에서 80.8%로 같은 조건의 Fast-WAM보다 9.6점과 4.5점 높았고, LIBERO-Plus에서는 추가 학습 없이 74.4%를 기록해 Joint-WAM보다 4.0점 높았다.
  • 행동 묶음 하나당 338.5ms로 Joint-WAM의 593.1ms보다 42.9% 빨라, 지연이 곧 실패로 이어지는 실제 로봇 제어에 쓰기 유리하다.
  • 다만 속도만 보면 미래 상상을 아예 버린 Fast-WAM의 196.5ms보다 여전히 느리고, 행동 정보가 없는 1인칭 영상으로 사전학습을 하지 않으면 잠재 행동 방식이 같은 조건의 Joint-WAM보다 오히려 약했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)