DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning

발행일
출처
arXiv
논문 번호
739
분야
Robotics
arXiv 번호
2607.24159

영상 예측과 행동 예측을 분리하고 물리 정보를 주입해 적은 시연으로 강한 로봇 조작 정책을 만든 연구다.

DeVA는 로봇 조작 정책 학습을 위해 영상 예측 전문가와 행동 예측 전문가를 따로 두는 분리형 구조다. 영상 백본의 여러 층 표현을 행동 쪽으로 전달하고, 물체 조작 가능 영역과 깊이 정보를 지도신호로 넣어 물리 이해를 강화한다. RoboCasa 72.0%, LIBERO 99.0%, 실제 양팔 로봇 평균 74%로 적은 데이터에서도 높은 성공률을 낸다. 통합 구조보다 빠르게 수렴하고 학습 데이터도 최대 20배 적게 쓴다.

핵심 요약

  • 영상 예측과 행동 예측을 별도 전문가로 분리해 정책 학습을 더 다루기 쉽게 만들었다.
  • 영상 백본 여러 층의 표현을 교차어텐션과 다리 토큰으로 행동 전문가에 전달한다.
  • 물체 조작 가능 영역과 상대 깊이를 보조 지도신호로 주입해 물리 정보를 강화한다.
  • RoboCasa 과제당 50개 시연으로 72.0% 성공, 같은 예산 대비 최대 22포인트 앞섰다.
  • 실제 양팔 로봇 3개 과제에서 평균 74%로 GR00T-N1.6(48%), Cosmos Policy(34%)를 앞섰다.
  • Cosmos-Policy보다 최대 20배 적은 학습 예제로 더 빠르게 수렴했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)