Modality-Autoregressive World-Action Models

발행일
출처
arXiv
논문 번호
1092
분야
Robotics
arXiv 번호
2609.17524

로봇 세계-행동 모델이 미래를 RGB 영상 대신 점 궤적·DINO 특징·깊이 같은 가벼운 예측 대상을 한 개씩 순서대로 생성한 뒤 마지막에 행동을 예측하게 한 ModAR을 제안한 논문.

이 논문은 한마디로 로봇의 미래 예측 모델(WAM)이 미래 장면을 통째로 영상으로 예측하는 대신, 움직임·의미·깊이 정보를 따로 따로 순서대로 예측한 뒤 마지막에 행동을 결정하게 만든 연구다. 모달리티(정보 형태)별로 하나씩 노이즈를 제거하며 생성하고, 앞서 만든 예측을 다음 예측의 조건으로 쓴다. 처음부터 다시 훈련해 비교 실험을 하니 점 궤적·DINO 특징·깊이 예측이 성능을 확실히 끌어올렸고 RGB 영상 예측을 더하는 건 일관된 이득이 없었다. 30.1M(약 3천만) 파라미터의 작은 모델이 60억 규모 사전학습 모델(Flex-π)을 같은 데이터에서 앞질렀고(75% vs 72%), 학습 계산량은 약 20분의 1이었다.

핵심 요약

  • 미래를 여러 정보 형태로 순서대로 예측하고 행동을 마지막에 생성하는 '모달리티 자기회귀' 구조를 처음 제안했다.
  • 점 궤적(움직임), DINO 특징(의미), 깊이(기하) 예측은 성능을 올리지만 RGB 영상 예측은 일관된 이득이 없음을 밝혔다.
  • 6B 사전학습 모델 대비 약 20배 적은 학습 계산량으로 비슷하거나 더 나은 성공률(75% vs 72%)을 달성했다.
  • 양팔 로봇 실제 과제(컵 쌓기, 수건 접기, 서랍 정리)에서 기존 방식을 이겼고 사람 영상 데이터를 섞으면 더 좋아졌다.
  • 사전학습 없이 처음부터 훈련해 통제된 비교가 가능하다는 점이 이 분야 실험 설계에 주는 시사가 크다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)