World Action Models Enable Continual Imitation Learning with Recurrent Generative Replays

발행일
출처
arXiv
논문 번호
519
분야
Robotics
arXiv 번호
2606.27374

World Action Model의 생성 능력을 활용해 저장된 과거 데모 없이도 파멸적 망각을 완화하는 REGEN continual learning 프레임워크.

REGEN은 World Action Model(WAM)의 미래 관측 생성 능력을 활용해 과거 과제의 pseudo-replay 궤적을 합성하는 최초의 continual imitation learning 프레임워크다. 새 과제 학습 시 WAM에게 이전 과제의 언어 지시와 현재 관측을 조건으로 주고, 생성된 미래 프레임을 재귀적으로 재입력하여 완성된 궤적을 만든다. 이를 새 과제 데이터와 함께 훈련해 순차 미세조정 대비 최대 50% 망각을 감소시킨다. 다만 장기 horizon에서의 시각적 열화와 action-observation 간 불일치가 주요 병목으로 확인되었다.

핵심 요약

  • WAM의 생성 능력(reconstructed future frames)을 pseudo-replay에 활용하는 최초의 continual imitation learning 접근
  • 순차 미세조정(seq-FT) 대비 파멸적 망각을 최대 50% 감소시키며, 실제 demonstration에 접근하는 experience replay에 근접
  • 재귀적 생성: WAM이 예측한 미래 관측을 다시 입력으로 feed back하여 완전한 궤적을 합성 (recurrent generative replay)
  • 실제 로봇 환경에서도 유효: NBT 96.3→60.5 (40% 망각 감소), FWT 50→80으로 forward transfer도 개선
  • 주요 병목 규명: (1) 장기 horizon 재귀 생성에서의 시각 품질 저하 (PSNR 감소), (2) 예측 관측과 action 간 불일치 (imagined 83% vs grounded 42%)
  • Action representation drift 측정: REGEN(0.12)이 Seq-FT(0.30) 대비 현저히 낮은 drift로 표현 보존 확인

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)