World Action Models Enable Continual Imitation Learning with Recurrent Generative Replays
- 발행일
- 출처
- arXiv
- 논문 번호
- 519
- 분야
- Robotics
- arXiv 번호
- 2606.27374
World Action Model의 생성 능력을 활용해 저장된 과거 데모 없이도 파멸적 망각을 완화하는 REGEN continual learning 프레임워크.
REGEN은 World Action Model(WAM)의 미래 관측 생성 능력을 활용해 과거 과제의 pseudo-replay 궤적을 합성하는 최초의 continual imitation learning 프레임워크다. 새 과제 학습 시 WAM에게 이전 과제의 언어 지시와 현재 관측을 조건으로 주고, 생성된 미래 프레임을 재귀적으로 재입력하여 완성된 궤적을 만든다. 이를 새 과제 데이터와 함께 훈련해 순차 미세조정 대비 최대 50% 망각을 감소시킨다. 다만 장기 horizon에서의 시각적 열화와 action-observation 간 불일치가 주요 병목으로 확인되었다.
핵심 요약
- WAM의 생성 능력(reconstructed future frames)을 pseudo-replay에 활용하는 최초의 continual imitation learning 접근
- 순차 미세조정(seq-FT) 대비 파멸적 망각을 최대 50% 감소시키며, 실제 demonstration에 접근하는 experience replay에 근접
- 재귀적 생성: WAM이 예측한 미래 관측을 다시 입력으로 feed back하여 완전한 궤적을 합성 (recurrent generative replay)
- 실제 로봇 환경에서도 유효: NBT 96.3→60.5 (40% 망각 감소), FWT 50→80으로 forward transfer도 개선
- 주요 병목 규명: (1) 장기 horizon 재귀 생성에서의 시각 품질 저하 (PSNR 감소), (2) 예측 관측과 action 간 불일치 (imagined 83% vs grounded 42%)
- Action representation drift 측정: REGEN(0.12)이 Seq-FT(0.30) 대비 현저히 낮은 drift로 표현 보존 확인
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.