ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts
- 발행일
- 출처
- arXiv
- 논문 번호
- 787
- 분야
- Robotics
- arXiv 번호
- 2607.28993
로봇이 시각적 환경이 바뀌어도 안정적으로 동작하도록 만든 모델이다. 기존 월드 액션 모델이 학습 데이터와 다른 환경에서 환각(헛것)을 일으키는 문제를 해결했다.
이 논문은 한마디로 로봇 조작 AI가 시각적으로 낯선 환경에서도 잘 작동하게 만드는 방법을 제안한다. 기존 월드 액션 모델(WAM)이 학습한 환경과 다른 배경이나 조명을 만나면 학습 데이터의 장면을 환각(헛것을 봄)하는 '학습분포 환각' 현상을 처음으로 발견하고 명명했다. 이 문제를 해결하기 위해 DINOv3(시각적 특징 추출기)의 의미적 안정성을 활용해서 미래 예측과 과거 기록 검색에 모두 사용하는 ST-WAM을 설계했다. 결과적으로 LIBERO 벤치마크 98.7%, LIBERO-Plus(시각 변형)에서 기존 대비 +21.3%p 향상, 실제 로봇에서는 25.8%에서 61.5%로 성공률이 두 배 이상 뛰었다.
핵심 요약
- 기존 월드 액션 모델이 시각적으로 낯선 환경에서 학습 데이터의 장면을 환각하는 '학습분포 환각' 현상을 발견하고, 180건 검사에서 70.6%가 이 현상을 보이는 걸 확인했다.
- DINOv3 특징이 VAE 잠재 표현보다 시각 변화에 강하면서도 작업 상태를 잘 구분한다는 걸 290개 프레임 삼중항 실험으로 증명했다.
- 이중공간 미래 전문가(DSFE)로 VAE와 DINO 공간을 동시에 예측하고, 현재-닻징 의도 검색(CAIR)로 최근 DINO 기록에서 작업 관련 증거를 찾아냈다.
- LIBERO 98.7%, RoboTwin 2.0 92.8%를 달성했고, 시각 변형 환경(LIBERO-Plus)에서 기존 Fast-WAM 대비 +21.3%p, 실제 로봇 성공률을 25.8%에서 61.5%로 끌어올렸다.
- 추가 사전학습이나 작업별 주석 없이 end-to-end로 훈련되며, 추론 시 explicit 미래 생성이 필요 없어 효율적이다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.