ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts

발행일
출처
arXiv
논문 번호
787
분야
Robotics
arXiv 번호
2607.28993

로봇이 시각적 환경이 바뀌어도 안정적으로 동작하도록 만든 모델이다. 기존 월드 액션 모델이 학습 데이터와 다른 환경에서 환각(헛것)을 일으키는 문제를 해결했다.

이 논문은 한마디로 로봇 조작 AI가 시각적으로 낯선 환경에서도 잘 작동하게 만드는 방법을 제안한다. 기존 월드 액션 모델(WAM)이 학습한 환경과 다른 배경이나 조명을 만나면 학습 데이터의 장면을 환각(헛것을 봄)하는 '학습분포 환각' 현상을 처음으로 발견하고 명명했다. 이 문제를 해결하기 위해 DINOv3(시각적 특징 추출기)의 의미적 안정성을 활용해서 미래 예측과 과거 기록 검색에 모두 사용하는 ST-WAM을 설계했다. 결과적으로 LIBERO 벤치마크 98.7%, LIBERO-Plus(시각 변형)에서 기존 대비 +21.3%p 향상, 실제 로봇에서는 25.8%에서 61.5%로 성공률이 두 배 이상 뛰었다.

핵심 요약

  • 기존 월드 액션 모델이 시각적으로 낯선 환경에서 학습 데이터의 장면을 환각하는 '학습분포 환각' 현상을 발견하고, 180건 검사에서 70.6%가 이 현상을 보이는 걸 확인했다.
  • DINOv3 특징이 VAE 잠재 표현보다 시각 변화에 강하면서도 작업 상태를 잘 구분한다는 걸 290개 프레임 삼중항 실험으로 증명했다.
  • 이중공간 미래 전문가(DSFE)로 VAE와 DINO 공간을 동시에 예측하고, 현재-닻징 의도 검색(CAIR)로 최근 DINO 기록에서 작업 관련 증거를 찾아냈다.
  • LIBERO 98.7%, RoboTwin 2.0 92.8%를 달성했고, 시각 변형 환경(LIBERO-Plus)에서 기존 Fast-WAM 대비 +21.3%p, 실제 로봇 성공률을 25.8%에서 61.5%로 끌어올렸다.
  • 추가 사전학습이나 작업별 주석 없이 end-to-end로 훈련되며, 추론 시 explicit 미래 생성이 필요 없어 효율적이다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)