Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models

발행일
출처
arXiv
논문 번호
846
분야
Computer Vision
arXiv 번호
2608.05903

로봇 제어용 월드-액션 모델에 '의미론적 예지(semantic foresight)'를 추가해서, 조명이 바뀌어도 로봇이 안정적으로 동작하도록 만든 방법이다.

이 논문은 한마디로 비디오 생성 모델을 로봇 제어에 쓸 때, 조명이나 색감이 바뀌어도 로봇이 안정적으로 동작하도록 '의미론적 예지'를 추가하는 간단한 post-training 방법을 제안했다. 기존 WAM은 비디오 생성 모델의 사전학습을 활용하지만 시각적 변화에 취약했다. Robust-WAM은 학습 가능한 쿼리 토큰을 추가해 DINOv3(시각적 의미를 추출하는 모델)의 특징으로 정렬한다. 이렇게 하면 로봇이 '겉모습'이 아니라 '장면의 의미'를 기준으로 행동하게 된다. 실제 로봇에서 조명 변경 시 성능 저하(OOD gap)를 22.7%p → 2.7%p로 줄였다.

핵심 요약

  • VAE 기반 세계행동 모델의 대규모 영상 사전학습은 보존하면서 외형 변화에 강한 의미 정보를 더하는 사후 학습법을 제안했다.
  • 행동 흐름에 시간 위치가 붙은 학습용 질의 토큰을 넣고 미래 장면의 DINOv3 의미 표현과 맞춰 추론 시 추가 비용을 작게 유지했다.
  • LIBERO-Plus에서 FastWAM과 GE-Act의 분포 밖 성공률을 각각 9.2%포인트와 8.6%포인트 높이면서 정상 조건 성능은 유지했다.
  • 실제 Franka 로봇의 조명 색 변경에서 GE-Act 성공률을 57.3%에서 80.0%로 높였고 여러 세계행동 구조에 같은 방식을 붙일 수 있었다.
  • 검증한 변화는 두 모의실험 벤치마크와 한 실제 로봇의 조명·색 변화 중심이어서 더 복잡한 물체·배경·동작 변화에 대한 강건성은 추가 확인이 필요하다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)