BadWAM: When World-Action Models Dream Right but Act Wrong

발행일
출처
arXiv
논문 번호
654
분야
Machine Learning
arXiv 번호
2607.15207

로봇의 '상상'과 '행동'이 분리되는 취약점을 발견하고, 작은 영상 교란만으로 로봇이 상상은 제대로 하면서 행동은 실패하게 만드는 공격 프레임워크를 제시한 논문이다.

이 논문은 한마디로 세계-행동 모델(WAM)의 치명적 취약점을 폭로한 연구다. WAM은 로봇이 미래를 상상하고 그에 맞춰 행동하는 구조인데, 작은 영상 교란만으로 '상상은 정상'인 채 '행동만 엉뚱하게' 만들 수 있다. 행동만 망가뜨리는 공격은 성공률을 96.5%에서 43.1%로 떨어뜨린다. 더 위험한 것은 상상까지 보존하는 은밀 공격으로, 안전 모니터가 미래 영상을 봐도 이상을 감지하기 어렵다.

핵심 요약

  • WAM(세계-행동 모델)의 '상상'과 '행동'이 분리될 수 있다는 새로운 취약점을 최초로 발견했다.
  • 행동만 공격하는 방식은 로봇 작업 성공률을 96.5%에서 43.1%로, 절반 이하로 떨어뜨린다.
  • 상상은 보존하면서 행동만 조용히 왜곡하는 '은밀 공격'을 설계해, 기존 안전 모니터가 무력화됨을 보였다.
  • 공격이 한 WAM 변형에서 다른 변형으로 전이되며, 이 취약점이 특정 구현의 문제가 아님을 확인했다.
  • 간단한 전처리 방어로는 부족하며, 행동-상상 동기화를 직접 검사하는 새로운 안전 접근이 필요함을 시사한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)