BadWAM: When World-Action Models Dream Right but Act Wrong
- 발행일
- 출처
- arXiv
- 논문 번호
- 654
- 분야
- Machine Learning
- arXiv 번호
- 2607.15207
로봇의 '상상'과 '행동'이 분리되는 취약점을 발견하고, 작은 영상 교란만으로 로봇이 상상은 제대로 하면서 행동은 실패하게 만드는 공격 프레임워크를 제시한 논문이다.
이 논문은 한마디로 세계-행동 모델(WAM)의 치명적 취약점을 폭로한 연구다. WAM은 로봇이 미래를 상상하고 그에 맞춰 행동하는 구조인데, 작은 영상 교란만으로 '상상은 정상'인 채 '행동만 엉뚱하게' 만들 수 있다. 행동만 망가뜨리는 공격은 성공률을 96.5%에서 43.1%로 떨어뜨린다. 더 위험한 것은 상상까지 보존하는 은밀 공격으로, 안전 모니터가 미래 영상을 봐도 이상을 감지하기 어렵다.
핵심 요약
- WAM(세계-행동 모델)의 '상상'과 '행동'이 분리될 수 있다는 새로운 취약점을 최초로 발견했다.
- 행동만 공격하는 방식은 로봇 작업 성공률을 96.5%에서 43.1%로, 절반 이하로 떨어뜨린다.
- 상상은 보존하면서 행동만 조용히 왜곡하는 '은밀 공격'을 설계해, 기존 안전 모니터가 무력화됨을 보였다.
- 공격이 한 WAM 변형에서 다른 변형으로 전이되며, 이 취약점이 특정 구현의 문제가 아님을 확인했다.
- 간단한 전처리 방어로는 부족하며, 행동-상상 동기화를 직접 검사하는 새로운 안전 접근이 필요함을 시사한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.