Faster-WAM: Do World Action Models Need Deep Action Modules?
- 발행일
- 출처
- arXiv
- 논문 번호
- 794
- 분야
- AI / General
- arXiv 번호
- 2608.02365
영상 세계모델 위에 얹는 행동 예측 모듈을 30층에서 단 1층으로 줄이고도 성능을 지키는 구조 DoT와 Faster-WAM을 제안해, 추론 시간을 211.7ms에서 66.5ms로 3.2배 줄였다.
World Action Model(WAM)은 영상 세계모델 백본 위에서 로봇 행동을 예측하는데, 기존 구조는 행동 모듈의 층 수를 영상 백본과 똑같이 맞추느라 추론이 느리다. 저자들은 사전학습된 영상 트랜스포머를 표현 허브로 두고 가벼운 출력 헤드를 도킹 인터페이스로 붙이는 Dock of Transformers(DoT) 원칙을 제안했다. 이를 구현한 Faster-WAM은 30층 영상 백본에 단일 층 행동 헤드를 붙이며, 모든 영상 층의 키와 값을 합치는 KV-Fusion과 영상과 행동 사이 위치 인코딩을 맞추는 RoPE 정렬을 쓴다. 별도 로봇 사전학습 없이 LIBERO 98.5%, RoboTwin 2.0 89.17%, LIBERO-Plus 75.0%를 기록했다. 32스텝 행동 묶음 하나를 66.5ms에 내놓아 Fast-WAM의 211.7ms 대비 3.2배 빠르다.
핵심 요약
- 문제 제기는 속도다. 대표적 저지연 모델인 Fast-WAM도 행동 묶음 하나에 211.7ms가 걸려, 71.4ms인 파이제로닷파이브(VLA 모델)의 약 3배였다.
- DoT는 기존 MoT 방식이 요구하는 영상 층과 행동 층의 일대일 대응을 없앤다. 그래서 행동 헤드 깊이를 백본 깊이와 따로 정할 수 있고, 행동 헤드가 백본 전 층의 표현에 접근한다.
- LIBERO 네 개 과제 묶음 평균 98.5%로 Fast-WAM의 97.6%보다 0.9포인트 높았고, LIBERO-Long에서 2.6포인트 올랐다. 로봇 사전학습을 한 파이제로닷파이브, X-VLA, Motus보다도 높다.
- 24GB 소비자용 GPU 동일 조건 지연시간 비교에서 Faster-WAM 66.5ms, 파이제로 68.2ms, 파이제로닷파이브 71.4ms, X-VLA 105.3ms, Fast-WAM 211.7ms였다. LingBot-VA와 Motus는 메모리 초과로 측정 불가였다.
- LIBERO-Plus 분포 밖 일반화에서 75.0%로 Fast-WAM의 51.5%를 23.5포인트 앞섰다. 카메라 교란은 16.4%에서 67.9%, 센서 잡음은 37.7%에서 82.7%, 언어 교란은 68.9%에서 92.1%로 올랐다.
- 절제 실험은 49.5%에서 시작해 최종 층만 쓰는 단순 DoT 60.3%, KV-Fusion 추가 66.8%, RoPE 정렬 추가 71.3%, 텍스트 교차어텐션 제거로 75.0%까지 단계별로 올라간다. 층 혼합 신호는 중간층에 몰리되 전 층에 넓게 퍼져 있었다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.