MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models
- 발행일
- 출처
- arXiv
- 논문 번호
- 408
- 분야
- Computer Vision
- arXiv 번호
- 2606.13515
World Action Model에 마스크를 입력과 예측 양쪽으로 통합한 MaskWAM. LIBERO 98.4%, RoboTwin 92.2%, 실제 로봇에서 언어 모호 작업 84.9% 성공률로 기존 최고 baseline 대비 33.2% 앞선다.
MaskWAM은 비디오 예측 기반 로봇 제어(World Action Model)의 공간적 병목을 해결하기 위해 마스크를 입력과 출력 양쪽으로 통합한다. 미래 마스크 예측은 객체 중심의 의미적 감독을 제공해 시각적 노이즈를 억제하고, 첫 프레임 마스크 시각 프롬프트는 대상 객체에 대한 정확한 공간 닻을 제공해 언어의 참조 모호성을 크게 줄인다. Mixture of Transformers(MoT) 구조로 RGB·마스크·액션을 jointly 예측하며, LIBERO 98.4%, RoboTwin 92.2%를 달성했다. 언어가 모호한 실제 작업에서 84.9% 성공률로 가장 강한 baseline 대비 33.2% 우위를 보였다.
핵심 요약
- 마스크를 입력(첫 프레임 시각 프롬프트)과 출력(미래 마스크 예측) 양쪽으로 통합
- 미래 마스크 예측이 객체 중심 의미 감독을 제공해 RGB-only 대비 성능 향상
- 첫 프레임 마스크 프롬프트로 언어 모호성 해결, 텍스트 좌표 프롬프트 대비 압도적 우위
- Mixture of Transformers(MoT)로 RGB·마스크·액션을 unified flow-matching으로 jointly 예측
- LIBERO 98.4%, RoboTwin 92.2% SOTA; 실제 로봇 언어 명확 작업 84.3%, 모호 작업 84.9%
- 마스크 예측 없이 프롬프트만 주면 21.6%로 급락 → 예측 목표가 시각 프롬프트 활용에 필수
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.