WALL-WM: Carving World Action Modeling at the Event Joints
- 발행일
- 출처
- arXiv
- 논문 번호
- 351
- 분야
- Robotics
- arXiv 번호
- 2606.01955
고정 길이 청크 대신 의미적 행동 이벤트를 학습 원자 단위로 사용하여 비디오-행동 학습의 정합성을 높인 월드 액션 모델 WALL-WM을 제안한다.
기존 WAM은 고정 길이 행동 청크를 최적화 단위로 사용해 언어·비전·행동의 시간적 해상도 불일치 문제가 있었다. WALL-WM은 도달·파지·이동 등 의미적으로 응집된 행동 이벤트를 원자 단위로 삼아 event-grounded VLA 사전학습을 수행한다. Event mode(가변 길이 실행)와 Unified mode(Staircase Decoding 기반 고정 길이 청크) 두 가지 추론 모드를 지원하며, 대규모 실제 로봇 평가에서 SOTA를 달성했다.
핵심 요약
- Chunk-centric에서 event-grounded 최적화로 패러다임 전환 — 언어·비디오·행동의 자연스러운 경계 정합
- Event caption과 cluster-balanced sampling으로 구성된 데이터 생태계 구축
- Event mode(가변 길이 이벤트 실행)와 Unified mode(Staircase Decoding 고정 청크)의 이중 추론
- Muon optimizer 기반 대규모 사전학습 인프라로 확장 가능한 학습 레시피 제공
- 언어·장면·태스크 전반에 걸친 강력한 일반화 능력 입증
- 물리적 비디오 예측과 실행 가능 제어 모두에서 기존 WAM 대비 우위 확인
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.