WALL-WM: Carving World Action Modeling at the Event Joints

발행일
출처
arXiv
논문 번호
351
분야
Robotics
arXiv 번호
2606.01955

고정 길이 청크 대신 의미적 행동 이벤트를 학습 원자 단위로 사용하여 비디오-행동 학습의 정합성을 높인 월드 액션 모델 WALL-WM을 제안한다.

기존 WAM은 고정 길이 행동 청크를 최적화 단위로 사용해 언어·비전·행동의 시간적 해상도 불일치 문제가 있었다. WALL-WM은 도달·파지·이동 등 의미적으로 응집된 행동 이벤트를 원자 단위로 삼아 event-grounded VLA 사전학습을 수행한다. Event mode(가변 길이 실행)와 Unified mode(Staircase Decoding 기반 고정 길이 청크) 두 가지 추론 모드를 지원하며, 대규모 실제 로봇 평가에서 SOTA를 달성했다.

핵심 요약

  • Chunk-centric에서 event-grounded 최적화로 패러다임 전환 — 언어·비디오·행동의 자연스러운 경계 정합
  • Event caption과 cluster-balanced sampling으로 구성된 데이터 생태계 구축
  • Event mode(가변 길이 이벤트 실행)와 Unified mode(Staircase Decoding 고정 청크)의 이중 추론
  • Muon optimizer 기반 대규모 사전학습 인프라로 확장 가능한 학습 레시피 제공
  • 언어·장면·태스크 전반에 걸친 강력한 일반화 능력 입증
  • 물리적 비디오 예측과 실행 가능 제어 모두에서 기존 WAM 대비 우위 확인

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)