RepWAM: World Action Modeling with Representation Visual-Action Tokenizers
- 발행일
- 출처
- arXiv
- 논문 번호
- 416
- 분야
- Computer Vision
- arXiv 번호
- 2606.13674
WAM의 시각 latent를 시각 기반 모델과 정렬하고 잠재 행동 토큰을 결합한 representation-centric world action model이다.
RepWAM은 기존 WAM이 영상 생성 모델의 reconstruction-oriented tokenizer를 그대로 가져오는 한계를 지적하며, 시각 기반 모델(DINOv2)과 정렬된 semantic visual tokenizer와 이와 짝을 이루는 latent action tokenizer를 제안한다. 이를 바탕으로 flow matching으로 미래 시각 상태와 잠재 행동을 동시에 예측하는 세계-행동 모델을 사전학습한 뒤 실제 로봇 궤적으로 적응시킨다. RoboTwin 2.0에서 Easy 89.3, Hard 88.4를 기록하며 VLA 및 WAN-pretrained WAM 기준선을 능가했다.
핵심 요약
- 기존 WAM의 reconstruction-oriented tokenizer가 조작 의미론을 놓치는 문제를 식별하고 semantic visual-action tokenizer 제안
- RepViTok: 비디오 오토인코더 latent를 DINOv2와 정렬 + 같은 공간에서 latent action을 유도하는 구조
- 2단계 학습: visual+latent action 사전학습 후 로봇 행동으로 적응이 joint prediction보다 우수함을 입증
- RoboTwin 2.0에서 Easy 86.6, Hard 83.1로 WAN2.2 VAE 기반 대비 큰 폭 향상 (Average 50 tasks)
- CFG scale 1.0에서 최고 성능 → semantic 정렬이 video CFG 의존성을 크게 줄임
- Latent action 시각화에서 LAPA 대비 조작 관련 변화에 더 집중된 패턴 관찰
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.