World-Language-Action Model for Unified World Modeling, Language Reasoning, and Action Synthesis
- 발행일
- 출처
- arXiv
- 논문 번호
- 352
- 분야
- Robotics
- arXiv 번호
- 2606.05979
월드 모델링, 언어 추론, 행동 합성을 단일 autoregressive transformer로 통합한 WLA(World-Language-Action) 모델 클래스를 제안한다.
WLA는 텍스트 지시·이미지·로봇 상태를 입력받아 텍스트 하위 작업과 물리 역학을 예측한 뒤 실행 가능한 행동을 생성하는 새로운 embodied foundation model이다. 기존 WAM의 bidirectional diffusion transformer와 달리 AR transformer 백본을 사용해 언어 생성 능력을 보존하며, World Expert와 Action Expert의 이중 구조로 미래 상태 예측이 행동 생성을 암시적으로 안내한다. WLA-0(2B 활성 파라미터)는 RTX 5090에서 40ms 추론으로 RoboTwin2.0 Clean 92.94%, RMBench 56.5%를 달성하고, 행동 주석 없는 타 로봇 영상에서도 새 태스크를 학습한다.
핵심 요약
- WAM의 미래 상태 예측과 VLA의 언어 추론을 단일 AR transformer로 통합
- World Expert(시각 예측)와 Action Expert(행동 생성)의 메타-쿼리 기반 이중 구조
- World Expert는 추론 시 비활성화 가능 — 40ms 추론으로 실시간 제어 가능
- Test-time scaling으로 로봇 제어 정확도를 추가로 향상
- RoboTwin2.0 Clean 92.94%, RMBench 56.5%로 SOTA 달성
- Cross-embodiment 영상에서 행동 주석 없이 새 태스크 학습 가능 — 확장 가능한 로봇 학습 방향
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.