Long-WAM: Scaling the Context of World-Action Models
- 발행일
- 출처
- arXiv
- 논문 번호
- 1172
- 분야
- Robotics
- arXiv 번호
- 2610.10528
로봇이 과거 영상을 길게 보면 더 잘하는데도 실시간 제어가 늦어지는 문제를, 자기회귀(앞 부분을 보고 뒤를 예측) 방식으로 영상 기반모델을 사전학습하고 시스템 최적화까지 묶어서 풀었다.
이 논문은 한마디로 로봇 팔이 '지금 눈앞 장면'만 보고 움직이던 것을 '최대 19초까지의 과거 영상'까지 활용하도록 만든 연구다. 핵심은 과거 영상을 그냥 넣어주기만 하면 소용없고, 영상 생성모델을 자기회귀(과거→미래 순서로 예측하는 방식)로 사전학습해야 과거가 실제로 도움이 된다는 발견이다. 약 1만 시간의 로봇·1인칭 영상으로 기반모델을 만들고, 여기에 스트리밍 영상 인코딩과 저정밀 양자화(숫자를 줄여 연산을 빠르게 하는 기법) 같은 시스템 기술을 더해 실시간 제어를 유지했다. 그 결과 로봇 조작 성공률이 크게 오르고(예: 63.3%→78.7%), 움직이는 컵 쌓기처럼 기존 방법이 전부 실패한 과제에서 95% 성공했다.
핵심 요약
- 과거 영상을 0초에서 19.2초로 늘리자 조작 성공률이 63.3%에서 78.7%로 올라갔다. 단, 자기회귀 방식으로 사전학습한 모델에서만 효과가 있었다.
- 1만 시간 분량의 로봇·1인칭 영상으로 '과거를 보고 미래를 예측하는' 기반모델을 먼저 만든 뒤, 로봇 동작에 적응시키는 두 단계 학습을 썼다.
- 스트리밍 인코딩과 저정밀 양자화 덕분에 소비자용 GPU에서도 행동 하나를 107.4ms 만에 생성해 실시간 제어가 가능했다.
- 움직이는 컨베이어에서 컵을 잡아 쌓는 과제에서 95% 성공했는데, 비교한 기존 방법 두 개는 20번 시도 전부 실패했다.
- 상위 계획 모델(GPT 계열)과 조합하면 전체 성공률이 31.4%에서 54.4%로 올라가, 좋은 실행기가 있어야 계획이 빛난다는 것을 보였다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.