In-Context World Modeling for Robotic Control
- 발행일
- 출처
- arXiv
- 논문 번호
- 513
- 분야
- Robotics
- arXiv 번호
- 2606.26025
VLA 모델이 새로운 환경(카메라 시점·로봇 형태 변경)에서 자율적으로 시스템 변수를 추론해 적응하도록 하는 in-context 세계 모델링 프레임워크 ICWM을 제안한다.
ICWM(In-Context World Modeling)은 Vision-Language-Action(VLA) 모델의 일반화 실패를 시스템 식별 문제로 재구성한다. 로봇이 과제 수행 전 짧은 무작위 탐색 동작을 수행하고 그 결과 시각 전환을 컨텍스트로 prepend하면, 모델이 암묵적으로 현재 시스템 구성(카메라 시점, 형태학 등)을 추론하여 파라미터 업데이트 없이 적응한다. 시뮬레이션과 실제 로봇 실험 모두에서 ICWM은 표준 VLA 대비 새로운 카메라 시점에서 큰 성능 향상을 보였으며, 의미론적 장면 변화와 로봇 형태학적 변경으로도 일반화된다. 핵심은 컨텍스트 윈도우를 '무엇을 할 것인가'가 아닌 '시스템이 어떻게 작동하는가'를 이해하는 데 사용한다는 점이다.
핵심 요약
- VLA 정식화에서 누락된 시스템 구성 ψ(카메라 시점·형태학)를 컨텍스트로 복원하는 문제 정식화
- 과제 독립적 무작위 탐색 클립 N개(보통 3~5개)를 컨텍스트로 prepend해 파라미터 업데이트 없이 시스템 동역학 암묵 추론
- 6개 OOD 시점 평균 성공률 25.0% (Multi-View 기준 19.8% 대비 +5.2pp); 잘못된 컨텍스트는 오히려 성능을 18.9%로 저하시켜 모델이 실제로 컨텍스트에 의존함을 입증
- 로봇 그리퍼에 20~80mm 스페이서 부착(형태학 변경) 시 MV 기준 5.6%에서 ICWM 14.4%로 +60% 마진 유지
- KV 캐싱으로 컨텍스트 hidden state 재사용 시 추론 지연을 기준선(0.112s) 수준으로 회복 가능
- 이 컨텍스트 적응 능력은 표준 모방 학습에서 자연 발생하지 않으며 명시적 훈련 인센티브가 필요함
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.