In-Context World Modeling for Robotic Control

발행일
출처
arXiv
논문 번호
513
분야
Robotics
arXiv 번호
2606.26025

VLA 모델이 새로운 환경(카메라 시점·로봇 형태 변경)에서 자율적으로 시스템 변수를 추론해 적응하도록 하는 in-context 세계 모델링 프레임워크 ICWM을 제안한다.

ICWM(In-Context World Modeling)은 Vision-Language-Action(VLA) 모델의 일반화 실패를 시스템 식별 문제로 재구성한다. 로봇이 과제 수행 전 짧은 무작위 탐색 동작을 수행하고 그 결과 시각 전환을 컨텍스트로 prepend하면, 모델이 암묵적으로 현재 시스템 구성(카메라 시점, 형태학 등)을 추론하여 파라미터 업데이트 없이 적응한다. 시뮬레이션과 실제 로봇 실험 모두에서 ICWM은 표준 VLA 대비 새로운 카메라 시점에서 큰 성능 향상을 보였으며, 의미론적 장면 변화와 로봇 형태학적 변경으로도 일반화된다. 핵심은 컨텍스트 윈도우를 '무엇을 할 것인가'가 아닌 '시스템이 어떻게 작동하는가'를 이해하는 데 사용한다는 점이다.

핵심 요약

  • VLA 정식화에서 누락된 시스템 구성 ψ(카메라 시점·형태학)를 컨텍스트로 복원하는 문제 정식화
  • 과제 독립적 무작위 탐색 클립 N개(보통 3~5개)를 컨텍스트로 prepend해 파라미터 업데이트 없이 시스템 동역학 암묵 추론
  • 6개 OOD 시점 평균 성공률 25.0% (Multi-View 기준 19.8% 대비 +5.2pp); 잘못된 컨텍스트는 오히려 성능을 18.9%로 저하시켜 모델이 실제로 컨텍스트에 의존함을 입증
  • 로봇 그리퍼에 20~80mm 스페이서 부착(형태학 변경) 시 MV 기준 5.6%에서 ICWM 14.4%로 +60% 마진 유지
  • KV 캐싱으로 컨텍스트 hidden state 재사용 시 추론 지연을 기준선(0.112s) 수준으로 회복 가능
  • 이 컨텍스트 적응 능력은 표준 모방 학습에서 자연 발생하지 않으며 명시적 훈련 인센티브가 필요함

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)