OpenWAM: An Open, Modular Exploration Towards Systematic World-Action Model Pretraining

발행일
출처
arXiv
논문 번호
1075
분야
Robotics
arXiv 번호
2609.07398

OpenWAM은 영상 생성 지식을 로봇 행동 학습에 옮기는 설계 요소를 모듈로 나누어 비교할 수 있게 만든 공개 연구 체계다.

세계와 행동을 함께 배우는 로봇 모델은 여러 구성 요소가 밀접하게 연결되어 있어 어떤 설계가 성능을 높이는지 구분하기 어렵다. OpenWAM은 모델 구조와 시각 표현, 정보 흐름, 학습과 평가 절차를 조합 가능한 모듈로 분리한다. 통제 실험에서는 충분한 생성 모델 능력, 정보가 풍부한 압축 표현, 행동 전용 용량과 명시적인 정보 전달이 중요하다고 보고한다. 이 원칙을 적용한 OpenWAM-alpha는 약 6,400시간의 사람 시점 영상과 로봇 데이터로 사전 학습되었으며 시뮬레이션과 실제 로봇에서 평가되었다. 공개된 초록의 결과는 시험한 조작 환경에 대한 근거이므로 모든 로봇이나 물리 환경에서 같은 성능을 보장하는 것으로 해석해서는 안 된다.

핵심 요약

  • OpenWAM-Infra는 세계와 행동 모델의 설계 공간을 모듈로 나누고 학습, 추론, 배포와 평가 절차를 통합한다.
  • 통제 실험을 통해 생성 모델과 압축 표현의 역할, 세계 예측에서 행동으로 전달되는 정보, 공동 학습의 효과를 구분해 조사한다.
  • 약 6,400시간의 사람 시점 및 로봇 데이터로 학습한 모델을 여덟 시뮬레이션 벤치마크와 실제 로봇 조작 실험에서 평가했다.
  • 설계와 평가 조건을 공유하므로 개별 구성 요소를 바꾸어 성능 차이를 재현하고 로봇 학습 방법을 비교하는 데 활용할 수 있다.
  • 확인한 초록의 성능 주장은 평가한 단일 팔, 양팔과 손 조작 환경에 한정되며 모든 로봇 환경에 대한 검증 결과는 아니다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)