Masked Visual Actions for Unified World Modeling

발행일
출처
arXiv
논문 번호
681
분야
Computer Vision
arXiv 번호
2607.19343

로봇 동작을 '픽셀 단위 마스크'로 표현해서, 하나의 비디오 모델이 정방향(로봇→장면)과 역방향(목표 물체→로봇) 시뮬레이션을 모두 할 수 있게 만든 논문.

이 논문은 한마디로 로봇 동작을 비디오 픽셀 위에 마스크로 그려 넣어, 하나의 비디오 모델이 로봇 동작의 결과를 예측(정방향)하거나 원하는 물체 움직임으로부터 로봇 동작을 찾아내(역방향)도록 만든 연구다. 기존에는 로봇 동작을 저차원 벡터(관절 각도 등)로 전달했는데, 이는 로봇 형태마다 따로 학습해야 하는 문제가 있었다. 저자들은 사전 학습된 비디오 모델을 15시간 분량의 마스크 예시로만 미세조정해서, 서로 다른 로봇 형태에서도 잘 작동하는 단일 체크포인트를 얻었다. 시뮬레이션과 실제 환경 모두에서 정책 평가(r=0.982 상관), 모델 기반 계획, 역모델링(90% 성공률)을 검증했다.

핵심 요약

  • 로봇 동작을 픽셀 단위 마스크로 표현하는 'Masked Visual Actions' 인터페이스를 제안했다.
  • 하나의 체크포인트로 정방향 시뮬레이션과 역방향 동작 생성을 모두 지원한다.
  • 실제 로봇 데이터 15시간 분량만으로 미세조정해도 다양한 환경과 로봇 형태에서 잘 작동한다.
  • 비디오 모델이 상상한 롤아웃이 실제 실행 결과와 r=0.982로 강한 상관을 보였다.
  • 역방향 모델로 원하는 물체 움직임을 주면 로봇 동작을 합성해내며, 90% 성공률을 달성했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)