H-JEPA: End-to-End Learning of Hierarchical World Models for Visual Planning

발행일
출처
arXiv
논문 번호
1169
분야
Machine Learning
arXiv 번호
2610.06805

이 논문은 '여러 층으로 쌓인 세계 모델'로 긴 계획을 세워야 하는 로봇 문제를, 층마다 다른 시간 단위로 미래를 예측하게 해서 풀었다.

이 논문은 한마디로 세계 모델(환경의 변화를 배우는 모델)을 여러 층으로 쌓아서 긴 시간이 걸리는 계획을 잘 세우게 만든 연구다. 각 층은 자기만의 잠재 공간(이미지 대신 추상화된 정보 공간)에서 서로 다른 시간 폭으로 미래를 예측하고, 위층의 예측이 아래층의 목표가 되는 내려다보기식 계획을 쓴다. 그 결과 미로 찾기 과제에서 성공률이 18%에서 73%로 뛰었고, 계획을 세우는 데 쓰는 컴퓨터 자원도 줄었다. 실제 로봇 영상 데이터(DROID)에서도 더 적은 자원으로 더 정확한 계획을 세웠다.

핵심 요약

  • 세계 모델을 한 층이 아니라 세 층으로 쌓아서, 각 층이 다른 시간 단위(5/10/20 스텝)로 미래를 예측하게 했다.
  • 위층은 빠르게 변하는 디테일은 버리고 느리게 변하는 중요한 상태만 남겨서, 추상적인 목표와 잘 맞는 표현을 배웠다.
  • 미로 찾기 시각 과제에서 3층 구조가 평평한 단층 구조보다 성공률을 18%에서 73%로 올리면서 계획 연산량은 오히려 줄였다.
  • 사람이 준 보상 없이, 영상을 다시 그리는 방식도 쓰지 않고 순수하게 예측 학습만으로 이 계층 구조가 저절로 생겨났다.
  • 역동역학(행동을 되찾아내는 보조 학습)을 붙이면 실제 로봇 영상 데이터셋(DROID)에서도 계층이 계획 품질을 높였다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)