H-JEPA: End-to-End Learning of Hierarchical World Models for Visual Planning
- 발행일
- 출처
- arXiv
- 논문 번호
- 1169
- 분야
- Machine Learning
- arXiv 번호
- 2610.06805
이 논문은 '여러 층으로 쌓인 세계 모델'로 긴 계획을 세워야 하는 로봇 문제를, 층마다 다른 시간 단위로 미래를 예측하게 해서 풀었다.
이 논문은 한마디로 세계 모델(환경의 변화를 배우는 모델)을 여러 층으로 쌓아서 긴 시간이 걸리는 계획을 잘 세우게 만든 연구다. 각 층은 자기만의 잠재 공간(이미지 대신 추상화된 정보 공간)에서 서로 다른 시간 폭으로 미래를 예측하고, 위층의 예측이 아래층의 목표가 되는 내려다보기식 계획을 쓴다. 그 결과 미로 찾기 과제에서 성공률이 18%에서 73%로 뛰었고, 계획을 세우는 데 쓰는 컴퓨터 자원도 줄었다. 실제 로봇 영상 데이터(DROID)에서도 더 적은 자원으로 더 정확한 계획을 세웠다.
핵심 요약
- 세계 모델을 한 층이 아니라 세 층으로 쌓아서, 각 층이 다른 시간 단위(5/10/20 스텝)로 미래를 예측하게 했다.
- 위층은 빠르게 변하는 디테일은 버리고 느리게 변하는 중요한 상태만 남겨서, 추상적인 목표와 잘 맞는 표현을 배웠다.
- 미로 찾기 시각 과제에서 3층 구조가 평평한 단층 구조보다 성공률을 18%에서 73%로 올리면서 계획 연산량은 오히려 줄였다.
- 사람이 준 보상 없이, 영상을 다시 그리는 방식도 쓰지 않고 순수하게 예측 학습만으로 이 계층 구조가 저절로 생겨났다.
- 역동역학(행동을 되찾아내는 보조 학습)을 붙이면 실제 로봇 영상 데이터셋(DROID)에서도 계층이 계획 품질을 높였다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.