Hydra-0: Action Flow for Generalist World Modeling and Control
- 발행일
- 출처
- arXiv
- 논문 번호
- 942
- 분야
- Robotics
- arXiv 번호
- 2608.18077
로봇 행동을 '화면 위 픽셀 움직임'으로 통일해 표현하면 여러 로봇과 사람 영상을 한 월드모델로 함께 배울 수 있다는 NVIDIA 연구다.
이 논문은 한마디로 로봇 행동을 관절 각도 대신 이미지 위 점의 움직임(액션 플로우)으로 나타내면, 서로 다른 로봇과 사람 시범 영상까지 하나의 월드모델이 함께 배울 수 있다는 연구다. 이 공통 표현 덕분에 이기종 데이터를 섞어 쓸 수 있고 카메라 시점에서 움직임의 결과를 예측할 수 있다. 순방향으로는 명령의 결과를 예측하는 시뮬레이터로, 역방향으로는 원하는 물체 움직임에서 로봇 움직임을 뽑는 제어기로 쓸 수 있다. 로봇 움직임 예측 오차는 기존 대비 90.4% 줄었고 정책 성공률 재현 상관은 0.96이었다.
핵심 요약
- 로봇 명령을 이미지 평면의 점 궤적으로 바꿔 조건으로 주면, 월드모델이 기체별 좌표계를 몰라도 움직임의 결과를 예측할 수 있다.
- 사람 1인칭 시범, 핸드그리퍼, 양팔·한팔 로봇 등 이기종 영상을 같은 표현으로 담아 하나의 범용 월드모델을 학습했다.
- 순방향 예측에서 로봇 움직임 오차 90.4%, 물체 움직임 오차 60.2% 감소했고 RoboLab 정책 5개의 성공률 재현 상관은 0.96이었다.
- 역방향 모드는 사람 시범의 물체 움직임만 보고 호환되는 로봇 움직임을 생성하고, 학습된 액션 헤드가 실행 가능한 명령으로 바꿨다.
- 오픈루프 방식의 정책 평가까지만 다뤘고 폐루프 평가는 남은 과제라고 밝혔다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.