Hydra-0: Action Flow for Generalist World Modeling and Control

발행일
출처
arXiv
논문 번호
942
분야
Robotics
arXiv 번호
2608.18077

로봇 행동을 '화면 위 픽셀 움직임'으로 통일해 표현하면 여러 로봇과 사람 영상을 한 월드모델로 함께 배울 수 있다는 NVIDIA 연구다.

이 논문은 한마디로 로봇 행동을 관절 각도 대신 이미지 위 점의 움직임(액션 플로우)으로 나타내면, 서로 다른 로봇과 사람 시범 영상까지 하나의 월드모델이 함께 배울 수 있다는 연구다. 이 공통 표현 덕분에 이기종 데이터를 섞어 쓸 수 있고 카메라 시점에서 움직임의 결과를 예측할 수 있다. 순방향으로는 명령의 결과를 예측하는 시뮬레이터로, 역방향으로는 원하는 물체 움직임에서 로봇 움직임을 뽑는 제어기로 쓸 수 있다. 로봇 움직임 예측 오차는 기존 대비 90.4% 줄었고 정책 성공률 재현 상관은 0.96이었다.

핵심 요약

  • 로봇 명령을 이미지 평면의 점 궤적으로 바꿔 조건으로 주면, 월드모델이 기체별 좌표계를 몰라도 움직임의 결과를 예측할 수 있다.
  • 사람 1인칭 시범, 핸드그리퍼, 양팔·한팔 로봇 등 이기종 영상을 같은 표현으로 담아 하나의 범용 월드모델을 학습했다.
  • 순방향 예측에서 로봇 움직임 오차 90.4%, 물체 움직임 오차 60.2% 감소했고 RoboLab 정책 5개의 성공률 재현 상관은 0.96이었다.
  • 역방향 모드는 사람 시범의 물체 움직임만 보고 호환되는 로봇 움직임을 생성하고, 학습된 액션 헤드가 실행 가능한 명령으로 바꿨다.
  • 오픈루프 방식의 정책 평가까지만 다뤘고 폐루프 평가는 남은 과제라고 밝혔다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)