GRAIL: Generating Humanoid Loco-Manipulation from 3D Assets and Video Priors
- 발행일
- 출처
- arXiv
- 논문 번호
- 308
- 분야
- Robotics
- arXiv 번호
- 2606.05160
휴머노이드 로코-매니퓰레이션을 확장하려면 다양한 객체, 전신 동작, 장면 기하구조에 걸친 로봇 호환 시연이 필요하지만, 텔레오퍼레이션과 모션 캡처는 각 수집이 물리적 설정, 계측된 행위자, 로봇 운용에 의존하기 때문에 확장하기 어렵다.
GRAIL은 휴머노이드의 이동과 물체 조작 시연을 실제 원격 조작 없이 디지털로 만드는 파이프라인이다. 물체 모양, 카메라, 실제 크기, 장면 깊이와 로봇 체형이 알려진 3D 장면에서 영상 생성 모델로 상호작용을 만든 뒤, 이를 미터 단위의 4D 사람-물체 궤적으로 복원한다. 복원 동작을 Unitree G1에 맞추고 물체 조작용 추적기와 지형 이동용 추적기를 학습해 2만 개가 넘는 시퀀스를 만들었다. 이 합성 자료만으로 학습한 시각 정책은 실제 로봇에서 다양한 물체 집기 84%, 계단 오르기 90%의 성공률을 냈다. 다만 3D 자산과 준비된 시뮬레이션 장면이 필요하고, 심한 가림이나 빠른 움직임, 영상 속 물체 외관의 불일치에서는 복원 품질이 떨어진다.
핵심 요약
- 이 특권적 설정은 4D 복원을 더 잘 조건화하여, 모델 기반 객체 추적, 인간 동작 추정, 상호작용 인식 최적화가 깊이 모호성과 형태 불일치를 줄이면서 미터법 4D 인간-객체 상호작용(HOI) 궤적을 재구성할 수 있게 한다.
- 저자들은 복원된 동작을 휴머노이드 로봇에 리타깃팅하고, 상호 보완적인 범용 작업 추적기를 학습한다. 즉, 조작을 위한 객체 인식 잠재 적응기와 지형 횡단을 위한 장면 인식 추적기다.
- GRAIL이 생성한 데이터만 사용하여, sim-to-real 파이프라인을 통해 자기중심 시각 정책을 학습하고 이를 Unitree G1 휴머노이드에 배포하여, 다양한 객체 집기에서 84%, 계단 오르기에서 90%의 실세계 성공률을 달성한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.