GigaWorld-Policy-0.5: A Faster and Stronger WAM Empowered by AutoResearch

발행일
출처
arXiv
논문 번호
630
분야
Robotics
arXiv 번호
2607.13960

로봇 정책 학습을 위한 World Action Model로, 훈련 시 미래 시각 역학을 활용하되 추론 시 액션만 디코딩하여 85ms 지연 시간을 달성한다.

GigaWorld-Policy-0.5는 World Action Model(WAM)의 효율성을 개선한 모델이다. 훈련 중에는 미래 시각 역학을 밀집 감독 신호로 활용하면서도 추론 시에는 명시적 비디오 생성을 건너뛰고 액션만 디코딩하는 action-centered 설계를 채택했다. Mixture-of-Transformers 아키텍처로 시각 역학 모델링과 액션 생성을 전문가로 분리하여 RTX 4090에서 85ms 추론 지연을 달성했으며, 혼합 AC-WM/WAM 사전 학습 전략으로 액션 표현의 전이성을 강화했다. AutoResearch 에이전트 파이프라인으로 하이퍼파라미터 탐색을 자동화하여 실제 로봇 성공률 85%를 기록했다.

핵심 요약

  • 훈련 때 미래 시각 변화와 행동을 함께 배우되 추론 때는 영상을 만들지 않고 행동만 디코딩하는 행동 중심 WAM을 사용한다.
  • AC-WM과 WAM을 섞어 사전학습하고 시각 변화와 행동 생성을 서로 다른 Transformer 전문가로 나눴다.
  • 로컬 RTX 4090 환경에서 행동 추론 지연을 85밀리초로 줄이면서 미래 시각 감독의 정책 학습 이점을 유지했다.
  • 에이전트 기반 AutoResearch로 학습 설정 탐색을 자동화해 실시간 폐루프 로봇 제어의 개발 부담을 줄일 수 있다.
  • 85밀리초 수치는 특정 RTX 4090 배포 환경에서 측정됐으므로 다른 하드웨어와 더 다양한 로봇 작업의 지연과 성능을 보장하지는 않는다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)