HAF: Adapting Generalist VLAs to Humanoid Whole-Body Loco-manipulation via Hierarchical Action Flow and Spectral Latent RL

발행일
출처
arXiv
논문 번호
937
분야
Robotics
arXiv 번호
2608.16837

일반 로봇 VLA를 휴머노이드 전신 작업에 맞게 단계별 행동 생성과 저차원 강화학습으로 바꾸는 HAF를 제안했다.

이 논문은 한마디로 영상과 언어를 보고 행동을 내는 범용 VLA를 휴머노이드의 이동과 양팔 조작에 맞게 바꾸는 HAF를 제안한다. HAF-VLA는 머리와 이동, 허리, 양팔 조작 순서로 행동 공간을 넓히며 세 단계에서 전신 동작을 만든다. HAF-Steer는 큰 VLA를 고정한 채 행동 잡음을 시간 주파수 성분 8개로 압축하고, 행동 복제와 실제 로봇 강화학습으로 이 작은 공간만 조정한다. 실제 휴머노이드 2종의 7개 장기 작업에서 단일 단계 VLA보다 높은 점수를 냈다. 다만 단계가 늘어 추론 지연이 생기고, 기본 VLA가 심하게 틀린 동작은 작은 보정만으로 고치기 어렵다.

핵심 요약

  • HAF-VLA는 머리와 이동, 허리, 양팔 조작을 세 단계로 차례로 활성화한다. 단계 표시와 이전 단계의 KV 캐시를 사용해 앞선 몸동작과 뒤의 조작 동작이 이어지게 만든다.
  • HAF-Steer는 VLA가 사용하는 시간축 잡음을 이산 코사인 변환으로 압축해 앞쪽 계수 8개만 학습한다. 행동 복제로 시작한 뒤 오프라인 자료와 실제 상호작용을 섞은 SAC 강화학습을 적용하며 VLA 본체는 고정한다.
  • TienKung 2.0과 3.0에서 세탁물 넣기, 바구니 옮기기와 공 던지기 등 7개 작업을 시험했다. 작업마다 원격 조작 시연 120개를 모으고, 방법과 작업별로 10회씩 실행했다.
  • 7개 작업의 평균 진행 점수는 HAF-VLA가 70.5퍼센트로 가장 강한 비교 모델 파이0.5의 53.3퍼센트보다 높았다. 모든 작업에서 최고 또는 공동 최고 점수를 기록했다.
  • HAF-Steer는 두 과제의 기존 위치와 새 위치, 총 4개 조건에서 HAF-VLA의 성공률을 모두 높였다. 예를 들어 새 위치의 장난감 보관은 10회 중 8회 성공에서 10회 성공으로 올랐다. 다만 추가 계산 지연과 기본 VLA의 행동 범위에 묶이는 한계가 있다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)