AHA-WAM:Asynchronous Horizon-Adaptive World-Action Modeling with Observation-Guided Context Routing

발행일
출처
arXiv
논문 번호
374
분야
Robotics
arXiv 번호
2606.09811

로봇 조작에서 비디오 world model과 action model의 시간 스케일을 분리해 저빈도 세계 계획과 고빈도 액션 실행을 비동기화하는 AHA-WAM을 제안했다. RoboTwin 92.80% 달성 및 24.17Hz 제어 주파수를 기록했다.

AHA-WAM은 기존 world-action model이 비디오 예측과 액션 실행을 같은 시간 해상도에 묶던 한계를 극복한다. Video DiT를 저빈도 world planner로, Action DiT를 고빈도 실행기로 분리해 각각의 기능에 최적화된 시간 스케일을 할당한다. Planner는 rolling KV memory로 과거 관측을 누적하고 layerwise latent context를 제공하며, Executor는 OVCR(Observation-Guided Video-Context Routing)으로 최신 관측에 맞춰 context를 동적 라우팅한다. RoboTwin 2.0에서 92.80%, 실제 로봇 태스크에서 78.3% 성공률을 달성하면서 기존 대비 4.59~10.82배 빠른 제어 주파수를 기록했다.

핵심 요약

  • Video DiT(저빈도 planner)와 Action DiT(고빈도 executor)의 비동기 분리 설계
  • Rolling KV memory로 planner의 시간적 context 누적 유지
  • OVCR로 최신 관측 기반 planner context 동적 라우팅 및 업데이트
  • Horizon-adaptive offset training으로 임의 planner-executor 위상 관계 학습
  • RoboTwin 92.80%, 실세계 78.3% 성공률로 SOTA 수준 달성
  • 최대 56.9Hz 제어 주파수로 Fast-WAM 대비 10.82배 속도 향상

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)