ABot-M0.5: Unified Mobility-and-Manipulation World Action Model

발행일
출처
arXiv
논문 번호
538
분야
Computer Vision
arXiv 번호
2607.00678

이동 조작 로봇을 위한 세계-행동 모델. 시간 해상도·행동 공간·학습-추론 정합을 3단 정렬하여 듀얼 MoT 구조와 dream-forcing 학습으로 장시간 모바일 조작 및 정밀 제어를 달성한다.

ABot-M0.5는 이동 조작(mobile manipulation)의 구조적 한계를 해결하기 위해 시간 해상도, 행동 공간, 학습-추론 일관성 세 축에서 정렬을 맞춘 세계-행동 모델(WAM)이다. 중간 잠재 행동(latent action)으로 비디오와 로봇 제어 사이의 해상도 간극을 메우고, 듀얼 레벨 Mixture-of-Transformers로 베이스 이동과 팔 조작의 행동 공간을 분리하며, Dream Forcing 학습으로 모델 예측 비디오 상에서 역동학을 훈련해 추론 시의 오류 누적을 줄인다. RoboCasa365·RoboTwin·LIBERO 등에서 SOTA를 달성했으며, 실제 로봇(6-DoF Agilex Piper)에서 페그 삽입 70% 성공률, 장시간 조작 과제 60~80% 성공률을 기록했다.

핵심 요약

  • 3대 구조적 병목 식별: 시간 해상도 불일치(거친 비디오 vs 세밀한 제어), 행동 공간 불일치(네비게이션 vs 매니퓰레이션), 학습-추론 맥락 불일치
  • 중간 잠재 행동(latent action) 도입: 비디오 잠재표현과 embodiment-specific 제어 사이 브릿지 역할, local visual state transition 포착
  • Dual-level Mixture-of-Transformers: 모달리티 표현과 이질적 행동 부분공간(베이스 이동/팔 조작)을 분리하여 각각 최적화
  • Dream Forcing: 모델이 예측한(dream) 비디오로 역동학 학습 → autoregressive 추론과 훈련 조건 정합, 장시간 롤아웃 오류 누적 감소
  • RoboCasa365 모바일 조작 90.8%/75.4%/58.4%(난이도별), 실제 로봇 페그 삽입 70% 성공률/96% 프로세스 점수 (대비 pi0.5: 50%/90%, Fast-WAM: 30%/77%)
  • 실제 로봇 장시간 과제(접시 정렬, 과일 정렬, 꽃꽂이 등) 60~80% 성공률, Fast-WAM(20~40%) 대비 큰 폭 향상

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)