LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments

발행일
출처
arXiv
논문 번호
740
분야
Robotics
arXiv 번호
2607.23969

픽셀 영상 생성 대신 잠재 공간 예측으로 로봇 제어를 가볍게 만든 월드액션 모델이다.

LeapBot-WA는 미래 영상을 픽셀로 그리는 대신 공동임베딩 예측 구조 기반 잠재 공간에서 물리 변화를 예측하는 로봇 월드액션 모델이다. 예측 특징과 확산 모델의 분포 차이를 등방성 의미 오토인코더로 메우고, 비대칭 혼합 트랜스포머로 학습 때만 무거운 예측 분기를 쓰고 추론 때 잘라낸다. RoboTwin 2.0 91.46%, LIBERO 97.3%, LIBERO-Plus 제로샷 73.1%로 대규모 궤적 사전학습 없이 강한 성능과 시각 방해 견고성을 보인다.

핵심 요약

  • 픽셀 단위 영상 복원 대신 잠재 공간에서 추상적 물리 변화를 예측하는 방향으로 전환했다.
  • 공동임베딩 예측 구조를 월드 앵커로 써서 시각 외형이 아닌 상태 변화에 집중한다.
  • 등방성 의미 오토인코더로 예측 특징과 확산 사전분포의 불일치를 메운다.
  • 무거운 예측 분기는 학습 때만 쓰고 추론 때 잘라내 추가 비용 없이 동작한다.
  • RoboTwin 2.0 91.46%, LIBERO 97.3%로 대규모 궤적 사전학습 없이 최고 수준을 기록했다.
  • 등방성 정규화로 잠재 랭크를 38.1에서 92.3으로 올리고 성공률을 71.3%로 끌어올렸다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)