Point Tracking Improves World Action Models

발행일
출처
arXiv
논문 번호
234
분야
Robotics
arXiv 번호
2605.23856

이 연구는 디퓨전 트랜스포머 내에서 시각적 잠재 표현, 가시성을 포함한 2D 포인트 트랙, 로봇 동작을 공동으로 디노이징하여 로봇 조작 능력을 향상시키는 통합 월드-액션 모델 JOPAT를 소개한다.

JOPAT은 미래의 픽셀 모양만 예측하면 조명과 질감 같은 불필요한 변화가 로봇 동역학 학습을 방해하는 문제를 다룬다. 하나의 확산 트랜스포머에서 시각 잠재 표현, 가시성을 포함한 2차원 포인트 궤적, 로봇 행동을 함께 잡음 제거하도록 설계했다. 포인트 궤적은 물체의 이동과 가림 및 화면 밖 움직임을 명시해 픽셀 표현의 의미 정보와 상호 보완한다. LIBERO와 실제 LeRobot 작업에서 픽셀 중심 기준 모델보다 높은 성능과 데이터 효율을 보였고, 행동이 없는 영상의 움직임 지식도 제어로 옮길 수 있었다. 다만 희소한 점은 미세 변형을 놓칠 수 있고 외부 추적기의 품질에 성능이 제한되며, 20Hz를 넘는 고주파 제어와 이동 카메라에는 현재 구조가 충분히 빠르거나 적합하지 않다.

핵심 요약

  • 레지스터 토큰 r은 전역 정보 처리를 돕는 학습 가능한 토큰이다.
  • 잠재 표현만 사용하는 모델은 장기 동작에 필요한 정밀도가 부족하여, 시각적 단서가 미묘할 때 실패했다.
  • 트랙만 사용하는 모델은 어떤 객체와 상호작용해야 하는지 식별하는 데 필요한 의미적 근거가 부족했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)