Patch Policy: Efficient Embodied Control via Dense Visual Representations
- 발행일
- 출처
- arXiv
- 논문 번호
- 666
- 분야
- Robotics
- arXiv 번호
- 2607.18236
얼려둔 ViT의 조밀한 패치 특징을 그대로 먹는 가벼운 로봇 정책으로, 거대 VLA보다 적은 파라미터로 더 잘 움직이게 만든 연구다.
로봇 정책은 보통 이미지를 벡터 하나로 눌러 담거나, 반대로 수십억 파라미터짜리 시각언어 모델을 통째로 미세조정한다. 앞은 정밀 조작에 필요한 공간 정보를 잃고, 뒤는 느리고 비싸다. Patch Policy는 사전학습 ViT의 패치 토큰을 압축 없이 그대로 정책 트랜스포머에 넣되, 프레임 안은 양방향, 프레임 사이는 인과로 막는 블록 인과 어텐션 마스크만 추가한다. 시뮬레이션 4종과 실제 로봇 3종에서 전역 특징 기반 정책 대비 40% 상대 개선, 미세조정된 OpenVLA-OFT 대비 18% 우위를 파라미터 약 0.7%로 달성했다.
핵심 요약
- 핵심 주장은 간단하다. 시각운동 정책에 필요한 것은 거대한 생성 모델이 아니라 조밀한 시각 특징 그 자체다.
- 방법은 최소 확장이다. 얼린 ViT의 패치 토큰을 모두 이어붙이고, 프레임 내부는 서로 다 보게 하고 프레임 사이만 과거로 막는 블록 인과 마스크를 쓴다.
- 정책 머리는 갈아끼울 수 있다. VQ-BeT와 Diffusion Policy 둘 다에서 동작하며 인코더는 미세조정하지 않는다.
- 결과는 시뮬레이션 4종(Push-T, LIBERO Goal, BlockPush, Cube)과 프랑카 로봇 실제 3작업에서 전역 특징 대비 40% 상대 개선이다.
- 효율이 강점이다. VQ-BeT 기반은 DINOv2 패치를 써도 추론 10.99ms, OpenVLA-OFT는 61.71ms다. 학습도 6.5 GPU시간 대 16 GPU시간이다.
- 패치를 줄이면 손해다. Push-T에서 256패치 0.69가 64패치 0.52, 1패치 0.48로 떨어져 공간 해상도가 정밀 조작의 핵심임을 보였다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.