LARA: Latent Action Representation Alignment for Vision-Language-Action Models
- 발행일
- 출처
- arXiv
- 논문 번호
- 366
- 분야
- Computer Vision
- arXiv 번호
- 2606.07100
잠재 행동 모델(LAM)과 VLA 모델을 표현 정렬로 공동 최적화하는 LARA 프레임워크로, 로봇 학습에서 평균 ~10% 향상을 달성했다.
LARA는 잠재 행동 모델(LAM)과 비전-언어-액션(VLA) 모델 간의 표현 정렬을 통해 양방향 최적화를 가능하게 하는 플러그앤플레이 프레임워크다. LAM은 실제 행동 궤적으로 그라운딩되어 허위 시각 변화 학습을 줄이고, VLA는 LAM의 전방 동역학으로 정규화되어 기능적으로 무효한 궤적 할루시네이션을 감소시킨다. 사전학습, 포스트트레이닝, LAM 정제 세 가지 활용 방식에서 각각 ~10%, ~5%, ~15%의 성능 향상을 3개 시뮬레이션 및 1개 실제 로봇 벤치마크에서 입증했다.
핵심 요약
- LAM과 VLA를 양방향 표현 정렬 손실로 공동 최적화하여 기존 분리된 훈련 파이프라인의 한계를 극복했다
- LAM은 실제 행동 궤적으로 그라운딩되어 배경 및 조명 등 허위 시각 변화 학습을 억제한다
- VLA는 LAM의 전방 동역학 예측으로 정규화되어 운동학적으로 가능하나 기능적으로 오류인 궤적 할루시네이션을 감소시킨다
- DiT 레이어 L-2에서 정렬 삽입이 최적이며 심층부에서의 정렬이 효과적임을 확인했다
- 3개 시뮬레이션 벤치마크와 실제 로봇 조작 환경에서 일관된 성능 향상을 달성했다
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.