What Matters for Latent Actions in Robot Learning
- 발행일
- 출처
- arXiv
- 논문 번호
- 964
- 분야
- Robotics
- arXiv 번호
- 2608.19613
라벨 없는 영상에서 로봇 행동을 배우는 잠재 행동 모델(LAM)의 설계 선택 41가지를 통일된 조건에서 비교한 최초의 대규모 실증 연구다.
이 논문은 한마디로 로봇 학습용 잠재 행동 모델(LAM)의 설계 선택지 41개를 체계적으로 비교한 실증 연구다. LAM은 로봇 팔 데이터 없이 일반 영상만으로 '무엇이 어떻게 움직였는가'를 압축해 배우는 기법이다. 결론은 화려한 신기술보다 기본기가 중요했다. 원조 방법인 LAPO도 여전히 강했고, 잠재 행동 차원은 32가 최적이었다. VLM 백본을 잠재 행동으로 미리 튜닝하면 실제 로봇 성공률이 64.75%→79.25%로 크게 올랐다.
핵심 요약
- 잠재 행동 모델(LAM)의 설계 선택 41가지를 3개 시뮬레이션 벤치마크 + 실제 Franka 로봇에서 통일된 조건으로 비교했다.
- 잠재 행동 차원 32가 단일 팔/양팔 로봇 모두에서 최적이었고, 사전학습 정규화를 제대로 하면 추가 정규화는 불필요했다.
- VLM 백본을 잠재 행동으로 미리 파인튜닝하자 실제 로봇 4개 작업 성공률이 64.75%→79.25%(+14.5%p) 올랐다.
- LAM 튜닝 모델은 10k 스텝만에 85% 성공률을 찍어, 베이스라인이 40k 스텝에서 내는 성적(76.25%)을 추월하는 데이터 효율을 보였다.
- 기존 관행인 MLP 프로브 지표보다 순진한 복원(FDM) 지표가 잠재 행동 품질의 더 믿을 만한 예측자였다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.