Freeform Preference Learning for Robotic Manipulation
- 발행일
- 출처
- arXiv
- 논문 번호
- 553
- 분야
- Robotics
- arXiv 번호
- 2606.32027
자연어로 비교 축을 지정하는 자유형 선호 학습(FPL). 로봇 정책 성능을 38%p 향상시키며 테스트 시간 조향 가능.
Stanford의 FPL(Freeform Preference Learning)은 이진 선호도 대신 annotator가 자연어로 비교 축(속도, 안전성, 배치 품질 등)을 정의하고 축별 pair별 선호를 제공하는 방식이다. 언어 조건부 보상 모델이 각 축에 대한 스칼라 보상을 출력하고, 이로 다축 보상 조건부 정책을 훈련한다. 4개 실제 로봇 + 2개 시뮬레이션 장기 조작 태스크에서 희소 보상 및 이진 선호 대비 38%p 성능 향상을 달성했으며, 훈련 데이터에 없는 행동 조합(compositionality)과 테스트 시간 행동 조향(steerability)을 보여준다.
핵심 요약
- 이진 선호도의 모호성 해결: 자연어 축(속도/안전/정밀도 등)을 정의하고 축별 pair 선호 수집
- Bradley-Terry를 다차원으로 확장: 언어 라벨로 조건부된 단일 보상 모델이 축별 스칼라 보상 출력
- VLM(Qwen VL 3.5 4B) 기반 보상 모델로 시각+언어 이해를 결합한 보상 학습
- sparse reward 대비 38%p, binary preference 대비도 유의미한 성능 격차 달성
- 학습 데이터에 없는 빠른 속도+새로운 타겟 조합(compositionality) 창발
- 테스트 시간 보상 조건 변경으로 재훈련 없이 정책 행동 조향 가능(steerability)
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.