Freeform Preference Learning for Robotic Manipulation

발행일
출처
arXiv
논문 번호
553
분야
Robotics
arXiv 번호
2606.32027

자연어로 비교 축을 지정하는 자유형 선호 학습(FPL). 로봇 정책 성능을 38%p 향상시키며 테스트 시간 조향 가능.

Stanford의 FPL(Freeform Preference Learning)은 이진 선호도 대신 annotator가 자연어로 비교 축(속도, 안전성, 배치 품질 등)을 정의하고 축별 pair별 선호를 제공하는 방식이다. 언어 조건부 보상 모델이 각 축에 대한 스칼라 보상을 출력하고, 이로 다축 보상 조건부 정책을 훈련한다. 4개 실제 로봇 + 2개 시뮬레이션 장기 조작 태스크에서 희소 보상 및 이진 선호 대비 38%p 성능 향상을 달성했으며, 훈련 데이터에 없는 행동 조합(compositionality)과 테스트 시간 행동 조향(steerability)을 보여준다.

핵심 요약

  • 이진 선호도의 모호성 해결: 자연어 축(속도/안전/정밀도 등)을 정의하고 축별 pair 선호 수집
  • Bradley-Terry를 다차원으로 확장: 언어 라벨로 조건부된 단일 보상 모델이 축별 스칼라 보상 출력
  • VLM(Qwen VL 3.5 4B) 기반 보상 모델로 시각+언어 이해를 결합한 보상 학습
  • sparse reward 대비 38%p, binary preference 대비도 유의미한 성능 격차 달성
  • 학습 데이터에 없는 빠른 속도+새로운 타겟 조합(compositionality) 창발
  • 테스트 시간 보상 조건 변경으로 재훈련 없이 정책 행동 조향 가능(steerability)

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)