Agent Priors-guided Policy Learning

발행일
출처
arXiv
논문 번호
1133
분야
Robotics
arXiv 번호
2609.35690

로봇이 배운 기술을 새 상황에서 재조합할 때, 각 기술이 '어디서 통하는지'를 알려주는 구조적 사전(prior)을 훈련과 실행 양쪽에 함께 쓰는 방법을 제안한 논문이다.

이 논문은 한마디로 로봇 기술 라이브러리의 '적용 범위' 정보를 훈련에 심어서 작업 조합 성공률을 끌어올렸다. 기존에는 기술 이름이나 설명만으로 상위 에이전트가 기술을 골랐지만, 그 기술이 실제로 어디서 작동하는지 정보가 사라졌다. 저자들은 각 기술마다 '무엇에 의존하는 행동인지'를 알려주는 구조적 사전(예: 집기 동작은 물체 기준 좌표만 본다)을 여러 개 제안하고, 사전마다 정책을 따로 훈련해 검증한다. 실행 시점의 에이전트는 이 문서를 읽고 상황에 맞는 정책을 골라 이어 붙인다. MetaWorld와 ManiSkill에서 처음 보는 상황에서도 기술이 잘 통했고, 본 적 없는 기술 조합까지 성공시켰다.

핵심 요약

  • 기술의 구조적 사전을 훈련용 유도 편향과 실행 에이전트용 설명 문서로 동시에 썼다.
  • 하나의 기술에 대해 여러 사전을 제안하고, 사전마다 확산 정책(diffusion policy)을 따로 훈련·검증했다.
  • 실행 에이전트가 사전·인계 조건·검증 증거를 읽고 정책을 골라 최대 300스텝 단위로 호출하게 했다.
  • MetaWorld·ManiSkill에서 학습 분포 밖 상황의 기술 일반화가 좋아졌고 본 적 없는 기술 조합도 성공했다.
  • 사전 정보를 없애는 비교 실험에서 성능이 크게 떨어져, 이 인터페이스가 핵심임을 확인했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)