HORIZON: Recoverability-Governed Curriculum for Physical-Domain Scaling

발행일
출처
arXiv
논문 번호
315
분야
Robotics
arXiv 번호
2606.05143

강건한 로봇 정책을 확장하려면 더 넓은 무작위화 이상이 필요한데, 물리 도메인 경험이 학습 전 과정에서 체계적이고 학습 가능한 상태로 유지되어야 하기 때문이다.

HORIZON은 로봇 강화학습에서 물리 조건을 무작정 넓히기보다 현재 정책이 실패에서 회복할 수 있는 범위 안에서 확장하는 교육 과정이다. 새 동역학이 너무 어려우면 교정에 쓸 경험을 만들지 못하고 롤아웃 전체가 실패하므로, 체크포인트와 되돌리기, 경계 조정으로 난도를 단계적으로 높인다. 4족 보행 실험에서는 마찰, 질량, 구동력 같은 물리 축마다 바로 넓힐 수 있는 정도가 달랐고 순서를 둔 학습이 필요했다. 더 많은 조건을 넣는다고 항상 강건해지는 것은 아니었으며, 핵심 조건만 조합한 구성이 일곱 조건 전체를 쓴 것보다 목표 스트레스 시험에서 더 좋았다. 다만 현재 결과는 사람이 정한 물리 조건의 보행 과제에 한정돼, 물체 조작과 시각 변화까지 넓히려면 회복 가능 경계를 새로 정의해야 한다.

핵심 요약

  • 온폴리시 학습에서 새로운 동역학은, 롤아웃을 회복 불가능한 실패로 무너뜨리는 대신 교정용 온폴리시 데이터를 생성할 만큼 현재 정책에 충분히 가깝게 유지되는 한에서만 유용하다.
  • 체화된 일반화를 위한 물리적으로 까다로운 벤치마크로 4족 보행을 사용하여, 이 논문은 HORIZON을 도입한다. 이는 현재 정책의 회복 가능 경계 안에서만 물리 도메인을 확장하는 체크포인트 기반 프런티어 커리큘럼이다.
  • 종합하면, 이 결과들은 물리 도메인 일반화를 체화된 제어를 위한 지속적 성장 문제로 규정하며, 회복 가능성을 온폴리시 확장의 조직 원리로 삼는다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)