DynaHarness: A Dynamic Physical Harness for Self-Evolving Robot Agents

발행일
출처
arXiv
논문 번호
1160
분야
robotics
arXiv 번호
2609.40306

이 논문은 로봇이 긴 작업을 하다 실패하면 어디가 잘못됐는지 찾아 스스로 고치는 '실행 감독 장치(하네스)' 문제를 이중 뇌 구조와 실행 계약으로 풀었다.

이 논문은 한마디로 로봇 에이전트를 스스로 진화시키는 물리 실행 하네스다. 느린 뇌(LLM이 계획을 세우는 부분)과 빠른 뇌(명령을 실시간으로 감시·교정하는 부분)를 '실행 계약'으로 묶고, 실패 기록에서 잘못된 부품을 특정해 고친 뒤 회귀 테스트(고쳤는지 다시 확인하는 시험)를 통과해야 반영한다. LIBERO-Pro 벤치마크에서 얼어붙은 기본 정책은 17.5%인데 DynaHarness는 75.2%를 달성했다. 기존 능력을 재학습 없이 조립해 쓰는 접근이라 자율 실험 로봇에 바로 참고할 만하다.

핵심 요약

  • 실패를 통째로 '로봇이 나빴다'로 보지 않고 계획·실행·회복 중 어느 부분이 잘못됐는지 특정해 그 부분만 고쳤다.
  • 느린 뇌(계획)와 빠른 뇌(감시)를 시간 단위가 다른 두 층으로 나눠, 애매한 명령은 거부하고 대체 행동을 찾도록 했다.
  • 고침이 반영되기 전에 회귀 검사를 통과해야 해서, 고치다가 원래 잘 되던 기능을 망칠 위험을 막았다.
  • LIBERO-Pro 새 초기 상태 800개에서 얼어붙은 정책 17.5% 대비 75.2%를 기록해, 재학습 없이 하네스만으로 4배 이상 성능을 올렸다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)