RoboHarness: Memory-Driven Orchestration of Heterogeneous Robot Policies for Long-Horizon Planning
- 발행일
- 출처
- arXiv
- 논문 번호
- 677
- 분야
- Robotics
- arXiv 번호
- 2607.18060
서로 다른 방식으로 만들어진 로봇 제어 정책들을 하나의 하네스에 스킬로 감싸고, 실행 기억으로 각 정책이 잘하는 범위를 파악해 골라 쓰게 만든 프레임워크다.
긴 작업을 하는 로봇에서는 어느 한 가지 제어 방식도 전 구간을 잘하지 못한다. 시각언어행동 모델은 말귀는 잘 알아듣지만 정밀도가 떨어지고, 강화학습 정책은 학습 분포를 벗어나면 무너지고, 기호와 기하 기반 계획기는 미리 정한 추상화를 벗어나면 약하다. RoboHarness는 이렇게 따로 개발된 정책들을 재사용 가능한 에이전트 스킬로 감싸고, 여러 형태의 실행 기억과 현장 증거로 각 정책의 능력 경계를 추정해 작업을 쪼개고 배분한다. 정책을 바꿔 넘길 때 생기는 분포 불일치는 메모리 브리지가 다음 정책의 정상 동작 구간으로 로봇을 미리 데려다 놓는 방식으로 해결하며, 세 개 공개 벤치마크와 자체 500개 과제, 실제 로봇 135회 실험에서 효과를 보였다.
핵심 요약
- 긴 작업을 한 정책으로 푸는 대신, 능력 경계가 서로 다른 이질적 정책들을 조율하는 문제로 다시 정의했다.
- 기존 계획 방법은 능력 범위가 고정되고 겹치지 않는 동질적 스킬을 가정하지만, 실제 정책의 능력 경계는 상황에 따라 달라진다는 점을 지적한다.
- 이해 스킬, 기억 스킬, 자기진화 스킬 세 묶음을 두어 상황 해석, 능력 경계 추정, 실행 경험 기반 보정을 맡긴다.
- 메모리 브리지는 다음 정책과 연결된 실행 궤적을 꺼내 그 정책의 정상 입력 구간을 추정하고, 로봇을 그 구간으로 유도해 재학습 없이 인수인계를 안정시킨다.
- 500개 장기 과제 절제 실험에서 전체 시스템은 성공률 86.0퍼센트, 메모리 브리지 제거는 60.4퍼센트, 이해 스킬 제거는 37.6퍼센트였고 단일 정책만 쓰면 0퍼센트였다.
- 실제 로봇 135회 실험에서 블록 재은닉 교란 시 성공률이 86.7퍼센트에서 66.7퍼센트로 떨어졌지만, 구조물 일부 해체 후에도 80.0퍼센트를 유지했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.