EnvHarness: Awakening Static Worlds for Agent Learning
- 발행일
- 출처
- arXiv
- 논문 번호
- 967
- 분야
- AI / General
- arXiv 번호
- 2608.19880
에이전트가 배우는 '환경'을 감싸는 플러그인 층을 얹어, 고정된 기존 환경을 에이전트 약점 맞춤 훈련장으로 바꾸는 기법이다.
이 논문은 한마디로 고정된 에이전트 학습 환경을 플러그인으로 감싸 맞춤 훈련장으로 바꾸는 EnvHarness다. 에이전트 하네스가 모델을 감싸 능력을 더해주듯, EnvHarness는 환경을 감싸 시작 상태·행동 제약·과제 연결을 바꾼다. EnvRigger가 정책의 실행 기록을 보고 약점을 진단한 뒤, 이를 겨냥한 환경 구성요소를 만들고 검증한다. 5개 벤치마크에서 최대 9.0점 향상, 실행 스텝은 9.8% 줄었고, 기존 환경이 성장이 멈추는 지점에서도 계속 상승했다.
핵심 요약
- 환경을 새로 짓지 않고 reset/step 인터페이스에서 감싸서(Stage·Contract·Chain 플러그인) 행동만 바꾸는 EnvHarness 층을 제안했다.
- 원본 검증기(정답 채점기)를 그대로 물려받아, LLM이 만든 환경의 '정답 신뢰성' 문제를 원천 차단했다.
- EnvRigger가 정책 실패 궤적을 진단해 약점 겨냥 환경을 자동 합성하고 신규 롤아웃으로 검증하는 자동화 루프를 만들었다.
- SWE-bench Verified 등 4개 도메인 5개 벤치마크에서 기존 환경 학습 대비 최대 +9.0점, 실행 스텝 9.8% 절감을 달성했다.
- 정책-환경 공진화 반복으로 환경 300개에서도 47.67→54.79로 계속 올라, 기존 환경 스케일링이 꺾이는 지점을 넘었다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.