OpenForgeRL: Train Harness-native Agents in Any Environment
- 발행일
- 출처
- arXiv
- 논문 번호
- 707
- 분야
- AI / General
- arXiv 번호
- 2607.21557
Claude Code, OpenClaw 같은 실제 에이전트 하네스(운영 환경) 그대로 강화학습을 할 수 있는 오픈소프 프레임워크다. 학습-배포 불일치를 해결했다.
이 논문은 한마디로 에이전트 하네스(에이전트를 구동하는 운영 환경, 예: Claude Code, Codex, OpenClaw)를 그대로 사용하면서 강화학습(RL)으로 파인튜닝할 수 있는 오픈소스 프레임워크(OpenForgeRL)를 제안했다. 핵심은 가벼운 프록시로 하네스의 모델 호출을 기록해서 학습 데이터로 만들고, 각 롤아웃을 개별 컨테이너에서 돌리는 것이다. 이렇게 하면 학습할 때와 실제 배포할 때 같은 하네스를 쓰므로 불일치가 사라진다. CLI 에이전트(ClawEval 55.9 pass@3)와 GUI 에이전트(OSWorld 37.7) 모두에서 비슷한 크기 기준 모델을 능가했다. RL이 에이전트의 자기 검증, 도구 사용 다양성, 다단계 계획 완료를 개선하지만 오류 복구는 여전히 약하다는 점을 발견했다.
핵심 요약
- 하네스의 모델 호출을 프록시로 기록해서 표준 RL 코드(veRL 등)로 학습할 수 있게 했다.
- 각 롤아웃을 Kubernetes 컨테이너로 격리해서 복잡한 환경도 안전하게 실행한다.
- 학습과 배포가 같은 하네스를 공유해서 train-deploy mismatch를 제거했다.
- OpenForge-Claw가 ClawEval 55.9(pass@3), OpenForge-GUI가 OSWorld 37.7을 달성했다.
- RL이 자기 검증과 도구 커버리지를 개선하지만, 오류 복구 능력은 여전히 취약하다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.