ClawGym II: Exploring Black-Box RL on Agent Harness

발행일
출처
arXiv
논문 번호
926
분야
LLMs / NLP
arXiv 번호
2608.16798

공개되지 않은 에이전트 실행 도구를 뜯어고치지 않고, 모델 호출만 모아 강화학습하는 훈련 틀이다.

이 논문은 한마디로 OpenClaw와 Claude Code처럼 내부 동작을 볼 수 없는 에이전트 실행 도구를 그대로 둔 채 모델만 강화학습하는 ClawGym II를 제안한다. 작업마다 임시 환경을 만들고, 흩어지거나 갈라진 모델 호출 기록을 접두사 트리로 묶어 여러 차례 대화를 복원한다. 이 구조에 맞게 PPO와 GRPO 강화학습을 바꾸고 실제 생성 토큰과 학습 토큰도 일치시킨다. Qwen3-30A3B 계열의 ClawGym-Bench Pass@1은 OpenClaw에서 콜드 스타트 초기 모델의 52.64에서 62.62로, Claude Code에서는 원본 모델의 37.06에서 51.87로 올랐다. 두 실행 도구는 시작 모델이 달라 결과를 서로 직접 비교하면 안 된다.

핵심 요약

  • 작업 환경과 실행 도구를 각각 임시 환경에 격리한다. 모델 요청은 중간 서버가 받아 입력 토큰, 출력 토큰과 생성 확률을 기록한다.
  • ClawGym-Bench는 코드 검사만 쓰거나 코드 0.7과 평가 기준 0.3을 합산했다. 평가 기준 판정에는 GPT-5.4를 썼고, PinchBench는 멀티모달 과제를 뺀 30개를 평가했다.
  • Qwen3-30A3B 계열의 PinchBench 점수는 OpenClaw에서 콜드 스타트 초기 모델의 75.61에서 87.32로 올랐다. Claude Code에서는 원본 모델의 54.14에서 71.42로 올랐다.
  • 같은 실행 예산에서 PPO는 256개 과제를 한 번씩, GRPO는 32개 과제를 여덟 번씩 실행했다. 두 방식 모두 약 200회에서 400회 학습 동안 성능이 안정적으로 올랐다.
  • JobBench-Easy는 20.46에서 27.20으로, OfficeQA-Full은 8.53에서 21.54로 올랐다. WhiteBox AgentLoop에서 학습한 모델을 OpenClaw로 옮긴 점수는 50.33으로, OpenClaw에서 직접 학습한 62.62보다 낮았다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)