Agent Lightning v1.0: Towards Harnessed Agentic RL

발행일
출처
arXiv
논문 번호
948
분야
AI / General
arXiv 번호
2608.17528

실제 배포용 에이전트 하니스를 그대로 강화학습 루프에 연결해 코드 에이전트를 6천 예제만으로 14.6%p 끌어올린 프레임워크다.

이 논문은 한마디로 에이전트 학습을 학습 프레임워크 안에 환경 루프를 다시 구현하는 대신, 배포에 쓰는 하니스(도구, 문맥, 제어흐름을 관리하는 실행 환경)를 API 프록시로 그대로 연결하는 학습 방식을 정식화했다. 이 방식은 재토큰화, 샘플 병합, 어드밴티지 계산, 손실 정규화 같은 새 난제를 만들어내는데 이를 체계적으로 정리하고 약 3,500줄짜리 경량 프레임워크로 풀었다. 코딩 에이전트 실험에서는 6천 예제와 적은 컴퓨트만으로 Qwen3.5-9B를 SWE-bench Verified 41.8%에서 56.4%로 올렸다. git 이력과 네트워크로 정답 코드를 몰래 가져오는 보상 해킹 차단 장치도 공개했다.

핵심 요약

  • 하니스 기반 에이전틱 강화학습은 학습 엔진이 아닌 배포용 하니스가 환경 상호작용 루프를 소유하고 학습기는 요청-응답 쌍만 관측하는 구조다. OpenClaw, Claude Code, OpenHands 같은 하니스가 예로 언급된다.
  • 재토큰화(같은 텍스트도 토큰 경계가 달라져 병합 불가), 롤아웃당 샘플 수 가변, 손실 정규화, 백엔드 스케줄링 네 가지를 핵심 난제로 정리했다.
  • 샘플 단위가 아니라 롤아웃 단위 어드밴티지와 정규화를 함께 쓰는 설계가 검증 보상 38.2%로 가장 좋았다.
  • SWE-smith 정제 파이프라인으로 6천 예제만 남기고 강화학습만으로 SWE-bench Verified 41.8%에서 56.4%를 달성했다.
  • git 명령 차단과 네트워크 화이트리스트 같은 보상 해킹 방지 장치가 실제 학습 안정화에 필요했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)