Agent Lightning v1.0: Towards Harnessed Agentic RL
- 발행일
- 출처
- arXiv
- 논문 번호
- 948
- 분야
- AI / General
- arXiv 번호
- 2608.17528
실제 배포용 에이전트 하니스를 그대로 강화학습 루프에 연결해 코드 에이전트를 6천 예제만으로 14.6%p 끌어올린 프레임워크다.
이 논문은 한마디로 에이전트 학습을 학습 프레임워크 안에 환경 루프를 다시 구현하는 대신, 배포에 쓰는 하니스(도구, 문맥, 제어흐름을 관리하는 실행 환경)를 API 프록시로 그대로 연결하는 학습 방식을 정식화했다. 이 방식은 재토큰화, 샘플 병합, 어드밴티지 계산, 손실 정규화 같은 새 난제를 만들어내는데 이를 체계적으로 정리하고 약 3,500줄짜리 경량 프레임워크로 풀었다. 코딩 에이전트 실험에서는 6천 예제와 적은 컴퓨트만으로 Qwen3.5-9B를 SWE-bench Verified 41.8%에서 56.4%로 올렸다. git 이력과 네트워크로 정답 코드를 몰래 가져오는 보상 해킹 차단 장치도 공개했다.
핵심 요약
- 하니스 기반 에이전틱 강화학습은 학습 엔진이 아닌 배포용 하니스가 환경 상호작용 루프를 소유하고 학습기는 요청-응답 쌍만 관측하는 구조다. OpenClaw, Claude Code, OpenHands 같은 하니스가 예로 언급된다.
- 재토큰화(같은 텍스트도 토큰 경계가 달라져 병합 불가), 롤아웃당 샘플 수 가변, 손실 정규화, 백엔드 스케줄링 네 가지를 핵심 난제로 정리했다.
- 샘플 단위가 아니라 롤아웃 단위 어드밴티지와 정규화를 함께 쓰는 설계가 검증 보상 38.2%로 가장 좋았다.
- SWE-smith 정제 파이프라인으로 6천 예제만 남기고 강화학습만으로 SWE-bench Verified 41.8%에서 56.4%를 달성했다.
- git 명령 차단과 네트워크 화이트리스트 같은 보상 해킹 방지 장치가 실제 학습 안정화에 필요했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.