SPADE: Self-Play in Adaptive Synthetic Executable Environments

발행일
출처
arXiv
논문 번호
953
분야
LLMs / NLP
arXiv 번호
2608.19197

AI가 스스로 훈련 환경(실행 가능한 코드 형태)을 만들고 스스로 풀면서 계속 성장하는 셀프플레이 강화학습 프레임워크다.

이 논문은 한마디로 '에이전트가 자기 훈련용 환경을 직접 설계하고, 그 환경에서 스스로 배우는' 셀프플레이 강화학습 프레임워크 SPADE를 제안했다. 하나의 LLM이 두 역할을 맡는다. 환경 설계자는 리셋/스텝 인터페이스를 갖춘 실행 가능한 파이썬 환경(상태 전이·보상 함수·검증 코드 포함)을 코드로 작성하고, 추론 에이전트는 그걸 푼다. 설계자는 '힌트 있을 때와 없을 때의 성능 차이'(후회, regret)를 보상으로 받아서, 에이전트 능력의 한계선에 있는(어렵지만 풀 수 있는) 환경을 노리는 법을 학습한다. 사전학습 문서로 설계를 그라운딩하고 환경 메모리를 축적하는 게 성공의 핵심이었다. 30B 모델까지 스케일하면 고정 환경 최강 기준 대비 8개 벤치마크 평균 +5.3, 도구 사용 벤치마크에서 +5.7~+13.9를 기록했다.

핵심 요약

  • 환경 설계 자체를 학습 가능한 컴포넌트로 만들었다. 설계자가 만드는 환경 분포가 에이전트 성장에 맞춰 함께 진화한다(공진화).
  • 힌트 기반 후회 보상이 핵심 트릭이다. 순수 적대적 설계자는 못 풀 문제를 내고, 협조적 설계자는 가르칠 게 없는 문제를 낸다. 힌트 유무 성능차는 '풀 수 있으면서 배우는 가치가 있는' 환경을 자동으로 골라낸다.
  • 환경을 Gym 스타일 실행 코드로 쓰기 때문에 하나의 인터페이스로 한 턴 추론 문제와 멀티턴 도구 사용 과제를 모두 커버한다.
  • 사전학습 문서로 설계를 그라운딩하고, 만들었던 환경의 메모리를 축적하는 게 성능에 결정적이었다.
  • 30B 스케일에서 고정 환경 최강 기준 대비 8개 수학·과학·코딩·추론 벤치마크 평균 +5.3, BFCL v4 멀티턴 +5.7, ACEBench-Agent +13.9를 기록했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)