Recursive Self-Improvement through Multi-Agent Self-Supervision
- 발행일
- 출처
- arXiv
- 논문 번호
- 1183
- 분야
- AI / General
- arXiv 번호
- 2610.12176
이 논문은 검증하기 어려운 개방형 연구 과제에서 모델이 스스로를 개선하는 방법으로, 멀티에이전트 워크플로를 스스로 설계하고 그 궤적으로 자신을 재훈련하는 MASS를 제안했다.
이 논문은 한마디로 사람도 채점하기 어려운 과제에서 모델 하나가 자기 복사본들로 팀을 꾸려 워크플로를 진화시키고, 그 결과물로 스스로를 재훈련하는 재귀적 자기개선(RSI) 방법이다. 핵심은 단일 모델의 자기 피드백은 같은 편견을 강화하기 쉬운데, 멀티에이전트 구조에서 역할 분담과 정보 흐름을 최적화하면 더 좋은 감독 신호가 생긴다는 발견이다. Qwen3.6-27B로 두 사이클 돌린 결과, 연구 벤치마크 4종에서 출력 토큰당 성능이 1.2~1.6배 올랐고 평가자 정확도도 73%에서 93%로 좋아졌다. 1.4배 많은 토큰으로 학습한 단일 에이전트 학생보다 멀티에이전트 궤적으로 학습한 학생이 더 강했다.
핵심 요약
- 워크플로 최적화와 자기 생성 궤적 재훈련을 번갈아 돌리는 구조로, 개선된 모델이 다시 더 좋은 최적화자·평가자가 되는 재귀적 부트스트래핑을 실현했다.
- 두 사이클 만에 연구 벤치마크 4종에서 출력 토큰당 성능이 1.2~1.6배 향상됐다.
- 훈련 전엔 73%던 자기 평가 정확도가 93%로 올라가며 평가 능력까지 같이 개선됐다.
- 1.4배 많은 토큰을 쓴 단일 에이전트 학습보다 멀티에이전트 궤적 학습이 더 효율적이었다.
- 최적화된 워크플로에서 역할별 정보 전달과 라우팅이 더 많아지는 것을 확인해 '정보 흐름 최적화' 가설을 뒷받침했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.