Rethinking Self-Evolving Agents: Do We Still Need Prescribed Optimization Pipelines?
- 발행일
- 출처
- arXiv
- 논문 번호
- 872
- 분야
- AI / General
- arXiv 번호
- 2608.09629
이 논문은 자기 진화 에이전트에서 '프레임워크가 정해준 개선 절차'가 최신 프론티어 모델에서는 불필요할 수 있음을 보였다. GPT-5.5가 스스로 개선 과정을 조립하는 OEO가 정해진 파이프라인(SKILLOPT, GEPA)을 14회 중 12회 이겼다.
이 논문은 한마디로 '에이전트가 스스로 학습하는 방식을 프레임워크가 정해줘야 할까, 아니면 충분히 똑똑한 모델은 스스로 학습 방법을 찾을 수 있을까?'를 물었다. Open-Ended Optimization(OEO)은 목표, 예산, 평가만 고정하고 개선 절차를 모델이 online으로 조립하게 한다. GPT-5.5 기준 OEO가 기존 정해진 파이프라인(SKILLOPT, GEPA)을 14회 중 12회 이기면서 토큰 예산의 34%만 썼다. 다만 중간급 모델에서는 정해진 구조가 더 좋아서, 능력에 따른 적응적 분업이 필요하다.
핵심 요약
- 프레임워크가 정한 개선 절차(최적화 메타정책)의 필요성을 최초로 체계적으로 질문했다.
- GPT-5.5 기반 OEO가 SKILLOPT·GEPA 두 파이프라인 대비 14회 중 12승 1무 1패를 기록했다.
- OEO는 SKILLOPT 대비 중앙값 34.3%의 토큰만 사용해서 효율성을 입증했다.
- 중간급 모델에서는 정해진 파이프라인이 더 좋아서, 모델 능력에 따른 적응적 분업 경계를 확인했다.
- 정해진 절차는 최적화 경로를 더 일관되게 만들지만 최종 행동의 차이보다 경로 차이가 큼을 밝혔다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.