Continual Learning Bench: Evaluating Frontier AI Systems in Real-World Stateful Environments
- 발행일
- 출처
- arXiv
- 논문 번호
- 362
- 분야
- AI / General
- arXiv 번호
- 2606.05661
LLM 기반 에이전트가 순차적 경험을 통해 실제로 학습하는지 측정하는 최초의 전문가 검증 벤치마크를 제안한다.
CL-BENCH는 소프트웨어 엔지니어링, 신호처리, 질병 발생 예측, 데이터베이스 쿼리, 전략 게임, 수요 예측 6개 도메인에서 에이전트가 경험을 통해 학습하는 능력을 평가한다. 각 태스크는 사전 지식으로 해결할 수 없는 잠재 구조를 포함하며, 개념 드리프트도 도입하여 적응력을 테스트한다. gain 메트릭을 통해 기본 모델 능력과 온라인 학습을 분리하여 측정한다.
핵심 요약
- 6개 실제 도메인에서 전문가가 검증한 고품질 태스크로, 각 태스크는 사전학습으로 해결 불가능한 잠재 구조를 포함한다
- gain 메트릭을 도입하여 기본 모델 능력과 경험 기반 학습을 분리 측정하는 평가 방법론 제안
- 단순 ICL(In-Context Learning)이 전용 메모리 시스템(Mem0, ACE 등)보다 대부분의 태스크에서 우수한 성능을 보인다
- 최고 시스템도 25.4%의 정규화 gain에 그쳐, 현재 프론티어 모델의 지속 학습 능력이 여전히 제한적임을 시사한다
- 메모리 모듈이 오히려 허위 일반화와 진부한 신념을 생성하여 성능을 저하시키는 경우가 빈번하게 관찰된다
- 비용 대비 효율성에서도 ICL이 우위이며, 고비용 시스템이 비용에 비례한 성능 향상을 보여주지 못한다
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.