Continual Learning Bench: Evaluating Frontier AI Systems in Real-World Stateful Environments

발행일
출처
arXiv
논문 번호
362
분야
AI / General
arXiv 번호
2606.05661

LLM 기반 에이전트가 순차적 경험을 통해 실제로 학습하는지 측정하는 최초의 전문가 검증 벤치마크를 제안한다.

CL-BENCH는 소프트웨어 엔지니어링, 신호처리, 질병 발생 예측, 데이터베이스 쿼리, 전략 게임, 수요 예측 6개 도메인에서 에이전트가 경험을 통해 학습하는 능력을 평가한다. 각 태스크는 사전 지식으로 해결할 수 없는 잠재 구조를 포함하며, 개념 드리프트도 도입하여 적응력을 테스트한다. gain 메트릭을 통해 기본 모델 능력과 온라인 학습을 분리하여 측정한다.

핵심 요약

  • 6개 실제 도메인에서 전문가가 검증한 고품질 태스크로, 각 태스크는 사전학습으로 해결 불가능한 잠재 구조를 포함한다
  • gain 메트릭을 도입하여 기본 모델 능력과 경험 기반 학습을 분리 측정하는 평가 방법론 제안
  • 단순 ICL(In-Context Learning)이 전용 메모리 시스템(Mem0, ACE 등)보다 대부분의 태스크에서 우수한 성능을 보인다
  • 최고 시스템도 25.4%의 정규화 gain에 그쳐, 현재 프론티어 모델의 지속 학습 능력이 여전히 제한적임을 시사한다
  • 메모리 모듈이 오히려 허위 일반화와 진부한 신념을 생성하여 성능을 저하시키는 경우가 빈번하게 관찰된다
  • 비용 대비 효율성에서도 ICL이 우위이며, 고비용 시스템이 비용에 비례한 성능 향상을 보여주지 못한다

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)