Continual Learning in Transition
- 발행일
- 출처
- arXiv
- 논문 번호
- 847
- 분야
- Machine Learning
- arXiv 번호
- 2608.06216
LLM 시대에 지속학습(continual learning)이 어떻게 바뀌고 있는지, '언제·어디서·어떻게' 3축으로 정리한 서베이 논문이다.
이 논문은 한마디로 LLM과 에이전트 시대에 지속학습의 개념을 파라미터 조정에서 시스템 전체 적응으로 확장한 서베이다. 예전에는 모델 파라미터를 어떻게 업데이트하느냐가 전부였지만, 이제는 메모리(기억), 스킬 라이브러리(도구 모음), 추론 시점 적응 등 모델 바깥의 요소들까지 학습의 일부로 봐야 한다고 주장한다. '언제(When)' '어디서(Where)' '어떻게(How)' 3개 축으로 기존 연구들을 분류해서 보여주며, 어느 영역이 연구가 덜 됐는지도 짚어준다. 결론적으로 진짜 AGI로 가려면 파라미터만 건드리는 게 아니라 모델+외부 시스템 전체를 함께 진화시켜야 한다고 말한다.
핵심 요약
- 기존 지속학습은 '파라미터 업데이트'가 전부였지만, 이제는 메모리·스킬·프로토콜 등 모델 바깥의 요소까지 학습 영역으로 봐야 한다고 주장했다.
- 3축 프레임워크(When·Where·How)를 제안해서 기존 수십 개 방법론을 하나의 지도에서 비교할 수 있게 했다.
- on-policy 학습(모델이 직접 경험하면서 배우는 방식)이 기존 off-policy 방식보다 망각 문제를 줄이는 데 유리하다고 정리했다.
- 검증 가능한 보상(verifiable reward)이 에이전트가 사람 도움 없이 스스로 개선하는 핵심 다리 역할을 한다고 분석했다.
- 현재 연구가 밀집된 영역과 텅 빈 영역을 구분해서, 시스템 수준의 통합 학습이 앞으로의 핵심 도전 과제임을 지적했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.