Macaron-V1: Towards Open Continual Learning with Self-Improvement and Mixture-of-LoRA
- 발행일
- 출처
- arXiv
- 논문 번호
- 861
- 분야
- Machine Learning
- arXiv 번호
- 2608.09819
이 논문은 배포 후에도 계속 학습하는 에이전트 모델 패밀리(Macaron-V1)를 만들었다. Mixture-of-LoRA로 전문가 어댑터를 조합하고, 모델-하네스 공동 설계로 재귀적 자기개선을 추구한다.
이 논문은 한마디로 '경험으로부터 배우고 배포 후에도 계속 발전하는' 에이전트 모델 시스템을 제안했다. 핵심은 Mixture-of-LoRA(MoL) 구조로, 베이스 모델(GLM-5.2 744B)은 얼려두고 채팅·에이전트·코딩·GenUI용 LoRA 전문가를 턴마다 선택한다. 모델과 하네스(실행 환경)를 버전별로 짝지어 재귀적으로 개선하는 루프를 설계했고, 벤치마크에서 의미 있는 결과를 냈다.
핵심 요약
- Mixture-of-LoRA 구조로 베이스 모델은 고정하고 턴마다 전문가 어댑터(chat, agent, coding, GenUI)를 선택하는 시스템을 만들었다.
- 모델-하네스 공동 설계와 재귀적 자기개선 루프로 배포 후에도 지속 학습하는 프레임워크를 제안했다.
- 744B GLM-5.2 베이스 기반 Venti 모델과 50B Qwen3.6 기반 Tall 모델을 공개했다.
- UI4A라는 컴포넌트 네이티브 GenUI 하네스와 MindForge라는 에이전트 RL 프레임워크를 개발했다.
- Personal Intelligence, GenUI, 일반 능력 벤치마크에서 프론티어 모델들과 경쟁하는 성능을 보였다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.