ProtoAda: Prototype-Guided Adaptive Adapter Expansion and Geometric Consolidation for Multimodal Continual Instruction Tuning
- 발행일
- 출처
- arXiv
- 논문 번호
- 288
- 분야
- Computer Vision
- arXiv 번호
- 2606.02576
멀티모달 대규모 언어 모델(MLLM)은 명령어 튜닝을 통해 강력한 성능을 달성하지만, 실세계 배포에서는 새로운 비전-언어 능력을 지속적으로 습득해야 하므로 멀티모달 지속적 명령어 튜닝(MCIT)이 필수적이다.
ProtoAda는 멀티모달 모델이 여러 과제를 순차적으로 학습할 때 의미가 비슷하지만 답 형식이 다른 과제를 같은 어댑터에 잘못 배정하는 문제를 다룬다. 좌표를 출력하는 그라운딩과 짧은 문장을 답하는 질의응답처럼 출력 구조가 다른 과제를 이미지·텍스트 유사도만으로 묶으면 매개변수 간섭과 망각이 생길 수 있다. 이 방법은 의미와 출력 형식을 함께 반영한 과제 프로토타입으로 어댑터의 생성과 라우팅을 결정하고, 형식이 호환되는 업데이트는 기하학적 관계를 고려해 통합한다. 여러 지속적 명령어 튜닝 벤치마크에서 특히 순차 학습으로 답 구조가 쉽게 손상되는 과제의 성능을 개선했다. 그러나 훨씬 긴 과제 흐름이나 더 다양하고 개방적인 응답 형식에서는 아직 검증되지 않아 대규모 실제 배치로의 확장성은 추가 평가가 필요하다.
핵심 요약
- 멀티모달 대규모 언어 모델(MLLM)은 명령어 튜닝을 통해 강력한 성능을 달성하지만, 실세계 배포에서는 새로운 비전-언어 능력을 지속적으로 습득해야 하므로 멀티모달 지속적 명령어 튜닝(MCIT)이 필수적이다.
- 이 문제를 해결하기 위해, 이 논문은 프로토타입 기반 적응형 튜닝 프레임워크 ProtoAda를 제안한다.
- 여러 벤치마크에 걸친 광범위한 실험은 ProtoAda가, 특히 답 구조가 순차적 튜닝에 의해 쉽게 손상되는 과제에서 우수한 성능을 달성함을 보여준다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.