ProtoAda: Prototype-Guided Adaptive Adapter Expansion and Geometric Consolidation for Multimodal Continual Instruction Tuning

발행일
출처
arXiv
논문 번호
288
분야
Computer Vision
arXiv 번호
2606.02576

멀티모달 대규모 언어 모델(MLLM)은 명령어 튜닝을 통해 강력한 성능을 달성하지만, 실세계 배포에서는 새로운 비전-언어 능력을 지속적으로 습득해야 하므로 멀티모달 지속적 명령어 튜닝(MCIT)이 필수적이다.

ProtoAda는 멀티모달 모델이 여러 과제를 순차적으로 학습할 때 의미가 비슷하지만 답 형식이 다른 과제를 같은 어댑터에 잘못 배정하는 문제를 다룬다. 좌표를 출력하는 그라운딩과 짧은 문장을 답하는 질의응답처럼 출력 구조가 다른 과제를 이미지·텍스트 유사도만으로 묶으면 매개변수 간섭과 망각이 생길 수 있다. 이 방법은 의미와 출력 형식을 함께 반영한 과제 프로토타입으로 어댑터의 생성과 라우팅을 결정하고, 형식이 호환되는 업데이트는 기하학적 관계를 고려해 통합한다. 여러 지속적 명령어 튜닝 벤치마크에서 특히 순차 학습으로 답 구조가 쉽게 손상되는 과제의 성능을 개선했다. 그러나 훨씬 긴 과제 흐름이나 더 다양하고 개방적인 응답 형식에서는 아직 검증되지 않아 대규모 실제 배치로의 확장성은 추가 평가가 필요하다.

핵심 요약

  • 멀티모달 대규모 언어 모델(MLLM)은 명령어 튜닝을 통해 강력한 성능을 달성하지만, 실세계 배포에서는 새로운 비전-언어 능력을 지속적으로 습득해야 하므로 멀티모달 지속적 명령어 튜닝(MCIT)이 필수적이다.
  • 이 문제를 해결하기 위해, 이 논문은 프로토타입 기반 적응형 튜닝 프레임워크 ProtoAda를 제안한다.
  • 여러 벤치마크에 걸친 광범위한 실험은 ProtoAda가, 특히 답 구조가 순차적 튜닝에 의해 쉽게 손상되는 과제에서 우수한 성능을 달성함을 보여준다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)