Projector Is All You Train
- 발행일
- 출처
- arXiv
- 논문 번호
- 979
- 분야
- LLMs / NLP
- arXiv 번호
- 2608.19726
새 모달리티(여기선 3D 포인트클라우드)를 언어모델에 붙일 때 프로젝터(연결 다리 역할의 MLP)만 학습해도 충분하고, 백본을 같이 학습하면 기존 능력이 오히려 무너진다고 보여준 논문이다.
이 논문은 한마디로 멀티모달 모델에 새 감각 입력(3D 포인트클라우드)을 추가할 때 언어모델 백본은 얼려두고 프로젝터(인코더 특징을 언어모델 임베딩 공간으로 옮기는 작은 MLP 다리)만 학습해도 된다는 주장이다. 같은 16시간 GPU 예산에서 프로젝터만 학습한 모델이 기존 3D MLLM과 동급 성능을 냈고, 백본을 LoRA로 같이 학습한 모델과도 비슷했다. 대신 백본을 함께 학습하면 GSM8K 86.96에서 0.61로, HumanEval 64.02에서 0으로 기존 능력이 무너지는데, 프로젝터만 학습하면 구조적으로 이런 붕괴가 원천 차단된다. 프로젝터만 학습하면 학습 샘플 처리 속도도 약 2배라, 싸고 안전하며 모듈러한 적응 방법이 된다.
핵심 요약
- 3D MLLM에서 인코더와 언어모델 백본을 모두 얼리고 프로젝터(3층 MLP)만 학습해도, 3D 분류·캡셔닝에서 기존 baseline들과 동급 성능을 냈다.
- 동일한 16 GPU시간(A100 1장) 예산에서 프로젝터 단독 학습이 백본 LoRA 동시 학습과 성능이 비슷하면서, 학습 샘플 처리량은 약 2배였다.
- 백본을 함께 학습하면 기존 능력이 심하게 무너졌다(Llama 백본 GSM8K 86.96에서 0.61, HumanEval 64.02에서 0.00). 프로젝터만 학습하면 백본을 건드리지 않아 이런 퇴행이 원천적으로 없다.
- 백본 동시 학습 후 일부 비전 점수가 오른 것처럼 보였지만, 이는 객관식 채점 방식(보기 확률 재정규화) 때문이고 실제로는 지시 이행 실패가 늘었다고 분석했다.
- 하나의 언어모델 백본에 모달리티별 프로젝터를 독립적으로 붙여 학습하는, 모듈러 멀티모달 구성을 미래 방향으로 제안했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.