ParVL: Parallel Scaling and Expandable Compute Allocation for Multimodal LLMs
- 발행일
- 출처
- arXiv
- 논문 번호
- 816
- 분야
- Computer Vision
- arXiv 번호
- 2608.04010
이 논문은 다모달 LLM에서 비전과 언어에 할당되는 연산량을 독립적으로 조절하는 ParVL 프레임워크를 제안했다.
이 논문은 한마디로 다모달 LLM에서 시각 처리(ViT)와 언어 처리(LLM)의 연산 분배를 독립적으로 조절하는 방법을 연구했다. 기존 모델은 두 부분의 연산 비율이 고정되어 있어 태스크마다 최적이 달랐다. ParVL은 백본 파라미터를 공유하면서 병렬 브랜치로 연산을 확장해, 9개 벤치마크에서 최적 분배가 다름을 체계적으로 보였다.
핵심 요약
- ViT와 LLM에 각각 별도의 병렬 브랜치를 만들어 연산 할당을 독립적으로 조절하는 최초의 프레임워크를 제안했다.
- 백본 파라미터를 공유하는 prefix-conditioned 브랜치로 파라미터 증가 없이 연산만 확장한다.
- 9개 비전-언어 브랜치 구성을 체계적 실험으로 최적 분배가 태스크마다 다름을 보였다.
- 1B/2B/8B 스케일에서 단일 브랜치 대비 일관된 성능 향상을 확인했다.
- 병렬 실행으로 추가 연산이 벽시간 지연으로 직결되지 않음을 분석했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.