ParVL: Parallel Scaling and Expandable Compute Allocation for Multimodal LLMs

발행일
출처
arXiv
논문 번호
816
분야
Computer Vision
arXiv 번호
2608.04010

이 논문은 다모달 LLM에서 비전과 언어에 할당되는 연산량을 독립적으로 조절하는 ParVL 프레임워크를 제안했다.

이 논문은 한마디로 다모달 LLM에서 시각 처리(ViT)와 언어 처리(LLM)의 연산 분배를 독립적으로 조절하는 방법을 연구했다. 기존 모델은 두 부분의 연산 비율이 고정되어 있어 태스크마다 최적이 달랐다. ParVL은 백본 파라미터를 공유하면서 병렬 브랜치로 연산을 확장해, 9개 벤치마크에서 최적 분배가 다름을 체계적으로 보였다.

핵심 요약

  • ViT와 LLM에 각각 별도의 병렬 브랜치를 만들어 연산 할당을 독립적으로 조절하는 최초의 프레임워크를 제안했다.
  • 백본 파라미터를 공유하는 prefix-conditioned 브랜치로 파라미터 증가 없이 연산만 확장한다.
  • 9개 비전-언어 브랜치 구성을 체계적 실험으로 최적 분배가 태스크마다 다름을 보였다.
  • 1B/2B/8B 스케일에서 단일 브랜치 대비 일관된 성능 향상을 확인했다.
  • 병렬 실행으로 추가 연산이 벽시간 지연으로 직결되지 않음을 분석했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)