MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities

발행일
출처
arXiv
논문 번호
749
분야
Computer Vision
arXiv 번호
2607.25948

이 논문은 하나의 디코더-only 모델로 텍스트, 이미지, 깊이, 세그먼테이션 등 15가지 모달리티를 서로 변환할 수 있는 통합 모델(MODUS)을 만든 연구다.

이 논문은 한마디로 '하나의 디코더로 어떤 모달리티든 다른 모달리티로 변환할 수 있다'는 any-to-any 모델을 제안했다. 기존 방식은 모달리티마다 별도 헤드나 손실 함수가 필요했지만, MODUS는 모든 모달리티를 대칭적으로 처리해서 모달리티별 구성요소 없이 작동한다. 2900만 샘플로 사전학습된 BAGEL 모델을 확장했고, 균일 타임스텝 샘플링과 단계적 커리큘럼으로 안정적 훈련을 달성했다. 전문가 모델들과 경쟁하는 성능을 보였고, 체인드 생성(연쇄 변환)과 교차 모달 자기 검증도 지원한다.

핵심 요약

  • 모달리티별 헤드, 손실 함수, 태스크 파이프라인 없이 하나의 디코더로 15개 모달리티를 처리하는 최초의 모델이다.
  • 기존 any-to-any 모델과 달리 대규모 사전학습 디코더(BAGEL)를 활용해서 훈련 비용을 크게 줄였다.
  • 균일 타임스텝 샘플링(uniform timestep sampling)으로 모달리티 혼동을 방지하고 안정적 훈련을 달성했다.
  • 체인드 생성(중간 모달리티를 거쳐 변환)과 교차 모달 자기 검증(다른 모달리티로 자기 출력 검사)을 자연스럽게 지원한다.
  • 2900만 샘플의 MODUS-DATASET과 2개 체크포인트를 오픈소스로 공개했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)